Python文本挖掘和知識發現--大模型時代的新挑戰與探索

楊秀璋 武帥 黨超輝 杜瑞祺 徐香香

相關主題

商品描述

本書立足大數據、人工智能與大語言模型快速演進的技術背景,系統闡釋文本挖掘與知識發現的理論基礎、關鍵方法與實踐路徑。全書以Python為主要實現工具,圍繞“數據—信息—知識”的轉化邏輯,構建由基礎到高階的遞進式內容體系,涵蓋文本表示、分類、聚類、情感分析、主題挖掘、智能問答、知識圖譜及多模態處理等核心內容,強調方法原理、算法實現與場景應用的有機統一。 本書兼具學術性、系統性與實踐性,既適合作為高等院校相關課程教材,也可為科研人員與行業從業者開展文本智能分析與知識服務研究提供參考。

作者簡介

楊秀璋 貴州大學校聘副教授,武漢大學博士,CSDN、華為雲博客專家,科大訊飛榮譽講師,長期致力於人工智能、大模型、網絡安全及大數據分析研究。出版學術專著及譯著共12部,著有暢銷書《DeepSeek賦能職場辦公與科學研究開發實踐》《Python網絡數據爬取及分析從入門到精通》系列;發表論文30餘篇,主持國家級、省部級科研項目8項,參與國家重點研發計劃、國家自然科學基金、貴州省重大專項等項目多項。

目錄大綱

第1章 緒論
1.1 人工智能
1.2 自然語言處理
1.3 文本挖掘和知識發現
1.3.1 文本挖掘
1.3.2 知識發現
1.3.3 研究現狀
1.4 章節安排
第2章 預備知識與開發工具
2.1 Python基礎入門
2.1.1 Python簡介
2.1.2 常用開發工具
2.1.3 基礎語法和基本操作
2.1.4 函數和文件操作
2.2 Python數據分析常用擴展包
2.2.1 NumPy基本用法
2.2.2 pandas基本用法
2.2.3 scikit-learn基本用法
2.2.4 Matplotlib基本用法
2.3 Keras基礎入門
2.3.1 TensorFlow、Keras和PyTorch簡介
2.3.2 Keras的安裝
2.3.3 Keras基礎知識
2.4 大模型入門
2.5 本章小結
第3章 機器學習基礎知識
3.1 機器學習概述
3.1.1 什麼是機器學習
3.1.2 性能評估
3.2 回歸
3.2.1 什麼是回歸
3.2.2 線性回歸算法
3.2.3 多項式回歸算法
3.2.4 邏輯回歸算法
3.3 分類
3.3.1 什麼是分類
3.3.2 決策樹分類算法
3.3.3 KNN分類算法
3.3.4 SVM分類算法
3.3.5 其他分類算法
3.4 聚類
3.4.1 什麼是聚類
3.4.2 K-Means聚類算法
3.4.3 BIRCH聚類算法
3.4.4 均值漂移聚類算法
3.5 本章小結
第4章 深度學習基礎知識
4.1 深度學習概述
4.2 神經網絡
4.2.1 什麼是神經網絡
4.2.2 神經網絡案例實現
4.2.3 激勵函數
4.2.4 優化器
4.3 神經網絡評估機制
4.3.1 評估指標
4.3.2 評估曲線
4.4 卷積神經網絡
4.4.1 卷積神經網絡原理
4.4.2 卷積神經網絡案例實現
4.4.3 神經網絡參數保存及可視化
4.5 循環神經網絡
4.5.1 循環神經網絡原理
4.5.2 LSTM
4.5.3 GRU
4.5.4 循環神經網絡案例實現
4.6 Autoencoder算法
4.6.1 Autoencoder算法原理
4.6.2 Autoencoder算法案例實現
4.7 註意力機制和Transformer
4.7.1 註意力機制原理
4.7.2 註意力機制代碼實現
4.7.3 Transformer和大模型
4.8 圖神經網絡拓展
4.9 本章小結
第5章 文本挖掘算法數學知識
5.1 概率論基礎知識
5.1.1 樣本空間與隨機事件
5.1.2 等可能概率模型
5.1.3 條件概率模型
5.2 極大似然估計
5.2.1 參數估計
5.2.2 極大似然估計
5.2.3 極大似然估計示例
5.3 貝葉斯法則
5.3.1 貝葉斯法則概念
5.3.2 樸素貝葉斯
5.3.3 貝葉斯法則應用之情感分析
5.3.4 貝葉斯法則應用之文本分類
5.3.5 貝葉斯法則應用之中文分詞
5.4 隱馬爾可夫模型
5.4.1 馬爾可夫鏈
5.4.2 隱馬爾可夫模型原理
5.5 信息論基礎知識
5.5.1 信息
5.5.2 信息論
5.5.3 信息熵
5.6 本章小結
第6章 詞嵌入和文本表征
6.1 文本表征概述
6.1.1 向量空間模型
6.1.2 常見權重計算方法
6.1.3 TF-IDF技術及案例詳解
6.2 離散文本表征
6.2.1 One-hot表示法
6.2.2 詞袋模型
6.2.3 N-Gram模型
6.3 分布式文本表征及Word2Vec
6.3.1 神經網絡語言模型
6.3.2 詞嵌入
6.3.3 Word2Vec詞向量原理及基本用法
6.3.4 GloVe詞向量
6.3.5 fastText詞向量
6.4 圖向量表征
6.5 預訓練模型和BERT
6.6 本章小結
第7章 詞法分析及命名實體識別
7.1 自然語言處理框架
7.2 詞法分析概述
7.2.1 詞的定義
7.2.2 詞法分析的定義
7.3 中文自動分詞技術
7.3.1 中文分詞原理
7.3.2 Jieba中文分詞
7.3.3 LTP中文分詞
7.3.4 中文分詞分類
7.4 詞性標註
7.4.1 詞性標註概述及常見詞性類型
7.4.2 Jieba詞性標註
7.4.3 LTP詞性標註
7.4.4 基於深度學習的詞性標註
7.5 命名實體識別
7.5.1 命名實體識別的定義及分類
7.5.2 基於LTP的命名實體識別
7.5.3 基於機器學習的安全命名實體識別
7.5.4 基於深度學習的安全命名實體識別
7.5.5 古籍命名實體識別和多模態融合探索
7.5.6 基於BERT的古籍命名實體識別
7.6 實體對齊和實體消歧拓展
7.7 基於大模型的詞法分析拓展
7.7.1 基於大模型的中文分詞
7.7.2 基於大模型的詞性標註
7.7.3 基於大模型的實體識別
7.8 本章小節
……
第8章 句法分析
第9章 語義分析
第10章 文本分類
第11章 文本聚類
第12章 情感分析
第13章 文本主題挖掘
第14章 主題演化分析與話題跟蹤
第15章 大模型時代的智能問答與對話
第16章 搜索引擎與知識圖譜
第17章 機器翻譯及古文字圖像數智化保護
參考文獻