機器學習與數據挖掘(基於Python)
黃海廣,徐震,張楠
- 出版商: 清華大學
- 出版日期: 2026-08-01
- 定價: $359
- 售價: $358
- 語言: 簡體中文
- ISBN: 7302722641
- ISBN-13: 9787302722649
-
相關分類:
Machine Learning、Python、Data-mining
下單後立即進貨 (約4週~6週)
相關主題
商品描述
本書秉持理論為基、實踐為用的編寫理念,依托完善的Python技術生態,搭建模塊化知識體系與多元化應用場景,聚焦機器學習與數據挖掘工程化實操能力培養,打通算法理論與工程落地之間的壁壘。全書內容體系清晰完整,劃分為Python基礎入門、經典機器學習算法、綜合項目實踐三大模塊,兼顧理論講解與實戰教學。書中融入大量貼合行業真實場景的應用案例,每章均配備案例詳解與分步操作指南,助力讀者鞏固知識要點、提升代碼實操與問題解決能力。本書配套全套教學課件、源碼、習題及教學進度大綱等豐富教輔資源,適配課堂教學與自主學習雙重需求。 本書精準適配應用型本科院校教學需求,貼合學生動手能力突出、理論基礎有待夯實的學情,適合作為本科及研究生機器學習相關課程教材與參考用書。
作者簡介
黃海廣,溫州大學計算機與人工智能學院教師,博士、副教授,碩士生導師。黃海廣博士致力於致力於人工智能在國內的普及工作,在學術界和工業界都有大量讀者;善於指導初學者入門,他翻譯和編寫過大量人工智能領域的文章,幫助過無數初學者。其個人筆記《吳恩達機器學習個人筆記》被下載超過百萬次,個人的Github的獲贊數(star)75000多個;在知識分享平臺知乎,擁有關註者超過7萬人,文章被收藏超過21萬次。出版教材《機器學習入門基礎(微課版)》,公開課《機器學習》(中國大學慕課)。
目錄大綱
目錄
第1章機器學習與數據挖掘概述1
1.1機器學習的定義與類型1
1.1.1機器學習的定義1
1.1.2機器學習的類型2
1.1.3機器學習的主要概念5
1.2數據挖掘的概念與過程7
1.2.1數據挖掘的概念7
1.2.2數據挖掘的過程8
1.3機器學習與數據挖掘的關系10
1.3.1機器學習與數據挖掘的相似之處10
1.3.2機器學習與數據挖掘的不同之處10
1.3.3機器學習與數據挖掘協同工作11
1.4應用領域與案例11
1.5學習路線11
1.5.1掌握基本數學知識12
1.5.2學習編程語言及數據處理工具12
1.5.3了解並學習機器學習算法12
1.5.4實踐項目與工具掌握12
1.5.5關註最新進展並深入研究領域12
習題113
第2章Python基礎與常用庫15
2.1Python的基礎回顧15
2.1.1Python的簡介與安裝15
2.1.2Python的數值類型17
2.1.3Python的流程控制22
2.1.4Python的函數與模塊24
2.2NumPy庫與矩陣運算28
2.2.1NumPy概述282.2.2NumPy數組(ndarry)對象28
2.2.3NumPy通用函數32
2.2.4NumPy的函數庫33
2.3Pandas庫與數據處理34
2.3.1Pandas庫介紹34
2.3.2Pandas庫的兩種主要數據結構34
2.3.3Pandas文件讀寫35
2.3.4Pandas常見操作36
2.4Matplotlib和Seaborn庫與可視化42
2.4.1Matplotlib42
2.4.2Seaborn47
2.5機器學習庫scikitlearn59
2.5.1scikitlearn概述59
2.5.2基本建模流程59
2.5.3數據預處理62
2.5.4監督學習算法64
2.5.5無監督學習算法65
2.5.6評價指標66
2.5.7交叉驗證及超參數調優67
2.5.8scikitlearn總結68
習題269
目錄〖3〗第3章數據準備與預處理72
3.1數據收集與質量控制72
3.1.1數據收集72
3.1.2質量控制73
3.2數據清洗與缺失值處理74
3.2.1數據清洗的重要性74
3.2.2數據清洗的流程74
3.3數據變換與規範化75
3.3.1數據變換75
3.3.2數據規範化的主要方式78
3.3.3數據規範化的適用範圍79
3.4特征工程與特征選擇79
3.4.1特征工程80
3.4.2特征選擇80
習題388
第4章回歸算法91
4.1線性回歸91
4.1.1目標函數和最小二乘法92
4.1.2梯度下降93
4.1.3多元線性回歸95
4.1.4對數線性回歸和廣義線性回歸96
4.2嶺回歸和套索回歸96
4.2.1過擬合和欠擬合96
4.2.2正則化的主要形式97
4.2.3嶺回歸98
4.2.4套索回歸99
4.2.5算法比較與選擇100
4.3回歸的評價指標100
4.4案例: 房價預測項目101
習題4105
第5章分類算法108
5.1邏輯回歸109
5.2K最近鄰算法112
5.3樸素貝葉斯分類器113
5.4決策樹117
5.4.1ID3算法119
5.4.2C4.5算法121
5.4.3CART算法124
5.4.4決策樹總結126
5.5支持向量機127
5.6分類的評價指標132
5.7案例: 垃圾郵件分類項目135
習題5139
第6章集成學習142
6.1集成學習的基本概念142
6.2Bagging算法與Boosting算法143
6.2.1Bagging算法143
6.2.2Boosting算法144
6.3Stacking與模型融合147
6.4XGBoost與LightGBM148
6.4.1XGBoost148
6.4.2LightGBM150
6.5案例: 集成學習在金融欺詐檢測中的應用152
習題6154
第7章聚類分析156
7.1聚類的基本概念156
7.2K均值聚類157
7.3DBSCAN與密度聚類158
7.4層次聚類160
7.5聚類算法的評價指標161
7.6案例: 客戶聚類分析163
習題7167
第8章關聯規則學習170
8.1關聯規則的基本概念170
8.1.1關聯規則概述170
8.1.2關聯規則的背景知識170
8.2常見關聯規則算法172
8.2.1Apriori算法172
8.2.2FPGrowth算法175
8.2.3ECLAT算法181
8.3案例: 圖書購買分析182
習題8185
第9章無監督學習與降維189
9.1主成分分析與線性判別分析189
9.1.1主成分分析189
9.1.2線性判別分析192
9.2自編碼器與tSNE195
9.2.1自編碼器195
9.2.2tSNE197
9.3案例: 圖像分類中的降維與特征提取200
習題9203
第10章時間序列分析207
10.1時間序列數據的特性與預處理207
10.1.1時間序列的特性207
10.1.2時間序列的預處理與可視化208
10.2時間序列預測的常用算法209
10.2.1傳統時序建模209
10.2.2機器學習模型方法210
10.2.3深度學習模型方法210
10.3時間序列預測的性能評估211
10.3.1評估指標211
10.3.2可視化評估211
10.3.3交叉驗證212
10.3.4穩健性測試212
10.4案例: 航空乘客數量預測212
習題10221
第11章機器學習項目綜合實踐224
11.1數據清理和格式化224
11.2探索性數據分析228
11.3特征工程和特征選擇232
11.4基於性能指標比較幾種機器學習模型233
11.5對最佳模型執行超參數調優234
11.6在測試集上評估最佳模型235
11.7解釋模型結果236
11.8結論與展望236
習題11237
參考文獻240







