Python數據分析與可視化項目教程
梁婷婷 梁肇敏 余悅 主編 黎泓懿 陸珊 盧誌翔 副主編
- 出版商: 清華大學
- 出版日期: 2026-08-01
- 售價: $419
- 語言: 簡體中文
- ISBN: 7302726019
- ISBN-13: 9787302726012
-
相關分類:
Python、Data-visualization、Machine Learning
下單後立即進貨 (約4週~6週)
相關主題
商品描述
本書理論與實踐相結合,循序漸進地介紹使用 Python進行數據分析的完整流程和核心方法,全面、系統地講解了數據獲取、清洗、處理、可視化、探索性分析、預測建模及機器學習算法等內容。全書分5部分共13章,前11章系統介紹數據分析入門、Python數據分析必備編程基礎、Pandas數據處理基礎、數據清洗與預處理、數據可視化分析、數據合並與重塑、分組聚合與數據透視、時間序列分析、探索性數據分析、機器學習之有監督學習、機器學習之無監督學習等核心知識與方法,最後兩章為綜合實踐項目,分別為電商用戶行為分析與精準營銷、混凝土配方優化與成本決策。書中的每個知識點都有相應的實現代碼和實例。 本書主要面向全國高等學校的在讀學生,以及從事數據分析、數據科學、機器學習等領域的廣大教師、科研人員和從業人員。
作者簡介
梁婷婷,女,教授,碩士生導師,國家級一流課程負責人。現任教於南寧學院,擔任人工智能專業帶頭人。深耕於計算機科學與技術領域,特別是在人工智能方向有著深入的研究和豐富的教學經驗,在教學領域,主講的《Python程序設計》課程於2025年被評為國家級一流課程。在教材建設上,擁有豐富經驗,出版多部著作,該教材是其在課程建設成果上的系統凝練,具有三大鮮明特色:一是創新性地將課程思政元素深度融入AI項目實踐,實現價值引領與技能傳授的統一;二是緊貼人工智能前沿技術,精選實戰案例,註重學生問題解決能力的培養;三是配套資源全面,為混合式教學提供有力支撐。該教材已獲多項榮譽與資金支持,已在多所兄弟院校推廣使用。
目錄大綱
目錄
第1部分數據分析準備
第1章數據分析入門3
1.1認識數據分析3
1.1.1數據分析的價值3
1.1.2數據分析的應用4
1.1.3數據分析的核心思維5
1.1.4數據分析流程: OSEMN模型6
1.1.5數據分析方法7
1.2工具與環境搭建8
1.2.1Python在數據分析中的優勢8
1.2.2Anaconda安裝與配置8
1.3Jupyter Notebook核心操作與文檔撰寫10
1.3.1Jupyter Notebook的筆記本和單元格10
1.3.2筆記本文件的創建、運行與管理11
1.3.3高效快捷鍵操作指南12
1.3.4使用Markdown撰寫結構化分析文檔13
1.4實踐: 超市運營數據分析方案設計15
1.4.1項目背景15
1.4.2項目目標16
1.4.3項目實施16
1.4.4項目總結18
第2章Python數據分析必備編程基礎20
2.1Python程序的基本構成要素20
2.1.1行20
2.1.2縮進21
2.1.3標識符21
2.1.4關鍵字21
2.1.5註釋21
2.1.6變量22
2.1.7引號和轉義字符22
2.2基本數據類型及類型轉換與常用運算22
2.2.1基本數據類型22
2.2.2數據類型轉換23
2.3數據運算與常用函數23
2.3.1基本運算符與優先級23
2.3.2常用內置函數24
2.4流程控制結構24
2.4.1順序結構24
2.4.2選擇結構25
2.4.3循環結構25
2.5函數26
2.5.1自定義函數26
2.5.2匿名函數26
2.6容器類型與基本操作27
2.6.1列表及其基本操作27
2.6.2元組及其基本操作28
2.6.3集合及其基本操作29
2.6.4字典及其基本操作30
2.6.5容器數據類型的通用操作31
2.7使用NumPy進行高效數據計算32
2.7.1NumPy數組32
2.7.2NumPy數組的核心優勢33
2.7.3數組的創建與保存35
2.7.4數組的基本屬性43
2.7.5數組索引44
2.7.6數組形狀操作45
2.7.7向量化運算47
2.7.8廣播機制50
2.8實踐: 電商銷售數據分析52
2.8.1項目背景52
2.8.2項目目標52
2.8.3項目實施52
2.8.4項目總結55
第2部分數據處理與可視化分析
第3章Pandas數據處理基礎59
3.1Pandas的數據結構59
3.1.1Pandas數據結構的創建60
3.1.2Pandas數據結構的基本屬性63
3.2索引操作65
3.2.1索引對象的核心特性65
3.2.2索引的基本操作65
3.2.3缺失值處理68
3.3數據的查詢69
3.3.1快速瀏覽數據70
3.3.2精確提取數據: loc、iloc72
3.4數據的編輯75
3.4.1修改數據75
3.4.2增加數據76
3.4.3刪除DataFrame數據77
3.5描述性統計分析79
3.5.1數值型特征的描述性統計(describe()方法)79
3.5.2常用統計函數80
3.5.3類別型特征的頻數統計81
3.6分級別匯總統計83
3.6.1創建層次化索引(set_index()方法)83
3.6.2重排層次化索引(swaplevel()方法)84
3.6.3分級別匯總統計(level參數)85
3.7數據排序86
3.7.1按索引排序(sort_index()方法)86
3.7.2按數值排序(sort_values()方法)88
3.8利用Pandas讀寫數據90
3.8.1讀寫文本類文件90
3.8.2讀寫Excel文件92
3.8.3讀寫數據庫文件94
3.9實踐: 電商運營數據初探97
3.9.1項目背景97
3.9.2項目目標98
3.9.3項目實施98
3.9.4項目總結101
第4章數據清洗與預處理102
4.1數據清洗與預處理基礎102
4.1.1數據清洗與預處理的目標與重要性102
4.1.2數據質量問題的常見類型103
4.1.3數據清洗與預處理的基本流程103
4.2重復值的檢測與處理104
4.2.1重復值的判定規則104
4.2.2重復值的檢測與標識104
4.2.3重復值的刪除處理106
4.3缺失值的檢測與處理107
4.3.1缺失值的檢測與統計108
4.3.2缺失值的刪除處理108
4.3.3缺失值的填充處理109
4.3.4缺失值的插值填充111
4.4異常值檢測與處理112
4.4.1標準差(3σ)法113
4.4.2箱線圖法114
4.4.3異常值的處理策略115
4.5數據轉換與標準化116
4.5.1數據類型轉換與編碼116
4.5.2數據的歸一化與標準化118
4.5.3連續數據分箱與離散化120
4.6實踐: 電商訂單數據清洗與預處理項目121
4.6.1項目背景121
4.6.2項目目標122
4.6.3項目實施122
4.6.4項目總結125
第5章數據可視化分析126
5.1數據可視化分析簡介126
5.1.1數據可視化分析的經典案例126
5.1.2數據可視化的分析用途127
5.1.3數據可視化圖表類型128
5.1.4Python數據可視化方法128
5.2Matplotlib基礎繪圖129
5.2.1Matplotlib的安裝129
5.2.2Matplotlib繪圖主要流程130
5.2.3圖形屬性與rc參數配置132
5.3Matplotlib 常用圖表繪制135
5.3.1折線圖135
5.3.2柱狀圖139
5.3.3散點圖140
5.3.4餅圖142
5.3.5箱線圖144
5.3.6熱力圖146
5.4實踐: 人力資源數據可視化分析148
5.4.1項目背景148
5.4.2項目目標149
5.4.3項目實施150
5.4.4項目總結160
第3部分數據整合與探索性分析
第6章數據合並與重塑163
6.1縱向合並163
6.1.1縱向合並簡介163
6.1.2數據合並函數concat()164
6.2橫向合並166
6.2.1橫向合並簡介166
6.2.2使用concat()函數進行橫向合並167
6.2.3使用merge()函數進行橫向合並168
6.2.4使用join()方法進行橫向合並170
6.3數據變形172
6.3.1什麼是數據變形172
6.3.2數據變形的兩種基本形式172
6.3.3寬格式轉長格式函數melt()172
6.3.4長格式轉寬格式函數pivot()174
6.3.5層次化索引操作stack()與unstack()175
6.4實踐: 中風患者健康數據整合與分析177
6.4.1項目背景177
6.4.2項目目標178
6.4.3項目實施178
6.4.4項目總結181
第7章分組聚合與數據透視182
7.1分組思想182
7.1.1為什麼要分組182
7.1.2分組分析三步驟183
7.2分組描述統計183
7.2.1groupby()基礎用法184
7.2.2單列分組與多列分組184
7.2.3分組對象的常用屬性和方法185
7.2.4分組後直接應用統計方法187
7.3數據聚合基礎188
7.3.1agg方法及基礎用法188
7.3.2多函數聚合與多列聚合190
7.4進階聚合192
7.4.1靈活的自定義聚合192
7.4.2保持形狀的聚合193
7.4.33種聚合方法對比與選擇原則195
7.5數據透視表(pivot_table)195
7.5.1從分組到透視的思維轉換195
7.5.2數據透視表核心用法197
7.5.3透視表與分組運算的功能定位198
7.6交叉表199
7.6.1交叉表核心用法199
7.6.2交叉表與透視表的差異200
7.7實踐: 城市空氣質量數據統計分析201
7.7.1項目背景201
7.7.2項目目標201
7.7.3項目實施201
7.7.4項目總結205
第8章時間序列分析207
8.1時間類型數據的轉換與索引對象構建207
8.1.1時間字符串轉換為標準時間類型207
8.1.2時間索引對象209
8.2時間序列常用操作211
8.2.1時間信息提取211
8.2.2時間間隔運算213
8.2.3有規律時間序列創建214
8.2.4重采樣216
8.3趨勢分解218
8.3.1趨勢分解基礎模型218
8.3.2趨勢分解函數seasonal_decompose()219
8.4時間序列預測方法之移動平均法221
8.4.1移動平均法原理221
8.4.2移動平均法的應用222
8.5實踐: 某產品日銷量季節性分析224
8.5.1項目背景224
8.5.2項目目標225
8.5.3項目實施225
8.5.4項目總結230
第9章探索性數據分析231
9.1EDA概述與核心思想231
9.1.1什麼是探索性數據分析231
9.1.2EDA與建模的關系232
9.1.3EDA的基本流程框架232
9.2單變量分布分析233
9.2.1集中趨勢233
9.2.2離散程度234
9.2.3分布可視化235
9.3雙變量關系分析236
9.3.1數值變量間關系236
9.3.2分類變量與數值變量關系238
9.3.3分類變量間關系239
9.4多變量探索分析241
9.4.1多變量相關性矩陣241
9.4.2散點矩陣與降維觀察243
9.4.3分組聚合與對比分析247
9.5實踐: 心臟病患病數據EDA250
9.5.1項目背景250
9.5.2項目目標251
9.5.3項目實施251
9.5.4項目總結258
第4部分預測建模與機器學習
第10章機器學習之有監督學習263
10.1機器學習概述263
10.1.1機器學習簡介263
10.1.2scikitlearn 庫簡介264
10.1.3機器學習方法分類266
10.1.4機器學習方法的選擇路徑266
10.1.5機器學習工作流程267
10.2特征工程268
10.2.1特征選擇268
10.2.2特征構造269
10.3有監督學習269
10.4模型評估指標270
10.5實踐: 回歸預測與房價估計模型272
10.5.1項目背景273
10.5.2項目目標273
10.5.3項目實施273
10.5.4項目總結281
10.6實踐: 分類預測與用戶流失預警模型282
10.6.1項目背景282
10.6.2項目目標282
10.6.3項目實施283
10.6.4項目總結291
第11章機器學習之無監督學習292
11.1無監督學習概述292
11.2聚類分析293
11.3KMeans聚類算法296
11.3.1KMeans算法原理與K值選擇296
11.3.2聚類結果評估與可視化299
11.4實踐: 遊客評論聚類分析302
11.4.1項目背景302
11.4.2項目目標302
11.4.3項目實施303
11.4.4項目總結308
第5部分綜 合 實 踐
第12章電商用戶行為分析與精準營銷313
12.1項目背景313
12.2項目目標314
12.3項目實施314
12.3.1數據獲取與預處理315
12.3.2RFM指標計算與基本信息合並325
12.3.3用戶分群——基於RFM的KMeans聚類分析327
12.3.4群組特征可視化與業務解讀330
12.4項目總結334
第13章混凝土配方優化與成本決策335
13.1項目背景335
13.2項目目標336
13.3項目實施336
13.3.1數據探索與問題識別337
13.3.2特征工程與業務理解340
13.3.3模型構建與評估341
13.3.4成本優化與決策支持345
13.4項目總結347
參考文獻348







