Python數據挖掘項目化教程(微課版)

陳清華,朱燕民,章逸豐

  • 出版商: 電子工業
  • 出版日期: 2026-07-01
  • 售價: $354
  • 語言: 簡體中文
  • 頁數: 284
  • ISBN: 7121530910
  • ISBN-13: 9787121530913
  • 相關分類: Data-mining
  • 下單後立即進貨 (約4週~6週)

商品描述

本書為大數據、人工智能、軟件技術、電子商務等專業學生的教材。隨著數據要素成為新質生產力的核心驅動力,數據挖掘技術正深度賦能商貿流通、智能制造及綠色低碳等多元領域。本書以掌握一定的Python語言基礎為前提,通過10個典型的行業項目,其內容涵蓋臟數據治理、回歸預測、聚類畫像、循環神經網絡序列預測及工業視覺識別,實現從數據清洗到Web看板交付的全鏈路閉環與軟硬一體化。本書註重理實一體與思政融入。作為微課版教材,本書配有微課視頻、源代碼及行業脫敏數據集等豐富的數字化資源。

目錄大綱

項目1 用餐數據異常分析 1
任務1 用餐數據集成與處理 4
1.1.1 數據挖掘的基本概念 8
1.1.2 特征工程 9
1.1.3 讀取CSV數據並集成 10
1.1.4 數據映射 11
1.1.5 數據類型轉換 11
任務2 用餐數據重復值檢測與處理 11
1.2.1 檢測重復值 13
1.2.2 刪除重復值 13
任務3 用餐數據缺失值檢測與處理 14
1.3.1 檢測缺失值 16
1.3.2 處理缺失值 16
任務4 用餐數據異常值檢測與處理 16
1.4.1 檢測異常值 20
1.4.2 繪制散點圖 21
1.4.3 繪制直方圖 21
1.4.4 繪制箱形圖 21
1.4.5 處理異常值 22
拓展實訓:電影數據加工與處理 22
項目考核 24
項目2 碳排放數據多維分析 27
任務1 對碳排放數據進行分組分析 31
2.1.1 讀取Excel文件數據 35
2.1.2 常用數據分析方法 36
2.1.3 分組分析的基本概念 36
2.1.4 描述性統計分析指標 37
任務2 對碳排放數據進行分布分析 37
2.2.1 分布分析的基本概念 40
2.2.2 數據分箱 40
2.2.3 可視化包 41
任務3 對碳排放數據進行交叉分析 41
2.3.1 交叉分析的基本概念 43
2.3.2 數據透視表 44
2.3.3 交叉表 44
2.3.4 熱力圖 45
任務4 對碳排放數據進行結構分析 45
2.4.1 結構分析的基本概念 48
2.4.2 繪制餅圖 48
任務5 對碳排放數據進行相關分析 49
2.5.1 相關分析的基本概念 51
2.5.2 相關分析 52
拓展實訓:數據分析方法的應用 52
項目考核 54
項目3 電影數據回歸分析 56
任務1 使用一元線性回歸分析方法對日均票房進行預測 59
3.1.1 回歸分析 59
3.1.2 一元線性回歸 61
3.1.3 Sklearn簡介 64
3.1.4 歸一化處理 67
3.1.5 數據集的切分 69
任務2 使用多項式回歸分析方法對日均票房進行預測 72
3.2.1 多項式回歸 72
3.2.2 degree參數的設置 75
任務3 使用多元線性回歸分析方法對電影評分進行預測 78
3.3.1 標簽映射 80
3.3.2 嶺回歸 81
3.3.3 alpha參數的設置 84
3.3.4 回歸模型評估的常用指標 84
拓展實訓:回歸分析方法的應用 85
項目考核 86
項目4 性別與肥胖程度分類分析 89
任務1 使用邏輯回歸實現性別判定 93
4.1.1 機器學習 97
4.1.2 監督學習 98
4.1.3 邏輯回歸 99
4.1.4 Sklearn中的LogisticRegression()函數 100
任務2 使用樸素貝葉斯實現性別判定 101
4.2.1 樸素貝葉斯分類 103
4.2.2 Sklearn中樸素貝葉斯的實現 105
4.2.3 Sklearn中的GaussianNB()函數 105
4.2.4 Sklearn中的MultinomialNB()函數 105
任務3 使用決策樹實現性別判定 106
4.3.1 決策樹 109
4.3.2 Sklearn中的DecisionTreeClassifier()函數 109
4.3.3 分類模型常用評估指標 110
4.3.4 Sklearn中的分類模型評估方法 111
4.3.5 欠擬合與過擬合 111
任務4 使用支持向量機實現性別判定 112
4.4.1 支持向量機 114
4.4.2 Sklearn中支持向量機的實現 115
4.4.3 Sklearn中的SVC()函數 115
任務5 使用支持向量機實現肥胖程度分類 116
4.5.1 核函數的基本概念 119
4.5.2 多項式核函數的使用 120
拓展實訓:肥胖程度分類分析 121
項目考核 122
項目5 鳶尾花多分類分析 124
任務1 使用k近鄰實現鳶尾花的分類 128
5.1.1 k近鄰 131
5.1.2 Sklearn中的KNeighborsClassifier()函數 132
任務2 使用隨機森林實現鳶尾花的分類 133
5.2.1 集成學習 134
5.2.2 隨機森林 135
5.2.3 Sklearn中的RandomForestClassifier()函數 136
任務3 使用TensorFlow設計神經網絡實現鳶尾花的分類 137
5.3.1 人工神經網絡 140
5.3.2 認識TensorFlow 142
5.3.3 神經網絡參數優化 143
任務4 使用多層感知機實現鳶尾花的分類 144
5.4.1 神經網絡的基本原理 146
5.4.2 多層感知機 147
5.4.3 Sklearn中的MLPClassifier()函數 147
拓展實訓:回歸與分類的應用 148
項目考核 150
項目6 觀影用戶聚類分析 152
任務1 使用DBSCAN確定聚類的質心個數 155
6.1.1 無監督學習 159
6.1.2 聚類的基本概念 160
6.1.3 DBSCAN 161
6.1.4 Sklearn中的DBSCAN()函數 162
任務2 使用k-Means對觀影用戶進行聚類分析 162
6.2.1 k-Means的基本概念 165
6.2.2 k-Means的特點 166
6.2.3 Sklearn中的KMeans()函數 167
拓展實訓:根據身高、體重和性別對用戶進行聚類分析 168
項目考核 169
項目7 超市零售數據關聯規則挖掘 171
任務1 對超市零售數據進行預處理 175
任務2 使用Apriori算法實現超市零售數據關聯規則挖掘 177
7.2.1 關聯規則挖掘 180
7.2.2 購物籃模型 182
7.2.3 頻繁項集 182
7.2.4 關聯規則 183
7.2.5 Apriori算法 184
7.2.6 強關聯規則 185
任務3 使用Apyori庫實現超市零售數據關聯規則挖掘 187
7.3.1 Apyori庫 188
7.3.2 Apriori算法的優缺點 189
拓展實訓:論文作者關聯規則挖掘 189
項目考核 190
項目8 人體行為識別應用 193
任務1 使用卷積神經網絡識別人體行為 197
8.1.1 深度學習 201
8.1.2 卷積神經網絡 202
8.1.3 Keras簡介 203
8.1.4 行為數據獲取與特征分析 203
8.1.5 Keras中的卷積層與池化層實現 205
任務2 使用循環神經網絡識別人體行為 206
8.2.1 循環神經網絡 208
8.2.2 長短期記憶網絡 210
8.2.3 Keras中的LSTM()函數 210
拓展實訓:電影評論數據分析應用 211
項目考核 213
項目9 智能產線應用 214
任務1 數據采集環境搭建 217
9.1.1 數控機床 220
9.1.2 工業相機重要參數 222
9.1.3 工業互聯網雲端控制系統的安裝與測試 223
任務2 工件圖像數據采集與增強 226
9.2.1 智能制造行業數據采集 231
9.2.2 智能產線的基本概念 231
9.2.3 機器視覺的基本概念 231
9.2.4 計算機視覺的基本概念 232
9.2.5 圖像增廣技術 235
任務3 工件圖像智能分類分析 236
任務4 誤差自動補償數據分析 239
任務5 聯調與自動化生產驗證 243
拓展實訓:復雜工件分揀與調參應用 245
項目考核 246
項目10 數據挖掘綜合看板實戰 249
任務1 搭建看板基礎架構與多維KPI展示 252
任務2 交互式用戶聚類特征畫像展示 256
任務3 銷量趨勢序列預測應用 260
任務4 “模擬決策”預測模擬器應用 263
拓展實訓:電信客戶價值分析與流失預警駕駛艙 267
項目考核 268
附錄A 本書使用的工具包 270
參考文獻 271