統計學習方法和R語言實踐
陳娟、楊曉蓉
商品描述
《統計學習方法和R語言實踐》將當前流行的大數據處理的機器學習方法與統計學理論相融合,系統搭建統計學習知識體系,培養兼具統計學思維與大數據技術應用能力的交叉型人才。本書共分11章,第1章介紹統計學習概論、統計學習的分類與模型精度的評價準則等;第2章到第9章,由淺入深講解主流統計學習方法,涵蓋線性回歸、重抽樣、分類方法、非線性回歸、樹模型、支持向量機、非參數檢驗與非參數估計,覆蓋經典與前沿統計學習框架。第10章聚焦R語言核心操作,從基礎語法、數據處理、編程實現到可視化繪圖,幫助讀者掌握R語言數據分析技能。第11章結合各種統計方法構建統計分析模型,解決經濟社會發展中的實際問題,培養統計專業學生大數據分析等相關工作能力。本書可作為統計學、大數據相關專業高年級本科生及碩士研究生的教材,也可作為統計學愛好者的參考用書。
目錄大綱
目 錄
第1章 統計學習 1
1.1 統計學習概論 1
1.1.1 統計學習概述 1
1.1.2 統計學習的對象 1
1.1.3 統計學習的方法 2
1.1.4 統計學習的重要性 2
1.2 統計學習的分類 3
1.2.1 按方法分類 3
1.2.2 按模型分類 4
1.3 模型精度的評價準則 4
1.3.1 評價模型精度 5
1.3.2 偏差—方差權衡 6
習題 6
第2章 線性回歸模型 7
2.1 一元線性回歸模型 7
2.1.1 一元線性回歸模型概述 7
2.1.2 一元線性回歸模型的估計 8
2.1.3 一元線性回歸模型的統計檢驗 9
2.1.4 一元線性回歸模型的預測 11
2.2 多元線性回歸模型 11
2.2.1 多元線性回歸模型概述 11
2.2.2 多元線性回歸模型的參數估計 12
2.2.3 多元線性回歸模型的檢驗 13
2.2.4 多元線性回歸模型的預測 15
2.2.5 多元線性回歸的變量遴選 16
2.3 懲罰回歸模型 16
2.3.1 嶺回歸模型 16
2.3.2 Lasso回歸模型 17
2.3.3 Lasso回歸模型的特點 18
2.4 線性回歸模型的R語言實踐 19
2.4.1 用lm函數擬合回歸模型 19
2.4.2 一元線性回歸模型的R語言實踐 20
2.4.3 多元線性回歸模型的R語言實踐 21
2.4.4 線性回歸模型診斷的R語言實踐 23
2.4.5 懲罰回歸模型的R語言實踐 27
習題 31
第3章 重抽樣方法 32
3.1 交叉驗證法 32
3.1.1 驗證集方法 32
3.1.2 留一交叉驗證法 33
3.1.3 k折交叉驗證法 33
3.2 自助法 34
3.3 重抽樣方法的R語言實踐 35
3.3.1 驗證集方法的R語言實踐 35
3.3.2 留一交叉驗證法的R語言實踐 35
3.3.3 k折交叉驗證法的R語言實踐 36
3.3.4 自助法的R語言實踐 36
習題 38
第4章 分類方法 39
4.1 邏輯斯蒂回歸法 39
4.1.1 二項邏輯斯蒂回歸模型概述 39
4.1.2 二項邏輯斯蒂回歸模型的檢驗 40
4.1.3 多項邏輯斯蒂回歸模型概述 43
4.2 判別分析 44
4.2.1 判別分析概述 44
4.2.2 判別函數 45
4.2.3 判別分析方法 46
4.2.4 判別分析的適用條件和驗證 52
4.3 k最近鄰法 53
4.3.1 k最近鄰法概述 53
4.3.2 距離度量 53
4.3.3 k值的選擇 54
4.3.4 分類決策規則 55
4.4 分類方法的R語言實踐 55
4.4.1 邏輯斯蒂回歸的R語言實踐 55
4.4.2 線性判別分析的R語言實踐 58
4.4.3 k最近鄰法的R語言實踐 60
習題 61
第5章 非線性回歸模型 63
5.1 多項式回歸模型 63
5.1.1 多項式回歸模型概述 63
5.1.2 階梯函數模型 64
5.1.3 基函數模型 65
5.2 樣條回歸模型 65
5.2.1 分段多項式函數 65
5.2.2 樣條基函數 66
5.2.3 確定結點的個數和位置 66
5.2.4 與多項式回歸對比 67
5.3 光滑樣條 67
5.3.1 光滑樣條概念 67
5.3.2 選擇平滑參數λ 68
5.4 廣義可加模型 69
5.4.1 GAM模型介紹 69
5.4.2 GAM模型的特點 70
5.4.3 分類問題的GAM模型 70
5.5 非線性回歸模型的R語言實踐 71
5.5.1 多項式回歸模型的R語言實踐 71
5.5.2 樣條回歸模型的R語言實踐 73
5.5.3 GAM模型的R語言實踐 74
習題 75
第6章 基於樹的方法 77
6.1 決策樹模型 77
6.1.1 決策樹模型介紹 77
6.1.2 決策樹的剪枝 78
6.1.3 決策樹模型的特點 79
6.2 分類回歸樹 80
6.2.1 回歸樹的生成 81
6.2.2 分類樹的生成 81
6.2.3 分類回歸樹的剪枝 82
6.3 隨機森林 83
6.3.1 隨機森林的算法 83
6.3.2 隨機森林的特點 84
6.4 提升樹 84
6.4.1 提升方法 84
6.4.2 AdaBoost算法 85
6.4.3 提升樹模型 86
6.5 基於樹方法的R語言實踐 87
6.5.1 決策樹的R語言實踐 87
6.5.2 樹剪枝的R語言實踐 90
6.5.3 回歸樹的R語言實踐 91
6.5.4 隨機森林的R語言實踐 93
6.5.5 提升樹的R語言實踐 95
習題 96
第7章 支持向量機 98
7.1 線性可分支持向量機 98
7.1.1 超平面 98
7.1.2 最大間隔分類器 100
7.1.3 拉格朗日乘數 101
7.1.4 最優化問題的求解 102
7.2 線性支持向量機 103
7.2.1 支持向量分類器 103
7.2.2 支持向量 104
7.3 非線性支持向量機 105
7.3.1 非線性支持向量機介紹 105
7.3.2 核函數 105
7.3.3 多分類的支持向量機 106
7.3.4 與邏輯斯蒂回歸的關系 107
7.4 支持向量機的R語言實踐 107
7.4.1 線性支持向量機的R語言實踐 108
7.4.2 非線性支持向量機的R語言實踐 110
習題 112
第8章 非參數檢驗方法 113
8.1 符號檢驗方法 113
8.1.1 符號檢驗 113
8.1.2 配對樣本的符號檢驗 114
8.2 秩檢驗方法 115
8.2.1 威爾科克森符號秩檢驗 115
8.2.2 Kruskal-Wallis檢驗 117
8.2.3 Jonckheere-Terpstra檢驗 120
8.2.4 區組設計 121
8.3 分類數據的列聯分析 125
8.3.1 列聯表 125
8.3.2 χ2檢驗 126
8.3.3 對數線性模型 127
8.4 非參數檢驗方法的R語言實踐 130
8.4.1 符號檢驗的R語言實踐 130
8.4.2 秩和檢驗的R語言實踐 131
8.4.3 區組設計的R語言實踐 132
8.4.4 列聯表的R語言實踐 134
習題 135
第9章 非參數估計方法 137
9.1 非參數密度估計 137
9.1.1 直方圖 137
9.1.2 核密度估計 139
9.1.3 最近鄰密度估計 141
9.2 非參數回歸 142
9.2.1 非參數回歸模型 142
9.2.2 核估計回歸 143
9.2.3 k近鄰回歸 143
9.3 非參數估計的R語言實踐 144
9.3.1 非參數密度估計的R語言實踐 144
9.3.2 非參數回歸的R語言實踐 147
習題 148
第10章 R語言 151
10.1 R語言的基本概念 151
10.1.1 R語言概述 151
10.1.2 R語言的包 154
10.1.3 R語言的工作空間 156
10.1.4 R語言的獲取幫助 156
10.2 R語言的數據結構 157
10.2.1 數字、字符和向量 157
10.2.2 矩陣、數組和數據框 158
10.2.3 因子、列表和數據庫 162
10.3 R語言的數據整理和編程設計 164
10.3.1 數據的讀與寫 164
10.3.2 數據的清洗 168
10.3.3 數據的初步整理 169
10.3.4 R語言的編程基礎 175
10.4 R語言的繪圖 177
10.4.1 使用圖形 177
10.4.2 圖形參數 178
10.4.3 圖形文本和圖例 181
10.4.4 統計圖形繪制 183
10.5 R語言的字符串操作 190
10.5.1 字符串操作概述 191
10.5.2 正則表達式 193
第11章 案例分析 198
11.1 交通死亡率的研究分析案例 198
11.1.1 數據來源 198
11.1.2 數據整理與可視化 199
11.1.3 數據分析 199
11.1.4 結論 200
11.2 醫療保險費用預測分析案例 201
11.2.1 數據預處理 201
11.2.2 描述性分析 201
11.2.3 多元回歸分析 203
11.2.4 結論 208
11.3 航班取消預測案例 208
11.3.1 數據來源 208
11.3.2 算法介紹 209
11.3.3 數據預處理與分析 209
11.3.4 基於隨機森林分類算法的預測模型 212
11.3.5 結論 213
11.4 蘑菇可食用數據分析案例 214
11.4.1 數據來源 214
11.4.2 數據分析 215
11.4.3 模型預測 216
11.4.4 結論 218
11.5 信用卡違約預測案例 218
11.5.1 數據處理 219
11.5.2 相關性檢驗 221
11.5.3 模型建立與分析 222
11.5.4 結論 224
11.6 數據驅動的銀行營銷行為預測案例 224
11.6.1 數據預處理 225
11.6.2 數據可視化 225
11.6.3 關聯分析 226
11.6.4 基於樹的預測模型 228
11.6.5 結論 231
11.7 女性糖尿病預測案例 232
11.7.1 數據說明 232
11.7.2 數據處理與描述性分析 233
11.7.3 支持向量機(SVM)模型建立 235
11.7.4 結論 237
11.8 城市用電負荷分析案例 238
11.8.1 數據準備 238
11.8.2 相關分析 240
11.8.3 特征工程 242
11.8.4 模型構建 244
11.8.5 結論 246
11.9 居民收入的影響因素分析案例 247
11.9.1 數據預處理 247
11.9.2 影響因素分析 248
11.9.3 結論 252
11.10 中國部分城市水汙染分析案例 253
11.10.1 數據來源 253
11.10.2 探索性分析 254
11.10.3 聚類分析 255
11.10.4 判別分析 256
11.10.5 結論 259
參考文獻 260



