統計學習方法和R語言實踐

陳娟、楊曉蓉

  • 出版商: 清華大學
  • 出版日期: 2026-08-01
  • 售價: $414
  • 語言: 簡體中文
  • ISBN: 7302720258
  • ISBN-13: 9787302720256
  • 相關分類: R 語言
  • 下單後立即進貨 (約4週~6週)

  • 統計學習方法和R語言實踐-preview-1
  • 統計學習方法和R語言實踐-preview-2
  • 統計學習方法和R語言實踐-preview-3
統計學習方法和R語言實踐-preview-1

商品描述

《統計學習方法和R語言實踐》將當前流行的大數據處理的機器學習方法與統計學理論相融合,系統搭建統計學習知識體系,培養兼具統計學思維與大數據技術應用能力的交叉型人才。本書共分11章,第1章介紹統計學習概論、統計學習的分類與模型精度的評價準則等;第2章到第9章,由淺入深講解主流統計學習方法,涵蓋線性回歸、重抽樣、分類方法、非線性回歸、樹模型、支持向量機、非參數檢驗與非參數估計,覆蓋經典與前沿統計學習框架。第10章聚焦R語言核心操作,從基礎語法、數據處理、編程實現到可視化繪圖,幫助讀者掌握R語言數據分析技能。第11章結合各種統計方法構建統計分析模型,解決經濟社會發展中的實際問題,培養統計專業學生大數據分析等相關工作能力。本書可作為統計學、大數據相關專業高年級本科生及碩士研究生的教材,也可作為統計學愛好者的參考用書。

目錄大綱

目    錄

 

第1章  統計學習  1

1.1  統計學習概論  1

1.1.1  統計學習概述  1

1.1.2  統計學習的對象  1

1.1.3  統計學習的方法  2

1.1.4  統計學習的重要性  2

1.2  統計學習的分類  3

1.2.1  按方法分類  3

1.2.2  按模型分類  4

1.3  模型精度的評價準則  4

1.3.1  評價模型精度  5

1.3.2  偏差—方差權衡  6

習題  6

第2章  線性回歸模型  7

2.1  一元線性回歸模型  7

2.1.1  一元線性回歸模型概述  7

2.1.2  一元線性回歸模型的估計  8

2.1.3  一元線性回歸模型的統計檢驗  9

2.1.4  一元線性回歸模型的預測  11

2.2  多元線性回歸模型  11

2.2.1  多元線性回歸模型概述  11

2.2.2  多元線性回歸模型的參數估計  12

2.2.3  多元線性回歸模型的檢驗  13

2.2.4  多元線性回歸模型的預測  15

2.2.5  多元線性回歸的變量遴選  16

2.3  懲罰回歸模型  16

2.3.1  嶺回歸模型  16

2.3.2  Lasso回歸模型  17

2.3.3  Lasso回歸模型的特點  18

2.4  線性回歸模型的R語言實踐  19

2.4.1  用lm函數擬合回歸模型  19

2.4.2 一元線性回歸模型的R語言實踐  20

2.4.3 多元線性回歸模型的R語言實踐  21

2.4.4 線性回歸模型診斷的R語言實踐  23

2.4.5  懲罰回歸模型的R語言實踐  27

習題  31

第3章  重抽樣方法  32

3.1  交叉驗證法  32

3.1.1  驗證集方法  32

3.1.2  留一交叉驗證法  33

3.1.3  k折交叉驗證法  33

3.2  自助法  34

3.3  重抽樣方法的R語言實踐  35

3.3.1  驗證集方法的R語言實踐  35

3.3.2  留一交叉驗證法的R語言實踐  35

3.3.3  k折交叉驗證法的R語言實踐  36

3.3.4  自助法的R語言實踐  36

習題  38

第4章  分類方法  39

4.1  邏輯斯蒂回歸法  39

4.1.1  二項邏輯斯蒂回歸模型概述  39

4.1.2  二項邏輯斯蒂回歸模型的檢驗  40

4.1.3  多項邏輯斯蒂回歸模型概述  43

4.2  判別分析  44

4.2.1  判別分析概述  44

4.2.2  判別函數  45

4.2.3  判別分析方法  46

4.2.4  判別分析的適用條件和驗證  52

4.3  k最近鄰法  53

4.3.1  k最近鄰法概述  53

4.3.2  距離度量  53

4.3.3  k值的選擇  54

4.3.4  分類決策規則  55

4.4  分類方法的R語言實踐  55

4.4.1  邏輯斯蒂回歸的R語言實踐  55

4.4.2  線性判別分析的R語言實踐  58

4.4.3  k最近鄰法的R語言實踐  60

習題  61

第5章  非線性回歸模型  63

5.1  多項式回歸模型  63

5.1.1  多項式回歸模型概述  63

5.1.2  階梯函數模型  64

5.1.3  基函數模型  65

5.2  樣條回歸模型  65

5.2.1  分段多項式函數  65

5.2.2  樣條基函數  66

5.2.3  確定結點的個數和位置  66

5.2.4  與多項式回歸對比  67

5.3  光滑樣條  67

5.3.1  光滑樣條概念  67

5.3.2  選擇平滑參數λ  68

5.4  廣義可加模型  69

5.4.1  GAM模型介紹  69

5.4.2  GAM模型的特點  70

5.4.3  分類問題的GAM模型  70

5.5  非線性回歸模型的R語言實踐  71

5.5.1  多項式回歸模型的R語言實踐  71

5.5.2  樣條回歸模型的R語言實踐  73

5.5.3  GAM模型的R語言實踐  74

習題  75

第6章  基於樹的方法  77

6.1  決策樹模型  77

6.1.1  決策樹模型介紹  77

6.1.2  決策樹的剪枝  78

6.1.3  決策樹模型的特點  79

6.2  分類回歸樹  80

6.2.1  回歸樹的生成  81

6.2.2  分類樹的生成  81

6.2.3  分類回歸樹的剪枝  82

6.3  隨機森林  83

6.3.1  隨機森林的算法  83

6.3.2  隨機森林的特點  84

6.4  提升樹  84

6.4.1  提升方法  84

6.4.2  AdaBoost算法  85

6.4.3  提升樹模型  86

6.5  基於樹方法的R語言實踐  87

6.5.1  決策樹的R語言實踐  87

6.5.2  樹剪枝的R語言實踐  90

6.5.3  回歸樹的R語言實踐  91

6.5.4  隨機森林的R語言實踐  93

6.5.5  提升樹的R語言實踐  95

習題  96

第7章  支持向量機  98

7.1  線性可分支持向量機  98

7.1.1  超平面  98

7.1.2  最大間隔分類器  100

7.1.3  拉格朗日乘數  101

7.1.4  最優化問題的求解  102

7.2  線性支持向量機  103

7.2.1  支持向量分類器  103

7.2.2  支持向量  104

7.3  非線性支持向量機  105

7.3.1  非線性支持向量機介紹  105

7.3.2  核函數  105

7.3.3  多分類的支持向量機  106

7.3.4  與邏輯斯蒂回歸的關系  107

7.4  支持向量機的R語言實踐  107

7.4.1  線性支持向量機的R語言實踐  108

7.4.2  非線性支持向量機的R語言實踐  110

習題  112

第8章  非參數檢驗方法  113

8.1  符號檢驗方法  113

8.1.1  符號檢驗  113

8.1.2  配對樣本的符號檢驗  114

8.2  秩檢驗方法  115

8.2.1  威爾科克森符號秩檢驗  115

8.2.2  Kruskal-Wallis檢驗  117

8.2.3  Jonckheere-Terpstra檢驗  120

8.2.4  區組設計  121

8.3  分類數據的列聯分析  125

8.3.1  列聯表  125

8.3.2  χ2檢驗  126

8.3.3  對數線性模型  127

8.4  非參數檢驗方法的R語言實踐  130

8.4.1  符號檢驗的R語言實踐  130

8.4.2  秩和檢驗的R語言實踐  131

8.4.3  區組設計的R語言實踐  132

8.4.4  列聯表的R語言實踐  134

習題  135

第9章  非參數估計方法  137

9.1  非參數密度估計  137

9.1.1  直方圖  137

9.1.2  核密度估計  139

9.1.3  最近鄰密度估計  141

9.2  非參數回歸  142

9.2.1  非參數回歸模型  142

9.2.2  核估計回歸  143

9.2.3  k近鄰回歸  143

9.3  非參數估計的R語言實踐  144

9.3.1  非參數密度估計的R語言實踐  144

9.3.2  非參數回歸的R語言實踐  147

習題  148

第10章  R語言  151

10.1  R語言的基本概念  151

10.1.1  R語言概述  151

10.1.2  R語言的包  154

10.1.3  R語言的工作空間  156

10.1.4  R語言的獲取幫助  156

10.2  R語言的數據結構  157

10.2.1  數字、字符和向量  157

10.2.2  矩陣、數組和數據框  158

10.2.3  因子、列表和數據庫  162

10.3  R語言的數據整理和編程設計  164

10.3.1  數據的讀與寫  164

10.3.2  數據的清洗  168

10.3.3  數據的初步整理  169

10.3.4  R語言的編程基礎  175

10.4  R語言的繪圖  177

10.4.1  使用圖形  177

10.4.2  圖形參數  178

10.4.3  圖形文本和圖例  181

10.4.4  統計圖形繪制  183

10.5  R語言的字符串操作  190

10.5.1  字符串操作概述  191

10.5.2  正則表達式  193

第11章  案例分析  198

11.1  交通死亡率的研究分析案例  198

11.1.1  數據來源  198

11.1.2  數據整理與可視化  199

11.1.3  數據分析  199

11.1.4  結論  200

11.2  醫療保險費用預測分析案例  201

11.2.1  數據預處理  201

11.2.2  描述性分析  201

11.2.3  多元回歸分析  203

11.2.4  結論  208

11.3  航班取消預測案例  208

11.3.1  數據來源  208

11.3.2  算法介紹  209

11.3.3  數據預處理與分析  209

11.3.4  基於隨機森林分類算法的預測模型  212

11.3.5  結論  213

11.4  蘑菇可食用數據分析案例  214

11.4.1  數據來源  214

11.4.2  數據分析  215

11.4.3  模型預測  216

11.4.4  結論  218

11.5  信用卡違約預測案例  218

11.5.1  數據處理  219

11.5.2  相關性檢驗  221

11.5.3  模型建立與分析  222

11.5.4  結論  224

11.6  數據驅動的銀行營銷行為預測案例  224

11.6.1  數據預處理  225

11.6.2  數據可視化  225

11.6.3  關聯分析  226

11.6.4  基於樹的預測模型  228

11.6.5  結論  231

11.7  女性糖尿病預測案例  232

11.7.1  數據說明  232

11.7.2  數據處理與描述性分析  233

11.7.3  支持向量機(SVM)模型建立  235

11.7.4  結論  237

11.8  城市用電負荷分析案例  238

11.8.1  數據準備  238

11.8.2  相關分析  240

11.8.3  特征工程  242

11.8.4  模型構建  244

11.8.5  結論  246

11.9  居民收入的影響因素分析案例  247

11.9.1  數據預處理  247

11.9.2  影響因素分析  248

11.9.3  結論  252

11.10  中國部分城市水汙染分析案例  253

11.10.1  數據來源  253

11.10.2  探索性分析  254

11.10.3  聚類分析  255

11.10.4  判別分析  256

11.10.5  結論  259

參考文獻  260