R語言醫學生信數據分析從入門到實戰
孫小潔
- 出版商: 電子工業
- 出版日期: 2026-09-01
- 售價: $654
- 語言: 簡體中文
- ISBN: 7121534304
- ISBN-13: 9787121534300
-
相關分類:
R 語言、生物資訊 Bioinformatics
下單後立即進貨 (約4週~6週)
相關主題
商品描述
這是一本從零基礎到獨立完成多組學分析的醫學生物信息實戰指南,內容涵蓋R語言基礎編程、基因表達芯片數據分析、Bulk轉錄組數據分析、腫瘤免疫微環境分析、單細胞轉錄組數據分析、多組學聯合分析和AI大模型應用等。全書以“體系完整、實戰驅動、對新手友好、AI輔助”為特色,融入真實的數據分析案例、可直接運行的代碼及常見報錯解決方案,貼合主流數據分析思路,解決自學入門難、代碼報錯多、分析流程不清晰的難題,幫助讀者系統掌握生信數據分析全流程。
本書適合生物信息學、生命科學、醫學相關專業的本科生、研究生、醫生及科研工作者閱讀,也適合希望提升數據分析能力的實驗人員、技術人員,以及渴望借助AI工具提高科研效率的初學者與進階者閱讀。另外,本書附贈示例的完整代碼、數據文件等資源,可以助力讀者高效、快速地學習。
作者簡介
主編:孫小潔
生信技能樹合夥人,8年資深全職講師;生信星球創始人之一,全網累計粉絲超7萬人;數百場線上線下培訓的實戰派導師,帶領數萬名學員完成生信數據分析的啟蒙與進階。R包tinyarray 作者,《解碼生命》共同編者。
副主編:曾健明
澳門大學生物醫藥專業博士,生信技能樹、生信菜鳥團、單細胞天地等知名自媒體創始人,累計粉絲超60萬人。運營生物信息學專業的自媒體矩陣,發表超萬篇筆記和教程,組織過數百場線上線下培訓。
副主編:劉運澤
澳門大學醫學院博士,生信星球創始人之一,單細胞天地創作者之一,全網累計粉絲超7萬人。參與多場線上線下培訓,擅長排查和解決各類生信數據分析的疑難問題。R包genekitr作者,《解碼生命》共同編者。
目錄大綱
第1篇 R基礎入門
第1章 初識R語言 2
1.1 基礎概念 2
1.2 軟件安裝 3
1.2.1 安裝前的準備工作 3
1.2.2 R軟件的安裝 5
1.2.3 RStudio的安裝 8
1.3 RStudio的設置和使用 8
1.3.1 RStudio界面 9
1.3.2 RStudio設置 10
1.3.3 使用RStudio Project管理工作目錄 13
1.3.4 使用腳本管理代碼 15
第2章 函數、參數和R包 19
2.1 函數和參數 19
2.1.1 區分函數、形式參數和默認參數 19
2.1.2 形式參數 20
2.1.3 默認參數 20
2.1.4 學會查詢函數的幫助文檔 20
2.1.5 自定義函數編寫和使用 21
2.2 R包的安裝 22
2.2.1 R包的來源及安裝方式 22
2.2.2 檢查R包是否安裝成功 24
2.2.3 設置鏡像 25
2.2.4 指定版本R包的安裝 29
2.2.5 GitHub的R包的離線安裝 34
2.2.6 避免重覆安裝 35
2.2.7 批量安裝包 36
2.3 R包的使用方法 38
2.3.1 加載後使用 38
2.3.2 顯式指定出自x包的x函數 38
2.3.3 獲取R包與函數幫助信息 40
2.4 R包常見的問題及解決辦法 43
2.4.1 報錯:package "xxx" is not available 43
2.4.2 報錯:there is no package called "xxx" 45
2.4.3 報錯:x.x.x is already loaded,but x.x.x is required 46
2.4.4 報錯:object xxx is not exported by xxx 47
2.4.5 報錯:'make' not found 47
2.4.6 報錯:make: /opt/gfortran/bin/gfortran:No such file or directory 50
2.4.7 報錯:Permission denied 53
2.4.8 報錯:The specified module could not be found 54
2.4.9 網絡問題 54
2.4.10 經常被誤解的問題 55
第3章 數據管理 57
3.1 變量 57
3.1.1 變量的賦值與查看 57
3.1.2 變量的命名 58
3.1.3 變量的使用 59
3.2 數據類型 59
3.2.1 數據類型介紹 59
3.2.2 數據類型的判斷 60
3.2.3 數據類型的轉換 61
3.2.4 異常數據 61
3.3 數據結構之向量 62
3.3.1 向量的生成方式 62
3.3.2 單個向量的運算 65
3.3.3 兩個向量的運算 67
3.3.4 向量取子集 70
3.3.5 元素修改 71
3.4 數據結構之數據框 72
3.4.1 創建數據框 72
3.4.2 數據框的屬性 73
3.4.3 數據框取子集 74
3.4.4 數據框的修改 75
3.4.5 兩個數據框的拼接 77
3.5 數據結構之矩陣 79
3.5.1 創建矩陣 79
3.5.2 矩陣的屬性 80
3.5.3 矩陣取子集 81
3.5.4 矩陣的修改 82
3.5.5 兩個矩陣的拼接 82
3.5.6 常用函數 83
3.6 數據結構之列表 86
第4章 數據讀寫 89
4.1 文件讀取技巧 89
4.1.1 文件存放位置 89
4.1.2 不推薦使用絕對路徑 90
4.1.3 區分文件格式和分隔符 90
4.2 R語言原生讀取和導出的方式 91
4.2.1 R語言原生讀取和導出函數介紹 91
4.2.2 R語言原生讀取函數之間的關系 91
4.2.3 文件讀取示例 92
4.3 優化的讀取和導出方式 96
4.3.1 readr包的應用 96
4.3.2 data.table包的應用 98
4.3.3 rio包的應用 100
4.4 多種讀取方法比較 102
4.5 覆雜示例解讀 103
4.5.1 基因表達芯片平臺的註釋文件 103
4.5.2 TCGA的RNAseq counts文件 104
4.5.3 基因表達芯片數據的表達矩陣文件 105
第5章 R語言作圖 107
5.1 R基礎包 107
5.1.1 高級繪圖函數 107
5.1.2 低級繪圖函數 108
5.2 利用ggplot2作圖 109
5.2.1 ggplot2的基本語法 110
5.2.2 設置圖片屬性 111
5.2.3 幾何對象 120
5.2.4 位置關系 121
5.2.5 坐標系調整 124
5.2.6 主題設置 126
5.2.7 使用paletteer配色包 127
5.2.8 完整的ggplot2語法結構 128
5.3 利用ggpubr和ggstatplot作圖 129
5.4 常見拼圖方法 131
5.4.1 par函數的mfrow參數 131
5.4.2 patchwork拼圖 131
5.4.3 cowplot拼圖 137
5.5 圖片的保存與導出方法 141
5.5.1 ggplot2系列保存方法 141
5.5.2 通用保存方法 141
5.5.3 使用eoffice包導出 142
5.6 畫圖的思考過程 142
第6章 實用數據處理與流程控制 143
6.1 tidyr包應用 143
6.1.1 數據清理 143
6.1.2 分割和合並 145
6.1.3 處理NA 146
6.2 dplyr包應用 148
6.2.1 常用函數 148
6.2.2 管道操作(%>%) 153
6.2.3 處理關系數據 154
6.3 stringr包應用 156
6.3.1 stringr包與示例數據 156
6.3.2 長度和數量統計 156
6.3.3 拆分和合並 157
6.3.4 內容定位和篩選 159
6.3.5 大小寫轉換 160
6.3.6 替換和刪除 160
6.4 條件語句 161
6.4.1 if語句 161
6.4.2 if語句衍生的ifelse函數 162
6.4.3 switch函數 163
6.5 循環語句 163
6.5.1 for循環 163
6.5.2 while循環 165
6.6 apply族函數 166
6.6.1 apply函數的應用 166
6.6.2 lapply函數的應用 167
6.6.3 sapply函數的應用 169
6.7 項目管理方法示例 170
6.7.1 腳本的管理 170
6.7.2 項目的管理 172
第2篇 基因表達芯片數據分析實戰
第7章 基因表達芯片數據分析 175
7.1 常見圖表 175
7.1.1 熱圖 175
7.1.2 箱線圖 176
7.1.3 火山圖 178
7.1.4 PCA圖 180
7.2 GEO數據庫介紹 181
7.2.1 數據條目 181
7.2.2 GEO數據集的常見實驗類型 182
7.3 實驗設計思路及案例 182
第8章 基因表達芯片數據標準分析 184
8.1 安裝R包 184
8.1.1 前期設置 184
8.1.2 批量安裝R包 185
8.1.3 檢查是否安裝成功 187
8.2 數據下載與整理 187
8.2.1 前期設置 187
8.2.2 數據下載方式 188
8.2.3 數據整理 189
8.3 提煉分組信息 194
8.3.1 分組信息的3個要求 194
8.3.2 提煉內容 195
8.4 獲取探針註釋 196
8.4.1 查詢註釋R包 196
8.4.2 GPL頁面的表格文件解析 199
8.5 數據質控 207
8.5.1 PCA圖 207
8.5.2 離散基因熱圖 210
8.6 差異分析 212
8.6.1 用limma完成二分組數據的差異分析 212
8.6.2 差異分析結果整理 213
8.6.3 差異分析結果的可視化 215
8.7 富集分析 217
8.7.1 輸入數據 217
8.7.2 執行富集分析 219
8.7.3 分析結果解讀 220
8.7.4 分析結果可視化 222
8.8 基因集富集分析 223
8.8.1 輸入數據準備 223
8.8.2 執行GSEA分析 226
8.8.3 分析結果解讀 227
8.8.4 分析結果可視化 228
8.9 蛋白互作網絡分析 231
8.9.1 導出差異基因和屬性表格 231
8.9.2 使用string網站進行蛋白互作網絡分析 232
8.9.3 cytoscape網絡分析 234
第9章 基因表達芯片數據高級分析 242
9.1 R包安裝與文件下載 242
9.1.1 R包安裝 242
9.1.2 文件下載 243
9.2 tinyarray簡化分析流程 244
9.2.1 數據下載和整理 244
9.2.2 生成分組信息與探針註釋 244
9.2.3 差異分析 245
9.2.4 富集分析 246
9.3 多分組數據分析 247
9.3.1 數據下載和整理 247
9.3.2 生成分組向量與探針註釋 248
9.3.3 差異分析 250
9.3.4 tinyarray的簡化操作 252
9.3.5 富集分析 252
9.4 雙因素數據差異分析 254
9.4.1 實驗設計 254
9.4.2 數據下載和整理 254
9.4.3 整理實驗設計 255
9.4.4 做差異分析 256
9.4.5 差異分析結果的可視化 257
9.4.6 理解logFC的計算方式 258
9.4.7 富集分析 259
9.5 多數據集聯合分析 261
9.5.1 分別進行差異分析後取交集 261
9.5.2 合並表達矩陣後校正批次效應 263
9.5.3 RRA整合差異基因 268
9.6 加權共表達網絡分析 272
9.6.1 數據預整理 272
9.6.2 表達矩陣數據整理 273
9.6.3 表型信息整理 276
9.6.4 WGCNA的具體步驟 277
9.7 常見格式的原始數據處理 286
9.7.1 CEL格式 287
9.7.2 TXT格式 288
第3篇 Bulk轉錄組數據分析實戰
第10章 Bulk轉錄組數據標準分析 294
10.1 R包安裝與文件下載 294
10.1.1 R包安裝 294
10.1.2 文件下載 295
10.2 數據下載和整理 296
10.2.1 項目命名 296
10.2.2 讀取和整理數據 296
10.2.3 表達矩陣行名ID轉換 297
10.2.4 基因過濾 297
10.2.5 分組信息獲取 298
10.2.6 保存數據 298
10.3 差異分析及其可視化 298
10.3.1 三大R包差異分析 299
10.3.2 可視化分析 303
10.3.3 三大R包差異基因對比 305
10.4 富集分析 307
10.4.1 普通富集分析 307
10.4.2 基因集富集分析 309
10.5 數據讀取與整理案例 310
10.5.1 GEO數據庫官方整理的原始計數文件 310
10.5.2 TXT格式的文件讀取和整理示例 313
10.5.3 多個TXT文件的整理與合並 315
10.5.4 TCGA的轉錄組數據整理 317
第11章 Bulk轉錄組高級分析 321
11.1 R包安裝與文件下載 321
11.1.1 R包安裝 321
11.1.2 文件下載 322
11.2 轉錄組多分組數據的差異分析 323
11.2.1 數據下載與整理 323
11.2.2 多分組數據的差異分析 324
11.3 多個轉錄組數據集聯合分析 329
11.3.1 進行差異分析後取交集 329
11.3.2 使用ComBat-seq合並校正Count矩陣 331
11.3.3 RRA整合差異基因 333
11.4 轉錄組加權共表達網絡分析(WGCNA) 338
11.4.1 表達矩陣預整理 338
11.4.2 表達矩陣數據整理 339
11.4.3 表型信息整理 341
11.4.4 WGCNA的具體步驟 342
11.5 機器學習分類模型 350
11.5.1 訓練集數據下載和整理 350
11.5.2 測試集數據下載與整理 354
11.5.3 構建Lasso回歸的分類模型 356
11.5.4 構建隨機森林模型 359
11.5.5 構建支持向量機模型 361
第12章 預後分析 364
12.1 R包安裝與文件下載 364
12.1.1 R包安裝 364
12.1.2 文件下載 365
12.2 TCGA數據下載與整理 365
12.2.1 下載數據 366
12.2.2 表達矩陣的整理 366
12.2.3 整理生存信息和臨床信息 370
12.2.4 實現表達矩陣與臨床信息的匹配 373
12.3 測試集數據的下載與整理 373
12.3.1 整理表達矩陣 373
12.3.2 整理生存信息和臨床信息 375
12.3.3 表達矩陣與臨床信息的對齊 376
12.4 KMplot圖繪制和預後相關基因的篩選 376
12.4.1 準備輸入數據 376
12.4.2 KM生存曲線 377
12.4.3 批量Log-rank檢驗 381
12.4.4 批量單因素Cox回歸 382
12.5 Lasso回歸與預後模型構建 383
12.5.1 準備輸入數據 383
12.5.2 train數據集建模 384
12.5.3 test數據集驗證 386
12.6 構建Cox比例風險模型與多維驗證 386
12.6.1 準備輸入數據 386
12.6.2 構建多因素Cox模型 387
12.6.3 風險評分的計算與評估 387
12.6.4 模型的可視化評估(訓練集) 388
12.6.5 模型的外部驗證(測試集) 392
12.6.6 訓練集與測試集對比驗證 392
12.6.7 風險因子三圖聯動(鏡像驗證) 395
12.7 構建列線圖與校準曲線 396
12.7.1 數據整理 396
12.7.2 構建Cox比例風險模型 397
12.7.3 檢查Cox模型的多重共線性 398
12.7.4 繪制列線圖 398
12.7.5 繪制列線圖校準曲線 399
第13章 腫瘤免疫微環境分析 402
13.1 R包安裝與文件下載 402
13.1.1 R包安裝 402
13.1.2 文件下載 403
13.2 基於ESTIMATE算法的微環境宏觀評估 404
13.2.1 準備數據與評分計算 404
13.2.2 結果提取與腫瘤純度計算 405
13.2.3 高低風險組宏觀微環境差異比較 406
13.3 基於ssGSEA的免疫浸潤計算與可視化 407
13.3.1 免疫基因集準備與表達矩陣預處理 407
13.3.2 免疫浸潤評分計算 407
13.3.3 高低風險組免疫浸潤差異可視化 408
13.4 基於CIBERSORT的免疫浸潤計算與可視化 409
13.4.1 表達矩陣與免疫數據的對齊 409
13.4.2 免疫浸潤比例堆疊柱狀圖 412
13.4.3 免疫細胞豐度差異分組箱線圖 415
13.5 基於IOBR的免疫浸潤計算與可視化 416
13.5.1 提取多種算法的TCGA免疫浸潤評估結果 416
13.5.2 基於xCell的廣譜細胞評估 417
13.5.3 基於MCP-counter的絕對豐度評估 418
13.6 免疫治療隊列的預測與驗證 420
13.6.1 IMmotion150隊列 420
13.6.2 IMvigor210隊列 427
第4篇 單細胞轉錄組數據分析與多組學探索
第14章 單細胞轉錄組數據分析 431
14.1 R包安裝與文件下載 431
14.1.1 R包安裝 431
14.1.2 文件下載 432
14.2 Seurat單樣本數據標準流程 433
14.2.1 環境準備、數據讀取與對象創建 433
14.2.2 質量控制與基礎過濾 435
14.2.3 數據標準化與高度可變基因鑒定 436
14.2.4 數據歸一化縮放與線性降維 436
14.2.5 雙細胞識別與過濾 437
14.2.6 細胞聚類與非線性降維可視化 440
14.3 細胞類型註釋與marker基因計算 442
14.3.1 手動註釋 443
14.3.2 自動註釋 446
14.3.3 marker基因及其可視化 448
14.4 多樣本整合與差異分析 451
14.4.1 數據下載與文件結構整理 451
14.4.2 批量讀取與統一質控 452
14.4.3 雙細胞去除 454
14.4.4 數據整合與批次效應去除 457
14.4.5 聚類分辨率選擇 457
14.4.6 細胞類型註釋 459
14.4.7 分組可視化及細胞比例比較 463
14.4.8 差異分析 464
14.4.9 偽Bulk轉錄組差異分析 466
14.5 細胞亞群的二次分群 467
14.5.1 二次分群背景與子集提取 467
14.5.2 子對象的多樣本整合與重新聚類 468
14.5.3 細胞亞群的細分註釋 469
14.5.4 將細胞亞群註釋映射回原對象 471
14.6 單細胞擬時序分析(Monocle 2) 473
14.6.1 擬時序分析背景與對象構建 473
14.6.2 時序基因篩選與降維 474
14.6.3 構建軌跡與設定發育起點 475
14.6.4 發育軌跡可視化 476
14.6.5 基因表達的時序動態變化 477
14.7 細胞通訊分析(CellChat) 478
14.7.1 細胞通訊分析背景與策略 478
14.7.2 數據準備與數據庫設置 479
14.7.3 自定義函數並分組分析 479
14.7.4 組間通訊網絡宏觀對比 480
14.7.5 信號通路與受體-配體微觀差異探究 481
第15章 多組學探索 485
15.1 R包安裝與文件下載 485
15.1.1 R包安裝 485
15.1.2 文件下載 486
15.2 突變數據 487
15.2.1 數據獲取 487
15.2.2 突變數據的可視化 488
15.3 DNA甲基化芯片數據分析 492
15.3.1 甲基化信號值數據的獲取與預處理 492
15.3.2 甲基化信號值矩陣歸一化與數據質控 494
15.3.3 差異甲基化位點(DMP)分析 496
15.4 拷貝數變異(CNV)分析 500
15.4.1 TCGA拷貝數變異數據的獲取與預處理 500
15.4.2 整理GISTIC2.0分析參考文件 501
15.4.3 基於GISTIC2.0的顯著突變區域鑒定 502
15.4.4 區域水平的拷貝數變異可視化 505
15.4.5 基因水平的差異CNV鑒定與可視化 507
15.5 空間轉錄組的細胞類型映射與空間定位 510
15.5.1 單細胞參考圖譜的預處理與構建 510
15.5.2 空間標簽轉移與細胞亞群反卷積 512
第16章 AI大模型在醫學數據分析中的應用 515
16.1 主流AI工具的使用 515
16.1.1 通過網頁端進行對話式交互 515
16.1.2 通過代碼編輯器進行AI Agent交互 516
16.2 代碼編輯器中的AI Agent 517
16.3 大語言模型在代碼編輯器中的使用 517
16.3.1 在RStudio中使用Copilot 518
16.3.2 在Positron中使用AI智能助手 521
16.4 提問的方法和技巧 525
16.4.1 結構化提問 525
16.4.2 用元數據描述代替大文件上傳 525
16.4.3 分步提問 526
16.4.4 明確約束條件 526
16.4.5 提供報錯信息的上下文 527
16.5 典型分析場景的提示詞實戰 527
16.5.1 數據下載場景:從公共數據庫獲取轉錄組數據 528
16.5.2 數據分析場景:臨床數據的生存分析 528
16.5.3
數據可視化場景:差異基因的火山圖綁制 529
16.5.4 小結 530
16.6 數據隱私底線與學術合規 530
