Hadoop大數據技術原理與應用(第3版)
黑馬程序員 組編;張玉龍 主編
- 出版商: 清華大學
- 出版日期: 2026-08-01
- 售價: $419
- 語言: 簡體中文
- ISBN: 7302721556
- ISBN-13: 9787302721550
-
相關分類:
Hadoop、大數據 Big-data
下單後立即進貨 (約4週~6週)
商品描述
作者簡介
目錄大綱
目錄
第1章初識Hadoop1
1.1大數據概述1
1.1.1什麼是大數據1
1.1.2大數據的數據類型2
1.1.3大數據的特征3
1.1.4研究大數據的意義3
1.2大數據的應用場景4
1.2.1醫療行業的應用4
1.2.2金融行業的應用4
1.2.3零售行業的應用5
1.3Hadoop概述6
1.3.1Hadoop的前世今生6
1.3.2Hadoop的優點與局限7
1.3.3Hadoop的生態體系8
1.3.4Hadoop架構變遷9
1.4本章小結11
1.5課後習題12
第2章部署Hadoop集群13
2.1Hadoop集群部署模式13
2.2Hadoop核心配置14
2.3基於偽分布式模式部署Hadoop18
2.4基於完全分布式模式部署
Hadoop 27
2.5案例——詞頻統計32
2.6本章小結35
2.7課後習題36
第3章HDFS分布式文件系統37
3.1文件系統的分類37
3.2HDFS簡介40
3.2.1HDFS架構40
3.2.2HDFS的特點42
3.3HDFS的文件讀寫流程43
3.4HDFS的健壯性45
3.5HDFS Shell操作46
3.5.1HDFS Shell介紹46
3.5.2案例——通過Shell腳本定時
采集數據到HDFS58
3.6HDFS Java API操作61
3.6.1HDFS Java API介紹61
3.6.2案例——使用HDFS Java
API操作HDFS64
3.7Federation73
3.7.1Federation實現原理73
3.7.2Federation優缺點75
3.7.3實現Federation76
3.8Erasure Coding79
3.9本章小結84
3.10課後習題84
第4章MapReduce分布式計算框架 …86
4.1MapReduce概述86
4.2MapReduce編程模型88
4.3MapReduce工作原理89
4.3.1MapReduce工作過程89
4.3.2MapTask工作原理91
4.3.3ReduceTask工作原理92
4.4MapReduce編程組件93
4.4.1InputFormat組件93
4.4.2Mapper組件95
4.4.3Reducer組件97
4.4.4Partitioner組件99
4.4.5OutputFormat組件100
4.5MapReduce驅動類102
4.6MapReduce性能優化策略104
4.7YARN資源管理框架106
4.7.1YARN架構107
4.7.2YARN工作流程108
4.8MapReduce經典案例——數據
去重110
4.8.1案例分析110
4.8.2案例實現111
4.9MapReduce經典案例——TopN …114
4.9.1案例分析114
4.9.2案例實現114
4.10MapReduce經典案例——倒排
索引118
4.10.1倒排索引概述118
4.10.2案例分析119
4.10.3案例實現120
4.11本章小結125
4.12課後習題125
第5章ZooKeeper分布式協調
服務 1275.1ZooKeeper簡介127
5.1.1ZooKeeper特性128
5.1.2ZooKeeper架構128
5.2ZooKeeper數據模型130
5.3ZooKeeper典型應用場景131
5.4ZooKeeper的Watcher機制132
5.5ZooKeeper的選舉機制134
5.6部署ZooKeeper135
5.6.1基於偽分布式模式部署
ZooKeeper136
5.6.2基於完全分布式模式部署
ZooKeeper139
5.7ZooKeeper Shell操作142
5.8ZooKeeper Java API操作149
5.8.1建立會話149
5.8.2操作ZNode151
5.9本章小結159
5.10課後習題160
第6章Hadoop高可用集群161
6.1HDFS高可用集群161
6.2YARN高可用集群164
6.3部署Hadoop高可用集群165
6.4本章小結176
6.5課後習題176
第7章Hive數據倉庫178
7.1數據倉庫簡介178
7.1.1什麼是數據倉庫178
7.1.2數據倉庫的意義179
7.1.3數據倉庫分層181
7.1.4數據倉庫模型183
7.2Hive簡介186
7.2.1Hive概述186
7.2.2Hive系統架構187
7.2.3Hive數據模型188
7.2.4Hive數據類型190
7.3Beeline概述193
7.4Hive部署196
7.4.1內嵌模式部署Hive196
7.4.2本地模式部署Hive199
7.4.3遠程模式部署Hive203
7.4.4安裝Tez207
7.5數據庫操作211
7.5.1創建數據庫211
7.5.2查詢數據庫212
7.5.3查看數據庫信息213
7.5.4切換數據庫214
7.5.5修改數據庫215
7.5.6刪除數據庫215
7.6表操作217
7.6.1CREATE TABLE語句
分析217
7.6.2創建表218
7.6.3查詢表221
7.6.4查看表信息221
7.6.5修改表222
7.6.6刪除表225
7.6.7修改分區226
7.7數據操作229
7.7.1加載數據229
7.7.2插入數據233
7.7.3查詢數據236
7.7.4連接查詢245
7.8本章小結250
7.9課後習題250
第8章Flume日誌采集系統252
8.1Flume概述252
8.2Flume日誌采集系統架構圖253
8.3部署Flume255
8.4Flume的基本使用256
8.5Flume的采集方案260
8.5.1Flume Sources260
8.5.2Flume Channels264
8.5.3Flume Sinks266
8.6Flume攔截器270
8.7Flume的可靠性保證273
8.7.1負載均衡273
8.7.2故障恢復279
8.8案例——將日誌采集到HDFS282
8.8.1案例分析282
8.8.2案例實現283
8.9本章小結288
8.10課後習題289
第9章Azkaban工作流管理器290
9.1工作流管理器概述290
9.2Azkaban概述291
9.3部署Azkaban292
9.3.1Azkaban部署模式292
9.3.2安裝Azkaban293
9.3.3配置Azkaban294
9.3.4啟動Azkaban297
9.4Azkaban的使用300
9.4.1Azkaban的常用概念300
9.4.2案例演示——基於依賴
關系的Job調度管理302
9.4.3案例演示——基於MapReduce
程序的Job調度管理309
9.4.4案例演示——基於Hive
腳本的任務調度管理313
9.5本章小結318
9.6課後習題318
第10章Spark分布式計算框架320
10.1Spark概述320
10.2Spark SQL簡介322
10.3部署Spark323
10.3.1Spark部署模式323
10.3.2基於Spark on YARN
模式部署Spark324
10.4DataFrame的基礎知識327
10.4.1DataFrame簡介327
10.4.2DataFrame的創建328
10.4.3DataFrame的常用操作 …330
10.4.4DataFrame的數據寫出 …332
10.5基於Spark實現數據遷移334
10.5.1案例演示——將MySQL
中的數據導入HDFS334
10.5.2案例演示——將MySQL
中的數據導入Hive339
10.5.3案例演示——將HDFS
中的數據導入MySQL …341
10.5.4案例演示——將Hive
中的數據導入MySQL …344
10.6本章小結346
10.7課後習題347
第11章綜合項目——網站流量日誌
數據分析系統34811.1系統概述348
11.1.1系統背景介紹348
11.1.2需求分析349
11.1.3系統架構349
11.2項目實施351
11.3本章小結351



