Hadoop大數據技術原理與應用(第3版)

黑馬程序員 組編;張玉龍 主編

  • 出版商: 清華大學
  • 出版日期: 2026-08-01
  • 售價: $419
  • 語言: 簡體中文
  • ISBN: 7302721556
  • ISBN-13: 9787302721550
  • 相關分類: Hadoop大數據 Big-data
  • 下單後立即進貨 (約4週~6週)

  • Hadoop大數據技術原理與應用(第3版)-preview-1
  • Hadoop大數據技術原理與應用(第3版)-preview-2
  • Hadoop大數據技術原理與應用(第3版)-preview-3
Hadoop大數據技術原理與應用(第3版)-preview-1

商品描述

本書在前兩版教學體系的基礎上進行了系統升級與全面優化。以Hadoop 3.4.1為核心版本,圍繞Hadoop生態的全流程展開講解。全書共11章,內容覆蓋大數據概念、Hadoop理論基礎、Hadoop部署、HDFS應用、MapReduce應用、Hive部署與應用、ZooKeeper部署與應用、Flume部署與應用、Azkaban部署與應用、Spark部署與應用和綜合項目實踐,系統展示基於Hadoop生態構建大數據平臺並完成端到端數據處理與分析的整體過程。 本書附有豐富的教學資源,包括配套教學視頻、PPT課件、教學設計等,並特別為初學者提供了在線答疑服務,以幫助讀者更好地掌握書中的知識內容,歡迎讀者關註和使用。 本書兼具系統性、實用性與時代性,既適合作為高等教育本科和專科數據科學與大數據技術及相關專業的教材,也可作為數據開發、數據分析崗位培訓的實踐指導用書。

作者簡介

張明強,擔任江蘇傳智播客教育科技股份有限公司教材研發中心教材編輯一職,負責編寫大數據技術相關教材和制作教材的配套資源,有多年教育領域相關工作經驗,曾編寫《Flink基礎入門》《HBase基礎入門》《Hive數據倉庫應用》《NoSQL數據庫技術與應用》等大數據技術教材。

目錄大綱

目錄

第1章初識Hadoop1

1.1大數據概述1

1.1.1什麼是大數據1

1.1.2大數據的數據類型2

1.1.3大數據的特征3

1.1.4研究大數據的意義3

1.2大數據的應用場景4

1.2.1醫療行業的應用4

1.2.2金融行業的應用4

1.2.3零售行業的應用5

1.3Hadoop概述6

1.3.1Hadoop的前世今生6

1.3.2Hadoop的優點與局限7

1.3.3Hadoop的生態體系8

1.3.4Hadoop架構變遷9

1.4本章小結11

1.5課後習題12

第2章部署Hadoop集群13

2.1Hadoop集群部署模式13

2.2Hadoop核心配置14

2.3基於偽分布式模式部署Hadoop18

2.4基於完全分布式模式部署

Hadoop 27

2.5案例——詞頻統計32

2.6本章小結35

2.7課後習題36

第3章HDFS分布式文件系統37

3.1文件系統的分類37

3.2HDFS簡介40

3.2.1HDFS架構40

3.2.2HDFS的特點42

3.3HDFS的文件讀寫流程43

3.4HDFS的健壯性45

3.5HDFS Shell操作46

3.5.1HDFS Shell介紹46

3.5.2案例——通過Shell腳本定時

采集數據到HDFS58

3.6HDFS Java API操作61

3.6.1HDFS Java API介紹61

3.6.2案例——使用HDFS Java 

API操作HDFS64

3.7Federation73

3.7.1Federation實現原理73

3.7.2Federation優缺點75

3.7.3實現Federation76

3.8Erasure Coding79

3.9本章小結84

3.10課後習題84

第4章MapReduce分布式計算框架 …86

4.1MapReduce概述86

4.2MapReduce編程模型88

4.3MapReduce工作原理89

4.3.1MapReduce工作過程89

4.3.2MapTask工作原理91

4.3.3ReduceTask工作原理92

4.4MapReduce編程組件93

4.4.1InputFormat組件93

4.4.2Mapper組件95

4.4.3Reducer組件97

4.4.4Partitioner組件99

4.4.5OutputFormat組件100

4.5MapReduce驅動類102

4.6MapReduce性能優化策略104

4.7YARN資源管理框架106

4.7.1YARN架構107

4.7.2YARN工作流程108

4.8MapReduce經典案例——數據

去重110

4.8.1案例分析110

4.8.2案例實現111

4.9MapReduce經典案例——TopN …114

4.9.1案例分析114

4.9.2案例實現114

4.10MapReduce經典案例——倒排

索引118

4.10.1倒排索引概述118

4.10.2案例分析119

4.10.3案例實現120

4.11本章小結125

4.12課後習題125

第5章ZooKeeper分布式協調

服務 1275.1ZooKeeper簡介127

5.1.1ZooKeeper特性128

5.1.2ZooKeeper架構128

5.2ZooKeeper數據模型130

5.3ZooKeeper典型應用場景131

5.4ZooKeeper的Watcher機制132

5.5ZooKeeper的選舉機制134

5.6部署ZooKeeper135

5.6.1基於偽分布式模式部署

ZooKeeper136

5.6.2基於完全分布式模式部署

ZooKeeper139

5.7ZooKeeper Shell操作142

5.8ZooKeeper Java API操作149

5.8.1建立會話149

5.8.2操作ZNode151

5.9本章小結159

5.10課後習題160

第6章Hadoop高可用集群161

6.1HDFS高可用集群161

6.2YARN高可用集群164

6.3部署Hadoop高可用集群165

6.4本章小結176

6.5課後習題176

第7章Hive數據倉庫178

7.1數據倉庫簡介178

7.1.1什麼是數據倉庫178

7.1.2數據倉庫的意義179

7.1.3數據倉庫分層181

7.1.4數據倉庫模型183

7.2Hive簡介186

7.2.1Hive概述186

7.2.2Hive系統架構187

7.2.3Hive數據模型188

7.2.4Hive數據類型190

7.3Beeline概述193

7.4Hive部署196

7.4.1內嵌模式部署Hive196

7.4.2本地模式部署Hive199

7.4.3遠程模式部署Hive203

7.4.4安裝Tez207

7.5數據庫操作211

7.5.1創建數據庫211

7.5.2查詢數據庫212

7.5.3查看數據庫信息213

7.5.4切換數據庫214

7.5.5修改數據庫215

7.5.6刪除數據庫215

7.6表操作217

7.6.1CREATE TABLE語句

分析217

7.6.2創建表218

7.6.3查詢表221

7.6.4查看表信息221

7.6.5修改表222

7.6.6刪除表225

7.6.7修改分區226

7.7數據操作229

7.7.1加載數據229

7.7.2插入數據233

7.7.3查詢數據236

7.7.4連接查詢245

7.8本章小結250

7.9課後習題250

第8章Flume日誌采集系統252

8.1Flume概述252

8.2Flume日誌采集系統架構圖253

8.3部署Flume255

8.4Flume的基本使用256

8.5Flume的采集方案260

8.5.1Flume Sources260

8.5.2Flume Channels264

8.5.3Flume Sinks266

8.6Flume攔截器270

8.7Flume的可靠性保證273

8.7.1負載均衡273

8.7.2故障恢復279

8.8案例——將日誌采集到HDFS282

8.8.1案例分析282

8.8.2案例實現283

8.9本章小結288

8.10課後習題289

第9章Azkaban工作流管理器290

9.1工作流管理器概述290

9.2Azkaban概述291

9.3部署Azkaban292

9.3.1Azkaban部署模式292

9.3.2安裝Azkaban293

9.3.3配置Azkaban294

9.3.4啟動Azkaban297

9.4Azkaban的使用300

9.4.1Azkaban的常用概念300

9.4.2案例演示——基於依賴

關系的Job調度管理302

9.4.3案例演示——基於MapReduce

程序的Job調度管理309

9.4.4案例演示——基於Hive

腳本的任務調度管理313

9.5本章小結318

9.6課後習題318

第10章Spark分布式計算框架320

10.1Spark概述320

10.2Spark SQL簡介322

10.3部署Spark323

10.3.1Spark部署模式323

10.3.2基於Spark on YARN

模式部署Spark324

10.4DataFrame的基礎知識327

10.4.1DataFrame簡介327

10.4.2DataFrame的創建328

10.4.3DataFrame的常用操作 …330

10.4.4DataFrame的數據寫出 …332

10.5基於Spark實現數據遷移334

10.5.1案例演示——將MySQL

中的數據導入HDFS334

10.5.2案例演示——將MySQL

中的數據導入Hive339

10.5.3案例演示——將HDFS

中的數據導入MySQL …341

10.5.4案例演示——將Hive

中的數據導入MySQL …344

10.6本章小結346

10.7課後習題347

第11章綜合項目——網站流量日誌

數據分析系統34811.1系統概述348

11.1.1系統背景介紹348

11.1.2需求分析349

11.1.3系統架構349

11.2項目實施351

11.3本章小結351