大數據技術基礎實驗

歐中洪,朱一凡,宋美娜,鄂海紅

  • 出版商: 電子工業
  • 出版日期: 2026-07-01
  • 售價: $414
  • 語言: 簡體中文
  • 頁數: 224
  • ISBN: 7121531569
  • ISBN-13: 9787121531569
  • 相關分類: 大數據 Big-data、Hadoop、Spark
  • 下單後立即進貨 (約4週~6週)

商品描述

《大數據技術基礎實驗》是一本面向大數據處理的實驗教材,旨在幫助學生從理論學習過渡到實際操作,全面掌握大數據技術的實踐應用。本書系統講解了Spark、Storm、Flink等主流大數據處理框架的實踐操作,涵蓋了從大數據的存儲(HDFS,HBase)到批處理、流處理全過程。教材內容分為六章,每章圍繞一個核心主題展開。第一章介紹大數據技術的總體框架、大數據的處理流程和三大核心:HDFS、HBase和MapReduce,讓讀者從宏觀上認識大數據技術。後四章圍繞具體實操展開,輔以具體命令和代碼,系統介紹從存儲——處理——分析的大數據技術全過程。簡單說明如下:第二章聚焦於大數據技術的基礎——數據存儲,具體包括HDFS,HBase等組件的使用。第三章討論批處理框架,介紹MapReduce、Spark引擎。第四章討論流處理框架,介紹使用flume和kafka進行數據收集和分發,使用storm等進行流處理。第五章介紹分布式查詢引擎Hive、Druid等的使用。第六章為大數據綜合實驗,通過實際案例讓學生綜合運用所學知識,完成數據全流程操作。

目錄大綱

目 錄
第1章 大數據概述 001
1.1 大數據簡介:什麼是“4V” 002
1.2 大數據處理流程:數據的奇妙冒險 005
1.3 大數據具體落地:怎麼才算是美味 007
1.3.1 杭州城市大腦 007
1.3.2 京東銷量預測 007
1.4 大數據核心組件:將會用到什麼 008
1.4.1 大數據采集 008
1.4.2 大數據存儲 009
1.4.3 大數據處理 009
1.4.4 大數據分析 011
1.5 總結 012
第2章 大數據存儲 013
2.1 什麼是Hadoop 014
2.1.1 Hadoop的誕生 014
2.1.2 什麼是HDFS 016
2.2 HDFS:倉庫管理員 016
2.2.1 部署HDFS集群 017
2.2.2 操作 HDFS 集群 022
2.2.3 HDFS存儲文件機制 025
2.2.4 總結 031
2.3 ZooKeeper:分布式系統的協調者 031
2.3.1 ZooKeeper與HDFS 032
2.3.2 HA的背後原理 041
2.3.3 總結 044
2.4 HBase:一個NoSQL數據庫 044
2.4.1 HBase介紹 045
2.4.2 部署HBase集群 048
2.4.3 HBase基礎操作 054
2.4.4 Java API連接HBase 057
2.4.5 HBase背後的存儲原理 059
2.5 總結 063
第3章 大數據處理:批處理 065
3.1 MapReduce介紹 066
3.1.1 MapReduce的歷史地位 067
3.1.2 MapReduce的發展歷程 068
3.1.3 MapReduce的編程思想 068
3.1.4 總結 073
3.2 Yarn:資源協調者 074
3.2.1 為什麼需要Yarn 074
3.2.2 Yarn的思想 076
3.2.3 配置HA-Yarn 078
3.2.4 總結 084
3.3 MapReduce案例 085
3.3.1 準備數據集 085
3.3.2 創建項目,導入相關依賴 086
3.3.3 編寫代碼 086
3.3.4 運行作業 093
3.3.5 查看作業結果 093
3.3.6 總結 095
3.4 Spark介紹 096
3.4.1 提出 Spark 的原因 097
3.4.2 彈性分布式數據集(RDD) 098
3.4.3 Spark程序運行架構 101
3.4.4 總結 104
3.5 Spark案例 104
3.5.1 編寫代碼 104
3.5.2 提交Spark程序 106
3.6 總結 108
?
第4章 大數據處理:流處理 109
4.1 流處理/批處理區別:著急或不著急 110
4.1.1 流處理(Stream Processing) 111
4.1.2 批處理(Batch Processing) 112
4.1.3 流處理和批處理的區別 112
4.2 初步了解實時數據處理 113
4.2.1 Flume 114
4.2.2 Kafka 115
4.2.3 Storm 116
4.3 數據收集與分發:井然有序的數據傳輸線 118
4.3.1 Flume 119
4.3.2 Kafka 121
4.3.3 Flume與Kafka整合 124
4.4 數據流處理 126
4.4.1 Storm及其安裝配置 126
4.4.2 Flume+Kafka+Storm+HBase整合 129
4.5 其他常見流處理框架 135
4.5.1 Spark Streaming(Spark流處理) 135
4.5.2 Flink 138
4.5 總結 140
第5章 大數據查詢與分析 143
5.1 Hive介紹 145
5.1.1 Hive的歷史 146
5.1.2 總結 148
5.2 Hive實踐 148
5.2.1 Hive安裝 149
5.2.2 Hive的基本操作 155
5.2.3 總結 160
5.3 Hive進階實踐 160
5.3.1 Hive中的表類型 160
5.3.2 使用JavaAPI連接Hive 166
5.3.3 Spark SQL 168
5.3.4 總結 170
5.4 其他常見的數據倉庫 170
5.5 總結 173
第6章 大數據技術綜合實踐 175
6.1 電影評論情感傾向與用戶評價關聯性初探 177
6.1.1 實驗背景 177
6.1.2 實驗準備 178
6.1.3 正式開始實驗 180
6.1.4 執行程序並分析結果 191
6.2 網站日誌信息處理案例 193
6.2.1 實驗背景 193
6.2.2 實驗準備 194
6.2.3 正式開始實驗 195
6.3 總結 206
附錄 209
附錄A 本書GitHub倉庫的說明 211
附錄B 本書所用服務器配置信息 213
附錄C 節點在集群中的分布情況 215