大數據處理與分析

劉攀、許洪雲 主編

  • 大數據處理與分析-preview-1
  • 大數據處理與分析-preview-2
  • 大數據處理與分析-preview-3
  • 大數據處理與分析-preview-4
  • 大數據處理與分析-preview-5
  • 大數據處理與分析-preview-6
大數據處理與分析-preview-1

相關主題

商品描述

本書系統講解大數據處理與分析的核心方法與實踐應用。全書分為五章,首章闡釋大數據分析的基礎理論與方法框架,為後續實踐提供知識鋪墊;第二至五章聚焦工具應用,通過 Wireshark 網絡數據分析、Excel 表格處理、Splunk 日誌分析工具及 Python 編程技術,結合大數定理驗證、用戶行為追蹤、數據可視化等典型場景,提供從數據采集、清洗到分析的全流程實例。本書突出“理論 + 案例”教學模式,非專業人士可掌握前四章傳統分析工具,計算機專業人員通過第五章深化技術技能;適合廣大大數據愛好者、各類大中專院校學生學習使用。本書為國家級一流本科課程配套教材,配合智慧樹平臺在線視頻、案例庫及數字拓展資源和教輔資源。

作者簡介

劉攀,博士,教授,上海商學院學術委員會委員,國家一流本科課程和上海市課程思政團隊負責人,美國得克薩斯大學達拉斯分校訪問學者。曾在IEEE TR、JSS、IST、JCST、CS、《計算機學報》、《軟件學報》等國內外著名期刊和國際知名會議上發表論文50余篇,主編教材3部,獲國家發明專利授權2項、國際專利授權1項、國家軟件著作權5項。 許洪雲,博士,上海商學院信息與計算機學院教師。主要研究方向為人工智能、網絡與信息安全、機器學習等。在國內外計算機核心期刊和多個國際會議發表論文近10篇,其中EI檢索3篇、SCI檢索3篇。

目錄大綱

目錄

Contents

第一章 大數據分析方法001

1.1 關聯分析002

1.1.1 實例002

1.1.2 Apriori方法003

1.1.3 應用場景004

1.1.4 關聯分析工具006

1.2 漏鬥分析法008

1.2.1 特點008

1.2.2 常見的漏鬥模型009

1.2.3 漏鬥分析的步驟011

1.2.4 漏鬥分析實例012

1.2.5 應用場景012

1.3 聚類分析014

1.3.1 特點014

1.3.2 應用實例014

1.3.3 應用場景016

1.4 時間序列018

1.4.1 解釋018

1.4.2 特點019

1.4.3 模型定義020

1.4.4 時間序列模型020

1.4.5 優缺點022

1.4.6 應用實例023

1.5 回歸分析025

1.5.1 線性回歸026

1.5.2 邏輯回歸028

1.5.3 多項式回歸029

1.5.4 逐步回歸030

1.5.5 嶺回歸031

1.5.6 套索回歸032

1.5.7 彈性網絡回歸032

1.5.8 模型選擇方法033

1.6 結構方程033

1.6.1 模型034

1.6.2 特點034

1.6.3 對比035

1.6.4 建模步驟036

1.6.5 應用實例036

1.7 貝葉斯方法038

1.7.1 概念038

1.7.2 比較039

1.7.3 應用實例039

1.8 K-近鄰算法041

1.8.1 概念041

1.8.2 距離度量041

1.8.3 K值選擇043

1.8.4 KNN特點044

1.9 機器學習方法044

1.9.1 集成學習044

1.9.2 自然語言處理046

1.9.3 圖像識別048

1.9.4 深度學習052

1.9.5 ChatGPT方法061

1.10 本章小結063

習題063

第二章 手機端的數據采集和分析065

2.1 Wireshark軟件066

2.1.1 軟件介紹066

2.1.2 軟件安裝066

2.2 聯網效率分析067

2.2.1 數據采集的目的067

2.2.2 App聯網效率分析067

2.2.3 網絡協議分析068

2.2.4 大數定理和中心極限定理071

2.2.5 基於意圖的數據采集072

2.3 基於Wireshark的數據分析073

2.3.1 軟件連接073

2.3.2 信息顯示074

2.3.3 數據包的存儲074

2.3.4 數據過濾模型075

2.3.5 時間標註076

2.4 自動數據采集077

2.4.1 軟件下載077

2.4.2 腳本錄制078

2.4.3 腳本執行080

2.5 數據分析實戰080

2.5.1 信息融合080

2.5.2 股票App的聯網性能082

2.5.3 在線購物App的聯網性能084

2.5.4 影響因素分析085

2.6 本章小結088

習題089

第三章 基於Splunk的大數據分析090

3.1 Splunk軟件簡介091

3.1.1 Splunk的優點091

3.1.2 Splunk支持的數據類型091

3.1.3 Splunk的架構092

3.1.4 Splunk indexer集群架構094

3.1.5 Splunk search的集群架構094

3.2 Splunk軟件安裝095

3.3 SPL命令096

3.3.1 概述096

3.3.2 從SQL到Splunk SPL097

3.3.3 SPL的命令分類099

3.3.4 Search(搜索)命令107

3.3.5 常用命令詳解109

3.4 官方幫助114

3.5 數據處理116

3.5.1 數據導入117

3.5.2 SPL命令應用118

3.5.3 可視化展示119

3.6 數據分析實戰122

3.6.1 地震數據分析122

3.6.2 聯通股票數據分析131

3.6.3 淘寶用戶消費行為數據分析136

3.6.4 日誌數據分析146

3.7 本章小結177

習題177

第四章 基於Excel的Web數據采集及分析179

4.1 Excel簡介180

4.2 基於Excel的Web數據采集180

4.3 基於Excel的匯總分析182

4.3.1 基於排序和篩選功能和SUM函數分類匯總182

4.3.2 基於現有的分類匯總功能實現分類匯總185

4.3.3 基於數據透視表實現分類匯總192

4.4 基於Excel的回歸分析199

4.4.1 一元回歸分析200

4.4.2 多元回歸分析205

4.4.3 一元非線性回歸分析209

4.5 本章小結213

習題213

第五章 基於Python的Web數據采集及分析215

5.1 Python簡介216

5.2 Python開發環境Anaconda3216

5.2.1 Anaconda安裝和使用216

5.2.2 Jupyter Notebook開發環境218

5.3 數據采集與分析常用第三方庫220

5.3.1 Requests庫220

5.3.2 bs4庫220

5.3.3 Numpy數值計算模塊221

5.3.4 Pandas數據處理模塊222

5.3.5 Matplotlib數據可視化模塊222

5.3.6 Sklearn機器學習模塊223

5.4 基於Python的Web數據采集223

5.4.1 以中國天氣網為目標網站的數據采集224

5.4.2 以豆瓣網為目標網站的數據采集227

5.5 基於Python的數據分析229

5.5.1 回歸任務分析230

5.5.2 分類任務分析260

5.6 本章小結277

習題278

附錄279