多模態智能信息處理

鄧成、楊二昆、楊旭、閆傑熹、魏坤

  • 出版商: 清華大學
  • 出版日期: 2026-08-01
  • 售價: $414
  • 語言: 簡體中文
  • ISBN: 7302712514
  • ISBN-13: 9787302712510
  • 相關分類: DeepLearning
  • 下單後立即進貨 (約4週~6週)

  • 多模態智能信息處理-preview-1
  • 多模態智能信息處理-preview-2
  • 多模態智能信息處理-preview-3
多模態智能信息處理-preview-1

商品描述

《多模態智能信息處理》系統地介紹了多模態智能信息處理從底層特征提取到高層語義理解的完整技術路線,重點關註基於深度學習技術的多模態智能信息研究,包含了**出現的視覺問答及時域語言定位等多模態信息理解新方向,同時介紹了經典的傳統非深度方法,力圖搭建從傳統經典技術到現有先進技術的過渡橋梁,進而加深對傳統技術的理解,並促進對當前技術的進一步思考。 《多模態智能信息處理》內容豐富,結構清晰,理論由淺入深,具有內容的易讀性、知識的全面性以及技術的先進性等特點。適合作為相關領域學術研究人員、技術工程師與開發者、高年級本科生與研究生、行業決策者與管理者的有益參考。

作者簡介

鄧成,河海大學教授,享受國務院政府特殊津貼。中國計算機學會傑出會員、中國圖像圖形學會高級會員、IEEE高級會員。長期從事多模態數據感知計算與分析推理方面的研究工作。主持國家重點研發計劃、國家自然科學基金重點項目等40余項,獲國家自然科學獎二等獎1項、陜西省自然科學獎一等獎2項。

目錄大綱

CONTENTS

目錄

第 1章緒論 1 

1.1概述 1 

1.2理論基礎 1 

1.2.1卷積神經網絡 1 

1.2.2池化 4 

1.2.3註意力機制 5 

1.2.4 Transformer網絡 8 

1.3技術難點與挑戰 9 

1.3.1輸入處理 10 

1.3.2信息融合 11 

1.3.3其他問題與挑戰 11 

1.4典型應用 12 

1.4.1圖像描述 12 

1.4.2文圖生成 13 

1.4.3視覺問答 17 

1.4.4視覺推理 19 

1.5倫理與社會影響 21 

1.5.1隱私與數據安全挑戰 21 

1.5.2社會公平與道德考量 22 

1.5.3社會影響與接受度 23

第 2章多模態表示學習 24 

2.1理論基礎 24 

2.1.1關於表示學習 24 

2.1.2多模態表示學習 26 

2.1.3不同模態的表示映射 27 

2.2基本框架 28 

2.2.1聯合表示框架 28 

多模態智能信息處理 

2.2.2協同表示框架 30 

2.2.3編碼器-解碼器框架 34 

2.3經典模型 36 

2.3.1概率圖模型 36 

2.3.2多模態自動編碼器 37 

2.3.3典型相關分析 39 

2.4多模態大規模預訓練 41 

2.4.1 CLIP的橫空出世 41 

2.4.2基於 CLIP的改進方法 43 

2.4.3其他多模態預訓練方法 45 

2.5多模態大語言模型 48 

2.5.1模型簡介 48 

2.5.2模型架構 50 

2.5.3訓練流程 53 

2.5.4新技術的湧現 53

第 3章多模態信息融合 56 

3.1基於規則的融合 56 

3.1.1線性加權融合 57 

3.1.2多數投票融合 58 

3.2基於濾波的融合 59 

3.2.1卡爾曼濾波 59 

3.2.2粒子濾波 61 

3.3基於分類的融合 62 

3.3.1支持向量機 62 

3.3.2 Dempster–Shafer理論 64 

3.3.3貝葉斯推斷 66 

3.3.4動態貝葉斯網絡 67 

3.3.5最大熵模型 68 

3.4深度融合 69 

3.4.1深度置信網絡 69 

3.4.2遞歸神經網絡 70 

3.4.3編碼器-解碼器網絡 72 

目錄 

3.4.4 Transformer網絡 74 

3.4.5圖神經網絡 76

第 4章多模態信息檢索 80 

4.1基於樹的最近鄰檢索 80 

4.1.1 K維樹 80 

4.1.2 Ball-樹 81 

4.1.3 K-means層次樹 82 

4.1.4 Annoy檢索算法 82 

4.2基於圖的最近鄰檢索 83 

4.2.1 K-Graph 83 

4.2.2 NSW圖 84 

4.2.3 HNSW圖 84 

4.3基於量化的近似最近鄰檢索 86 

4.3.1乘積量化 86 

4.3.2加性量化 89 

4.3.3復合量化 90 

4.4基於哈希的近似最近鄰檢索 92 

4.4.1基於傳統模型的哈希學習框架 93 

4.4.2基於類別特定中心的雙流哈希 94 

4.4.3基於成對約束的跨模態哈希 98 

4.4.4基於語義結構的無監督哈希 100 

4.4.5基於漸近演化的深度哈希 104 

4.4.6漢明空間檢索中的對抗樣本 108

第 5章多模態內容理解 113 

5.1圖像描述任務 114 

5.1.1序列生成網絡 115 

5.1.2序列化描述生成 117 

5.1.3基於註意力的生成 119 

5.2視覺問題 124 

5.2.1基於多模態融合的問答 126 

5.2.2基於註意力機制的問答 129 

5.2.3基於組合推理的問答 134 

多模態智能信息處理 

5.3場景圖生成 138 

5.3.1融合上下文信息的生成 140 

5.3.2融入先驗知識的生成 146 

5.4基於多模態預訓練模型的內容理解 151 

5.4.1圖像-文本預訓練模型 152 

5.4.2視頻-文本預訓練模型 152 

5.5未來發展方向 153

第 6章多模態內容生成 154 

6.1圖像內容生成 155 

6.1.1基礎理論 155 

6.1.2文圖生成 162 

6.1.3基於手繪草圖的圖像內容生成 165 

6.1.4圖像風格遷移 169 

6.2文本內容生成 172 

6.2.1文本內容生成的理論基礎 172 

6.2.2圖像描述生成 177 

6.2.3視頻摘要生成 178 

6.3視頻內容生成 179 

6.3.1無條件視頻生成 180 

6.3.2文本到視頻生成 182 

6.3.3視頻到視頻生成 184 

6.3.4其他條件到視頻生成 184

第 7章多模態腦機智能與應用 187 

7.1腦機接口技術的背景和現狀 187 

7.1.1技術背景 188 

7.1.2發展現狀 190 

7.2腦信號采集與表示 194 

7.2.1非侵入式腦信號采集與表示 194 

7.2.2侵入式腦信號采集與表示 196 

7.3多模態腦機智能的應用 200 

7.3.1醫學領域的應用 200 

7.3.2非醫學領域的應用 203 

目錄 

7.4基於腦信號的視覺內容重建 209 

7.4.1人腦的 fMRI數據 210 

7.4.2自然場景數據集(NSD) 211 

7.4.3基於預訓練大模型的重建方法 211 

7.4.4基於條件擴散模型的重建方法 213

第 8章發展趨勢分析 215

參考文獻 219 

最後瀏覽商品 (18)