大模型賦能的智能體系統原理與實踐

謝雪梅 鐘微

  • 出版商: 人民郵電
  • 出版日期: 2026-07-01
  • 定價: $299
  • 售價: $298
  • 語言: 簡體中文
  • 頁數: 184
  • ISBN: 7115682704
  • ISBN-13: 9787115682703
  • 相關分類: Large language model
  • 下單後立即進貨 (約4週~6週)

  • 大模型賦能的智能體系統原理與實踐-preview-1
大模型賦能的智能體系統原理與實踐-preview-1

商品描述

本書是一本系統闡述人工智能技術,特別是大模型和智能體系統及其實際應用的專業圖書。本書通過理論與實踐相結合的方式,詳細介紹人工智能在計算機視覺、人機交互、具身智能等領域的應用,旨在幫助讀者全面理解人工智能技術如何賦能復雜系統,並推動未來科技發展。

本書共7章。第1章回顧人工智能發展歷程並展望未來發展趨勢。第2章探討計算機視覺中的物體識別,重點分析大模型在提升識別性能中的作用。第3章解析人物交互事件,並通過案例展示智能體的實際應用。第4章討論語言與視覺的融合,展示多模態人機交互的實現方法。第5章介紹人體姿態識別及其與語言信息的融合,探討智能化互動系統的構建。第6章闡述視覺信息的語義編碼與圖像生成,展示大模型在內容創作與智能推薦中的應用。第7章探討具身智能的發展,介紹主動感知、人機交互及大模型賦能的具身任務決策。

本書通過豐富的理論與實踐案例,為讀者提供對人工智能技術的深入解析和應用指導,適合作為高等學校人工智能相關課程的教材,也可供相關研究人員、工程師參考使用,助力其對人工智能技術的理解與實踐創新。

作者簡介

謝雪梅 西安電子科技大學人工智能學院教授、博導。廣州市人工智能(場景理解與語義交互)重點實驗室主任。教育部“新世紀優秀人才支持計劃”。 主要研究項目及領域:計算機視覺、場景理解與視頻分析、具身智能國家自然科學基金重點項目:面向弱小目標的機器學習與智能認知方法 科技部重點研發計劃:工業領域知識自動構建與推理決策技術及應用國家自然科學基金面上項目:面向大數據的預期形狀導向壓縮感知成像的重建方法研究 省自然科學基金項目:智能視頻監測及人員危害行為預警技術

目錄大綱

第1章 人工智能應用概述
1.1 引言
1.1.1 人類智能與人工智能
1.1.2 人工智能的發展歷程
1.2 人工智能的應用
1.2.1 深度學習時期
1.2.2 大模型時期
1.2.3 以大模型驅動的智能體時期
本章小結
第2章 大模型時代的物體識別
2.1 人類視覺與機器視覺識物
2.1.1 人類視覺的識物機制
2.1.2 機器視覺的識物機制
2.2 大模型賦能的物體識別
2.2.1 大模型的跨模態融合架構
2.2.2 大模型的視覺定位方法
2.2.3 物體識別的提示詞引導
2.2.4 物體的屬性識別與深層語義挖掘
2.3 智能體賦能的物體識別
2.3.1 智能體的物體識別任務規劃
2.3.2 智能體的物體知識庫
2.3.3 智能體的物體識別工具
2.4 智能體識別物體應用案例
2.4.1 物體的視覺語義分析
2.4.2 語義驅動的外觀缺陷識別
2.4.3 語義驅動的物體檢測
2.4.4 語義驅動的物體分割
本章小結
第3章 人物交互的語義解析與行為理解
3.1 人物交互
3.1.1 人物交互檢測研究現狀
3.1.2 人物交互語義
3.2 人物交互事件理解
3.2.1 交互事件場景的層級化表達
3.2.2 交互事件的空間推理
3.2.3 交互事件的時序推理
3.3 智能體驅動的人物交互檢測
3.3.1 知識庫引導的交互事件檢測
3.3.2 交互事件的語義關鍵幀
3.3.3 人物交互檢測智能體的學習與模糊推理
3.4 室內場景行為檢測應用案例
3.4.1 人物交互檢測系統的設計與實現
3.4.2 實際應用中的人物交互案例分析
本章小結
第4章 視覺語言語義結構化表達與推理
4.1 語言理解與結構化表達
4.1.1 語言理解和解析
4.1.2 語言的結構化表達
4.1.3 語言驅動的多模態交互
4.2 視覺感知與結構化表達
4.2.1 人類認知與場景理解
4.2.2 場景語義基元庫構建
4.2.3 場景語義層級化表達
4.3 視覺語言跨模態交互
4.3.1 多模態結構化對齊
4.3.2 語義驅動下的場景圖更新
4.3.3 智能決策與反饋機制
4.4 視覺語言多模態交互應用案例
4.4.1 智能看護系統:多模態交互的場景監測
4.4.2 智慧教學系統:可控慕課交互問答
本章小結
第5章 多模態人體姿態估計、理解與生成
5.1 認識人體姿態
5.1.1 人體姿態的本質
5.1.2 人體姿態的意義
5.2 理解姿態
5.2.1 姿態估計:從視覺信息中得到人體姿態
5.2.2 行為識別:理解人體的行為
5.3 智能體框架下的語言與姿態協同
5.3.1 層次化的肢體語言
5.3.2 世界知識輔助姿態認知與行為決策
5.3.3 智能體的執行:文本到姿態語義重構
5.4 大模型姿態應用案例
5.4.1 主動行為感知的姿態估計
5.4.2 利用結構化文本生成三維人體姿態
本章小結
第6章 視覺語義編碼與生成
6.1 視覺語義編碼
6.1.1 視覺語義編碼基礎知識
6.1.2 視覺語義編碼關鍵步驟
6.1.3 視覺語義理解的主要應用
6.2 圖像生成技術探索之旅
6.2.1 圖像生成技術發展歷程
6.2.2 神經網絡賦能的無文本圖像生成
6.2.3 語義驅動的文本圖像生成
6.3 大模型引領圖像生成革命
6.3.1 從DALL-E看圖像生成大模型
6.3.2 探索GPT-4o繪畫的奧秘
6.4 大模型驅動的圖像生成案例
6.4.1 語義重構下的圖像生成
6.4.2 創意PPT背景的智能生成
本章小結
第7章 具身智能
7.1 邊走邊看:主動探索
7.1.1 從人類探索到智能體探索
7.1.2 開放環境下的具身智能系統
7.2 具身任務中的人機交互
7.2.1 人類交流與人機交互
7.2.2 具身任務驅動下的自然語言解析
7.3 大模型賦能的具身任務決策
7.3.1 大模型與知識庫的結合
7.3.2 智能體決策
7.4 主動感知驅動的具身行為
7.4.1 主動感知
7.4.2 智能體行為認知
7.4.3 自適應調節機制
7.5 具身智能系統實驗
7.5.1 意圖識別
7.5.2 具身決策
7.5.3 具身任務執行
7.5.4 實驗案例
本章小結
參考文獻