大模型安全 / 高等教育网络空间安全专业系列教材
定价:¥79.00
作者: 周翰逊,郭薇,王妍
出版社:机械工业出版社
- 机械工业出版社
- 9787111814368
- 1-1
- 470
内容简介
在人工智能技术飞速发展的今天,大模型已经成为推动产业变革的核心驱动力。本书立足于当前大模型安全领域的基础知识和前沿技术,系统探讨了大模型技术的演进历程、核心架构及其面临的多维度安全挑战。本书内容涵盖基础理论、关键技术和安全攻防体系,旨在为读者构建完整的大模型安全知识框架,助力构建安全可信的大模型生态系统。
本书不仅填补了大模型安全领域的理论空白,更为产业实践提供了系统化解决方案,对促进人工智能安全健康发展具有重要的理论价值和实践意义。
本书可作为高等院校网络空间安全、信息安全、密码科学与技术、人工智能和计算机等相关专业学生的教材和参考书。
本书不仅填补了大模型安全领域的理论空白,更为产业实践提供了系统化解决方案,对促进人工智能安全健康发展具有重要的理论价值和实践意义。
本书可作为高等院校网络空间安全、信息安全、密码科学与技术、人工智能和计算机等相关专业学生的教材和参考书。
目录
前言
第1章大模型技术概述
11大模型的前世今生
111人工智能早期发展历程
112深度学习技术的崛起
113ChatGPT与大模型的兴起
12大模型的定义与分类
121大模型的定义
122大模型的特性
123大模型与小模型的区别
124大模型的分类
13大模型的基本原理与架构
131大模型的基本原理
132大模型的架构
133输入模块
134模型模块
135数据模块
136工具链模块
137输出模块
14本章小结
15习题
第2章大模型的安全体系
21大模型的安全风险
211输入模块风险
212数据模块风险
213模型模块风险
214工具链模块风险
215输出模块风险
22大模型的防御
221输入模块防御
222数据模块防御
223模型模块防御
224工具链模块防御
225输出模块防御
23本章小结
24习题
第3章提示词攻击与防御
31提示词
311提示词定义
312提示词的安全风险
32提示词攻击及其分类
321攻击形式
322攻击的执行方式
33威胁模型
331提示词攻击的场景
332攻击者的目的
333攻击者的知识和能力
34提示词直接注入攻击
341提示词泄露攻击
342目标劫持攻击
343越狱攻击
344提示词后门攻击
35其他提示词攻击
351代码注入
352ASCII艺术字
353伪装与重构
36提示词注入防御
361训练阶段防御
362推理阶段防御
37本章小结
38习题
第4章数据攻击与防御
41隐私泄露攻击
411隐私泄露的威胁模型
412推理攻击:间接隐私泄露
413梯度泄露攻击:直接数据重建
414PII泄露攻击:隐私泄露的终极目标
42投毒攻击
421投毒攻击的定义
422投毒攻击的威胁模型
423投毒攻击的方法
424投毒攻击的防御
43本章小结
44习题
第5章模型攻击与防御
51对抗攻击与防御
511对抗攻击的定义
512对抗攻击的威胁模型
513对抗攻击的分类
514对抗攻击的方法
515对抗攻击的防御
52后门攻击与防御
521后门攻击的定义
522后门攻击的威胁模型
523后门攻击的分类
524训练与微调阶段的后门攻击
525无须微调的后门攻击
526后门攻击的防御方法
53其他模型攻击
531能量-延迟攻击
532提取攻击
54本章小结
55习题
第6章大模型平台的安全
61大模型的软件平台安全
611平台自身漏洞
612深度学习框架安全
613依赖库安全
614安全防护措施
62大模型的硬件平台安全
621GPU计算平台安全
622内存与存储安全
623网络设备安全
63本章小结
64习题
第7章大模型的幻觉
71大模型幻觉的定义与分类
711幻觉的定义
712幻觉的分类
72大模型幻觉的产生根源
721数据因素导致的幻觉
722训练过程引发的幻觉
723推理过程产生的幻觉
73大模型幻觉的检测
731事实性幻觉的检测策略
732忠实性幻觉的检测策略
74大模型幻觉的抑制策略
741数据层面的幻觉抑制
742训练阶段的幻觉抑制
743推理阶段的幻觉抑制
75本章小结
76习题
第8章大模型水印
81水印
811水印的定义
812水印的分类
82传统数字水印
821传统数字水印的嵌入
822传统数字水印的提取
823传统数字水印的检测
83基于大语言模型的数字水印
831大模型水印的产生和定义
832大模型水印与传统数字水印的区别
84大模型水印的分类
841文本水印
842图像水印
843音频水印
844视频水印
845多模态水印
85本章小结
86习题
第1章大模型技术概述
11大模型的前世今生
111人工智能早期发展历程
112深度学习技术的崛起
113ChatGPT与大模型的兴起
12大模型的定义与分类
121大模型的定义
122大模型的特性
123大模型与小模型的区别
124大模型的分类
13大模型的基本原理与架构
131大模型的基本原理
132大模型的架构
133输入模块
134模型模块
135数据模块
136工具链模块
137输出模块
14本章小结
15习题
第2章大模型的安全体系
21大模型的安全风险
211输入模块风险
212数据模块风险
213模型模块风险
214工具链模块风险
215输出模块风险
22大模型的防御
221输入模块防御
222数据模块防御
223模型模块防御
224工具链模块防御
225输出模块防御
23本章小结
24习题
第3章提示词攻击与防御
31提示词
311提示词定义
312提示词的安全风险
32提示词攻击及其分类
321攻击形式
322攻击的执行方式
33威胁模型
331提示词攻击的场景
332攻击者的目的
333攻击者的知识和能力
34提示词直接注入攻击
341提示词泄露攻击
342目标劫持攻击
343越狱攻击
344提示词后门攻击
35其他提示词攻击
351代码注入
352ASCII艺术字
353伪装与重构
36提示词注入防御
361训练阶段防御
362推理阶段防御
37本章小结
38习题
第4章数据攻击与防御
41隐私泄露攻击
411隐私泄露的威胁模型
412推理攻击:间接隐私泄露
413梯度泄露攻击:直接数据重建
414PII泄露攻击:隐私泄露的终极目标
42投毒攻击
421投毒攻击的定义
422投毒攻击的威胁模型
423投毒攻击的方法
424投毒攻击的防御
43本章小结
44习题
第5章模型攻击与防御
51对抗攻击与防御
511对抗攻击的定义
512对抗攻击的威胁模型
513对抗攻击的分类
514对抗攻击的方法
515对抗攻击的防御
52后门攻击与防御
521后门攻击的定义
522后门攻击的威胁模型
523后门攻击的分类
524训练与微调阶段的后门攻击
525无须微调的后门攻击
526后门攻击的防御方法
53其他模型攻击
531能量-延迟攻击
532提取攻击
54本章小结
55习题
第6章大模型平台的安全
61大模型的软件平台安全
611平台自身漏洞
612深度学习框架安全
613依赖库安全
614安全防护措施
62大模型的硬件平台安全
621GPU计算平台安全
622内存与存储安全
623网络设备安全
63本章小结
64习题
第7章大模型的幻觉
71大模型幻觉的定义与分类
711幻觉的定义
712幻觉的分类
72大模型幻觉的产生根源
721数据因素导致的幻觉
722训练过程引发的幻觉
723推理过程产生的幻觉
73大模型幻觉的检测
731事实性幻觉的检测策略
732忠实性幻觉的检测策略
74大模型幻觉的抑制策略
741数据层面的幻觉抑制
742训练阶段的幻觉抑制
743推理阶段的幻觉抑制
75本章小结
76习题
第8章大模型水印
81水印
811水印的定义
812水印的分类
82传统数字水印
821传统数字水印的嵌入
822传统数字水印的提取
823传统数字水印的检测
83基于大语言模型的数字水印
831大模型水印的产生和定义
832大模型水印与传统数字水印的区别
84大模型水印的分类
841文本水印
842图像水印
843音频水印
844视频水印
845多模态水印
85本章小结
86习题










