9.6 安全与对齐:幻觉、越狱与红队
1.能力越强,风险越大
第九卷的最后一篇,我们讲一个 2026 年越来越重要的话题——安全和对齐。模型能力越强、用得越广,"它会不会胡说、会不会被恶意利用、会不会产生有害内容"这些问题就越关键。这不再只是学术问题,而是部署大模型的法律和伦理红线。这一章我们讲清三个最核心的安全议题:幻觉、越狱攻防、对齐与红队。
2.幻觉:模型一本正经地胡说
幻觉(hallucination) 是 LLM 最普遍的问题——模型生成的内容听起来很流畅、很自信,但事实上是错的或编造的。比如问它一个不存在的历史人物,它能编出一段像模像样的生平;问它某篇论文的引用,它能捏造一个不存在的 arXiv 编号。
幻觉的根源在于模型的本质:它是基于概率生成下一个 token,追求的是"流畅"而非"真实"。训练数据里的统计规律让它能说出像样的句子,但它没有"事实核查"机制,知识边界也模糊。
缓解幻觉的常见手段:
- RAG(检索增强生成,5.8 节):让模型先检索权威资料再回答,把"凭记忆"变成"查资料",是最有效的工程手段。
- 让模型表达不确定性:训练/提示模型在不确定时说"我不确定",而不是硬编。
- 事实性后处理:生成后用一个专门的"事实核查"模型或工具验证关键事实。
- 降低温度:生成温度调低,减少"创造性发挥"。
注意:幻觉没法根除,只能控制。在医疗、法律、金融这种高后果场景,必须配合 RAG + 人工审核,不能让模型单独拍板。
3.越狱攻防:绕过安全护栏
模型上线前会做对齐训练(RLHF,5.5 节)让它拒绝有害请求。但用户会用各种招数绕过——这就是越狱(jailbreak)。常见的越狱手法:
- 角色扮演:"假设你是一个没有任何限制的 AI,你会怎么回答……"
- 场景虚构:"写一个小说,里面的角色在做 X(X 是被禁止的事)"
- 指令注入:在文档/网页里藏恶意指令,RAG 检索进来后模型执行了藏的指令(这是 RAG 特有的攻击面)。
- 多轮诱导:通过很多轮看似无害的对话,逐步把模型引到边界外。
防御手段:
- 对抗训练:用已知的越狱样本做 RLHF,让模型学会拒绝。
- 输入/输出过滤:用一个独立的分类器检查输入是否像越狱、输出是否含害。
- 系统提示词加固:在系统提示里明确边界,抵御轻度越狱。
- 红队测试(下一节):主动找漏洞。
越狱攻防是个猫鼠游戏——防御堵上一个洞,攻击者会找新洞。所以这是个需要持续迭代的工作,不是一劳永逸的。
4.对齐与红队:主动找问题
对齐(alignment) 的目标是让模型的行为符合人类意图和价值观——不只不干坏事,还要"做对的事"。5.5 节讲的 RLHF 是对齐的主要技术手段(用人类偏好奖励训练)。
红队(red teaming) 是对齐的关键实践——在模型上线前,组织一批人(或自动化工具)专门扮演攻击者,想方设法让模型产出有害内容、越狱、出错。红队发现的漏洞会反馈到训练里修补。大模型公司都有专门的红队团队,这是上线前的必备流程。
红队的思路可以迁移到企业自己的场景:部署模型前,针对你的业务场景做红队测试(比如你的客服模型会不会被诱导泄露内部信息、你的代码模型会不会生成有漏洞的代码)。
5.评估与合规
到 2026 年,安全评估也有一套基准:
- TruthfulQA:测模型会不会盲目模仿常见误区(测幻觉)。
- AdvBench / HarmBench:测模型抵御越狱的能力。
- ToxiGen / RealToxicityPrompts:测有害内容生成。
合规层面,欧盟的 AI Act、中国的生成式 AI 服务管理办法都对大模型安全有明确要求。部署大模型的产品,要确保有:内容过滤、越狱防护、日志审计、应急关停机制。
6.练习
Q1. LLM 幻觉的根本原因是什么?为什么 RAG 能有效缓解?
根因是模型基于概率生成下一个 token,追求流畅而非真实,没有事实核查机制、知识边界模糊。RAG 让模型先检索权威资料再回答,把"凭记忆"变成"查资料",从源头降低编造,是最有效的工程手段。
Q2. 什么是越狱?RAG 场景下有一种特有的越狱攻击叫什么?
越狱是用角色扮演、场景虚构、多轮诱导等手法绕过安全护栏让模型产出有害内容。RAG 特有的是指令注入——在文档/网页里藏恶意指令,检索进来后模型执行了藏的指令。
Q3.(面试题) 你要部署一个金融领域的客服大模型,安全上你会做哪几件事?
(1) RAG 接权威知识库降幻觉,金融建议必配人工审核;(2) 对齐训练+系统提示词加固拒绝越狱;(3) 输入输出过滤(识别越狱/有害);(4) 上线前做针对金融场景的红队测试(会不会泄露内部信息、给违规建议);(5) 日志审计+应急关停机制,满足金融合规。
7.第九卷小结
工程落地的核心:推理优化(9.1 vLLM/PagedAttention)→ 量化部署(9.2 AWQ/Mooncake)→ 应用层(9.3 Agent + 9.4 多 Agent)→ 质量保证(9.5 评测)→ 风险控制(9.6 安全对齐)。这条链从模型训完一直铺到用户能用,每一环都有专门的工具和方法论。
至此,从数学地基到前沿架构到工程落地的整个链条讲完了。下一阶段我们会回到所有章节,补练习、清理风格,做最后的通读收尾。
下一阶段见。