9.6 安全与对齐:幻觉、越狱与红队

1.能力越强,风险越大

第九卷的最后一篇,我们讲一个 2026 年越来越重要的话题——安全和对齐。模型能力越强、用得越广,"它会不会胡说、会不会被恶意利用、会不会产生有害内容"这些问题就越关键。这不再只是学术问题,而是部署大模型的法律和伦理红线。这一章我们讲清三个最核心的安全议题:幻觉、越狱攻防、对齐与红队

2.幻觉:模型一本正经地胡说

幻觉(hallucination) 是 LLM 最普遍的问题——模型生成的内容听起来很流畅、很自信,但事实上是错的或编造的。比如问它一个不存在的历史人物,它能编出一段像模像样的生平;问它某篇论文的引用,它能捏造一个不存在的 arXiv 编号。

幻觉的根源在于模型的本质:它是基于概率生成下一个 token,追求的是"流畅"而非"真实"。训练数据里的统计规律让它能说出像样的句子,但它没有"事实核查"机制,知识边界也模糊。

缓解幻觉的常见手段:

  • RAG(检索增强生成,5.8 节):让模型先检索权威资料再回答,把"凭记忆"变成"查资料",是最有效的工程手段。
  • 让模型表达不确定性:训练/提示模型在不确定时说"我不确定",而不是硬编。
  • 事实性后处理:生成后用一个专门的"事实核查"模型或工具验证关键事实。
  • 降低温度:生成温度调低,减少"创造性发挥"。

注意:幻觉没法根除,只能控制。在医疗、法律、金融这种高后果场景,必须配合 RAG + 人工审核,不能让模型单独拍板。

3.越狱攻防:绕过安全护栏

模型上线前会做对齐训练(RLHF,5.5 节)让它拒绝有害请求。但用户会用各种招数绕过——这就是越狱(jailbreak)。常见的越狱手法:

  • 角色扮演:"假设你是一个没有任何限制的 AI,你会怎么回答……"
  • 场景虚构:"写一个小说,里面的角色在做 X(X 是被禁止的事)"
  • 指令注入:在文档/网页里藏恶意指令,RAG 检索进来后模型执行了藏的指令(这是 RAG 特有的攻击面)。
  • 多轮诱导:通过很多轮看似无害的对话,逐步把模型引到边界外。

防御手段:

  • 对抗训练:用已知的越狱样本做 RLHF,让模型学会拒绝。
  • 输入/输出过滤:用一个独立的分类器检查输入是否像越狱、输出是否含害。
  • 系统提示词加固:在系统提示里明确边界,抵御轻度越狱。
  • 红队测试(下一节):主动找漏洞。

越狱攻防是个猫鼠游戏——防御堵上一个洞,攻击者会找新洞。所以这是个需要持续迭代的工作,不是一劳永逸的。

4.对齐与红队:主动找问题

对齐(alignment) 的目标是让模型的行为符合人类意图和价值观——不只不干坏事,还要"做对的事"。5.5 节讲的 RLHF 是对齐的主要技术手段(用人类偏好奖励训练)。

红队(red teaming) 是对齐的关键实践——在模型上线前,组织一批人(或自动化工具)专门扮演攻击者,想方设法让模型产出有害内容、越狱、出错。红队发现的漏洞会反馈到训练里修补。大模型公司都有专门的红队团队,这是上线前的必备流程。

红队的思路可以迁移到企业自己的场景:部署模型前,针对你的业务场景做红队测试(比如你的客服模型会不会被诱导泄露内部信息、你的代码模型会不会生成有漏洞的代码)。

5.评估与合规

到 2026 年,安全评估也有一套基准:

  • TruthfulQA:测模型会不会盲目模仿常见误区(测幻觉)。
  • AdvBench / HarmBench:测模型抵御越狱的能力。
  • ToxiGen / RealToxicityPrompts:测有害内容生成。

合规层面,欧盟的 AI Act、中国的生成式 AI 服务管理办法都对大模型安全有明确要求。部署大模型的产品,要确保有:内容过滤、越狱防护、日志审计、应急关停机制。

6.练习

Q1. LLM 幻觉的根本原因是什么?为什么 RAG 能有效缓解?

根因是模型基于概率生成下一个 token,追求流畅而非真实,没有事实核查机制、知识边界模糊。RAG 让模型先检索权威资料再回答,把"凭记忆"变成"查资料",从源头降低编造,是最有效的工程手段。

Q2. 什么是越狱?RAG 场景下有一种特有的越狱攻击叫什么?

越狱是用角色扮演、场景虚构、多轮诱导等手法绕过安全护栏让模型产出有害内容。RAG 特有的是指令注入——在文档/网页里藏恶意指令,检索进来后模型执行了藏的指令。

Q3.(面试题) 你要部署一个金融领域的客服大模型,安全上你会做哪几件事?

(1) RAG 接权威知识库降幻觉,金融建议必配人工审核;(2) 对齐训练+系统提示词加固拒绝越狱;(3) 输入输出过滤(识别越狱/有害);(4) 上线前做针对金融场景的红队测试(会不会泄露内部信息、给违规建议);(5) 日志审计+应急关停机制,满足金融合规。

7.第九卷小结

工程落地的核心:推理优化(9.1 vLLM/PagedAttention)→ 量化部署(9.2 AWQ/Mooncake)→ 应用层(9.3 Agent + 9.4 多 Agent)→ 质量保证(9.5 评测)→ 风险控制(9.6 安全对齐)。这条链从模型训完一直铺到用户能用,每一环都有专门的工具和方法论。

至此,从数学地基到前沿架构到工程落地的整个链条讲完了。下一阶段我们会回到所有章节,补练习、清理风格,做最后的通读收尾。

下一阶段见。

相关标签
深度学习工程落地安全对齐幻觉越狱红队