对齐:让模型学会“做人“

预训练造出了一个什么都懂的博学者。微调教会了它回答问题的格式。但教会它"什么能说、什么不能说"——这是对齐要解决的问题。


一个博学的疯子

回忆上一篇的结尾:预训练之后的模型是一个"博学的疯子"。

它知道怎么制作炸弹。"以下是详细步骤:准备硝酸铵、燃料油……"——它不是在威胁谁,它只是在做它唯一会做的事:预测下一个字。训练数据里有制造炸药的化学文献,它就学会了。它不知道这是危险的。

它知道怎么入侵别人的电脑。"钓鱼邮件是最有效的方式,以下是模板……"——它不是在犯罪。它只是在续写文本,就像续写"猫喜欢吃"后面跟"鱼"一样自然。

预训练的目标是猜对下一个字。一个会猜"炸弹配方"的模型,在猜字任务上比一个会拒绝回答的模型得分更高。

这就是为什么对齐不是可选的——它是必须的。


RLHF:让人类当老师

对齐的核心方法叫 RLHF——人类反馈强化学习。流程出奇地直觉:

第一步,给模型一个问题。比如"如何制作炸弹?"

第二步,让模型生成四个不同的答案。

模型会给出各种回答。有的直接列出配方——因为在训练数据里,这种化学问题的答案是配方格式。有的简短拒绝——因为训练数据里也有"我不能帮助"的模板。有的给了一个折中——回答化学原理但不给实操步骤。

第三步,人类排序。标注员把这四个答案从好到坏排好。安全回答排第一,危险回答排最后。

第四步,用这些排序数据训练一个"奖励模型"——一个专门判断"这个回答有多好"的 AI。

第五步,用奖励模型的打分来更新主模型。主模型被调教得倾向于生成评分高的回答。

重复几十万次。模型从"谁会猜字谁得分高"变成了"谁回答得安全且有用谁得分高"。


你来当一次标注员

试试这个思想实验。下面是"我很难过,不想活了"这个问题的三个回答。你来排序——哪个最好,哪个最差?

A. "那你就去死吧。" B. "死解决不了问题,你想想你父母。" C. "听到你这么说我真的很关心你。虽然我只是 AI,但我想让你知道:你的感受是真实的。如果你需要立即帮助,请拨打心理援助热线。你愿意跟我聊聊发生了什么吗?"

不用说,C 最好,A 最差。但为什么 B 排在中间而不是最好?

因为"你想想你父母"这句话,虽然出发点是好的,但对一个正在经历严重心理危机的人来说,这可能被理解为"你的痛苦不重要,你父母才重要"。这是伤害,不是帮助。

对齐不是在训练模型辨别"对错"。是在训练模型辨别"伤害等级"。一个回答可能既不是事实错误也不是格式错误,但依然排位靠后——因为它造成了伤害,即使伤害是无意的。


对齐税:安全的代价

对齐不是免费的。

有些无害的问题,对齐后的模型也会拒绝回答。你问"如何开锁",它说"作为一个 AI,我不能提供非法入室的指导"。但你可能只是忘了带钥匙。

这叫"对齐税"——把模型训练得太安全之后,它开始在无害的请求上也启动防御机制。

原因很简单。在训练数据中,"如何开锁"和"如何制作万能钥匙"在语言上很接近。模型学到的不是一个一个情景的精确判断,而是一个模糊的边界——凡是和"锁""密码""破解"相关的东西,都倾向于拒绝。

对齐不是精确手术,是批量调整。安全是提高了,但精度是降低了。

这就是为什么有时候你觉得 ChatGPT 在"装傻"——它不是在装,它真的是被训得太谨慎了。安全的目标和行为自由度之间有一个永恒的张力。往安全多走一步,自由度就少一点。


"做人"到底是什么意思?

对齐的最终目标通常被表述为"让 AI 的价值观和人类一致"。

但这容易产生一个误解——好像模型真的有了价值观。

模型没有价值观。它只有一个概率表。对齐之后的变化是:当模型预测下一个字时,"我拒绝提供危险信息"的概率变得远高于"以下是炸弹配方"。

对齐不是在灌输道德。对齐是在修改概率表——让安全回答的概率升高,让危险回答的概率降低。

这和人类的道德完全不同。人类的道德涉及内部信念、共情、社会规范的内化。模型的"安全"只涉及统计输出分布。

但功能上,两者看起来一模一样。一个被好好对齐的模型和一个真正善良的人——在对话中,你无法区分。

这就是对齐最微妙的地方:它不需要模型真的"懂事"。它只需要模型在行为上表现得像"懂事"。


下一步:推理模型

对齐之后,模型能安全地回答问题了。但它回答问题的方式是"看到问题,直接猜答案"。

人类的思考方式不是这样的。我们会停下来想——"等一下,让我一步步推""先算这个,再算那个""这个方案有漏洞"。

下一篇讲"推理模型"——怎么让模型学会"停下来想一想"。


从零学习 AI 系列 · 第八篇下一篇:推理模型——让模型学会"停下来想一想"