愚公移山

大模型是如何「被教会说人话」的?

大模型进化三部曲

返回文章列表

前言

我们每天都在和大模型对话,问它写代码、查资料、帮忙润色文字,它都能对答如流,并且礼貌又克制,以至于我们几乎忘了问一个问题:它天生就会这样说话吗?

比如我们和其对话,输入「有什么好吃的推荐吗」。

你期待的回答是「附近这家川菜馆不错」。但一个只经过预训练的模型,可能只会漫不经心地续上一句:「好吃的很多啊」。它没说错——语法通顺、逻辑自洽——但它完全没懂你在问什么,也不在乎你想要什么。

这就是「会说话」和「会说人话」之间的鸿沟。填平这道鸿沟,靠的不是更大的模型,而是一套分阶段的训练范式:预训练打底子,SFT 教它听话,RLHF/RLAIF 教它懂人心。这篇文章,我们就沿着这三步,看看大模型是怎么一步步学会好好和人对话的。


整体训练范式

现代大模型(LLM)的训练已经形成一套稳定范式:预训练(Pre-Training)+ 后训练(Post-Training)

其中后训练通常包括:监督微调(SFT)+ 对齐优化(RLHF / RLAIF)。

阶段 它学会了什么 相当于
预训练 会说话(词语接龙) 读万卷书
SFT 会按指令好好应答 上学、按范例答题
RLHF / RLAIF 懂得什么是更好、更得体的回答 融入社会、习得分寸

只有预训练、没有经过 SFT 和对齐的模型,就像「一个背下了整座图书馆、却只会照搬照抄的超级学霸」。 他能一字不差地复述任何知识,却从没真正理解「为什么要这么说」、「该对谁说」。知识是满分,情商是零分。他会:

  • 机械复述:只会照搬学过的内容,不会根据场景灵活调整
  • 不懂分寸:可能说出伤人或不当的话,自己却浑然不觉
  • 缺乏判断:分不清什么该说、什么不该说,容易输出有害内容
  • 没有价值观:未经人类价值观校准,输出可能突破伦理底线

token-split

AI模型需要学会 "说⼈话、办⼈事",确保它的回答和⾏为符合⼈类的价值观和期望。


Pre-trainin:预训练

第一阶段叫 Pre-training(预训练)。它是指在大规模「无标注」或「弱标注」的文本数据(互联网网页、书籍、论文、代码等)上,对模型进行自监督学习,让它自己去摸索语言的底层规律——语法、逻辑,以及蕴含在文本里的事实知识。

一句话概括:这是一个「从数据到模型」的过程,目标是构建一个庞大的知识库。

而支撑这一切的核心机制其实只有一个:学习「下一个 Token 的概率分布」——说白了,就是不断地做「词语接龙」,根据前文预测下一个最可能出现的词。

这个阶段怎么练?

  • 数据规模:通常需要千亿至万亿级别的 token;
  • 计算成本:需要大规模 GPU/TPU 集群连续训练数月,成本极高;
  • 不辨好坏:模型只学「语言长什么样」,并不区分「好回答」和「坏回答」。

练完能得到什么?

预训练让模型具备了三种基础能力:

  • 语言理解与生成:能进行「词语接龙」,但还不具备真正的对话能力;
  • 基础事实知识:记住了大量世界知识;
  • 语法与逻辑归纳:能识别并复现语言中的模式与规律。

但它还缺什么?

问题就出在「词语接龙」上——它只会接得通顺,不保证接得有用。就如开篇提到「有什么好吃的推荐吗」的回答一样。

根本原因在于:预训练只教会了模型「怎么把话说通顺」,却没教它「怎么和人好好交流」。 它不懂你的意图,也无从判断回答是否有用、是否符合人类偏好。

正因如此,我们需要第二阶段——Post-training(后训练),它的核心目标,就是让模型学会理解人类的意图、听懂我们的指令。


SFT:监督微调

SFT(Supervised Fine-Tuning,监督微调) 是在预训练模型的基础上,用高质量的标注数据做有监督训练,让模型学会遵循指令、完成特定任务。

如果说预训练是让模型「读万卷书」,那 SFT 就是手把手教它「按老师给的范例答题」。

核心流程

  1. 数据准备:收集大量「指令-答案对」,比如「Golang语言是什么」→「Golang,是由Google开发并在2009年发布的一种开源编程语言」;
  2. 模型微调:用交叉熵损失函数,让模型学着生成这些「标准答案」;
  3. 参数调整:通常采用全参数微调,或 LoRA 等参数高效方法。

核心价值

  • 学会听指令:初步具备指令遵循和多轮对话能力,从「会接龙」升级为「会应答」;
  • 效率高:仅需预训练数据量的 0.1%–1%,就能显著提升表现;
  • 输出规范:能生成符合特定格式与标准的内容。

经过这一步,你再问「有什么好吃的推荐吗」,模型就会规规矩矩地回答「附近这家川菜馆不错」了——它终于听懂了你在问什么。

局限性

但 SFT 的本质是模仿,它只能学到「答案长什么样」,学不到「答案好在哪」:

  • 标注成本高:高质量的「指令-答案对」需要大量人工撰写;
  • 难以覆盖所有场景:人写的样例再多,也穷举不完现实中的提问;
  • 不辨优劣:它只知道「这样答像人」,却不知道两个都「像人」的回答里,哪个更有帮助、更得体、更安全。

一句话概括 SFT 的天花板:它能教会模型「像人一样说话」,却教不会它「怎样把话说得更好」。

要跨过这道坎,就需要第三阶段——RLHF / RLAIF,用人类的偏好告诉模型:什么才是「更好的回答」。


RLHF / RLAIF:对齐人类偏好

前两步之后,模型已经「读过万卷书」,也「学会了按范例答题」。但它还差最后一课:懂得什么是「更好」的回答。 这一步靠的就是 RLHF / RLAIF。

  • RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习):通过人类反馈来优化模型输出,让它更符合人类的偏好和价值观;

  • RLAIF(Reinforcement Learning from AI Feedback,基于 AI 反馈的强化学习):是 RLHF 的「自动化版本」,用 AI 模型代替人类来打分和反馈,从而降低成本、扩大规模。

解决什么问题 

SFT 靠模仿样例学会了「怎么答」,但它对「答案好不好」和「哪些内容不能说」的把握,全靠从有限样例里自己摸索,稳定性不足。

RLHF / RLAIF 换了个思路:不再直接告诉模型「标准答案是什么」,而是告诉它「两个回答里哪个更好」。用这种偏好反馈构建一个「奖励目标」,再引导模型朝着「更有帮助、更符合人类偏好、更安全礼貌克制」的方向优化。

核心流程 

  1. 收集偏好数据:让模型对同一个问题生成多个回答,由人类(或 AI)比较排序,标出「哪个更好」;
  2. 训练奖励模型:用这些偏好数据训练一个「奖励模型」,让它学会像人一样给回答打分;
  3. 强化学习优化:以奖励模型的打分为信号,用强化学习(如 PPO)不断微调,让模型倾向于输出高分回答。

这一步的关键转变在于:模型的目标,从「模仿一个标准答案」变成了「追求一个更好的回答」。 前者有天花板,后者可以持续逼近人类的期待。

token-split


写在最后

从「会预测下一个词」到「会好好说人话」,大模型走过的,其实是一条和人的成长惊人相似的路:先积累知识,再学会规矩,最后懂得分寸与善意。

下一次当你和 AI 流畅对话时,或许可以想起——它今天的每一句「人话」,背后都是这三个阶段共同教出来的结果。

让越来越强大的智能,始终朝着人的方向生长