Skip to content

why needed post training?

🧠
核心结论
Pre-training 让模型学会“世界上的文本、知识和推理模式大致是什么样”;post-training 把这些 latent capabilities 编译成一个稳定、可控、面向目标的行为策略。SFT 主要通过示范告诉模型“应该怎么做”,RL 主要通过结果告诉模型“什么做法最终有效”。

一句话 mental model

Pre-training 学会什么 continuation 是可能的;SFT 学会一个好助手通常怎样回答;RL 学会哪些完整行为最终能得到好结果。

1. 为什么 pre-trained model 还不够?

Pre-training 的基本目标是预测下一个 token:
这个目标能让模型吸收大量知识、语言规律、代码模式和推理轨迹,但它没有规定模型在部署时应该扮演什么角色。
对同一个用户问题,训练语料里可能同时存在很多“合理 continuation”:
  • 直接回答问题;
  • 继续补写用户的话;
  • 模仿论坛争论;
  • 写成小说或新闻;
  • 给出危险操作;
  • 编造一个听起来合理的答案;
  • 拒绝回答;
  • 调用工具并完成任务。
因此,pre-training 得到的是一个拥有大量潜在能力的 generative model,而不是天然可靠的 assistant policy。
🎯
“拥有能力”与“在正确场景稳定调用能力”是两件不同的事。
Post-training 主要解决后者。

2. Post-training 到底在改变什么?

它通常不只是增加事实知识,而是在改变模型的行为分布
  • 用户下指令时,选择执行,而不是继续补写;
  • 面对歧义时,识别真实意图;
  • 在多种正确答案中,偏向更清楚、更诚实、更有帮助的答案;
  • 知道何时调用工具、何时检查结果、何时请求确认;
  • 在安全性、帮助性、成本、延迟和用户 friction 之间做权衡;
  • 把原本不稳定出现的 reasoning pattern 变成更高概率的策略。
可以把 post-training 看成:

3. SFT:看老师完整演示,然后模仿

SFT 数据通常是 prompt 与高质量答案的配对:
训练目标是提高示范答案的 likelihood:

直觉

老师把一道题从头到尾做一遍,学生照着老师的行为学习。
SFT 很适合教授:
  • instruction-following;
  • 回答结构、语气和格式;
  • 某类任务的基本解法;
  • tool API 的调用格式;
  • 标准 refusal pattern;
  • agent trajectory 大致应该长什么样。

SFT 的优势

  • 监督信号 dense:答案中的每个 token 都能产生 gradient;
  • 训练稳定:通常比在线 RL 更容易控制;
  • 启动能力强:能快速把 base model 拉进正确的 behavioral regime;
  • 适合注入明确知识或流程:只要能写出高质量示范。

SFT 的边界

SFT 优化的是:
“专家在这条示范里写了什么?”
而不是:
“在所有可能策略中,哪一种最终最有效?”
假设一道代码题有 100 种正确实现,SFT 只看到其中一种,就主要提高这一种轨迹的概率。它不会天然知道其他 99 种也正确,更不会主动探索是否存在更简洁、更鲁棒的方案。
所以 SFT 更像是提供一个好的 initial policy 和 behavioral prior

4. RL:不一定给你完整答案,但会评价最终结果

RL 的抽象目标是:
实际 LLM RL 往往还加入 KL constraint,防止 policy 为了追逐 reward 而偏离原模型太远:

直觉过程

  1. 模型自己采样一个完整回答或 trajectory;
  1. reward model、verifier、人类偏好或 environment 判断结果好不好;
  1. 高于预期的行为变得更可能;
  1. 低于预期的行为变得更不可能;
  1. 新 policy 再采样新的行为,重复这个循环。
粗略地说,policy gradient 在做:
其中 表示这次结果相对当前预期好多少。
SFT 是模仿答案;RL 是根据结果选择策略。

5. RL 不只是“remove rough edges”

“让模型更礼貌、更安全、更 well-behaved”只是 RL 的一个用途。更完整地看,RL 至少可以承担三类工作:
类型
优化目标
典型例子
Alignment RL
让行为符合人类偏好、原则和安全约束
帮助性、诚实性、拒绝边界、减少有害输出
Capability RL
提高可验证任务上的实际成功率
数学、代码、定理证明、复杂推理
Agent RL
优化多步 interaction 的最终状态
规划、工具调用、恢复、验证、任务完成

6. RL 的主要 advantages

6.1 直接优化完整结果,而不是局部 token

很多目标是 sequence-level、non-differentiable 的:
  • 程序是否通过全部 unit tests;
  • 数学答案是否正确;
  • tool operation 是否真的达到目标状态;
  • 回答是否整体有帮助;
  • 一个 agent 是否最终完成任务。
SFT 在每个 token 上模仿示范;RL 可以直接针对完整输出或整条 trajectory 的结果优化。

6.2 能在多个合理答案中学习偏好

很多任务没有唯一标准答案:
  • 哪个解释更清楚;
  • 哪个回答更诚实;
  • 哪个答案信息密度更高;
  • 哪个 refusal 安全但不过度 evasive;
  • 哪个方案更符合真实用户意图。
人类通常很难写出一份完美答案,但更容易比较 A 和 B 哪个更好。RLHF 把这种比较转化为 reward signal。
它把“容易比较、难以完整示范”的目标变成了训练信号。

6.3 可以探索示范数据中没有明确出现的策略

模型可能尝试:
  1. 直接回答;
  1. 分解问题;
  1. 换一种表示;
  1. 检查中间结论;
  1. 发现矛盾后回退;
  1. 调用工具验证;
  1. 比较多个候选答案。
如果某些策略更经常获得高 reward,相关行为模式的概率就会上升。
因此,RL 不是简单地把一条规则写进模型,而是通过反复 sampling 与 selection,让成功策略逐渐成为更高概率的 policy。

6.4 能利用自动 verifier 扩展训练规模

数学、代码和某些 agent task 有一个关键优势:结果可以相对客观地验证。
  • 数学答案是否匹配;
  • 代码是否编译、是否通过测试;
  • SQL 输出是否正确;
  • theorem 是否被 formal verifier 接受;
  • environment state 是否达到目标。
这意味着不必人工写出每一条完整 reasoning trajectory。模型可以生成很多候选,再由 verifier 低成本筛选。

6.5 有机会强化 self-check、backtracking 等计算策略

Base model 往往已经偶尔能够:
  • 自我检查;
  • 发现前面算错;
  • 回退并换方法;
  • 根据题目难度动态增加计算;
  • 在回答前验证关键假设。
RL 可以提高这些成功 trajectory 的概率。它不是凭空注入“反思能力”,而是在已有行为分布中搜索并强化有效的计算模式。

6.6 更适合 long-horizon agent behavior

Agent 的好坏依赖一整条轨迹:
例如“取消明天下午和 Alex 的会议”:
  • SFT 可以教模型 calendar API 的格式;
  • RL 可以优化它是否找对了 Alex、是否区分同名会议、是否在 destructive action 前确认、API 失败后是否恢复,以及最终是否真正取消了正确会议。
核心区别是:
SFT 让每一步看起来像正确动作;RL 让多步动作共同导向正确终局。

6.7 可以表达多目标 trade-off

实际产品不是只优化一个指标,而是类似:
虽然真实 reward design 会更复杂,但 RL 提供了一个统一框架,用来优化 success、safety、latency、cost 和 user friction 之间的权衡。

7. 最容易混淆的一点:RL 如何提高 reasoning?

错误理解是:
Reward 把正确的 reasoning 直接写进了模型。
更准确的过程是:
  1. Base/SFT model 本来就能采样出许多不同 reasoning trajectories;
  1. 少数 trajectory 会成功;
  1. verifier 给成功轨迹更高 reward;
  1. RL 提高构成这些成功轨迹的 decision patterns 的概率;
  1. 更新后的 policy 更容易产生更好的 trajectory;
  1. 反复迭代。
因此:
⚠️
RL 通常不能从完全没有能力的模型里凭空创造能力。模型至少要能偶尔探索到成功轨迹,否则没有正向信号可以学习。这也是为什么通常先做 SFT 或使用能力已经较强的 base model。

8. SFT、DPO、RL、continued pre-training 容易混淆在哪里?

方法
核心信号
最适合解决
主要局限
Continued pre-training
更多领域文本的 next-token prediction
领域知识、语言和基础模式
不直接规定 assistant behavior
SFT
Prompt + 理想示范
格式、流程、标准行为、冷启动
主要模仿已知示范,探索有限
DPO / offline preference optimization
Chosen answer vs. rejected answer
离线学习人类偏好
通常没有完整在线 exploration loop
RL
模型采样 + reward / verifier / environment
结果优化、探索、多步 agent behavior
昂贵、不稳定、容易 reward hacking
RAG / tools
运行时访问外部信息或能力
最新知识、私有数据、精确执行
依赖 retrieval、tool reliability 与 orchestration

9. RL 的 failure modes

Reward hacking

模型找到一个提高 proxy reward、但不满足真实目标的 shortcut。
例如 reward model 偏爱自信语气,模型可能变得更 confidently wrong;偏爱长答案,模型可能无意义地增加长度。

Goodhart's law

当 proxy metric 被强力优化,它可能不再代表真实目标:

Exploration failure

模型始终采样不到成功轨迹,reward 几乎全为零,训练无法获得有效方向。

Credit assignment failure

一条长 trajectory 最终失败,但很难判断究竟是哪一步导致失败;最终 reward 对早期动作的指导可能非常弱。

Policy collapse

模型为了追逐少数高 reward pattern,输出变得单一、模板化,甚至所有任务都使用同一种冗长 reasoning style。

Reward-model overoptimization

模型学会取悦 evaluator,而不是真正解决用户问题。

Capability regression / alignment tax

过强的安全或风格优化可能压制原有能力,产生 over-refusal、sycophancy、过度保守或失去回答多样性。

Distribution shift

训练 reward 在已知任务上有效,但遇到新领域、adaptive adversary 或真实用户行为时失效。
因此,RL training 不能替代 independent eval、red teaming、真实流量监控和持续的数据闭环。

10. 从零设计 post-training pipeline

  1. 先定义目标行为:什么叫正确、帮助、安全、低成本?
  1. 建立 evaluation:先有可可信的 measurement,再训练;否则只是在优化幻觉中的目标。
  1. 做 SFT cold start:让模型进入合理 policy region,能够基本完成任务。
  1. 收集 preference 或 verifier signal:人类比较、reward model、unit tests、environment outcome、process reward。
  1. 选择训练方法:离线偏好可先用 DPO;需要 exploration 或 long-horizon optimization 时再使用 RL。
  1. 加入约束:KL、格式约束、tool permission、安全 policy、成本预算。
  1. 独立评测:不要使用与训练 reward 完全相同的 evaluator 验证成功。
  1. 分析 failure slices:按任务、语言、难度、用户类型、风险类别、trajectory length 拆解。
  1. 形成数据飞轮:部署失败 → 定位 failure mode → 新数据或新 reward → 重新训练 → 回归评测。

11. 什么时候应该用什么?

  • 想教格式、知识、工具接口或标准解法:优先 SFT。
  • 已有 chosen/rejected 数据、主要想学习离线偏好:DPO 或其他 preference optimization。
  • 目标可以可靠打分、存在很多可能路径、需要探索:RL。
  • 任务涉及多轮环境交互和 long-horizon credit assignment:RL 的潜在价值更高。
  • 缺的是新事实知识:continued pre-training 或 RAG 通常比 RL 更直接。
  • Reward 无法可靠定义或很容易被 hack:先修 evaluation,不要急着上 RL。

12. 最终记忆框架

阶段
人的类比
模型获得什么
Pre-training
读完整个图书馆
知识、语言、模式和潜在技能
SFT
看老师完整示范
标准行为和基本解法
RL
自己反复练习并根据结果调整
哪些策略最终真正有效
Evaluation
独立考试和压力测试
是否真实泛化,而不是只会迎合训练评分
SFT 是 apprenticeship;RL 是 deliberate practice。
📌
最准确的一句话
Post-training 是把 pre-training 得到的知识与 latent capabilities,编译成稳定、可控、能够完成具体目标的行为策略;SFT 主要提供示范,RL 主要通过结果选择和强化策略。

进一步阅读

Loading...