← 返回知识库

综述:大模型训练范式

一篇关于”大模型是如何训练出来的”综述:先讲清楚三段式流水线,再沿时间线看训练范式如何演化,最后解释评测(benchmark)在这套体系里扮演的角色。

一、先说结论:三段式训练流水线

今天的模型(比如 DeepSeek V4 Flash)在出生时大致经历三个阶段,自监督、监督、强化学习各司其职,缺一不可

① 预训练 (Pre-training)  —— 自监督,占 90%+ 算力
   喂海量网络文本 → 预测下一个 token → 学语言规律
   产物:一个"什么都知道但不会说人话"的背诵机

② 监督微调 (SFT)        —— 监督学习
   少量人工精标问答 → 学会对话格式
   产物:一个"会说人话但不会深入思考"的模型

③ 后训练 / 对齐          —— 强化学习主场
   RLHF / RLVR,用奖励信号反复强化"想得更对"
   产物:最终交付的"聪明模型"

关键点:预训练 100% 是自监督,RL 只存在于后训练阶段。这两个阶段的世界观完全不同。

三段式的量级对比

阶段数据算力时间成本量级
预训练数十 T tokens(V4-Flash 为 32T)10^24–10^25 FLOPs,占 90%+数千上万 GPU 跑几周几个月千万美元级
SFT几百万条人工精标预训练的 1–5%几天数据标注是大头
RLVR模型自生成的合成题(几十亿条)通常是 SFT 的 10–100 倍几周推理采样的电费

三个”反直觉”事实:

  1. 预训练花了 90% 的算力却只造出”背诵机”——它买到的是知识地基。
  2. SFT 用的数据是”人写的”,RL 用的是”模型自己生成的”——所以 RL 没有人类数据稀缺瓶颈,可以无限造题。
  3. 决定模型智商上限的是最后那台”RL 手术”——这也是厂商拼命堆算力建超算的原因,算力在 RL 阶段能直接换智能。

二、为什么 RL 是后训练的主流?

三个本质原因:

  1. 预训练没有”对错”:学的是语言统计规律,无客观答案,只能”预测下一个 token”,自监督是唯一可行方案。
  2. 后训练有明确的”好/坏”:数学对不对 → 对答案;代码跑不跑得过 → 跑测试;人喜不喜欢 → 人类反馈。奖励信号天然存在。
  3. RL 的试错成本极高:一轮策略更新要反复采样推理,只能在模型基本成形后做”精雕细琢”,无法在预训练阶段循环。

而 RL 相对 SFT 的关键升级是:SFT 是”模仿”,RL 是”优化”

SFT(模仿)RL(优化)
学的是人类给的答案长什么样什么样的答案更好
上限人类样本天花板可超越人类
效果会说但不会想逼出多步推理、自我纠错

三、训练范式如何一步步走到今天

要理解今天的”三段式”为什么长这样,值得沿着时间线看训练范式是怎么一步步演化的。这条线的起点,其实是强化学习本身。

强化学习算法层面的地基,是 2017 年 Schulman 等人提出的 PPO(Proximal Policy Optimization)。它在 RLHF、RLVR 这些范式出现之前很久就已存在,解决的是”如何让策略稳定地朝奖励方向更新”这个最底层的问题。PPO 的重要性在于,它至今仍是几乎所有大模型对齐层的主力算法——无论是后来 OpenAI 的 InstructGPT,还是 DeepSeek 的 R1,跑奖励优化时用的都是它。可以说,范式几经更迭,底层的优化器一直没换。

训练范式之所以能成形,还离不开一套衡量标准。2018 年 Wang 等人发布 GLUE,次年推出 SuperGLUE,开启了”一个模型 = 一套 benchmark 分数表”的风气。BERT 正是靠在这类榜单上一战成名,让学界相信”先在评测集上刷高分”是训练的有效信号。这一时期的玩法很简单:静态题目、精确匹配答案,评测分数直接等同于模型能力。

到了 2020 年,Kaplan 等人提出 Scaling Laws for Neural Language Models,给出了一个在当时颇具冲击力的观点:模型参数量、数据量、训练算力三者按比例放大时,模型损失会按幂律下降。也就是说,“无脑堆算力”不是暴发户行为,而是有理论支撑的可行路线。此后两年,DeepMind 的 Hoffmann 等人(Chinchilla,2022)对这套结论做了重要修正,指出 Kaplan 版的配比严重低估了数据需求,并给出”参数量与训练 token 约 1:20”的最优比例。Chinchilla 的修正让工业界意识到,光堆参数不行,还得成比例地喂数据——今天所有模型训练前的配比估算,几乎都源自这篇文章。

真正把”强化学习”引入大模型训练流程的,是 2022 年 Ouyang 等人的 InstructGPT。它提出一套三阶段流程:先用人工标注做监督微调,再训练一个奖励模型模拟人类偏好,最后用 PPO 让模型沿着奖励模型的方向优化,使模型学会”遵循指令”。这篇论文被公认为 RLHF 的定型之作。不过值得强调的是,它依然依赖一个”由模型充当裁判”的奖励模型——这个环节后来被证明是可以被 hack 的,也为日后的 RLVR 埋下了伏笔。

几乎同一时期,Anthropic 的 Bai 等人提出 Constitutional AI(2022),从另一个方向挑战”人类打分”的代价:与其让人逐条标注,不如用一组规则约束模型自我批评、自我修正。这条思路后来也被吸收进对齐训练的工程实践。

进入 2023 年,事情开始变得有趣。一方面,LMSYS 推出 Chatbot Arena,认为静态榜单已被刷到失真,改用真人随机对战投票来衡量模型体验——这直接承认了”分数能刷、体感难骗”。另一方面,普林斯顿的 Jimenez 等人发布 SWE-bench(2023),把评测从”答题”推进到”干活”:不再让模型在试卷上选答案,而是丢给它真实 GitHub 仓库里的 issue,让它产出代码补丁,再用真实测试验证对错。SWE-bench 的评分极其苛刻——补丁必须让原本失败的测试通过、且不能破坏原本通过的测试,才计为”解决”。它开创了整个代码 Agent 评测浪潮,后来的 Terminal-Bench、DeepSWE、NL2Repo 都由此衍生。

同年,OpenAI 的 Lightman 等人发表 Let’s Verify(2023),提出过程奖励模型(PRM)的思路:与其只看最终答案对错,不如对每一步推理打分。它补上了”只对结果打分过于粗糙”的短板,是推理模型强化训练的又一关键拼图。紧随其后,Rafailov 等人提出 DPO(2023),干脆把 RL 的目标改写成监督学习的形式,省去训练奖励模型与在线采样的开销,成为工业界追求效率时的常用替代。

真正把这一切拧成一个新范式的,是 2025 年 DeepSeek 的 R1 论文。DeepSeek 提出 RLVR(Reinforcement Learning with Verifiable Rewards):不再依赖人打分或模型裁判,而是直接让”对答案""跑测试”这类客观事实充当奖励信号,从而彻底消除了 reward hacking 的空间。R1 论文里的两个对照实验尤其值得注意:R1-Zero 跳过监督微调直接跑 RLVR,虽然学出了推理能力,但输出严重乱码;而加了少量监督样本的 R1 则稳定且可读。DeepSeek 据此认为,正确的配比是”极少量的监督 + 大量的强化”——监督只需让模型会说人话起步,真正的智能靠 RL 练出来。R1 的意义还在于,它把整个行业的后训练从”堆人工数据”拉向”堆算力跑 RL”,此后各家推理模型几乎都转向了这一范式,DeepSeek V4(2026)更是将其规模化,并用 MoE 架构摊薄了成本。

这条线再往下,便是 SWE-bench Verified(2024)这类”清洗过的权威标准”的出现,以及各厂商转向保密、动态的私有评测。它们共同构成了下一节要讲的”评测与训练的双向耦合”。

四、评测:训练与评估的”双向耦合”

这是理解整个生态的钥匙:benchmark 不只是拿来”测”,它本身就是 RL 的奖励信号

真实能力 → 抽象成 benchmark → 变成 RL 奖励信号 → 驱动模型优化
   ↑                                              ↓
   更新更难的新题 ← 分数饱和 ← benchmark 分数涨

RLVR 如何用 benchmark 当奖励

以 SWE-bench 为例:

  1. 模型针对某个 issue 输出补丁
  2. 系统在容器里真实执行测试
  3. F2P 全过 + P2P 没挂 = +1,否则 = 0——这个”0/1”是客观事实,无法 hack
  4. 梯度更新,强化”能过测试”的行为 → 反复迭代

所以你会看到 Preview → 0731 分数暴涨:不一定变聪明了,而是被定向优化到”考试状态”。这引出了生态的核心矛盾——数据污染

  • 公开 benchmark 会泄进训练语料,模型”背答案”
  • RL 的奖励信号又专门对准这些题 → 分数虚高
  • 因此顶级厂商转向保密、动态、不公开的评测(如 DeepSeek Harness)

评测生态的两条发展线

维度演化
测什么知识 (MMLU) → 指令跟随 (Arena) → 干活 (SWE-bench) → 真实世界 (GAIA)
怎么测静态集 → 动态集 → 对抗/保密 → 真人投票

这两张图来自 Artificial Analysis 的「AI 模型性价比排行榜 v4.1」(2026-07-31,128 个模型):横轴是每任务成本(美元),纵轴是 AI 智能得分。完整版散点图展示了整个生态的分布全貌,聚焦版则标出了其中的明星——DeepSeek V4 Flash 0731 极限版以最低档的成本摸到顶尖智能,被标记为「性价比之王」,正是「评测定义目标、训练朝目标优化」这条闭环的注脚:128 个模型在成本与智能两轴上的位置,就是评测驱动训练反复迭代后留下的生态版图。

AI模型性价比排行榜 v4.1(完整版)

AI模型性价比排行榜 v4.1(聚焦 DeepSeek V4 Pro)

一句话:评测定义目标,训练朝目标优化,优化结果催生新评测——这就是生态的完整闭环。

五、推智能的三要素

抛开模型细节,驱动智能的其实是三样东西:

算力 + 数据 + 算法(Scaling Laws 官方口径)

     靠电力喂
  • 算力:决定模型”多大、多深”,受 Scaling Law 支配但边际递减
  • 数据(数量+质量):海量脏数据不如少量精数据;合成数据补数量,人类数据守底线
  • 算法:被低估的第三极——同样的算力和数据,RLVR vs 纯 SFT、MoE vs 稠密,差距巨大
  • 电力:不直接推智能,是给前两者”供电”的基础设施

三者互相替代 + 各有天花板

算法决定”每单位算力+数据能换多少智能”;算力×数据决定”能买到多少单位”;电力决定”这些算力能不能真的跑起来”。

六、总结

  • 模型的诞生 = 自监督预训练(地基)+ 监督 SFT(礼仪)+ 强化学习 RLVR(手术) 三段式
  • 训练范式沿时间线演化:评测文化 (2018) → Scaling Law (2020) → RLHF (2022) → 干活型评测 (2023) → RLVR (2025)
  • 评测与训练双向耦合:benchmark 是奖励信号,训练又反过来催生新评测
  • 一切军备竞赛(堆算力、抢电、造 benchmark)都可以在这套闭环里找到解释

大模型发展

  1. ,小红书于2026-08-14发布,适合生活类决策,如旅游购物,8月21日实测确实会考虑更仔细,追问很多,像grill me。