从“知道术语”到看懂一条大模型训练链

这不是资讯摘要。正文尽量沿用原文的论证顺序、术语、实验口径和关键数字,用中文做忠实精读;只在“解释 / 边界”标签下加入必要的机制说明与跨文判断。

数据与配比目标与反馈系统与吞吐评测与回流 能力来自
阶段接口

原文忠实度

以原文为骨架:先还原作者怎么论证,再做中文解释

01

顺序

尽量保留原文从问题、方法、实验到结论的推进,不把段落拆成脱离语境的金句。

02

术语

首次出现时给出中英文与公式;后文沿用作者口径,不随意替换概念。

03

实验

保留比较对象、控制变量、模型与数据规模,让数字仍然属于它原来的实验。

04

结果

关键数字做近距离中文转述;步数、FLOPs、GPU-hours 与端到端成本严格分开。

05

标注

“直接证据”还原来源;“解释”帮助理解;“边界”明确原文没有证明什么。

06

合规

不整篇逐字转载;对关键内容做忠实详述,并始终提供原文入口供交叉核对。

直接证据

来源中有对应实验或数据。

解释

作者或本文对结果的机制解释。

边界

结果不应被外推的范围。

推荐路径

先看完整模型流,再钻进每一个训练决策

九章按依赖关系排列。时间有限可先读 01、04、05、06、07;负责预训练再补 02、03、08。

  1. 01两种完整 Model Flow:Olmo 3 与 Qwen3 为什么都不是“三段论”
  2. 02FineWeb:数据清洗如何从经验规则变成可消融的实验
  3. 03DataDecide:小模型何时能替大模型做数据选择
  4. 04Tülu 3:SFT、DPO、RLVR 的目标与阶段交互
  5. 05在策略蒸馏:为什么“学生自己的轨迹 + 教师逐 token 打分”更密集
  6. 06LoRA:rank、层覆盖、学习率与容量到底怎样联动
  7. 07TITO:Agentic RL 最隐蔽的 token 对齐错误
  8. 08Ultra-Scale × OlmPool:显存算术与长上下文的延迟代价
  9. 092026 后训练地图:哪些是共识,哪些仍只是前沿配方信号

机制 · 实验 · 边界

九章训练技术精读

正文以来源原文为主,尽量保留原作者的章节推进、技术名词、实验设置与结论强度;不是逐字全文转载。厂商博客按“团队自报”处理,跨来源数字不做榜单式横比。

01

Ai2 / Qwen · 2025 · 模型流与技术报告

Olmo 3 × Qwen3:现实训练链不是“预训练—SFT—RL”三段论

同样追求推理、工具与长上下文,两条公开流程却在分叉点上做了不同选择

先给结论

“阶段”不是组织文档的目录,而是改变模型分布的接口。Olmo 3 强调可分叉、可追溯的 checkpoint;Qwen3 则把思考/非思考两种行为通过四阶段后训练重新融合。它们共同否定了“一套后训练配方适合所有终端行为”的想法。

5.9TOlmo 3 预训练混合
100B + 50BOlmo 中训与长上下文 token
≈36TQwen3 预训练 token
4 阶段Qwen3 后训练流程
机制:所谓“阶段接口”,具体传递什么?

一阶段交给下一阶段的不是只有权重。至少还有五个接口:权重初始化决定可探索的局部空间;数据分布决定哪些能力被频繁激活;序列与模板决定模型学到的交互协议;优化目标决定何种行为被加权;评测协议决定团队会继续优化什么。

广覆盖预训练能力重排 / 长上下文行为冷启动偏好或可验证反馈轨迹回流

因此,“在最终 Instruct checkpoint 上再加一点领域 SFT”与“从 Base/Mid-training checkpoint 注入知识,再恢复行为”是两个不同实验;它们的遗忘方式、梯度容量和所需评测也不同。

实验事实:Olmo 3 如何把一条主干变成三条可复查分支

直接证据 Olmo 3 从约 9.3T-token 的 Dolma 3 语料池构造 5.9T-token 预训练混合;随后用 100B tokens 的 Dolmino 做数学、科学、代码、指令和阅读强化,再用约 50B tokens 的 Longmino 做长上下文扩展。Base 之后分成 Instruct、Think 与 RL-Zero:前两条都可观察 SFT→DPO→RLVR,RL-Zero 则从 Base 直接研究可验证奖励。

这个发布方式的研究价值在于:可以把同一底座、不同路径的 checkpoint 对齐,而不是把最终模型差异全部归因给最后一种 loss。团队还报告预训练最高使用 1,024 张 H100,7B 吞吐约 7.7K tokens/设备/秒;这些是系统测量,不是能力归因。

对照阅读:Qwen3 为什么先训练“会深思”,再把“快答”融合回来

Qwen3 报告约 36T-token 预训练:S1 在 4K 上训练 30T+ tokens,S2 再加入约 5T 知识密集的 STEM、代码与推理数据,最后用高质量长上下文数据扩至 32K。后训练则依次为:长 CoT 冷启动、基于规则奖励的推理 RL、思考/非思考模式融合、覆盖 20+ 通用任务的 RL。

解释 第三阶段很关键:若只优化长推理,模型可能把高成本推理当成默认行为;“模式融合”是在能力之外训练一个控制面,让用户能分配推理预算。也就是说,后训练不仅提高分数,还可以定义能力何时被调用

边界与最小实验

边界 两个团队的数据、基座、硬件与评测不同,不能用 token 数推断谁的数据效率更高;“阶段更多”也不等于效果更好。博客给出的流程说明了可行设计,但没有统一对照来证明每个阶段都是必要条件。

最小实验:保留 Base、知识中训、行为恢复三个 checkpoint;对每个点同时测领域 QA、通用 loss、指令遵循和输出长度。只有当“知识上涨但行为下降,随后行为可恢复且知识保留”时,才有证据支持你的阶段划分。

02

Hugging Face · NeurIPS 2024 Datasets & Benchmarks

FineWeb:不要问“哪条过滤规则听起来合理”,要问“哪条规则训练后更好”

网页清洗的核心不是洁癖,而是可消融的数据决策

论文 ↗
先给结论

FineWeb 的贡献不是一个 15T-token 文件,而是一套把抽取、去重、启发式过滤和模型质量打分分别做成训练实验的工作流。数据被删得更多不代表模型更强;过滤器优化的是特定评测下的效用函数。

96Common Crawl snapshots
15TFineWeb tokens
1.3TFineWeb-Edu tokens
≈500K教育质量标注样本
机制:从 WARC 到训练 token,质量损失发生在哪里
  1. 抽取。HTML 到纯文本会丢结构,也可能保留导航、广告与模板噪声;抽取器本身就是数据模型。
  2. 语言与基础过滤。去除非目标语言、极端长度、异常符号或解析失败,但阈值会系统性影响方言、代码和列表型知识。
  3. 去重。FineWeb 采用按 crawl dump 的 MinHash 近似去重。去重减少重复模板与训练记忆,但跨 dump 过度去重可能一起删除正常复现的高质量文本。
  4. 质量规则。选择部分 C4 规则,并加入重复行、短行比例等启发式过滤。规则的合理性必须通过固定训练预算的消融检验。
  5. 模型过滤。FineWeb-Edu 用 Llama 3 70B 给约 50 万样本标注教育价值,再训练轻量分类器扩展到全库。
实验设计:为什么“只看被删样本”不够

数据过滤存在一个反直觉陷阱:人工抽查很容易偏爱排版整齐、主题熟悉的文本,但预训练效用取决于覆盖、重复次数、难度和模型规模。FineWeb 的正确姿势是固定 tokenizer、架构、训练 token 与超参数,只更改一个处理决策,再比较代理模型的 validation loss 和下游能力。

数据消融的最小因果问题Δscore = Train(D after rule) − Train(D before rule)

只有训练预算、抽样量和评测一致,Δscore 才近似反映该规则的净影响。比较“过滤后更小的数据”与“过滤前更多的数据”会把质量和 token 数混在一起。

FineWeb-Edu 的价值与偏差

直接证据 FineWeb-Edu 在知识与推理密集任务上表现明显更强,说明模型打分可以把稀缺的“高教育价值”信号扩展到万亿 token 级。

边界 “教育性”不是普适质量。教师提示偏向学校式知识,可能压低口语、社区经验、创意文本、少数文化表达或真实交互日志。更危险的是,只在 MMLU/ARC 等目标上验证分类器,可能把 benchmark 风格写入整个数据分布。

落地协议:四张审计表
  • 保留率:按语言、域名、文体、长度和时间切片记录规则前后比例。
  • 反事实样本:每条规则保存“刚好被删/刚好保留”的边界样本,而不是只看随机样本。
  • 等 token 消融:同训练预算比较下游曲线,不用单一终点分数。
  • 能力覆盖:除目标榜单外,增加代码、长文、事实新鲜度、罕见知识和有害记忆等护栏评测。
03

Ai2 · 2025.04.15 · 代理实验套件

DataDecide:小模型不是大模型的缩小版,但可以是“数据选择仪器”

关键不是精确预测最终分数,而是能否提前选对 A 还是 B

查看原文 ↗
先给结论

在 DataDecide 的 25 种语料、4M–1B 参数与最高 100B tokens 范围内,直接用约 150M 模型的排名预测 1B 模型排名,决策准确率约 80%;八种基线 scaling-law 方法没有超过这条朴素前沿。

25候选预训练语料
14模型规模档位
30K+开放 checkpoints
≈80%150M→1B 决策准确率
定义:这里的 80% 到底是什么

DataDecide 关心的不是“150M 模型得 42 分,所以 1B 模型会得 58 分”,而是成对决策:若语料 A 在小规模上优于 B,它在目标 1B/100B-token 训练上是否仍优于 B。对开发者而言,这比拟合绝对分数更贴近真实问题——有限预算下先淘汰哪些数据方案。

决策准确率Acc_decision = mean[ sign(small_A − small_B) = sign(target_A − target_B) ]

它会忽略差距大小:A 仅高 0.1 分与高 10 分都算一次正确,所以还应报告置信区间、随机种子和效果量。

为什么复杂 scaling law 没有自动胜出

理论上,多规模拟合能捕获两条曲线的交叉点;实践中,参数更多也意味着估计噪声更大,且小规模 checkpoint、任务指标和训练区间未必足以稳定识别斜率。DataDecide 测试的八种基线 scaling law 至多追平单规模排名。

解释 当目标是“选对”而非“预测精确终点”,一个低方差的粗排序器可能优于高方差的精细外推。这不是 scaling law 无用,而是提示:先用公开 sweep 校准你的外推器是否真的改善决策。

代理任务并不平等:MMLU/ARC 便宜,HellaSwag 更难

直接证据 MMLU 与 ARC Easy 在比目标计算量低多个数量级时仍较可预测;HellaSwag 等任务的跨规模排序更不稳定。代码任务又揭示第二个变量:用离散 pass/fail 准确率,小模型可能接近随机;改用字符长度归一化的答案似然,MBPP 与 HumanEval 的数据排序更可预测。

连续似然捕获“模型是否正在接近正确程序”,而离散执行只看到最后是否过线。代理实验因此至少有三层选择:模型规模、训练 checkpoint、评测统计量。

不能推出什么,以及如何用于 frontier 训练

边界 80% 来自 4M–1B 参数、最高 100B-token 的研究矩阵,不能直接保证 150M 能预测 70B/MoE 或数万亿 token。数据配比、tokenizer、优化稳定性和涌现型任务都可能改变排名。

建议:先用 2–3 个中等规模点和多个种子,估计排序稳定性;只把明显劣势方案淘汰,把接近者留到更大规模。若某任务在相邻规模频繁翻转,就把它标成“不适合作为早期代理”,而不是继续拟合更复杂曲线。

04

Ai2 · 2024.11.21 · 开放数据 / 代码 / 评测

Tülu 3:SFT、DPO、RLVR 不是三个按钮,而是三种不同的监督密度

阶段顺序之所以重要,是因为每一步都改变下一步的采样分布

查看原文 ↗
先给结论

Tülu 3 最有价值的不是“DPO 还是 PPO”的争论,而是开放了一条从 prompt 策划、SFT、长度归一化 DPO、RLVR 到未见评测的完整链。其结果显示:从 SFT 直接做 RLVR 的局部涨幅更大,但最终最强 checkpoint 来自 DPO→RLVR。

939,344收集的 prompts
57% / 43%公开来源 / 合成
2–300K偏好数据 prompt 量级
+3.3RLVR 相对 DPO 的 GSM8K 点数
第一层:SFT 学的是条件模仿,不是“对齐的全部”
SFT 目标L_SFT = − Σ_t log πθ(y_t | x, y_<t)

给定 prompt x 和参考回答 y,模型对每个目标 token 做最大似然。它提供密集、稳定的梯度,但只覆盖数据中出现的状态;参考答案的风格、长度和错误也会被一起学习。

Tülu 3 先按技能构造数据混合,再组合并补齐落后能力;合成回答主要来自 GPT-4o,代码部分使用 Claude 3.5 Sonnet。数据质量高并不消除教师偏差,因此需要后续偏好、可验证奖励和未见任务评测。

第二层:DPO 在比较“更喜欢哪个回答”,参考模型是隐形锚点
DPO 的最小形式L_DPO = −E log σ( β[(log πθ(yw|x)−log πref(yw|x)) − (log πθ(yl|x)−log πref(yl|x))] )

yw/yl 是偏好与拒绝回答。它不是单纯提高 chosen 的概率,而是让策略相对参考模型,更偏向 chosen 而不是 rejected;β 控制偏离参考模型的强度。

Tülu 3 从多模型生成候选,也加入自身 SFT 模型的 on-policy 回答,再由 GPT-4o 按帮助性、指令遵循、诚实和真实性评分。团队报告长度归一化 DPO 更好;新 prompts、更多独立 prompts 以及 on-policy completion 都改善聚合表现。

边界 LLM-as-a-judge 的偏好会写入模型;长度归一化解决部分长度偏差,不等于消除了裁判偏差、位置偏差或事实性错误。

第三层:RLVR 是“奖励从哪里来”,不是某个固定优化器

RLVR 用答案匹配、代码执行或约束检查替代学习型 reward model。其优势是标签便宜、可重复;劣势是只有可形式化验证的任务才适用,而且错误的 verifier 会被模型利用。Tülu 3 报告,相对 DPO checkpoint,RLVR 在 MATH、GSM8K、IFEval 上分别最高提升约 1.7、3.3、1.3 点。

要区分两个概念:RLVR描述奖励信号是可验证的;PPO/GRPO/RLOO描述如何估计优势和更新策略。把“GRPO=RLVR”会掩盖真正的实验变量。

阶段交互:为什么局部涨得多,不代表最终更强

从 SFT 直接进入 RLVR,初始提升空间更大,所以 RLVR 的局部增量更显眼;但先做 DPO 可能改善一般指令行为、输出分布和有效轨迹比例,使后续 RL 在更好的状态分布上探索。最终 DPO→RLVR 更强,说明评价阶段不能只看“本阶段涨了多少”。

真正要做的消融

至少比较 SFT、SFT→DPO、SFT→RLVR、SFT→DPO→RLVR 四条路径;同时报告目标任务、非目标任务、长度、KL、奖励作弊率和多个种子。否则无法区分能力收益、格式收益和遗忘。

05

Thinking Machines Lab · 2025.10.27 · 实现与复现实验

在策略蒸馏:把 RL 的“学生分布”与蒸馏的“密集反馈”拼在一起

不是让学生继续模仿教师答案,而是让教师批改学生自己走过的每一步

查看原文 ↗
先给结论

离线蒸馏的轨迹来自教师,学生犯错后会进入训练集没有覆盖的状态;结果奖励 RL 的轨迹来自学生,但整条轨迹常只有一个稀疏分数。在策略蒸馏让学生采样、教师逐 token 给 log-prob,从而在“自己的错误分布”上获得密集信号。

60→70复现实验 AIME'24 目标区间
≈150达到 70% 的训练步
9–30×相对 SFT 外推的 FLOPs 节省
1,800Qwen3 报告的 OPD GPU-hours
三种训练信号:采样分布 × 反馈密度
方法轨迹来自信号主要盲点
离线 SFT / 蒸馏教师逐 token学生自己的错误状态未被覆盖
结果奖励 RL学生序列级稀疏奖励不知道哪一步把轨迹带偏
在策略蒸馏学生教师逐 token log-prob受教师能力与推理成本约束
目标函数:reverse KL 到底在优化什么
每个学生状态上的反向 KLKL(πθ || πT) = E[x_t ~ πθ] [ log πθ(x_t|h_t) − log πT(x_t|h_t) ]

h_t 是学生已经生成的前缀。先由学生采样 token,再让教师对同一 token 打分;训练把每个 token 的 advantage 设为负 KL。若学生在某一步选择了教师认为极不可能的分叉,该 token 会得到大惩罚。

  1. 学生生成一批轨迹并保存自身 log-prob。
  2. 教师对这些完全相同的 token计算 log-prob。
  3. 逐 token 计算 log πθ − log πT
  4. 用 importance-sampling 风格的 RL loss 更新学生,不反传教师。

这解释了一个有趣现象:最终错误答案有时惩罚不高,因为在错误前缀下它已经很可预测;真正高 KL 的往往是早先把推理带错的“分叉 token”。

结果:9–30×、10× GPU-hours 与“50–100×”为什么不能混为一谈

Thinking Machines 从 Qwen3-8B-Base 的 400K-prompt SFT checkpoint(AIME'24 约 60%)出发,在约 150 步、约 77K prompts(每 prompt 4 samples)后达到约 70%。按其 FLOPs 估算,相对把离线 SFT 外推到 2M prompts,节省约 9×;若把生成离线教师数据的成本也算入,可到约 30×。

Qwen3 技术报告中的另一组数字是:RL 约 17,920 GPU-hours 得到 AIME'24 67.6%,OPD 约 1,800 GPU-hours得到 74.4%。这约是 GPU-hours 的 10× 差异,但硬件利用率、teacher scoring 并行度和训练栈会影响口径。早期摘要里“50–100×”更适合描述某些策略复现/步数效率信号,不能当作通用端到端成本定律。

适用边界:蒸馏擅长迁移已有教师策略,不等于发现教师不会的策略

边界 reverse KL 倾向追随教师高概率模式;教师对某种解法盲目,学生也会被拉回。若环境能提供教师之外的可验证新策略,仍需要探索与环境奖励。可行方向是把逐 token 蒸馏奖励与序列级环境奖励组合,但这会重新引入权重平衡和奖励冲突。

最小实验:同时测离线 SFT、RLVR、OPD;按教师 FLOPs、学生 FLOPs、rollout wall time、教师服务成本分别记账。只有质量—成本曲线而不是单一终点,才能决定部署方案。

06

Thinking Machines Lab · 2025.09.29 · SFT / RL 消融

LoRA:低秩不是免费午餐,但“覆盖哪里”常常比“rank 多大”更重要

SFT 受容量与 batch 约束;结果奖励 RL 的信息量更低,因此低 rank 也可能够用

查看原文 ↗
先给结论

在该文覆盖的 Llama 3/Qwen3、Tülu3/OpenThoughts3 与数学 RL 实验中,小到中等 SFT 可让高容量 LoRA 接近 FullFT;数据超过适配器容量后学习会提前变慢。attention-only LoRA 即使把参数数目补回来也较差,而覆盖 MLP/MoE 后显著改善。

1–512被测试的 rank 范围
≈10×高 rank LoRA / FullFT 最佳 LR 比
3MLlama-3.1-8B rank-1 全层参数量级
32大 batch 代价较小的示例档位
参数化:LoRA 真正改变的是更新空间
低秩更新W' = W + (α / r) · B A

冻结原权重 W,只训练 A、B;更新矩阵的秩不超过 r。α/r 控制尺度。它节省可训练参数和优化器状态,但也把梯度限制在低秩子空间。

该文使用 α=32,并对每个条件单独扫学习率。由于 1/r 缩放,训练初期每个 rank-1 外积更新的期望做平均,最初的有效更新尺度近似与 rank 无关;这解释了不同 rank 的最优学习率在短训练里相近,而不是“rank 加倍就必须把 LR 减半”。

容量:为什么低 rank 不是到某个 loss 突然撞墙

实验曲线显示,低 rank 往往先沿着 FullFT/高 rank 的学习曲线下降,随后在某个数据规模或训练步数后逐渐落后。容量不足表现为样本效率变差,不是完全学不动。阈值随数据量、模型规模和任务结构变化。

这给出一个比“推荐 rank=64”更可靠的诊断:若提高 rank 后落后点向后移动,说明是容量;若所有 rank 都同样落后,先检查 target modules、batch size、学习率和实现。

覆盖:attention-only 为什么可能输给 MLP-only

直接证据 在该文的小数据设置中,attention-only 即使通过更高 rank 匹配可训练参数数目,仍显著弱于 MLP-only;MLP-only 与全层覆盖更接近。这说明“总参数数目”不能替代“更新位置”。知识和任务变换大量存于 MLP/MoE 路径,只调 attention 可能把适配器放在错误的子空间。

顺序建议:先覆盖所有关键线性层,特别是 MLP/MoE;再根据数据量调 rank;最后扫学习率。不要一开始用超高 attention rank 补偿错误覆盖。

为什么结果奖励 RL 可能 rank=1 也够,但 SFT 不一定

作者给出信息论直觉:SFT 每个 token 都提供监督,一条长序列含 O(tokens) 级信息;结果奖励 RL 每条轨迹的 advantage 常接近 O(1) 个标量。其 MATH 设置约 10K 问题 × 32 samples,若粗略按每条 completion 一比特计算,总信息约 320K bits;而 Llama-3.1-8B 的全层 rank-1 LoRA 已约 3M 参数。

边界 这是解释性上界,不是严格的信息等价证明;reward 不是独立比特,参数也不是无损存储位。结论应读成“被测数学 RL 的有效更新维度很低”,不能推广到长时序 Agent、密集过程奖励或大规模 SFT。

失败模式:大 batch 与错误学习率

LoRA 在部分 SFT 实验中比 FullFT 更不耐受大 batch,且加 rank 不能消除差距;这指向乘积参数化的优化动力学,而非单纯容量不足。高 rank LoRA 的最佳 LR 在实验中约为 FullFT 的 10 倍,rank 4–512 之间变化不到 2×,但 rank=1 有额外差异。

最小 sweep:固定全层覆盖,测试 3 个 rank × 4 个 LR × 2 个 batch;画 loss 对 token 曲线。若只看最终采样分数,很难区分优化慢、容量不足和评测噪声。

07

Hugging Face · 2026.05.29 · Agentic RL 工程

TITO:你以为在优化模型采样的 token,实际上可能在优化“重新编码后的另一个序列”

多轮工具调用里,decode→parse→render→encode 不是恒等变换

先给结论

RL 的 log-prob、importance ratio 和梯度必须对应策略实际采样的 token。多轮 Agent 若把消息列表整段重新渲染,BPE 分词、JSON 空格、字段顺序或特殊 token 都可能漂移;字符串相同也不保证 token id 相同。

机制错误:为什么 decode 不能撤销 encode

BPE 编码通常为字符串选择一个规范切分,但多个 token 序列可能 decode 成同一字符串。例如示意性的 ["he", "llo"]["hello"] 都可能还原为 “hello”。模型实际采样前者,事后重编码却得到后者;文本看起来不变,梯度位置已经变了。

采样时prompt_ids + sampled_ids_A保存 π_old(sampled_ids_A)
错误循环decode → JSON parse → render → ids_Bids_B ≠ sampled_ids_A,却被拿来反传
TITOrunning_buffer += sampled_ids_A解析只用于路由,不反馈给 token buffer

工具返回不是策略生成的 token,因此 loss mask 应为 0;下一轮模型生成的 token mask 才恢复为 1。若最后才重建 mask,模板边界一变就可能把工具 token 也纳入优化。

正确循环:保留 buffer,只计算 tool-response delta
  1. 初始 prompt 编码一次,写入 running token buffer。
  2. 模型生成的原始 token id 直接 append,并同步写入 loss mask=1。
  3. 可以 decode/parse 以决定调用哪个工具,但解析结果只用于路由。
  4. 工具结果需要模板包装时,分别渲染“工具前 prefix”和“加入工具结果后的 full”,取后者的 token 后缀 delta。
  5. 把 delta append 到 buffer,loss mask=0;继续下一轮采样。
前缀保持不变量full[:len(prefix)] == prefix

只有模板加入 tool message 后完全保留旧 token 前缀,suffix diff 才安全。文章测试 19 个常用模型族时有 18 个原生满足;旧 Qwen3 模板因最后一轮条件化的空 think block 失败,可一行修改修复。

真正困难的边界:历史重写让 on-policy 目标本身失去定义

上下文压缩、删除旧 thinking、子 Agent 汇总都会把先前采样过的历史替换成“从未被该策略生成的 prompt”。这不只是工程偏差:PPO/GRPO 的 importance ratio 无法解释这个 Frankenstein 轨迹。

TITO 的保守做法是:找到最后一次历史重写,把此前所有内容冻结成 prompt(mask=0),只对重写后真实采样的尾部计算 loss。代价是可学习 token 变少;若轨迹频繁压缩,最终可能只剩很短的训练尾部。

上线前必须通过的五个性质测试
  • Token identity:训练 token 与采样日志逐位置相同。
  • Mask identity:模型 token=1,工具/系统/重写历史=0,边界由生成时记录。
  • Prefix preservation:每个支持的 chat template 在 tool message 上通过前缀测试。
  • Truncation:中途截断不会触发静默 re-render;若无法证明安全就失败退出。
  • Observability:监控 reward 之外,还记录 retokenization drift、模板版本、解析失败和 loss-bearing token 比例。

TRL v1 的价值正是在稳定接口与实验算法之间建立契约;库能提供训练器,但不能替你证明数据流遵守这些不变量。

08

Hugging Face / Ai2 · 2025–2026 · 分布式系统与控制实验

Ultra-Scale × OlmPool:今天省下的显存,可能变成明天长上下文的能力债

并行策略决定能不能训练,架构选择决定扩到 64K 后还剩什么

先给结论

并行不是缩写收集,而是给四种资源分账:参数/优化器显存、activation 显存、卡内通信、跨 stage 空泡。OlmPool 进一步说明,QK norm、GQA、滑窗注意力和较短预训练上下文各自有稳定性或效率收益,但组合后会显著削弱长上下文扩展。

4,100+Ultra-Scale 分布式实验
512最高实验 GPU 数
26 × 7BOlmPool 控制模型
≤47%多项架构选择组合的长上下文降幅
先做显存算术:7B 模型为什么单卡“参数放得下”仍训不动

一个粗略但有用的估算:BF16 参数约 2 bytes/param,梯度约 2 bytes,Adam 的一阶/二阶矩与可能的 FP32 master weights 再占约 8–12 bytes。于是持久训练状态常在 12–16 bytes/param 量级;7B 模型约需 84–112GB,还没算 activation、通信 buffer、碎片和临时张量。

粗略每卡持久状态Memory ≈ P × bytes_per_param / ZeRO_shard_degree

若用 8 卡 ZeRO-3,理想下 112GB/8≈14GB/卡,但前向/反向仍会 all-gather 参数,并且 activation 可能成为新瓶颈。这个算式用于定位量级,不替代真实 profiler。

四个并行维度分别在交换什么
DP / ZeRO / FSDP

切 batch;ZeRO 再切参数、梯度和优化器状态。容量友好,但每步有聚合/重建通信。

TP

切单层矩阵。模型层放不下时必要,但几乎每层通信,优先放在高速互联域。

PP

按层切 stage。降低单卡模型状态,代价是 micro-batch 调度与 pipeline bubble。

CP / SP

切序列或 activation。长上下文时关键,但注意力通信与负载均衡更复杂。

选择顺序应从瓶颈出发:模型状态超显存先 ZeRO/FSDP;单层仍放不下再 TP;跨节点模型过大用 PP;序列 activation 爆炸再 CP。把所有维度都打开,往往只会把通信路径变得不可解释。

OlmPool 的控制实验:短上下文看不出的架构债

OlmPool 构造 26 个 7B 模型,仅改变四类注意力设计:QK normalization、GQA、sliding-window attention、预训练上下文长度;再用相同数据与流程扩展到 64K,并用 HELMET、RULER、LongPPL 评测。博客报告,单项影响常较小,但三项以上组合可让长上下文分数下降最多约 47%。

直接证据 训练 loss、validation perplexity、16 个短上下文任务,甚至 HELMET 8K,都不能可靠预测 32K/64K 排名;看似相同的模型在 32K 可相差 26+ 分。最差架构即使用 50B tokens 做扩展,也未追上 Llama 风格架构只扩展 1B tokens 的表现。

因果解释与限制

GQA 和滑窗通过减少 KV/全局注意力换取推理效率;较短预训练上下文节省预训练成本;QK norm 改善稳定性。但长上下文需要灵活地把注意力质量分配到远距离 token,这些约束可能共同减少可适应空间。文章还观察到无 QK norm 模型形成更强 attention sinks,并与更好的长上下文检索相关。

边界 attention sink 是相关机制线索,不等于已证明的唯一因果路径;26 个 7B 模型与三套 benchmark 也不能覆盖所有 MoE、位置编码和真实 Agent 工作负载。正确结论是“早做小规模上下文扩展实验”,不是“永远不要用 QK norm/GQA/滑窗”。

最低成本的架构保险

在架构冻结前,从早期 checkpoint 抽两个候选,各做 1B-token 级长上下文扩展;至少测 8K/32K/64K 的检索、长程依赖 perplexity 与真实任务,并记录 KV cache/吞吐成本。若 8K 持平而 32K 已明显分叉,就不要期待后期“多加长数据”自动抹平。

09

Interconnects / Hugging Face · 2026 · 行业综合与框架信号

2026 后训练地图:从一次训练,转向持续制造轨迹与反馈的数据引擎

哪些已经被多项实验支持,哪些仍只是前沿实验室的配方信号

先给结论

前沿配方正在堆叠冷启动、偏好数据、可验证奖励、在线 rollout、多教师蒸馏、工具环境和异步训练。但 Interconnects 的 MOPD 判断属于跨报告综合,不是统一控制实验;它适合做“搜索雷达”,不适合直接变成你的默认配方。

一个可操作的五对象框架
初始化从哪个 checkpoint 开始

Base、Mid-trained、SFT、DPO 的探索分布完全不同。

任务环境模型在哪里行动

静态 prompt、代码执行器、搜索、工具 API 或多 Agent 环境。

轨迹谁生成训练经验

教师离线生成、学生 on-policy、混合 replay 或异步旧策略。

反馈什么定义“更好”

参考答案、成对偏好、verifier、教师 token 分布或环境回报。

更新系统经验如何变成梯度

SFT、DPO、PPO/GRPO/RLOO、蒸馏及权重同步方式。

读任何新模型报告,都先把这五项填全。若报告只说“使用 RL 显著提升”,却不说明初始 checkpoint、采样预算和 verifier,算法名几乎没有归因价值。

证据分层:当前哪些判断相对稳,哪些仍待验证
判断证据等级理由
on-policy 数据能覆盖学生自己的错误状态较强Tülu 偏好、OPD、RL 方法都出现一致机制信号
密集 token 监督通常比序列级稀疏奖励更省样本条件较强OPD 有机制与实验,但教师成本和任务决定总成本
多教师 OPD 是 2026 前沿标准配方行业信号来自技术报告综合,缺统一开放对照
更复杂 RL 算法必然胜过 DPO/SFT不支持数据、采样与实现常比算法标签影响更大
RL 能无限补偿预训练数据缺口不支持探索受底座表征、任务环境与可达轨迹约束
为什么后训练库的重点正在从“算法实现”转向“系统契约”

TRL v1 同时维护稳定与实验接口,覆盖 PPO、GRPO、RLOO、DPO 系列,并把异步 rollout、分布式后端和快速变化的方法隔离开。这个方向本身就是信号:真实后训练系统要解耦采样、奖励、优势计算、训练、权重同步和数据记录。

一旦异步,rollout 可能来自旧策略;一旦多轮,token identity 可能被破坏;一旦多教师,不同反馈可能冲突。系统需要报告 policy lag、样本年龄、token 对齐率、无效轨迹比例、verifier 通过率和硬件利用率,而不是只展示 reward 曲线。

读者应该保留的判断
  • 把后训练看成数据生成系统:模型不断暴露错误,环境与教师把错误变成下一轮监督。
  • 把算法看成信用分配器:它决定一个序列级结果如何分配到 token 和更新。
  • 把基础设施看成实验变量:异步程度、采样吞吐和 token 契约会改变方法本身。
  • 把评测看成控制回路:如果开发集长期参与数据选择,它已不再是独立证据。

决策矩阵

遇到训练问题,先做哪项最小实验

症状首要假设最小实验停止/转向条件
新数据加了但能力没涨过滤/混合或代理指标失真等 token 单变量消融,连续 likelihood + 目标任务多个种子排序反复翻转,停止用该任务做代理
领域知识涨、指令行为掉Mid-training 改变行为分布Base→Mid→行为恢复三 checkpoint 联测恢复行为必然抹掉知识,转向混合背景数据或 OPD
DPO 后 RLVR 不稳定轨迹有效率、KL 或 verifier 问题四路径消融并审计失败 rollout奖励与真实正确率脱钩,先修 verifier
LoRA 明显落后 FullFT覆盖错误、容量不足或 batch 太大全层覆盖下 rank×LR×batch 小网格所有 rank 同样差,优先查实现/覆盖而非继续加 rank
Agent RL reward 涨但能力怪异token 漂移或 mask 错位逐 token identity + prefix property tests任一轨迹 re-encode 不一致,禁止继续训练
8K 正常、64K 崩架构组合限制长程注意力早期 checkpoint 做 1B-token 上下文扩展32K 已稳定分叉,不赌后期 50B tokens 自动修复

综合判断

把九章压成一张训练因果图

数据决定支持集

FineWeb 说明过滤需要消融;DataDecide 说明代理实验需要先校准“选对”的能力。

架构/系统决定可训练与可扩展空间

并行解决容量,OlmPool 提醒效率型架构选择会积累长上下文债务。

中间阶段重新塑造能力分布

Olmo 3/Qwen3 把知识、长上下文和行为控制拆成多个接口。

后训练改变能力调用与探索

SFT 给密集模仿,DPO 给相对偏好,RLVR 给环境结果,OPD 给学生状态上的密集教师反馈。

轨迹契约决定梯度是否对应真实行为

TITO 说明 token 身份、mask 与历史重写是算法成立的前提。

本期最重要的结论

预训练并不“单独决定一切”,后训练也不是“万能补丁”。更准确的说法是:预训练数据与架构决定可达能力和成本地形;Mid-training 重排地形;后训练在特定任务与反馈下搜索、放大和控制行为;系统与 token 契约决定这些实验是否真的在优化你以为的目标。

七天精读路线:每天必须交付一个可检查的产物
  1. 第 1 天|Model Flow:画出 Olmo 3 与 Qwen3 的阶段图;产物是每个箭头传递的五类接口。
  2. 第 2 天|数据:为一个清洗规则写等 token 消融;产物是保留率、边界样本和三类评测。
  3. 第 3 天|代理实验:定义成对决策准确率;产物是一个会被判定“不适合做代理”的失败条件。
  4. 第 4 天|SFT/DPO/RLVR:手写三个目标的输入、反馈、更新与盲点;产物是四路径消融表。
  5. 第 5 天|OPD:从学生 rollout 到 reverse-KL advantage 走一遍;产物是教师/学生/采样成本账本。
  6. 第 6 天|LoRA:区分覆盖、容量和优化;产物是 rank×LR×batch 的最小 sweep。
  7. 第 7 天|Agent/System:构造一次工具调用;产物是 token buffer、loss mask、prefix test 和截断策略。
仍然开放、值得继续追踪的六个问题
  • 小规模数据排序在 70B/MoE 和数万亿 token 上何时发生系统性反转?
  • RLVR 的收益有多少来自新搜索策略,有多少来自输出格式与已有能力的稳定调用?
  • OPD 与环境奖励联合时,怎样避免教师保守性压制可验证的新策略?
  • LoRA 的低有效维度结论能否扩展到长时序、多工具 Agent RL?
  • 长上下文架构的效率收益与可扩展性,能否在更早阶段被更便宜的指标预测?
  • 频繁历史压缩的 Agent,是否需要不同于 PPO/GRPO 的轨迹目标定义?

来源

本期核心原文与证据类型

  1. Olmo 3: Charting a Path Through the Model Flow · Ai2 · 2025-11-20 / 12-12 更新
  2. Qwen3: Think Deeper, Act Faster · Qwen Team · 2025-04-29
  3. The FineWeb Datasets · Hugging Face · NeurIPS 2024 D&B
  4. DataDecide · Ai2 · 2025-04-15
  5. Tülu 3: The Next Era in Open Post-training · Ai2 · 2024-11-21
  6. On-Policy Distillation · Thinking Machines Lab · 2025-10-27
  7. LoRA Without Regret · Thinking Machines Lab · 2025-09-29
  8. Agentic RL: Token-In, Token-Out Done Right · Hugging Face · 2026-05-29
  9. TRL v1.0 · Hugging Face · 2026-03-31
  10. The Ultra-Scale Playbook · Hugging Face · 2025
  11. OlmPool · Ai2 · 2026-04-23
  12. Frontier Post-training Recipe Review · Interconnects · 2026-06-16 · 行业综合,非控制实验

编辑说明:本期采用“忠实精读”而非整篇逐字翻译:尽量按原文结构详述关键段落、公式、实验与结论,同时避免脱离上下文的长篇转载。“解释”段落用于建立机制直觉,不替代原论文、代码与 checkpoint。