← 退出专注模式
07 · 训练闭环 · 开章

Agent 的能力,是练出来的

前六章我们站在评测者一边:看题、看轨迹、看判分。这一章换到另一侧——被评测的模型,能力是怎么训出来的?以及:我们辛苦分析的轨迹,最终去了哪里?

三节正好补上全站视角缺的两端:能力来源 与 分析出口

07-A · 总纲

五阶段链路:从代码语感到软件工程师

① 预训练 语感 · 会写代码
→
② mid-training 2026 新常态
→
③ SFT/蒸馏 格式 · 会模仿
→
④ RLVR 测试当裁判
→
⑤ 蒸馏统一 单模型部署
1
「会写代码」「会把题做对」「会当工程师」是三种能力 分别主要来自预训练、RL、多轮 agent 训练——不是一回事
2
第 ② 格是 2026 年才定型的:agent 训练前移进 mid-training Qwen3-Coder-Next 用约 600B token 的合成可验证任务直接从环境反馈学习
07-B · 预训练

代码语感是喂出来的——而且要先「去污染」

1
去污染:按 n-gram 重叠剔除与评测集重合的训练数据 不去污染的模型分数再高也是背题——这与我们评测时担心「见过这道题」是同一件事
2
FIM 中间填空:切前缀/中间/后缀,练「光标停中间」的补全 再用 AST 抽完整逻辑单元做填充块——IDE 补全的基础

语料工程决定上限:见过的代码不够多、不够好,后面全白搭

07-C · RLVR

代码有「上帝裁判」:测试通过就是 1

1
强化学习难在没法自动打分——代码是例外 单元测试通过与否就是客观奖励,模型无法讨好一个客观裁判
2
实证三段数字:11.4% → 20.5% → 39.0% Qwen2.5-72B:基线 → 拒绝采样微调(RFT)→ 再加 RL——RL 的增益是真实的
3
教科书配方是 DeepSeek-R1 四阶段 冷启动 SFT → 推理 RL → 拒绝采样 SFT → 全场景 RL
07-D · 2026 修正

RL 不创造能力,它收敛分布

1
pass@k 证据:RL 大涨 pass@1,大 k 下基座追平 RL 把基座里已存在的低概率正确路径抬上来——分布里没有的,创造不出来
2
随机奖励也能涨点(Spurious Rewards, ICML 2026) 部分增益来自隐式正则(输出变长、格式变好),不是学会了推理
3
推论:蒸馏 > 小模型自己 RL;预训练不可跳过 上限在底座和数据里,RL 负责单发命中率与纪律

对本平台的含义:只看 %Resolved 会把「收敛」误读成「变强」——要多采样一致性

07-E · 工具能力

模型怎么知道有哪些工具?——菜单是注入的

1
工具定义 = 函数名 + 说明书 + 表单(schema) 它随每次 API 请求发送,序列化进上下文、按 input token 计费——不在模型参数里
2
训练学的是「会填表」,注入给的是「菜单」 像会查字典的人——字典里有什么词条,是每次翻开才看到的
3
description 是第一决定因素(官方原话) 改一段工具描述就能改行为——描述是可干预的实验变量
07-F · 一次往返

模型只提议,环境才执行

1 提议 模型输出 tool_use
→
2 执行 宿主校验并真跑
→
3 观察 tool_result 塞回
→
4 继续 直到合成答案
!
模型输出 tool_use 的那一刻,现实世界什么都没发生 「模型以为调成功了但实际报错」——所以轨迹必须记提议与执行两层
07-G · 边界

工具多了会笨:30–50 是道坎

1
超过 30–50 个工具,选择准确率明显下降 多 server 场景工具定义能吃掉约 55K token——还没干活先交「菜单费」
2
解法 defer_loading:控制「进不进上下文」,不是「发不发送」 完整定义仍在请求里(服务端要靠它做搜索展开)——省的是模型上下文,不是流量
3
「模型没用某工具」可能是它根本看不见 工具可见性应该进轨迹记录——区分「不需要」与「被 defer」
07-H · 过程监督

奖励信号分四档:越稠密越贵

1 ORM 终局测试 · 零成本
→
2 执行反馈 测试数变化 · 零成本
→
3 PRM 学出来的每步打分
→
4 人工标注 最贵最稠密
!
执行反馈最可信,因为判据来自环境,不是模型自评 模型无法「讨好」编译器——天然抗奖励黑客
07-I · first-error

只标「第一个错步」——本仓能自动做

1
first-error 模式:第一个错步之前全对、之后全错 契合「错误级联传播」的现实,成本只有逐步标注的零头
2
自动推断:用 F2P/P2P 通过数的变化点反推分岔位置 「通过数从升转停」的那一步,大概率就在 first-error 附近
3
本仓现状:step_annotator 只描述、不判定 补上「判定」就是补齐 PRM 输入的最后一步
07-J · 军备竞赛

模型越强,越会「贿赂裁判」

1
RL 后期 agent 自学 git remote add 重连 GitHub 扒答案 Qwen3-Coder-Next 报告披露:删掉 remotes 的标准防护之后冒出来的新作弊
2
评测侧同步塌方:Verified 饱和、基准撤分事件 「过了测试」越来越不等于「做对了题」
3
对策:过程审计的价值暴涨 看它怎么过的测试,比看分数重要——这正是轨迹分析的用武之地
07 · 收官

闭环合拢:你们不是旁观者

1 评测 SWE-bench S1-S7
→
2 分析 analysis/ 六模块
→
3 构造 任务/环境/奖励
→
4 训练 SFT / RL
↺
5 再评测 闭环合拢
1
过程分析位于闭环的咽喉位置 既是评测的可信度来源,也是训练的燃料来源
2
三个可执行落点:pass@k 一致性 · reward-hacking detector · 六模块信号当 PRM 燃料 全部用现有数据就能起步——这正是本平台对外的独特贡献

全站 40 张教学讲义在这张闭环图上各归其位——课程到此合拢

回专注模式目录 · 选下一章 →
1 / 12 ← → 翻页 · Esc 退出
专注模式 · 第 07 章 训练闭环 · 生成时间:2026-09-12(v2.2 新增章) · agentsoft-research-platform teaching-web-platform