门户首页
教学站 · 本科生快速入门

看懂 Agent 如何解题,只要 5 步

面向第一次接触 code agent 评测的本科生—— 5 步走通"看一道题 → 看一次解题 → 学判分规则 → 理解 Agent 心智 → 回顾串联", 加 1 步课堂收口。围绕同一道真实题贯通,全程仅用 3 张讲义。 每步 5–15 分钟,总计约 1 小时,可分两次完成。

生成时间:2026-09-07 · 版本 v0.2(新增本科生 5+1 步快速入门线路图页) · 生成 Agent:MiniMax Code (LLM: MiniMax-M3) · 载体:agentsoft-research-platform teaching-web-platform
重要:本线路只动用本站 3 张讲义(讲义站共 40 张), 其余 37 张面向研究生与项目协作者,你现在不需要看。如果中途被劝退—— 你没错,是页面劝退。跳到 实验报告模板 完成 5 个任务同样能交差。

进度

已完成 0 / 6 步 · 进度自动保存到本机 localStorage

第 0 步 · 起点——两站分工与总览(5 分钟)
目标:建立"两站"心理地图——讲义站负责"学",实验平台负责"看真实数据"。
操作(按顺序做)
  • 滚读讲义站首页"全站目录"和"读者路径分流"两块,认 5 层组织
  • 新开公网实验平台首页,认出 6 个公网可见导航项(实验总览 / 数据集 / 已做实验 / 过程分析 / 模拟执行 / 使用指南)——作业管理 / Agent 配置 需 admin 权限,你看不到属于正常
  • 默念一遍:「讲义站学原理,平台看真东西」
看什么

这一站没有"题"可做——是认知锚定。第 1 步起开始动手。

任务:无(认知锚定即可)。如果非要记点什么:在本节空白处写一行「讲义站=学 / 平台=看」即可跳过。
对一对参考答案

这一步骤没有任何"对错"——它只检测你有没有在两个站之间建立方向感。如果你打开平台时能找到 6 个公网可见项中的任意 3 个,就算完成。

选学 · 跳过亦可
第 1 步 · 看一道题长什么样(10 分钟)
目标:理解 SWE-bench 的题目形式——一道真实 GitHub issue + 两组测试。
操作
  • 打开平台数据集页,搜索 django__django-14915,点开该题
  • 读 3 块内容:issue 原文(用户报的问题)、FAIL_TO_PASS(修好之前会失败的测试)、PASS_TO_PASS(本来就要通过不能被改坏的测试)
  • (选学深化)读讲义站《SWE-bench 数据 schema》:9 个字段逐个讲清
看什么
  • issue 描述通常包含一段最小复现代码 + 报错信息
  • F2P 是"修对"的合约,P2P 是"不破坏"的合约
  • 题目形式:真实 bug 报告,不是教科书例题
任务:一句话写出来——这道题想让 Agent 做什么?写到报告第一节「题目理解」。
对一对参考答案

要点:读真实 issue → 定位并修复缺陷 → 通过 F2P(证明修好)且不破坏 P2P(证明没改坏别的)。(注:参考答案定位为"对照要点"非唯一标准——只要包含"读 issue + 修 bug + 不破坏回归"三要素即合格。)

第 2 步 · 看一次完整解题(15 分钟)
目标:看真实 Agent 在同一道题上做了什么——阶段耗时、文件改动、轨迹细节。
操作
  • 打开实验详情页(kimi-agent 跑 django__django-14915,resolved=100%):先看 S1-S7 阶段耗时条,再滑到 补丁对比(Agent 改动了哪些文件)
  • 打开轨迹页正文(重点):从第一条 LLM 思考读到最后一条工具调用,关注节奏——读文件→想→改→测试→再读→再改
  • (若该题有沙箱数据)到模拟执行列表找 django__django-14915,看终端一步步解题的回放——零背景要求,最直观;缺数据时跳过
  • (选学)打开insights · replay 视角,看时间轴节奏的结构化呈现
看什么
  • S1-S7 七阶段:S1 准备环境 → S2 拉镜像 → S3-4 启动 Agent → S5 等待 → S6 评测 → S7 收尾
  • 补丁对比:Agent 通常改 1-3 个文件,行数 5-30 行为常见
  • 轨迹页:不必逐条读,先看节奏——「读/想/改/测」的循环
任务:截图 3 个关键动作(读文件 / 改代码 / 跑测试),各配 1 句说明 → 报告第二节「解题过程观察」。
对一对参考答案

读文件:通常是 cat / view_file 类工具调用——Agent 在「认识现场」。
改代码:通常是 str_replace / edit_file 类——通常改 1-3 个文件、5-30 行。
跑测试:通常是 bash 跑 pytest 或项目自定义测试命令——失败后 Agent 会回到「读/改」再试。
(注:解法不唯一,可能 Agent 走的路径与上述不完全一致——只要包含「读 → 改 → 验证」三步循环即合格。)

第 3 步 · 学判分规则(15 分钟)
目标:理解 %Resolved 数字怎么算出来——回过来验证第 2 步看到的 100% 不是玄学。
操作
  • 读讲义站《SWE-bench 入门》——判分主体在此:F2P/P2P 合约、"宿主机做题 + 容器判分"执行模型、%Resolved 公式
  • 回第 2 步实验详情页找 F2P 通过数 和 P2P 通过数,验证 100% 从哪来
  • (选学深化)讲义《SWE-bench 评测流程》:5 步流程 + 3 层 Docker 镜像
看什么
  • %Resolved 公式固定:count(FULL) / count(total),FULL = F2P 全过 ∧ P2P 全过(防回归)
  • 第 2 步看到的 100% 意味着:F2P 全过 ∧ P2P 全过(既修好又不破坏)
  • 判分模型:宿主机上 Agent 改代码,容器内跑测试——保证评测隔离
任务:把第 2 步实验的 F2P / P2P 计数抄下来,手算一次 %Resolved 并核对 → 报告第三节「判分回验」。
对一对参考答案

django__django-14915 在 kimi-agent 解中 F2P 全过 ∧ P2P 全过,resolved=1 → %Resolved=100.0%。如果数字与页面不符,先回看第 2 步实验详情页的「测试结果」段。(注:单题 100% 与"该 Agent 在全部 Lite 题上的 100%"是两件事——前者只代表这一道做对。)

第 4 步 · Agent 心智模型(15 分钟)
目标:理解 Agent 是怎么"思考"的——harness + LLM 的任务循环,6 大组件构成一个最小可行 Agent。
操作
  • 读讲义站《理解 Agent 开发过程:harness + LLM 的任务循环》:6 大组件(system / user / tool result / tool call / observe / think)+ 最小 harness 伪代码
  • 回看第 2 步轨迹页,对照伪代码走一遍——找到「observe(读文件结果)→ think(LLM 思考)→ act(工具调用)」的三段式在哪里
看什么
  • 6 大组件:system prompt · user prompt · tool result · tool call · observe · think
  • 最小循环:观察环境 → 思考下一步 → 行动 → 观察新结果 → …
  • Agent ≠ LLM:LLM 是大脑,harness 是身体+记忆
任务:纸笔 / draw.io 画一次 observe → think → act 循环流程图,标注第 2 步轨迹中对应的真实片段 → 报告第四节「Agent 心智」。
对一对参考答案

循环结构通常是:[observe 工具结果] → [think LLM 决策] → [act 工具调用] → [observe 新结果] → ...。在第 2 步轨迹中,找一条「读文件 → 修改 → 跑测试 → 失败 → 再读」的完整循环就是一次完整观察-思考-行动。(注:不同 Agent 实现细节不同,但核心三段式必出现。)

第 5 步 · 回顾串联(10 分钟)
目标:从「单点题解」上升到「范式」——人怎么和 AI Agent 一起干活,AI-DLC 是怎么回事。
操作
  • 读讲义站《范式迁移 + AI-DLC + 3 种协作模式》开头节:3 种协作模式(人主导 / AI 主导 / 人机融合)+ AI-DLC 四原则
  • 回看前 4 步:你这 5 步实际上走的就是「人主导 + AI 协助」模式——题目由人解读,Agent 跑题,判分由系统执行
看什么
  • 3 种协作模式:「人主导 AI 协助」「AI 主导人审核」「人机融合」
  • AI-DLC 四原则:把传统 SDLC 改造为「AI 是协作者而非工具」
  • 从「人写代码」到「人描述需求 + Agent 写代码 + 人审核」
任务:写 200 字小结「人机融合与全自动 Agent 差在哪」——可直接作报告结语。
对一对参考答案

要点:「人机融合」中,人仍是目标设定者 + 价值判断者,AI 是执行 + 检索 + 试错放大器;「全自动 Agent」是 AI 闭环所有决策,但当前技术下代价是质量与可解释性下降。本线路你是「人主导」——这就是为什么实验报告要你写小结,因为学习闭环最后一步必须由人完成。(注:开放问题,无标准答案。)

实验报告模板(照抄小节标题即可)

用法:把 5 个任务的产出直接作为下面 5 个小节的内容来源。教师评分时一眼能对上。
报告小节对应任务(来自线路图)必含元素
一、题目理解 第 1 步任务:一句话写「这道题让 Agent 做什么」 issue 核心问题 · F2P / P2P 含义 · 题目来源(哪个 repo)
二、解题过程观察 第 2 步任务:3 张截图 + 说明 读文件截图 · 改代码截图 · 跑测试截图 · S1-S7 耗时条观察
三、判分回验 第 3 步任务:抄 F2P/P2P 计数 + 算 %Resolved F2P 数 · P2P 数 · %Resolved 公式 · 与平台数字核对
四、Agent 心智 第 4 步任务:循环流程图 + 标注真实片段 observe → think → act 流程图 · 至少 1 处真实轨迹标注
五、范式小结 第 5 步任务:200 字「人机融合 vs 全自动」 3 种协作模式其一 · AI-DLC 四原则其一 · 你的立场

常见问题(FAQ)

1. F2P 和 P2P 有什么区别?

F2P(FAIL_TO_PASS):修对之前会失败、修对后必须通过的测试——证明"修好"。 P2P(PASS_TO_PASS):本来就要通过的测试,修完后仍必须通过——证明"没改坏别的"。 两者都通过才记为 FULL,%Resolved 就是 FULL 数 / 总题数。

2. 轨迹(trajectory)里那么长该从哪看起?

只看节奏——read_file → str_replace → bash test → fail → read_file → ... 的循环次数与间隔。不要逐条读每条 LLM 思考;那个量级(动辄上千条)超出入门负荷。 想看时间轴结构化版本,去 insights · replay 视角。

3. 为什么这道题 Agent 改的文件和我预想的不一样?

解法不唯一。bug 修复可以改根因(修源文件)也可以加补丁(加新文件 hook), 只要 F2P 全过 ∧ P2P 全过就算对。如果你对 Agent 的具体改动路径有疑问, 看 补丁对比 段,记录「改了哪些文件、几行」,不必纠结「为什么改这里」。

4. %Resolved 是 100% 才算"做对"吗?

本题 100% = 这道题 FULL = F2P 全过 ∧ P2P 全过,等于"做对"。 汇总 100% = 该 Agent 在该数据集上所有题都做对,极少见。 看到 %Resolved 数字时,先看分母——是单题还是多题汇总。

5. 学完 5 步接下来干什么?

你已经是讲义站首页「读者路径」中 「第一次来」派 的毕业生。 接下来按你的目标选路:想写 Agent → 走「动手派」(协议讲义 + Agent 心智); 想造 benchmark → 走「构造派」(从 PR 构造 Benchmark 题目); 想参与本仓 → 走「协作派」。详见讲义站首页「读者路径分流」表。

下一步去哪

恭喜:学完 5 步,你已经是讲义站「读者路径」中「第一次来」派的毕业生。 接下来按你的目标选路——讲义站首页「读者路径分流」表 7 派已铺好入口。