AI Agent 融合开发 · 学习平台
44 张讲义页面,按 7 个层次组织: 0 层 调研速查(人机融合全景 + 可信 AI Agent,7 张)· 0.1 层 独立深读(2 篇深读 + 4 篇论文精读)· 第 1 层 教学(按序读懂,25 张)· 第 2 层 总结(跨协议总览,1 张)· 第 3 层 详细参考(按需翻字段手册,3 张)· 第 4 层 工业案例(1 张 · 真实工业级案例讲解)· 第 5 层 专题(5 张 · 专题讲解 / 调研 / 讲座研读 / 工具链讲义)。 点击任一卡片直达;按角色分流请看下方"读者路径"。
全站目录(44 张 · 快速跳转)
| 层 | 分组 | 页面(点击直达) |
|---|---|---|
| 0 层 · 调研速查 跳到本层区块 ↓ |
人机融合式软件开发(6 张) | |
| 可信 AI Agent 开发(1 张) | ||
| 0.1 层 · 独立深读 跳到本层区块 ↓ |
深入阅读(2 张) | |
| 论文精读(4 张) | ||
| 第 1 层 · 教学 跳到本层区块 ↓ |
1.0 PR / GitHub 协作(3 张) | |
| 1.1 SWE-bench 领域(3 张) | ||
| 1.2 协议基础(3 张) | ||
| 1.3 协议精讲(1 张) | ||
| 1.4 Agent 实践(3 张) | ||
| 1.5 插件化架构(4 张) | ||
| 1.6 过程分析(5 张) | ||
| 1.7 训练闭环(3 张 · 单元收官) | ||
| 第 2 层 · 总结 跳到本层区块 ↓ |
跨协议总览(1 张) | |
| 第 3 层 · 详细参考 跳到本层区块 ↓ |
字段手册(3 张) | |
| 第 4 层 · 工业案例 跳到本层区块 ↓ |
真实工业级案例讲解(1 张) | |
| 第 5 层 · 专题 跳到本层区块 ↓ |
专题讲解 / 调研 / 讲座研读 / 工具链讲义(5 张) |
概览
MDE 高级讲义 · 张天《软件方法学》课程讲义
与按"层"组织的 44 张讲义并列的独立模块——专讲模型驱动工程(MDE)这条"提高抽象层次"的方法学主线。从 OMG 四标准(UML/MOF/XMI/CWM)与 MDA 框架的历史动因,到 MOF / Ecore / KM3 三大主流元-元模型的工程取舍,铺清"用模型构造软件"的整套方法论。
适合想理解"模型如何成为一等软件制品"的读者;实验部分将在未来单独扩展(基于 Ecore / KM3 构造领域 DSL 元模型的 IDE 实战)。当前收录 3 篇长讲义 + 实战专题 5 讲:① 导论 ② 元建模和建模 ③ 前沿拓展(SysML v2/LLM×MDE/语言工程新栈);第四模块实战专题(2026-10 新增)用本仓两套轨迹元模型(19-EClass / 13-EClass)与 18 源真实轨迹,把理论跑成活案例。
| 角色 | 目标 | 推荐路径 |
|---|---|---|
| 第一次来 | 系统了解本仓在做什么 | 第 1 层按序读:1.0 PR/GitHub → 1.1 SWE-bench → 1.2-1.3 协议 → 1.4 Agent 实践,再扫第 2/3 层 |
| 调研派 | 看"LLM + 软件工程"研究全景 | 0 层 7 张(人机融合全生命周期 6 张 + 可信 AI Agent 1 张)+ 0.1 层 2 张深读(Agent 测试价值悖论 / 八位先驱立场光谱)+ 4 篇论文精读(SWE-bench / SWE-agent / MegaFlow / SWE-Universe),再进教学层 |
| 动手派 | 直接写一个 Agent | 「SWE-bench 评测流程」+「协议讲义」+「Agent 心智」3 张——够写最小 harness 并理解评测链路 |
| 查询派 | 确认某个字段是什么意思 | 直接跳第 3 层——3 个协议各一页字段手册,按字母序查;跨协议对字段先看第 2 层翻译词典 |
| 协作派 | 本仓项目成员入职 | 1.0 三张(理解题源)+ 1.1 三张(理解评测对象)+「Agent 心智」(S1-S7 ↔ harness loop)+「工程决策案例」(ollama 三 runner 设计逻辑) |
| 构造派 | 自己造一道 benchmark 题 | 「从 PR 构造 Benchmark 题目」——5 步流程 + 7 个常见坑 + 10 项审查清单 |
| 避坑派 | 跨厂商协议兼容 | 「工程决策案例」§1 L1/L2/L3 三层叠加 + §2 三类失败模式——读完知道"为什么 ollama 不传 tools 字段"不是偷懒 |
| 本科生派 | 一次实验课入门,产出实验报告 | 5+1 步线路图(每步 5–15 分钟,总计约 1 小时,仅用 3 张讲义)——看一道题→看一次解题→学判分规则→理解 Agent 心智→范式串联→课堂收口 |
| 层 | 定位 | 包含 | 阅读模式 |
|---|---|---|---|
| 0 层 | 调研速查(研究性) | 人机融合式软件开发 6 张(范式 → 需求 → 设计 → 实现 → 测试 → 维护)+ 可信 AI Agent 开发 1 张(风险 / 评测 / 纵深防御)= 7 张 | 选读——想理解"LLM + 软件工程全生命周期"研究全景时读,不强制 |
| 0.1 层 | 独立深读(Featured) | Agent 测试价值悖论 + 计算机先驱对 AI 生成代码的立场(深读 ×2)+ SWE-bench / SWE-agent / MegaFlow / SWE-Universe 论文精读 ×4 = 6 张 | 读完 0 层对应章节后的再深化,独立成篇 |
| 第 1 层 | 教学(按序读懂) | PR/GitHub 3 + SWE-bench 领域 3 + 协议基础 3 + 协议精讲 1 + Agent 实践 3 + 插件化架构 4 + 过程分析 5 + 训练闭环 3 = 25 张 | 从头读到尾,建立完整心智模型(先懂"协作基础"→"被评估的对象"→"评估用的工具"→"动手做 Agent"→"分析 Agent 的过程") |
| 第 2 层 | 总结(跨协议总览) | 三协议 Schema 全景总结 = 1 张 | 读完教学后做横向对比(Chat ↔ Responses ↔ Messages) |
| 第 3 层 | 详细参考(按需翻) | 3 个协议各 1 张完整字段手册 = 3 张 | 开发时查字段,按字母序检索 |
| 第 4 层 | 工业案例(真实工业级) | SWE-agent 执行引擎源码级拆解(NeurIPS 2024 论文 + v1.1.0 代码)= 1 张 | 概念与规格读完后看真实实现,抽象机制逐行指认到一线代码 |
| 第 5 层 | 专题(讲解 / 调研 / 讲座研读 / 工具链讲义) | 最小 Agent Loop 专题(总 → 分 → 例 → 实)+ SWE-agent → mini-swe-agent 架构演进调研 + UML 架构建模 + 驾驭 AI 的软件工程(讲座研读)+ Agent 轨迹建模(工具链讲义+交互演示) = 5 张 | 按「做」组织——跟着完整路径把概念变成能跑的代码;或以对照实验读透架构演进规律 |
| 缩写 | 全称 | 一句话解释 |
|---|---|---|
| AI | Artificial Intelligence,人工智能 | 本站语境多指用大模型自动完成软件工程任务 |
| Agent | 智能体 | 能自主多步调用工具/模型完成任务的程序(= harness 循环代码 + LLM) |
| LLM | Large Language Model,大语言模型 | 通过 HTTP API 以 JSON 收发消息的大模型服务 |
| API | Application Programming Interface,应用程序接口 | 程序之间约定的调用方式 |
| JSON | JavaScript Object Notation | 人类可读的文本数据格式,LLM 协议的事实标准 |
| SWE-bench | SWE(Software Engineering 软件工程)+ bench(benchmark 基准测试) | 用真实 GitHub issue 评测代码 agent 的软件工程基准 |
| PR | Pull Request,拉取请求 | GitHub 上"请你合并我的代码"的请求,SWE-bench 的题源 |
| F2P / P2P | Fail-to-Pass / Pass-to-Pass | 评测契约:修好 bug 的测试 / 不被破坏的回归测试 |
| APR | Automated Program Repair,自动程序修复 | 用程序/模型自动定位并修复代码缺陷 |
| AI-DLC | AI-Driven Development Lifecycle,AI 驱动的开发生命周期 | IBM 2025 提出的"以 AI 为核心参与者"重设计 SDLC 的方法论 |
| SDLC | Software Development Lifecycle,软件开发生命周期 | 需求→设计→实现→测试→部署的全流程 |
| SSE | Server-Sent Events,服务器单向推送 | LLM 流式输出(打字机效果)的传输方式 |
| Schema | 模式定义 | 约定请求/响应里有哪些字段、什么类型、什么语义 |
0 层 · 调研速查(7 张 · 人机融合 + 可信 AI Agent)
范式迁移 + AI-DLC + 3 种协作模式
软件工程正从"自动化"迈向"智能化 + 人机共生"——AI 是贯穿全生命周期的协作主体。讲透范式本质(不是"AI 替代人",是"AI 执行 + 人治理")、AI-DLC 4 大原则、3 种可切换协作模式(Driver-Navigator / Review-First / Specialist)。
需求工程:AI 加速但受限于可解释性
需求工程是人机融合起步最慢的阶段——4 类高频用例已成熟,但研究占比 <10%,且可解释性即采用壁垒(受监管行业仅 16.1% 组织把 AI 推进到试点之外)。
分析与设计:方法化引导保质量
设计阶段 AI 的"自由度"最大也最危险——答案不是"限制 AI",是给它方法:ADD(Attribute-Driven Design)引导的 LLM 架构设计,把方法变成 prompt 的一部分。心法:"stay the architect, let LLM be the labor"。
实现:最成熟但主观-客观有落差
实现是人机融合渗透最深的环节(综述占 70%+),但藏着主观-客观生产力落差——开发者感觉变快,客观 commit 指标没显著变。3 层形态(补全 / 对话 / 自主 Agent)+ PDD(Prompt-Driven Development,提示驱动开发)方法论 + 5 个数据点。
测试:Test Pyramid 2.0 + Agent 测试价值悖论
测试是人机融合商业最活跃的领域——3 波演进、覆盖 59.6% vs 38.2%、9× 提速;但 2026 年新论文揭示Agent 测试价值悖论:对自主修 bug 的 Agent,改变测试量对任务解决率无统计显著影响。
维护 + 治理:APR + 新债型 + 责任框架
维护消耗 50-70% 工程资源,收益最大 + 风险也最大:AIR 仓库级自主修复 87.1%,但 3 种新型技术债(GIST / LLM-SATD / PromptDebt)+ 质量稀释悖论 + 信任缺口并存;4 条治理原则 + 3 条责任规则收尾。
0.1 层 · 独立深读(6 张 · 2 篇深读 + 4 篇论文精读)
Agent 测试价值悖论:写测试不解决 bug
SWE-bench Verified 上 6 个 SOTA LLM 的 Agent 轨迹分析,3 个反直觉事实:已解决 vs 未解决任务写测试频率相近、Agent 偏好 print 而非断言、测试量对解决率无统计显著影响——从"质量门"到"反馈通道"的范式转移,附 4 条实操 + 3 个开放问题。
计算机先驱如何看待 AI 生成代码:立场光谱与教学解析
从 C++ 之父到 Redis 之父,八位先驱对 AI 代码的立场构成一条"严守核心系统 ↔ 拥抱效率"光谱;所有言论对照原始访谈 / 论文 / 博客逐条核查(核实属实 ×2 · 部分属实 ×5 · 未获证实 ×1)——"核查大佬语录"本身就是第一课。附理解债务理论 + 4 道课堂讨论题。
SWE-bench:2,294 个真实 GitHub Issue 定义的评测合约
从约 90,000 个 PR 三阶段过滤出 2,294 个任务实例;判分不读补丁、只跑测试——F2P 全过 ∧ P2P 全过。2023 年底最好模型(Claude 2)仅解 1.96%;本站评分模块 answer_evaluator 与数据仓库的源头。
SWE-agent:给模型而非人设计的计算机接口(ACI)
同一个 GPT-4 Turbo:裸 shell 11.00% vs 专门接口 18.00%(Lite);全量 12.47% 刷新最好成绩。消融表证明限制信息量反而更好:全文件视图 ↓5.3、仿 IDE 翻页搜索比没有搜索还差。讲义「SWE-agent 执行引擎」的论文侧。
MegaFlow:大规模分布式 Agent 训练编排系统
Model / Agent / Environment 三服务解耦 + 阿里云 ECS 编排——32% 成本降低 · 10K 并发 · 2M+ rollout execution · 1024 并行 envs;作为 SWE-Universe 的底层基础设施,为下游 80 万环境构建 + 50 万轨迹生成铺路。
SWE-Universe:百万级真实可验证 SWE 环境
Building agent(mini-sweagent + Qwen-Next-80A3)+ iterative self-verification + in-loop hacking 检测——从 33.3M GitHub PR 构造 807,693 多语言实例,跑出 50 万轨迹 / 30B tokens,让 Qwen3-Max-Thinking 在 SWE-Bench Verified 达到 75.3%。
第 1 层 · 教学(25 张 · 按序读懂:协作基础 → 被评估对象 → 评估工具 → 动手实践 → 形式化 → 过程分析 → 训练闭环)
Git vs GitHub:理解两者的根本区别
Git 是版本控制工具(管本地历史),GitHub 是其上的托管协作服务(PR / Issue / Review / Actions)——7 个核心差异 + 3 个类比,理解 PR 与 SWE-bench 题源的前提。
GitHub Pull Request:设计与使用
GitHub 的核心协作机制——7 个组件 + 5 步生命周期 + 3 种合并方式 + 6 条最佳实践。PR 是 SWE-bench 题目的"题源",每条题目都来自一个真实 PR。
从 PR 构造 Benchmark 题目:SWE-bench 题目构造工程
怎么把一个真实 GitHub PR 转成 SWE-bench 题目——5 步构造流程 + 7 个常见坑 + 真实例子 django__django-10914 walk-through + 10 项题目审查清单,读完你就能自己构造一道题。
SWE-bench 入门:背景、特点与任务定义
Princeton 提出的、用真实 GitHub issue 评测代码 LLM 的 benchmark——本仓评估系统的地基。任务定义、F2P/P2P 双向验证、6 个变体(Lite / Verified / Pro 等)与 HumanEval 类 benchmark 的关键差异。
SWE-bench 数据长什么样:Schema 详解与实例
jsonl 每行一条 instance——9 个核心字段逐个讲清,配真实实例 django__django-10914,最后讲本仓零依赖加载器(load / get / filter_by_repo)怎么用,读完就能自己加载、过滤、统计数据。
SWE-bench 怎么用:评测流程与本仓 S1-S7
5 步评测流程(拉 base → pre-fix → apply patch → post-fix → 判分)+ 3 层 Docker 镜像机制 + 本仓 S1-S7 流水线怎么把评测契约工程化——读完就能自己跑一遍评测。
LLM 交互协议基础:协议是什么
大模型的"对话协议"到底是什么——客户端与 LLM 推理服务之间预先约定的一套消息结构。建立底层定义后,再看一次完整推理回合要装下的 5 件事与两层拆解(消息结构 vs 传输)。
LLM 协议 5 件事专章:1 卡 1 件事
把 5 件事(请求骨架 / 工具调用 / 流式 / 状态 / 终止)各展开成独立卡片——每张配 JSON 示例 + 关键陷阱。可以从任何一张切入读,不依赖顺序。
消息结构层:JSON 为什么是事实标准、变体差异、何时该用 Protobuf
JSON 不是一种格式,是一族格式(标准 / JSONL / JSON5 / JSON Schema / Stringified JSON)——摸清边界,再回答"什么时候该离开 JSON"(答案是 Protobuf,但 LLM 公开 API 永远不用)。
大模型对话协议讲义:手写 Agent 的第一课
手写 Agent 的第一道坎不是循环,而是协议——消息长什么样、tool_calls 怎么接、流式怎么拼。以 Chat Completions 为主线,最后落到一份手写 Agent 协议 Checklist(10 条)。
理解 Agent 开发过程:harness + LLM 的任务循环
所谓 Agent,就是一段循环代码(harness)+ 一个外部大模型(LLM)协同工作的产物——从 30 秒 LLM API 入门到本仓 S1-S7 真实例子,把"AI 做事"黑盒拆开,附 30 行可运行 harness。
Agent 程序的最小结构:六个部分
以 OpenAI 兼容格式为唯一主线的最小 Agent 结构规格——工具清单 / 系统提示词 / 对话历史 / 模型调用器 / 响应解析与调度 / 主循环六部分逐一拆解,每部分对应到具体 API 字段,附逐行修正标注的主循环伪代码(json.loads 参数解析、空列表判定、错误回传)与六部分 ↔ harness 六组件映射表。
OLLAMA 本地模型不支持 tool_call 的根因与等效替代方案
本仓 ollama 三个 runner 均不传 tools 字段——不是偷懒,而是 L1 协议层 + L2 兼容层 + L3 模型能力层三层叠加 + 任务形态分析后的工程结论。含 4 类失败模式实测与 4 场景选型决策树。
基于插件的 Agent 架构:为什么 + 是什么
Agent 是运行时进程,"插件化"说的是这个进程的组装方式:每个能力都是独立可插拔单元,运行时可演化,依赖透明。本系列 4 张从形式化论文出发拆解这套骨架的设计哲学。
Temporal Composability:组件可进可出(Revertible Effects)
时间维度 = 组件卸载时能否完全撤销它的所有副作用——Revertible Effects:每个 effect 配对一个显式 inverse,runtime 自动按 LIFO 顺序撤销。
Spatial Composability:依赖可声明可反应(Reactive Coeffects)
空间维度 = 组件间依赖能不能显式声明 + 反应式协调——Reactive Coeffects:依赖变化时自动通知,3 种反应(activate / deactivate / neutral),以 uid(不是 value)判定变化。
Context Paradigm + Cordis 落地 + Agent 架构连接
把 temporal 和 spatial 合起来——Context Paradigm:effect 与 coeffect 统一成一个 context type。落地看 Cordis 5 个核心 API、Koishi 4000+ 插件案例,最后连回本仓 4 brand adapter 架构。
如何阅读与分析 AI Agent 的执行轨迹
进入四讲之前的"怎么读"方法页:3 种轨迹载体选读指南(trajectory_events 表 / sidecar JSONL / ecore 元模型视图,按需各取)+ 三遍阅读法(概览 5 分钟 → 定位 10 分钟 → 深读 15 分钟,把读轨迹从 O(N) 扫读降为 O(1) 定位)+ 30 分钟实训(T1 五问初读 / T2 两遍对比 / T3 写一页纸分析)——不重复四讲内容,只负责把你领进门。
读一条 Agent 轨迹:八阶段解题过程模型
对 5 个真实任务约 1700 行推理日志做行为序列抽取,提炼出 S0 元决策 → S7 交付的八阶段结构:每个阶段由谁控制(Prompt 骨架 vs Agent 自主)、两个迭代循环(S3 环境修复 / S6→S4 验证回退)、弯路恢复四元组——读轨迹的地图。
过程可靠性评估(PRA):给 AI 的工作过程打分
harness 只答"结果对不对";PRA 答"即使这次对了,方法论值得信任吗"——100 分五维(复现先行 10 分 / 验证真实性 25 分 / 约束遵守 20 分…)+ V1-V4 一票否决 + 过程×结果二维矩阵。附 astroid-1196 示范评分 98/A 与工具版七维。
问题 step 分类学:无用 · 冗余 · 低效 · 错误
两篇论文 7 个标签收敛成用户视角四分类;LLM 判冗余的步级 F1 只有 24.88%——所以启发式优先 + LLM 兜底 + 双写审计。配真实消融案例:同一条 144 步轨迹 5 种判定,冗余率从 0.7% 到 42.4%。
点 + 线:过程评估方法论与 Trajectory Linting
五层评估栈(任务级 / 点级 / 流程级 / 线级 / 形式层)+ LoopsBench 的 25.00% 线级天花板与 loop 3 倍差 + Trajectory Linting 8 条机械规则——在真实 45 步轨迹上抓出 75% 形式问题,毫秒级、零 LLM。
编程能力是怎么训出来的:从预训练到过程强化
五阶段链路(预训练 → mid-training → SFT → RL → 蒸馏)逐段标注数据、奖励与能力产出;Nebius 三段数字(11.4 → 20.5 → 39.0)与 SWE-smith 轨迹 scaling 曲线做实证;并用 pass@k 与 Spurious Rewards 两条证据链修正「RL 创造能力」的流行误解——RL 是分布收敛,不是能力注入;轨迹是资产。
工具使用能力:训练与注入的双重来源
「模型怎么知道有哪些工具」的机制层答案:tools 字段 → 服务端 special system prompt(工具定义注入在用户 system prompt 之前①);训练学「填表」、注入给「菜单」的归因表;defer_loading 的反直觉真相(控制进不进上下文,不控制发不发送);30–50 个工具后选择准确率下降——最后落到本仓轨迹记录的三处缺口。
过程监督:让轨迹分析反哺训练
信用分配难题与三副药;奖励密度谱四档(ORM → 执行反馈 → PRM → 人工标注)与「判据来自环境天然抗黑客」;first-error 标注的自动推断路径;reward hacking 阴影下过程可信的价值——收官图把全站 44 张在「评测 → 分析 → 构造 → 训练」闭环上各归其位,并给出本平台三个可执行落点(pass@k 一致性 / reward-hacking detector / 六模块信号 → PRM 燃料)。
第 2 层 · 总结(1 张 · 跨协议总览)
三大 LLM 对话协议 Schema 详解
三套协议的完整 Schema 定义、字段语义与往返示例,并附三协议"翻译词典"——既是教学的总结(讲完 3 协议后横向回看),又是参考的入口(查字段先看摘要,再跳第 3 层详细版)。
第 3 层 · 详细参考(3 张 · 字段手册)
OpenAI Chat Completions API · Schema 完整参考
POST /v1/chat/completions 的完整字段参考——~25 个请求字段、5 种 message role、finish_reason 5 个值、流式 6 条规则,末章按字母序速查。
OpenAI Responses API · Schema 完整参考
POST /v1/responses 的完整字段参考——OpenAI 新一代协议(GPT-5 起新模型只在它上提供),三大差异:判别联合 item、服务端状态、推理链加密续接。
第 4 层 · 工业案例(1 张 · 真实工业级案例讲解)
SWE-agent 执行引擎拆解:一次任务如何走完 N 轮对话
以 Princeton SWE-agent(NeurIPS 2024 论文 + v1.1.0 源码)为标本的源码级拆解——一个 while 循环撑起的主循环、每轮"恰好一次模型调用 + 恰好一个动作"的四拍结构、history 三模板与 10 万字符观测截断、submit 哨兵终止(15 行 bash)与 12 种 exit_status 护栏,附 ACI 消融实验与 15 行最小伪代码重建。
第 5 层 · 专题(5 张 · 专题讲解 / 调研 / 讲座研读 / 工具链讲义)
最小化 Agent Loop:亲手造一个简化版 Code Agent
像 Claude Code 的产品拆开是一个朴素的循环——本专题按总 → 分 → 例 → 实四篇展开:一张总框图讲清六步骤概念体系,六卡逐个展开(干什么 / 为什么 / 没有它会怎样),一个改端口任务的三轮消息实录,最后是不足 90 行、只有读/写两个工具的最简完整实现——例与实用同一任务互为镜像,附与 Claude Code、mini-swe-agent 的三列对照。
从 SWE-agent 到 mini-swe-agent:以大模型能力跃迁为棱镜的架构演进调研
同一团队相隔 14 个月的对照实验:2024 年 NeurIPS 论文用数千行 ACI 工具集证明"接口设计至关重要"(GPT-4 Turbo 11.00% → 18.00%),2025 年又用约 100 行 bash-only 的 mini-swe-agent 证明"大部分接口设计已不重要"(Claude Sonnet 4 约 65%)。本专题把这条演进线讲透——完整 9 行消融表、四维度复杂度迁移、机制归因、性能-成本-复杂度三角,并用 2026 年最新证据(mini v2、官方 Bash Only 子榜、Live-SWE-agent 登顶、Verified 退役与 Pro 审计反转)修正并延伸核心命题:架构复杂度是模型能力缺口的函数。
用 UML 拆解两个 Agent 的骨架:mini-swe-agent 与 SWE-agent 的架构建模
把 mini-swe-agent 与 SWE-agent 的源码反向拆成七张 UML 图——包图 / 类图 / 顺序图 / 状态机图 / 组件图 / 泳道活动图 / Hook 织入时序图,看清同样是「Agent 主循环」,在两个项目里为何会长成完全不同的样子;最后用两张行为图直击「结构相似、行为差异」的本质。全程证据可溯(evidence.csv 逐图锚点),配套 UML 建模指令书 skill 可复用于任意 code agent。
驾驭 AI 的软件工程:可信性判断、双重驾驭与智能化工程师培养
完整研读南京大学李宣东教授 2026 年 9 月的同名讲座——核心公式 (AI 预测 + 可信性判断)× 迭代 = 决策、八字诀「先解后证、解证分离、解证迭代」、七维框架与本科三阶段培养路径;全部 10 项外部数据经独立信源溯源(判断等级逐条标注,效率悖论、信任缺口、2026 年安全事件),并以「难解易证 / 难解难证」判据把「AI 会不会取代程序员」转化为可判定的结构问题;最后落到本平台的工程承接:可信性判断 = F2P/P2P 结果验证 + PRA 过程评估 + 关键节点人工确认。
Agent 轨迹建模:把任意轨迹变成统一模型
19 种 Code Agent 各有各的落盘格式——做轨迹研究的第一步是认出它是谁,再把它回译成统一的元模型实例并诚实判档。本专题把「认源 → 回译 → 合模 → 四态判档」这条完整工具链拆开讲透:多信号打分为什么宁可拒答不可错认、判档怎么不说谎、隐私怎么长成架构而不是补丁;页内附可直接点的三态演示(数据来自真实作业、零后端零网络请求),并给出本机一键复现入口(bash scripts/start_tmr.sh start)。