门户首页
人机融合式软件开发系列 · 4 / 6 · 实现

实现:最成熟但主观-客观有落差

实现是人机融合渗透最深的环节(988 篇综述里占 70%+),但也藏着主观-客观生产力落差的陷阱—— 开发者感觉变快、感觉质量更好,但客观 commit 指标没显著变。 本页讲清 3 层形态(补全 / 对话 / 自主 Agent)+ PDD 方法论 + 5 个数据点 + 3 个挑战。

生成时间:2026-09-02 20:56 · 生成 Agent:MiniMax Code (LLM: MiniMax-M3) · 载体:agentsoft-research-platform teaching-web-platform

概览

3
层形态
+55%
任务速度
+85%
质量信心
45%
AI 代码含缺陷

第一篇 · 3 层形态 + PDD

Part 1 · 2 卡:3 层形态 + PDD
实现阶段人机融合按 AI 自主程度分 3 层,按"方法化"程度分 2 派——3 层讲"什么形态",PDD 讲"怎么用好"。
第 4 讲 · 3 层 + 1 综述

3 层形态:从补全到自主 Agent(Code Agent 综述,arXiv:2508.00083)

系统检索 447 篇候选、筛选 100 篇核心(时间窗 2022–2025.06,覆盖 ICSE/ASE/FSE/ISSTA/TOSEM/TSE),3 层形态按 AI 自主程度递进:

3 层形态对比
层 形态 代表工具 人类角色 适用
1 补全式协助 GitHub Copilot 类 边想边审(行/函数级建议) 所有日常编码
2 对话式实现 Copilot Chat / Cursor / Claude Code 用自然语言描述任务 中等复杂度功能
3 自主智能体 Devin / multi-agent 框架 任务定义者 + 流程监督者 + 结果审查者 端到端开发(需多 Agent 分工)
3 层形态时序图
flowchart TB subgraph L1[第 1 层 · 补全式] A1[人写代码] --> A2[AI 建议下一行] --> A3[人接受/拒绝] end subgraph L2[第 2 层 · 对话式] B1[人描述任务] --> B2[AI 解释+生成] --> B3[人审查+修改] end subgraph L3[第 3 层 · 自主 Agent] C1[人定义任务] --> C2[AI 规划+多步执行] --> C3[人审查结果] end L1 -.升级.-> L2 L2 -.升级.-> L3
图 1 · 3 层形态的"AI 自主度"递增——人类角色从"代码作者"逐渐变成"任务定义者 + 审查者"
关键定位:3 层不是替代关系,是共存——一个成熟团队会同时用:补全式(写日常代码)+ 对话式(实现新功能)+ 自主 Agent(跑端到端任务)。但层 3 风险最大,需要最严的人类审查——这是 §6 维护和治理的伏笔。
下一卡:PDD + 5 数据点 ← 返回入口 基础:Code Agent 综述, arXiv:2508.00083, 2025
第 4 讲 · 1 方法 + 5 数据

Prompt-Driven Development(PDD)+ 5 个关键数据点

PDD(Development Curated 2025)作为结构化方法论兴起:人类以串行、有界、可验证的提示做架构监督,AI 做机械性实现。约 67% 周期用于"识别逻辑不一致并反馈运行时数据给 AI"的纠正回路。

5 个关键数据点(GitHub 2022/2024 + Stray 2026 + Veracode 2026)
# 数据点 数值 来源
1 任务完成速度 +55% GitHub 2022 受控实验(N=95 专业开发者)
2 企业 PR(Pull Request,GitHub 上的代码合并请求)数 + 周期 PR +10.6% / 周期 −3.5h Harness 2023 企业案例
3 质量信心 +85% 开发者更有信心 GitHub 2024 研究
4 心流保持 73% 保持心流 / 87% 在重复任务上省心力 GitHub 2022
5 AI 代码含已知缺陷 45% Veracode 报告(cloudnews.tech 2026)
图 2 · 5 个关键数据点可视化(%;数据点 4 拆为"心流保持 73%"与"重复任务省心力 87%"两个分项)。数据:本页 PDD 卡片"5 个关键数据点"表(GitHub 2022/2024、Harness 2023、Veracode 2026)
第 1 + 第 5 之间的张力:+55% 速度提升 vs 45% 含缺陷——同一拨代码。含义不是"AI 不能用",是"省时省心的代价是把质量门后移"——传统写完就自审的检查点被"快写完再统一审"取代,如果团队没有配套的自动验证,速度红利就成债务种子。这是为什么 §6 维护会出"质量稀释悖论"。
下一卡:3 挑战 回 §3 设计 基础:GitHub 2022/2024 + Stray 2026 + Veracode 2026

第二篇 · 3 个实现阶段挑战

Part 2 · 1 卡:主观-客观落差 / 幻觉 / 私有上下文
实现阶段的挑战不是"AI 不会写"——是 AI 写得太快、太自信,让人类的验证机制跟不上。
第 4 讲 · 3 挑战 + 1 警示

3 个实现阶段挑战

挑战 1 · 主观—客观落差(Stray 2026 实证)
  • 挪威公共部门 NAV IT,26,317 个非合并提交 / 703 仓库 / 两年期
  • Copilot 用户持续比非用户更活跃,主观生产力提升显著
  • 但客观 commit 指标变化在统计上不显著
  • 含义:传统 LoC / 任务数衡量在 AI 时代失准,需多维框架(SPACE 框架)
挑战 2 · 幻觉与安全漏洞
  • AI 生成代码可能含逻辑缺陷、性能隐患、安全漏洞,难以被单元测试覆盖(Code Agent 综述 2025)
  • 45% AI 生成样本含已知安全缺陷(Veracode 报告,cloudnews.tech 2026)
  • 幻觉 = 概率自信 ≠ 能力正确,AI 不报错不等于 AI 对
挑战 3 · 私有上下文鸿沟
  • 真实项目含庞大私有代码库、定制构建、内部 API 与未成文约定
  • Agent 高效理解并利用这些信息是从演示走向专业工具的关键挑战
  • 对照本仓:4 brand adapter + ollama runner 各自维护私有 tool 协议(参考本仓 REPORT-ollama-tool-call-substitute)
实现阶段的心法:AI 不替代代码作者,AI 替代打字时间 + 上下文切换 + 重复任务。角色从"代码作者"变成"架构师 + 策展人 + 审查者"——PDD 67% 周期花在"识别不一致 + 反馈运行时数据"就是这个角色转换的具体体现。
下一篇:测试 ← 返回入口 基础:Stray et al. arXiv:2509.20353, 2026 + Code Agent 综述 2025