惊艳演示背后的工程现实
当各类“首位 AI 软件工程师”的宣传视频刷屏时,很多非技术人员以为几周内程序员就要全面下岗。
然而在工业级严苛基准 SWE-bench(基于真实 GitHub 开源项目的历史 Bug 修复集)上:
- 顶尖 Agent 的实际解决率从一年前的 13% 上升到了目前的 40%~55%;
- 这意味着:面对一个中等复杂的真实软件缺陷,AI 仍然有近一半的概率无法独立给出正确解。
读这个区间的数字时要注意两点:SWE-bench 是对"端到端独立完成真实缺陷修复"的上限估计,Agent 拿到的是完整仓库与真实 issue 文本,任何一步崩掉都算失败;同时解决率高度依赖包裹模型的任务脚手架(规划、检索、重试策略),同一模型换个框架分数可以明显浮动。因此它适合衡量"离无人值守还有多远",不适合直接当采购排名用。
真正阻碍 AI 成为独立工程师的 3 大鸿沟
- 长程目标遗忘:当一次重构需要修改 15 个以上相互依赖的文件时,AI 经常顾此失彼;
- 缺乏系统隐性知识(Tacit Knowledge):代码中未明文写入的业务历史妥协与政治逻辑,模型无从知晓;
- 定位不是取代,而是“副驾驶升级为机长助理”:人类从逐行敲代码的操作员,转变为定义边界与最终签批的系统架构师。
人机分工落地表
| 任务类型 | 当前可给的自主度 | 必须配的保护栏 |
|---|---|---|
| 单文件小修、样式调整 | 基本可放手,事后抽查 | 自动化测试通过即可合入 |
| 有清晰复现步骤的缺陷 | 可自主定位并起草修复 | 强制附回归测试,人工签批 |
| 跨多文件的中等重构 | 只做方案与试点,不做全量 | 分步计划校验、逐批审 diff |
| 涉及隐性业务规则的改动 | 仅辅助分析与提供选项 | 领域业务专家终审,不可绕过 |
鸿沟一(长程遗忘)与鸿沟二(隐性知识)决定了自主度的天花板恰好落在"多文件"与"业务历史"这两条线上。
验收 AI 产出的三道门
- 复现门:先让 AI 补出能稳定复现缺陷的失败测试,确认它修的是真问题而不是绕过了断言;
- 回归门:既有测试全量通过,且新增测试进入常备回归集,防止同类缺陷复发;
- 范围门:审查 diff 的波及面——改动文件数、公共接口变化、删除代码比例,超出声明意图的改动一律打回。
三道门全部可以自动化前置,人只看最后一眼结论与例外,这正是"机长助理"定位的工程含义。
常见问题速查
| 现象/疑问 | 原因/背景 | 处理/建议 |
|---|---|---|
| 演示里一次成功,实测常翻车 | 演示挑选了任务分布的容易尾部 | 用自身缺陷库统计真实通过率 |
| 同模型换框架分数差很多 | 解决率依赖脚手架而非仅模型 | 评测时固定并版本化脚手架 |
| AI 修复引入新缺陷 | 无回归门,diff 范围失控 | 复现/回归/范围三道门全开 |
| 团队不敢放手用 | 缺少责任与签批机制 | 按分工表逐级提高自主度 |
小结
对"AI 软件工程师"的可执行判断:先在自己仓库的历史缺陷中抽样跑一轮,得到你们业务分布下的独立解决率,再对照分工表决定各层任务的自主度。行业均值只是参照系,你自己的抽样率加三道门的拦截记录,才是放不放手的依据。