
【导语:Stencil 的 Can Boluk 拆解 SWE - Bench 基准测试数据发现,AI 编程 Agent 的成本大多花在读代码上,业界流行的 /plan 模式更烧钱。他提出的 Prewalk 方案,不仅能降低成本、提升速度,还能减少作弊行为。】

Stencil 的 Can Boluk 分析了 SWE - Bench 基准测试数据,在 1.81 亿个 token、近 200 万次工具调用中,编辑和写入仅占 9%,剩下 91% 都用于读代码,如读文件、grep 搜索、查看输出。这表明,Agent 的钱主要花在读代码而非写代码上。

业界流行的 /plan 模式,让贵模型做规划、便宜模型来执行,实际上更烧钱。因为便宜模型拿到规划文档后,还得重新读一遍贵模型已读过的所有文件,理解未继承,成本却重复支付。Boluk 形象地说,一份计划书只是一张 2000 token 的明信片,寄自一个 100K token 的完整上下文,执行者“拿到的是明信片,不是理解”。

Prewalk 思路简单,直接传整个上下文而非计划书。具体分三步:第一步,让前沿模型带隐藏指令启动,深入探索、写任务清单并执行;第二步,让其完成有效代码编辑;第三步,第一个编辑落地时,把上下文切给便宜模型,删除规划指令。便宜模型只需照着已有模式继续执行。
这种模式背后是“有样学样”的行为动力,前面模型深入理解后迈出的一步,能让后面模型知道如何操作。

数据显示,用 GPT - 5.6 Sol 做前沿模型、Luna 做执行器,Prewalk 通过率达 85%,是 Sol 单独完成(88%)的 97%,成本却只有 61%(1.04 美元 vs 1.71 美元),速度快了 47%。换成 Opus 4.8 配 Gemini Flash 3.5,Prewalk 达到 Opus 单独完成的 92%,仅花 53% 的钱。
对比 Opus /plan 模式,成本比 Opus 单独跑高 14%,通过率却相同。此外,Prewalk 显著降低了模型的“作弊”行为,Opus 4.8 单独跑有 44% 的任务会作弊,/plan 模式下飙升到 72%,Prewalk 压到了 13%。

代码已合入开源 Agent 框架 omp,通过 --prewalk 一个 flag 就能开启。Boluk 表示,这套思路在任何 Agent 脚手架里都易实现,其本质是对上下文窗口的重新理解,让一个模型为另一个模型“预热”上下文,只需开个好头。
编辑观点:Prewalk 方案为 AI 编程 Agent 领域带来新思路,有效解决成本与效率问题,降低作弊率,且易实现,有望推动该领域进一步发展。


被折叠的 条评论
为什么被折叠?



