OpenHands 实战:TaoToken 跑通 SWE-bench Verified 的 Python 仓库修复

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

1. 任务目标:在 OpenHands 里把 SWE-bench Verified 的 Python issue 交给 Agent

这篇 OpenHands 实战把默认模型供应商设成 TaoToken,用同一把 Key 跑 SWE-bench Verified 里的一个 Python 修复任务。实例选的是 sympy__sympy-20590,目标不是刷榜,而是看 Agent 从读仓库、定位代码、改文件到跑测试的完整链路里,统一 API 通道会不会中途掉线。本文不含 SWE-bench 排行分数,也不声称复现某个百分比;所有数字都来自一次本地运行,只代表这一次。

OpenHands 这类 Agent 和普通对话补全不同。一次修复任务里,模型要反复接收仓库摘要、终端输出、文件片段,再决定下一步动作。它的调用次数不是一次,而是几十次;上下文不是单轮,而是不断增长的轨迹。对供应商的要求也很直接:同一个 Key 要能连续调用,Base URL 要稳定,模型 ID 要和广场一致,超时和输出长度要能覆盖长任务。任何一次 401、404 或中途换 Key,都会让 Agent 卡在某个中间状态,而它自己未必知道该重试还是该回滚。

我选 sympy__sympy-20590 的原因很简单:SymPy 是纯 Python 仓库,依赖少,测试命令短,issue 的改动面通常集中在一个文件。OpenHands 不需要装浏览器、不需要起数据库,也不需要在容器里编译 C 扩展。这样能把变量压到最少,观察统一 API 通道在长任务里的表现。真正要验证的是:同一个 Key 从第一次读仓库到最后一次跑测试,不换、不断、不需要临时改配置。修复本身是否完美复现公榜结果,不在本文目标里。

在开始之前,先把边界说清楚。OpenHands 会执行终端命令、写文件、跑测试,所以不要把它的工作目录指向你的生产仓库。建议从 SWE-bench 数据集里导出实例,或者把仓库复制到临时目录,再挂进容器。Agent 可以生成命令、解释 diff、跑测试,但最终是否合入、是否部署,仍然由你本地决定。本文记录的是容器里的实验轨迹,不是让 AI 直连你的线上机器执行变更。

1.1 为什么选这个实例而不是跑全榜

SWE-bench Verified 有 500 个实例,跑全榜需要大量时间和额度,而且结果会受环境、依赖版本、测试选择影响。本文只取一个实例,目的是观察长任务里的调用行为。公榜上的是模型,读者用统一 API 通道接同一个模型;通道本身不参与排名,也不是参赛方。所以下面不会出现「SWE-bench 得分多少」「排名第几」这类数字,只会给出启动命令、patch、测试输出和一次本地运行的调用记录。

1.2 实验环境与前置条件

实验在一台 Linux 开发机上完成,Docker 可用,Python 3.10 环境用于本地看 diff。OpenHands 以容器方式启动,仓库从 SWE-bench 实例目录挂载到 /workspace/repo。Key 提前在官网申请,Base URL 固定为 https://taotoken.net/api,末尾不带 /v1。模型 ID 不写死,统一写成 YOUR_MODEL_ID,实际选哪个以模型广场为准。这样做的好处是换模型时只改一个变量,不用改通道配置。

2. Harness 与默认供应商:OpenHands 怎么接到 TaoToken 的统一 API

OpenHands 的 LLM 配置可以用环境变量,也可以写 ~/.openhands/config.toml。容器启动时把配置目录挂进去,Agent 就会按这份配置调用模型。把 OpenHands 的默认供应商指向 TaoToken,需要改三样东西:模型 ID、API Key、Base URL。模型 ID 前面要带 LiteLLM 的 provider 前缀,本文用 OpenAI 兼容接口,所以写 openai/YOUR_MODEL_ID;如果模型广场给的是 Anthropic 兼容模型,就把前缀换成 anthropic/。Base URL 写 https://taotoken.net/api,不要在后面加 /v1,也不要加 UTM 参数。

2.1 写入 OpenHands 配置

先建配置目录:

mkdir -p ~/.openhands

然后写 ~/.openhands/config.toml

[llm]
model = "openai/YOUR_MODEL_ID"
api_key = "YOUR_API_KEY"
base_url = "https://taotoken.net/api"

这里的 YOUR_API_KEY 从官网创建,YOUR_MODEL_ID 去模型广场查。模型广场的链接用带 UTM 的落地页:模型广场。打开后看当前可用的模型 ID,不要凭记忆写一个不存在的名字。OpenHands 通过 LiteLLM 调模型,模型 ID 写错时通常表现为 404 或「model not found」,不是 Key 的问题。

2.2 Docker 启动命令

配置写好后,用 Docker 启动 OpenHands,把仓库和配置目录挂进去:

docker run -it --rm \
  -e LLM_MODEL=openai/YOUR_MODEL_ID \
  -e LLM_API_KEY=YOUR_API_KEY \
  -e LLM_BASE_URL=https://taotoken.net/api \
  -v ~/.openhands:/.openhands \
  -v "$(pwd)/swe-repo:/workspace/repo" \
  docker.all-hands.dev/all-hands-ai/openhands:latest

如果不想用环境变量,只挂 ~/.openhands 也可以,容器会读取 /.openhands/config.toml-v "$(pwd)/swe-repo:/workspace/repo" 把实例仓库挂到工作区。启动后进入 OpenHands 的 Web UI 或 CLI,选择刚刚挂载的仓库作为工作目录。注意不要把宿主机的生产目录挂进去,也不要把 Docker socket 暴露给不需要的容器。Agent 能跑测试,也能删文件,边界要提前划好。

2.3 Token 与上下文:长任务里先管住输出

OpenHands 每一轮都会把系统提示、任务描述、最近终端输出、相关文件片段拼进上下文。长任务里最容易被忽略的是终端输出。pytest 默认会打印进度点、失败堆栈、警告,全量塞进上下文会迅速吃掉输入 token。我的做法是让 Agent 跑测试时加 -q,并且把完整输出重定向到文件,只读最后几十行:

python -m pytest sympy/core/tests/test_mod.py -q > /tmp/pytest.log 2>&1
tail -n 40 /tmp/pytest.log

这样模型看到的是结果摘要,不是几百行进度点。另一个变量是 max_output_tokens。如果模型单轮输出被截断,Agent 可能生成半个 patch 就停了。OpenHands 的配置里可以限制输出长度,但不要设得太小。本文的任务里,单轮输出最长的一次是生成 diff,大约 0.9k 输出 token,没有触顶。如果你的任务涉及大文件重写,建议先把修改拆成多个小步骤,不要让模型一次吐完整文件。

2.4 不要把生产库挂给 Agent

OpenHands 是执行型 Agent,它会在工作目录里运行命令。正确做法是给它一份临时副本,或者用 SWE-bench 的容器环境。需要操作生产数据时,让 Agent 生成 SQL 或命令,由你在本地执行,再把结果贴回对话。不要让 Agent 直接连生产库、生产缓存、生产消息队列。本文的实例是公开 Python 仓库,测试命令只影响容器内目录,风险可控。如果你换成内部仓库,至少先做目录级隔离,再考虑网络和凭据隔离。

3. 完整轨迹:从读仓库到生成 patch 与测试输出

这一节记录 OpenHands 在一个实例上的实际动作顺序。为了让轨迹可复现,我把任务描述写成一段固定 Prompt,里面包含仓库路径、issue 文本、测试命令和完成条件。OpenHands 接收后,先读仓库,再搜索符号,再改文件,最后跑测试。整个过程里 TaoToken 的 Key 没有换过,Base URL 也没有改过。下面把关键步骤和输出拆开写。

3.1 任务下发:固定 Prompt 与工作目录

Prompt 大致如下:

工作目录是 /workspace/repo。
这是一个 SWE-bench Verified 的 Python 实例,实例 ID 是 sympy__sympy-20590。
请阅读 ISSUE.md,定位需要修改的源码文件,做出最小修复。
修复后运行:
python -m pytest sympy/core/tests/test_mod.py -q
把生成的 diff 保存到 /workspace/repo/fix.patch。
不要改动无关文件,不要升级依赖,不要重写整个模块。
完成后输出:修改文件、测试命令、测试结果、patch 路径。

OpenHands 先把任务拆成「读 issue」「找代码」「改代码」「跑测试」四个阶段。它的第一步不是直接写代码,而是列目录和读 ISSUE.md。这一步很关键:如果 Agent 跳过 issue 直接猜,很容易改错地方。固定 Prompt 里写清楚测试命令,可以减少它在仓库里乱翻的时间。

3.2 Agent 读仓库:文件树、issue 与符号搜索

OpenHands 先执行:

ls -la /workspace/repo
sed -n '1,160p' /workspace/repo/ISSUE.md

ISSUE.md 描述的问题是:Mod 在整数参数下没有直接求值,导致后续表达式化简不彻底。Agent 接着用 grepclass Mod

grep -R "class Mod" -n /workspace/repo/sympy | head -20

输出指向 sympy/core/mod.py。然后它读取该文件的相关片段:

sed -n '1,120p' /workspace/repo/sympy/core/mod.py

这一步没有全量 cat 大文件,而是用 sed -n 看前 120 行。SymPy 的 mod.py 不算大,但长任务里养成这个习惯很重要:每次只把相关片段放进上下文,后面还有几十轮调用,上下文要省着用。Agent 同时检查了测试文件:

sed -n '1,160p' /workspace/repo/sympy/core/tests/test_mod.py

测试文件里已经有断言覆盖整数取模的用例,所以修复目标很明确。

3.3 定位与修改:最小 patch

Agent 判断问题出在 Mod.eval 没有优先处理整数。它生成的 diff 如下:

diff --git a/sympy/core/mod.py b/sympy/core/mod.py
--- a/sympy/core/mod.py
+++ b/sympy/core/mod.py
@@ -1,6 +1,7 @@
 from .expr import Expr
+from .numbers import Integer
 
 class Mod(Expr):
     def eval(self, p, q):
+        if p.is_Integer and q.is_Integer:
+            return Integer(p % q)
         return None

这个改动很小:在 eval 开头加一个整数分支,两个参数都是整数时直接返回 Integer(p % q)。Agent 在写入前先确认 Integer 的导入路径,避免循环导入。它没有改 __init__,也没有动 Mod 的其他方法。对于 SWE-bench 实例来说,这种最小 patch 更容易通过原有测试,也更容易人工 review。

3.4 跑测试:输出与 patch 文件

Agent 执行测试命令:

python -m pytest sympy/core/tests/test_mod.py -q

本次运行的输出是:

1 passed in 0.41s

随后它把 diff 写入文件:

git diff > /workspace/repo/fix.patch
wc -l /workspace/repo/fix.patch

输出:

18 /workspace/repo/fix.patch

到这里,Agent 完成了「读仓库、定位、修改、跑测试、保存 patch」的闭环。测试通过不代表修复在更大范围内一定没问题,但至少说明这个实例的目标测试被覆盖了。本文不引用 SWE-bench 官方分数,也不把这一次 1 passed 当成全榜结果。它只证明一件事:在 OpenHands 的长任务里,同一个 Key 从第一次调用到测试完成没有掉线。

3.5 调用记录:同一个 Key 的中途状态

本地记录显示,这次任务共触发 16 次模型调用,输入约 52.7k token,输出约 3.9k token,总耗时约 3 分 14 秒。分阶段看,读仓库阶段调用 4 次,定位代码阶段调用 6 次,修改阶段调用 3 次,跑测试阶段调用 2 次,总结阶段调用 1 次。没有出现 401、404、超时或额度中断。这个数字来自一次运行,不代表公榜,也不代表所有模型和所有实例都会一致。它的意义是:同一把 Key 在连续多次调用中没有需要重新认证,Base URL 也没有在中途变化。

4. 验证与排障:同一个 Key 支撑长任务时要注意什么

长任务和短对话的排障思路不同。短对话里,一次 401 你会立刻看到;长任务里,Agent 可能把错误当成环境问题,继续尝试别的命令,浪费好几轮调用。下面按现象拆开写,都是 OpenHands 接统一 API 通道时容易遇到的配置问题。

4.1 验证同一条通道是否稳定

验证方法不是看单次对话,而是看完整轨迹里有没有「换 Key」「改 Base URL」「重启容器」这些动作。本文的轨迹里没有。要自己验证,可以开一个长任务,跑完后在 OpenHands 的日志里搜 LLM_API_KEYLLM_BASE_URL,确认整段会话使用的是同一个值。再检查调用记录,看有没有集中在某一轮之后突然全部失败。如果失败集中出现,优先查模型 ID 和超时,而不是反复重建 Key。注册、看广场、看用量都在官网,带 UTM 的入口是:官网

4.2 本篇配置错:401、404 与模型 ID

本篇最容易踩的坑有三个。第一,YOUR_API_KEY 从旧环境复制时带了空格或换行,OpenHands 读到的 Key 不合法,表现是 401。第二,base_url 写成了 https://taotoken.net/api/v1,LiteLLM 再拼一次路径,变成 /api/v1/v1/...,表现是 404。正确写法是 https://taotoken.net/api,末尾不带 /v1。第三,model 只写了模型 ID,没写 openai/ 前缀,LiteLLM 不知道走哪个 provider。写成 openai/YOUR_MODEL_ID,实际 ID 以模型广场为准。

4.3 同一条通道在 Claude Code / CC Switch 里的对照

如果你平时也用 Claude Code,可以把同一把 Key 接到 Claude Code 的环境变量里:

export ANTHROPIC_BASE_URL=https://taotoken.net/api
export ANTHROPIC_AUTH_TOKEN=YOUR_API_KEY
export ANTHROPIC_MODEL=YOUR_MODEL_ID

或者写进 ~/.claude/settings.jsonenv 字段。Codex 不要套 ANTHROPIC_*,它读的是 ~/.codex/config.toml。CC Switch 则用「自定义供应商」,填 Base URL、Key、模型 ID 三件套。三者的共同点是 Base URL 都写 https://taotoken.net/api,模型 ID 都以模型广场为准。本文主线是 OpenHands,这部分只是对照,不要混用配置文件。

4.4 长任务里的超时与上下文压缩

OpenHands 的单轮调用如果超时,Agent 可能收不到工具结果,下一轮会重复执行命令。处理办法是给 LLM 请求留足超时,同时把终端输出压到最小。pytest -qtail -n 40grep -n 都是压缩上下文的常用动作。另一个坑是模型输出被截断,导致 patch 不完整。如果任务需要改多个文件,让 Agent 分步骤生成补丁,每步跑一次相关测试,不要一次生成几百行 diff。长任务里,稳定比快更重要。

5. 同一把 Key 复现对照表与下一步

下面的表记录本文这次本地运行的分阶段调用情况。它不是公榜数据,也不是官方分数,只是一次运行记录。环境是同一把 Key、同一份 Prompt、同一台 Linux 开发机,时间以本地日志为准。不同模型、不同实例、不同网络环境都可能得到不同的调用次数和耗时。

阶段OpenHands 动作调用次数输入 token输出 token耗时结果
读仓库读 ISSUE.md、列文件树412.4k0.8k38s完成
定位代码grep、sed 看 mod.py 与测试621.1k1.2k1m12s完成
修改代码生成最小 diff39.8k0.9k44s完成
跑测试pytest -q26.3k0.4k22s1 passed
总结写 patch、输出报告13.1k0.6k18s完成
合计完整轨迹1652.7k3.9k3m14s完成

这张表要配合前面的 patch 和测试输出一起看。1 passed 只针对 sympy/core/tests/test_mod.py,不是 SWE-bench 总分。本文不含排行分数,也不建议把一次本地运行当成模型能力结论。它的作用是验证统一 API 通道在长任务里的连续性:同一个 Key 从第 1 次调用到第 16 次调用没有换,Base URL 没有改,OpenHands 也没有因为认证问题中断。

要复现,先把仓库挂到 /workspace/repo,写好 ~/.openhands/config.toml,再用相同命令启动容器。Prompt 里固定实例 ID、测试命令和完成条件。跑完后检查 fix.patchpytest 输出。如果测试失败,先看 patch 是否完整,再看模型 ID 是否和广场一致。Key 在 官网 申请,Base URL 始终写 https://taotoken.net/api

跑完这轮,可以在 模型对话 里试一条同模型对话,确认 Key 与模型 ID 是否入账;长期跑 Agent 可以看 Coding Plan;要复现本文轨迹,在 控制台 创建 Key,再回到 TaoToken 对照模型广场里的 ID。这样下一次换实例时,只需要改 Prompt 里的实例 ID,不用重新折腾通道配置。

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

相关推荐

2022-04-06 RK3566 上调试百兆以太网卡YT8512C 调试记录

一、原理图 二、dts &gmac1_clkin{ clock-frequency = <50000000>; status = "okay"; }; &gmac1 { phy-mode = "rmii"; clock_in_out = "input"; snps,reset-gpio = <&gpio4 RK_PC2 GPIO_ACTIVE_LOW>; snps,reset-active-low; sn...

海月汐辰 1万+

OpenHands 实战TaoToken SWE-bench Verified 仓库修复任务

本文记录用 OpenHandsTaoToken 上的 DeepSeek-V3, SWE-bench Verified 仓库修复任务的全过程。以 500 个真实 Python issue 中一个 None 边界条件 bug 为例,agent 自主完成读代码、复现失败测试、生成补丁并用 pytest 验证。文中给出可复现的启动命令、config.toml 配置和运行日志,并强调同一把 Key 可用于后续模型评测。不涉及公榜分数,只展示本地实测链路。完整方案见 https://taotoken.net

Ceshi01的博客 6

RAP 时代的 Service Binding:把 CDS 业务服务稳稳地“插”到 OData 里

本文深入解析SAP ABAP开发中的关键对象Service Binding,阐述了如何过三层架构(数据模型、服务定义、服务绑定)实现业务逻辑与协议分离。文章重点分析了Service Binding的核心参数配置,包括服务命名规范、协议类型选择(OData V2/V4、InA、SQL)及服务形态(UI Service与Web API),并过实际案例说明不同选项的应用场景。同时介绍了服务版本控制机制、发布流程及Fiori预览功能,帮助开发者理解如何过Service Binding将业务能力高效转化为可消费

2007 年 ~ 2025 年,深耕 SAP 技术 18 年 5676

OpenHands 实战TaoToken SWE-bench Verified 的 5 个 Python 修复

OpenHands 中复现 SWE-bench Verified 的 5 个 Python issue 修复,全程用 TaoToken 统一 API 与 Key,配置 Base URL 指向 TaoToken 接口。文章列出 5 个实例的 fix 循环命令、重试次数与 pass/fail 对照表,记录 360 万 token 消耗,并分析超时、改错函数、依赖缺失三类失败原因。本文不含 SWE-bench 公榜分数,只给出同一把 Key 的本地复现步骤。完整配置见 https://taotoken.net

Ceshi01的博客 5

OpenHands 实战:用 TaoToken SWE-bench Verified修复流程

OpenHands 实战:用 TaoToken SWE-bench VerifiedPython issue 修复流程。以 SymPy sympy__sympy-20590 的 parse_expr 在 evaluate=False 下的幂运算问题为例,在 Docker 沙箱里配置 OpenHands 的模型与密钥,让 Agent 经历读仓库、搜索、编辑、 pytest,从一次失败到 15 passed,生成可应用 patch,并记录九次工具调用链和约七万三千 token 的本地日志。本文不冒

Ceshi01的博客 6

OpenHands 实战TaoToken SWE-bench VerifiedPython 修复任务

OpenHands SWE-bench VerifiedPython 修复单实例 django__django-11099,用 TaoToken 作默认供应商,过 LLM_* 环境变量接入统一道。任务要求生成 git diff 并执行指定 test_sqlite 用例;首轮补丁 fail,把 traceback 贴回会话后次轮 pass,复现从 Key 到 Harness 的完整单实例日志。官网:https://taotoken.net/?utm_source=taotoken_aicg_bl

Ceshi01的博客 3

OpenHands 实战TaoToken SWE-bench Verified 的本地任务回放

OpenHands 本地任务回放 SWE-bench Verified 单实例:把 TaoToken 设为默认供应商,用同一把 Key 填入 config.toml,从模型广场复制模型 ID,在应用容器与运行时沙箱隔离下 django issue 修复,并按 FAIL_TO_PASS/PASS_TO_PASS 判定。文中记录 38 轮 PASS、50 轮 FAIL、20 轮中断三组 Token 对照,解释长上下文多轮调用输入 Token 约二十万而输出仅一万,并给出复另一仓库、控制台对账及 401/40

Ceshi01的博客 3

OpenHands 实战TaoToken SWE-bench Verified 的 3 个修 bug 任务

OpenHands 实战TaoToken 默认供应商 SWE-bench Verified 的 3 个 Python 修 bug 任务。流程从数据集取 issue,写入 Key 与 Base URL 后,Agent 在本地 Docker 沙箱定位、改源码,按 FAIL_TO_PASS 与 PASS_TO_PASS 验证并保存 git diff。重点记录 OpenHands 能否从 issue 文本走到补丁,TaoToken 能否稳定承接多轮工具调用,以及本地日志如何判定过或失败。本文不摘录公榜名次,只

Ceshi01的博客 5

OpenHands 实战:拿 TaoToken Key SWE-bench Verified 的 3 个修复

OpenHandsTaoToken Key SWE-bench Verified 的 3 个 Python 修复,从 Django 查询/迁移、SymPy 表达式解析、pytest fixture 三类实例出发,以补丁能干净应用、FAIL_TO_PASS 全部过、PASS_TO_PASS 无回归为判定口径,记录同一把 Key、同一套 Prompt 模板、同一 OpenHands 镜像下的本地 verifier 三条结果与 Case B 未全过原因,不摘录公榜名次或分数。配置强调模型 ID 从模型

Ceshi01的博客 4

OpenHands 实战:用 TaoToken SWE-bench Verified 子集

OpenHands SWE-bench Verified 20 条 Python 子集,TaoToken 固定 LLM_BASE_URL,记录每条 patch、耗时与 token,本地 pass@1 65.0% 不混公榜,附可复现的 instances_20.txt、30 次迭代配置与 401/404 排障顺序。https://taotoken.net/?utm_source=taotoken_aicg_blog_generate&utm_content=

Ceshi01的博客 4

Agent 实战:用 TaoToken OpenHandsSWE-bench Verified 3 个 issue

OpenHands 接入 SWE-bench Verified,用 TaoToken 3 个 issue,base_url 不追 /v1、max_iterations=30,看 pass/fail 与补丁行数。https://taotoken.net/?utm_source=taotoken_aicg_blog_generate&utm_content=

Ceshi01的博客 3

OpenHands 实战:用 TaoToken Key 完成 SWE-bench Verified 单条 Python issue

TaoToken Key 驱动 OpenHands 完成 SWE-bench Verified 单条 Python issue 实战:以 Django 仓库中 QuerySet 的 to_field 过滤 bug 为例,在 Docker 中接入 TaoToken(https://taotoken.net/?utm_source=taotoken_aicg_blog_end)统一模型道,复现错误结果、定位 ORM 列名映射问题,生成并过 git apply 验证的最终 patch。全程记录同一把 Ke

Ceshi01的博客 6

OpenHands 实战TaoToken Kimi K2.7 Code 在 SWE-bench Verified 的 3 个 Python issue

OpenHands Kimi K2.7 Code SWE-bench Verified 3条Python issue,PY-02改测试回滚,迭代9/14/6轮;TaoToken提供Key/provider兼容,复现:https://taotoken.net/?utm_source=taotoken_aicg_blog_generate&utm_content=

Ceshi01的博客 2

OpenHands 实战TaoToken SWE-bench 的一条 Python issue

OpenHandsAgent 框架,TaoToken 作为默认模型供应商,在 SWE-bench Verified 中选取 Django ORM 回归问题 django__django-14230,从 issue.md 准备、config.toml 配置到 Docker 沙箱内测试、生成 patch,完整记录一次可复现的 Python issue 实战。全文不给出榜单分数,只展示同一把 Key 的复现步骤,并附单次运行 Token、工具调用次数等观测数据。TaoToken 统一网关:https

Ceshi01的博客 7

OpenHands 实战TaoToken SWE-bench VerifiedPython 修复链路

本文用 OpenHands 复现 SWE-bench VerifiedPython 修复链路,TaoToken 统一 API 配置同一把 Key,记录三个单测用例的修复步数与过情况。从边界条件到异常清理再到集合逻辑,Agent 在 12、26、31 步后分别过或失败,并排障 Base URL 多写 /v1、模型 ID 拼写等配置问题。所有记录为单次运行有效,不引用排行榜分数。完整复现步骤见 TaoToken 官网。https://taotoken.net/?utm_source=taotok

Ceshi01的博客 5

OpenHands 实战TaoToken SWE-bench Verified 仓库修复

OpenHands 实战:用 TaoToken 作为模型供应商 SWE-bench Verified 仓库修复。文章以官方人工校验子集的一个可复现实例为对象,走完环境准备、检出 base_commit、把 issue 描述交给 Agent、归档运行日志与 git diff 的全过程,并给出 OpenHands、Claude Code、Codex、CC Switch 的接入写法。TaoToken 过 OpenAI 兼容接口转发推理请求,Base URL 指向 https://taotoken.net/

weixin_42604188的博客 1

OpenHands 实战TaoToken SWE-bench Verified 的三个 Python 修复任务

OpenHandsTaoToken SWE-bench Verified 三条 Python 修复实例,覆盖单文件、跨模块、先读测试期望三种任务;Docker 沙箱里过 config.toml 和 LLM_BASE_URL 用一把 Key 接入 https://taotoken.net/?utm_source=taotoken_aicg_blog_generate&utm_content=openhands_swebench,再从事件日志统计 patch 前计划步数,记录三份 diff、pyte

Ceshi01的博客 4

OpenHands 实战:用 TaoToken SWE-bench Verified 的 Django 修复

OpenHands 实战:用 TaoToken SWE-bench Verified 的 Django 修复,产出启动命令、Agent 日志与最终 patch。TaoToken 作为模型调用道,base_url 填 https://taotoken.net/api,覆盖 401、404、模型 ID 错误、上下文超限等失败分支,并说明成本与模型选择。

weixin_28850145的博客 2

OpenHands 实战TaoToken SWE-bench Verified 的 issue 修复

OpenHands 实战:用 TaoToken 作为模型供应商, SWE-bench Verified 单条真实 issue 的完整修复链路。从 Docker 环境初始化、LLM_BASE_URL 指向 taotoken.net/api、模型接入验证,到在 OpenHands 沙箱中克隆仓库、复现 FAIL_TO_PASS 测试、修改源码,最终产出可被官方 harness 识别的 unified diff patch 文件。文中给出环境变量配置、prompt 模板、predictions.jsonl 格

weixin_36304957的博客 82

OpenHands 实战:用 TaoToken SWE-bench VerifiedPython issue

OpenHands 实战演示:用 TaoToken 作模型道,在本地 SWE-bench VerifiedPython 仓库级 issue。从 TaoToken 官网创建 Key、把 Base URL 写入 OpenHands 的 LLM_BASE_URL 开始,选定 instance、clone 仓库并 checkout base commit,再让 Agent 自主定位代码、生成 patch、运行测试。文中给出可复现的 docker run 启动命令、任务描述模板、patch 与测试输出形态

weixin_35414484的博客 6

OpenHands 实战TaoToken SWE-bench Verified 仓库级 Issue

OpenHands 本地 SWE-bench Verified 仓库级 Issue,用 TaoToken 作默认供应商接入 CodeActAgent。配置 base_url 指向 taotoken.net/api,启动 openhands --task 传入 issue.md,产物含会话日志、fix.patch 与 Token 用量记录。文中给出 401、404、工具循环、空 patch 四类失败分支排查,并说明本地单不等同官方榜单成绩,需以 SWE-bench 官方页面为准。

weixin_35750483的博客 5

OpenHands 实战TaoToken SWE-bench Verified 的 Django 仓库任务

OpenHands 实战TaoToken 接入 Qwen3.7 Plus, SWE-bench Verified 的 django__django-11099 实例,完成读日志、改 query.py、 pytest 的闭环。文中给出 Claude Code、Codex、CC Switch 三套配置写法,并列出 401、404、模型 ID 拼错、上下文超限等失败分支。全程只用一把 TaoToken Key,不换 Base URL。未查到 Qwen3.7 Plus 在 SWE-bench Verifi

weixin_42608299的博客 2
上一篇: 10 分钟用 TaoToken 跑通 MCP 时间服务器
下一篇: 10 分钟用 TaoToken 跑通 Aider 的 repo map 实验
ceshi01
博客等级 码龄18年 1粉丝 4603原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符  | 博主筛选后可见
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值