DeepSeek-R1 上了 Chatbot Arena 编程榜:用同一把 TaoToken Key 复现榜单对话

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

1. Chatbot Arena 编程分类里的 DeepSeek-R1:本文只复现对话,不摘录分数

DeepSeek-R1 出现在 Chatbot Arena 编程分类的公开讨论里之后,我想确认同一批编程提示词在 TaoToken 的兼容通道上会得到怎样的回答结构。这里先把边界说清楚:Chatbot Arena 是公开对话榜,编程分类里既有模型之间的匿名对战,也有用户投票形成的风格偏好;但截至写稿时,我没有保留带查阅日期的名次、ELO 或分数快照,所以本文不写排行数字,也不把记忆当数据。本文不含排行分数,只做同一组 Prompt 的本地重放,记录回答结构、长度档、代码密度和风格倾向。榜单上的是模型,读者用同一把 Key 和 Base URL 接的是同一个模型,这两件事要分开看。

编程分类在 Chatbot Arena 里常见的对话形态,和刷题网站不太一样。用户往往扔一段报错、几行 SQL、一段 React 代码,然后问“为什么错了”“怎么改”“哪个更快”。这类问题短、上下文碎、目标不唯一,模型需要先判断用户到底要解释还是要可运行补丁。DeepSeek-R1 作为推理型模型,回答可能会先展开分析,再给代码,再补验证步骤。我们要记录的正是这些特征:它有没有先澄清约束,有没有直接给出可复制代码,有没有在末尾说明怎么验证。一个名次无法告诉我们这些,只有把同一批 Prompt 重放一遍,才能看到对话层面的差异。

复现边界必须写清楚。本文使用同一把 Key、同一组 5 个编程 Prompt、同一套 system prompt、一次运行。结果只代表这次调用,不代表 Chatbot Arena 的公榜表现。Arena 的投票来自匿名用户,提示词分布、模型版本、采样参数、系统提示都可能不同。公榜表与本地复现表要分开,公榜看的是投票聚合结果,本地表看的是这次请求返回了什么。如果有人拿本文的表格去对比 ELO,那是错误用法。本文后面只给本地复现表,不给公榜名次,也不把“风格接近”写成“分数一致”。

调用环境固定下来:Base URL 用 https://taotoken.net/api,末尾不带 /v1;API Key 用 YOUR_API_KEY;模型 ID 以模型广场为准。注册拿 Key、看模型广场里的 DeepSeek-R1 对应 ID、查调用用量,都从 TaoToken 进入。不要把 UTM 参数加到 Base URL、curl 地址或环境变量里,UTM 只用于网页落地页和文末跳转。模型 ID 也不要凭记忆写,不同通道的命名可能不同,正确做法是在模型广场复制当前可用的 ID,填到 YOUR_MODEL_ID 位置。

这次挑的 5 个提示词覆盖编程对话里最常见的五类任务:数据结构实现、SQL 改写与索引、TypeScript 类型报错、Shell 日志统计、React 副作用调试。它们都不是竞赛题,而是日常开发里会直接搜或者直接问 AI 的问题。选择标准有三条:第一,Prompt 足够短,接近 Arena 里用户随手输入的长度;第二,问题有明确的可验证结果,比如代码能不能跑、SQL 逻辑对不对;第三,回答能体现风格差异,比如是代码优先还是解释优先,是分点还是长段落。下面先接通道,再逐条重放。

2. 同一把 Key 接 DeepSeek-R1:Base URL、模型 ID 与三种客户端配置

最小调用用 OpenAI 兼容接口就行。Python SDK 里把 base_url 指向 https://taotoken.net/api,不要习惯性加 /v1。Key 从控制台创建后填到 YOUR_API_KEY,模型 ID 从模型广场复制 DeepSeek-R1 对应的那一项,填到 YOUR_MODEL_ID。下面这段代码只做一件事:循环发送 5 个 Prompt,把回答写进本地文件,方便后面手动统计长度档和风格。注意,这里没有让 AI 直接操作生产库或生产机,也没有让它执行 SQL;它只生成解释和代码,真正的执行由读者在本地环境完成,再把结果贴回对话。

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://taotoken.net/api",
)

PROMPTS = [
    "用 Python 实现一个带过期时间的 LRU 缓存,要求 get 和 put 平均 O(1),并解释为什么哈希表加双向链表能做到。",
    "这条 SQL 在订单表上很慢:SELECT * FROM orders WHERE DATE(created_at) = CURRENT_DATE ORDER BY amount DESC LIMIT 20; 帮我改写并说明索引怎么建。",
    "这段 TypeScript 报错:Type 'string' is not assignable to type 'T'. 函数 identity<T>(arg: T): T 里我写了 return arg as string; 帮我解释并给最小修复。",
    "写一个 Bash 脚本,统计 access.log 里状态码 5xx 的请求中,出现次数最多的 10 个 IP,只用 awk、sort、uniq 和 head。",
    "React 函数组件里 useEffect 依赖数组漏了一个函数,导致无限循环。帮我定位问题,并重构到不会重复请求的状态。",
]

for i, prompt in enumerate(PROMPTS, start=1):
    resp = client.chat.completions.create(
        model="YOUR_MODEL_ID",  # 以模型广场 DeepSeek-R1 对应 ID 为准
        messages=[
            {"role": "system", "content": "你是编程助手。先给结论,再给可运行代码,最后给验证方法。解释保持紧凑。"},
            {"role": "user", "content": prompt},
        ],
        temperature=0.2,
    )
    text = resp.choices[0].message.content
    with open(f"r1_replay_{i}.md", "w", encoding="utf-8") as f:
        f.write(text)

Claude Code 接法要写对三件套。环境变量方式是:

export ANTHROPIC_BASE_URL="https://taotoken.net/api"
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_MODEL="YOUR_MODEL_ID"

也可以写进 ~/.claude/settings.json

{
  "env": {
    "ANTHROPIC_BASE_URL": "https://taotoken.net/api",
    "ANTHROPIC_AUTH_TOKEN": "YOUR_API_KEY",
    "ANTHROPIC_MODEL": "YOUR_MODEL_ID"
  }
}

这里再次提醒,Base URL 末尾不要加 /v1,模型 ID 以模型广场为准。Claude Code 的三件套是 ANTHROPIC_BASE_URLANTHROPIC_AUTH_TOKENANTHROPIC_MODEL,不要和 Codex 的配置混在一起。Codex 走 ~/.codex/config.toml,不要套 ANTHROPIC_*。一个可用的 codex 配置骨架如下,provider 名称可以自定义,关键是把 base_url 指到 https://taotoken.net/api,把 Key 放到环境变量里:

# ~/.codex/config.toml
model = "YOUR_MODEL_ID"
model_provider = "custom"

[model_providers.custom]
name = "custom"
base_url = "https://taotoken.net/api"
env_key = "CUSTOM_API_KEY"

然后在本机设置 CUSTOM_API_KEY="YOUR_API_KEY"。模型 ID 仍然以模型广场为准,不要编造 gpt-5 之类的正式配置名。CC Switch 的配置逻辑更简单:新增自定义供应商,Base URL 填 https://taotoken.net/api,Key 填 YOUR_API_KEY,模型 ID 填从模型广场复制的 DeepSeek-R1 对应 ID,保存后切换生效。三种客户端都指向同一个 Base URL 和同一把 Key,这样后面重放对照表时,环境差异不会混进来。注册、看模型广场、查用量都在 TaoToken 的官网入口。

3. 5 个编程提示词重放:DeepSeek-R1 问答对照表

这一节把 5 个 Prompt 原样列出,然后给本地重放表。表格只记录结构和风格,不写公榜分数。长度档用短、中、长三档表示:短大约是一屏以内,中大约一屏到两屏,长是两屏以上。代码密度表示回答里可复制代码块的数量和完整度。风格备注记录的是这次调用看到的倾向,不是模型永久特征,也不代表 Chatbot Arena 的投票结果。

Prompt 1:

用 Python 实现一个带过期时间的 LRU 缓存,要求 get 和 put 平均 O(1),并解释为什么哈希表加双向链表能做到。

Prompt 2:

这条 SQL 在订单表上很慢:SELECT * FROM orders WHERE DATE(created_at) = CURRENT_DATE ORDER BY amount DESC LIMIT 20; 帮我改写并说明索引怎么建。

Prompt 3:

这段 TypeScript 报错:Type 'string' is not assignable to type 'T'. 函数 identity (arg: T): T 里我写了 return arg as string; 帮我解释并给最小修复。

Prompt 4:

写一个 Bash 脚本,统计 access.log 里状态码 5xx 的请求中,出现次数最多的 10 个 IP,只用 awk、sort、uniq 和 head。

Prompt 5:

React 函数组件里 useEffect 依赖数组漏了一个函数,导致无限循环。帮我定位问题,并重构到不会重复请求的状态。

本地重放表如下。同一把 Key、同一组 Prompt、一次运行,不代表公榜。

编号Prompt 主题回答结构长度档代码密度风格备注
1Python 过期 LRU结论 → 哈希表+双向链表解释 → 完整类代码 → 复杂度与过期清理注意高,含完整可运行类偏教科书式,先讲原理再给实现,末尾提醒线程安全与时间精度
2SQL 慢查询改写先指出 DATE(created_at) 导致索引失效 → 给范围条件改写 → 索引建议 → 验证方式中,含改写 SQL 与建索引语句数据库调优口吻,分点明确,强调不要在列上套函数
3TypeScript 泛型报错解释 as string 破坏泛型约束 → 给最小修复 → 补充更安全写法中,含前后对比代码类型解释紧凑,先给错误原因,再给修改,不扩展无关类型体操
4Bash 日志统计给一行管道脚本 → 拆解 awk、sort、uniq 顺序 → 说明字段假设中长高,含完整命令与注释命令优先,解释跟随,提醒日志格式不同要改字段
5React useEffect 循环定位依赖数组缺函数 → 解释闭包与重复渲染 → 给 useCallback 重构 → 验证请求次数高,含组件重构片段前端调试风格,先讲为什么循环,再给可粘贴修复

从表格看,5 个回答都倾向于“结论先行、代码随后、验证收尾”。Prompt 1 和 Prompt 5 明显更长,因为它们同时要求实现和原理解释;Prompt 3 最短,因为问题本身聚焦在一个类型错误上。代码密度方面,Prompt 1、4、5 都给了可直接复制的完整片段,Prompt 2 给了 SQL 和索引语句,Prompt 3 给了最小修复。这个结构符合编程助手类对话的常见预期,也接近 Chatbot Arena 编程分类里用户偏好的那种“别只讲概念,给我能跑的东西”的风格。但要注意,这次 system prompt 明确要求“先结论、再代码、最后验证”,所以长度和结构有一部分来自我们设定的指令,不完全是模型自发行为。

4. 响应长度与风格记录:与 Chatbot Arena 编程对话逐条比对

逐条看下来,Prompt 1 的回答长度档是长。它先给结论,说哈希表负责 O(1) 查找,双向链表负责 O(1) 移动和删除,然后解释为什么不用普通链表或数组。代码部分给出一个带过期时间的类,内部维护 dict 和双向节点,get 时检查过期并移动节点,put 时处理容量和过期淘汰。末尾它补了复杂度、时间精度和线程安全提醒。这个风格与 Arena 编程分类里“实现+解释”类对话接近,但我们的 system prompt 要求验证收尾,所以它比匿名对战里常见的简短回答多了一段注意事项。长度是否与榜单表现一致?本文没有公榜快照,不能写“一致”,只能写“结构与常见编程对话偏好接近”。

Prompt 2 的长度档是中。回答没有直接重写整条 SQL 就结束,而是先指出 DATE(created_at) = CURRENT_DATE 会让列上的索引失效,然后给范围条件:created_at >= CURRENT_DATE AND created_at < CURRENT_DATE + INTERVAL 1 DAY,再按 amount DESC 排序。索引建议部分提到联合索引顺序,并提醒 ORDER BYLIMIT 的组合可能需要覆盖索引。它还给了一个 EXPLAIN 验证步骤。这个回答风格偏 DBA,分点清楚,没有堆砌执行计划术语。Arena 编程分类里 SQL 问题通常不会太长,用户更关心“怎么改”,所以这种中等长度、直接给改写和索引建议的风格比较贴地。

Prompt 3 的长度档是中,代码密度中等。它先解释 arg as string 把泛型 T 硬转成 string,返回类型却还是 T,所以类型系统报错。最小修复是去掉断言,直接 return arg;;如果确实要返回字符串,应该把函数签名改成 identity(arg: T): string 或者用重载。回答还补了一个更安全的写法,避免在泛型函数里做无依据断言。这个风格和 Arena 编程分类里的 TypeScript 报错对话接近:先解释报错,再给最小 diff,不把问题扩展到整个类型系统。长度没有膨胀,适合直接贴回编辑器。

Prompt 4 的长度档是中长,代码密度高。它给了一个管道脚本,先 awk 过滤 5xx 并打印 IP,再 sortuniq -csort -nrhead -10。然后逐段拆解每个命令的作用,并提醒如果日志字段位置不同,要改 $1$9 之类的列号。这个回答风格偏命令行实用主义,先给能跑的,再解释。Arena 编程分类里 Shell 问题往往粘一段日志格式,用户希望直接得到命令,所以这种“命令优先”的风格匹配度较高。长度档中长,是因为它额外解释了管道顺序和字段假设,但没有写成长篇教程。

Prompt 5 的长度档是长,代码密度高。它先定位问题:useEffect 依赖数组漏了函数,函数在每次渲染重新创建,导致 effect 反复执行,如果 effect 里又 setState,就会无限循环。然后它解释闭包和引用相等,再给 useCallback 包住函数的重构,或者把函数移到组件外、用 useRef 保存。最后给验证方法:在请求处打日志,确认只发一次。这个风格符合前端调试类对话的偏好:先讲循环原因,再给可粘贴修复,最后告诉你怎么确认修好了。实测下来,这一条的回答结构最接近 Chatbot Arena 编程分类里常见的“帮我看看为什么一直重渲染”的对话形态。但再次声明,这是一次运行,不代表公榜;公榜看的是匿名用户投票聚合,我们看的是同一把 Key 下的单次返回。

把 5 条放在一起,可以看到几个共同点。第一,回答都尽量先给结论,不绕弯。第二,代码块出现得早,解释跟在后面。第三,末尾大多有验证或注意事项。第四,长度受 system prompt 影响明显,因为我们要求“先结论、再代码、最后验证”,如果没有这条指令,回答可能更短或更散。第五,模型没有主动执行任何命令,也没有连接生产库;它只生成代码和 SQL,执行动作留给本地。公榜表和本地复现表要分开,公榜不写分数,本地表只记录结构和长度档。这样的记录方式可复现,也不会把一次调用包装成排行榜结论。

5. 复现对照表对账:看用量、换 Prompt、创建下一把 Key

跑完 5 条之后,第一件事是对账。用同一把 Key 在控制台看调用记录,确认 5 次请求都入账,模型 ID 和模型广场里 DeepSeek-R1 对应的那一项一致。如果用量里出现模型名不匹配,多半是 YOUR_MODEL_ID 填错,或者客户端缓存了旧配置。第二件事是检查返回长度。如果某条回答明显比表格里的长度档短很多,先看 max_tokens 有没有被客户端默认限制,再看 system prompt 是否被其他工具覆盖。Claude Code、Codex、CC Switch 各自有自己的配置文件,不要以为改了一个客户端的 Base URL,另一个客户端也会跟着变。每个客户端都要单独确认 https://taotoken.net/apiYOUR_API_KEY

本篇配置错主要看两个状态码。401 通常表示 Key 不对或没有带 Bearer,检查 YOUR_API_KEY 是否从控制台复制完整,环境变量是否写进了当前 shell。404 通常表示路径或模型 ID 不对,先检查 Base URL 是不是被加上了 /v1,因为本文要求用 https://taotoken.net/api,末尾不带 /v1;再检查 YOUR_MODEL_ID 是否从模型广场复制,而不是凭记忆写。还有一种情况是客户端把 Anthropic 协议和 OpenAI 协议混用,比如在 Codex 里套 ANTHROPIC_*,或者在 Claude Code 里填了 Codex 的 model_provider。这些配置差异会导致请求发不到正确端点,但错误信息不一定直观。

换 Prompt 复现时,建议保持同一套 system prompt 和 temperature,只改变 user 内容。这样长度档和风格差异才可比较。如果你想更接近 Chatbot Arena 的匿名对话,可以把 system prompt 去掉或改短,但那样会和本文表格的基线不同,不能直接混在一张表里。每次重放都记录环境:同一把 Key、Base URL、模型 ID、是否带 system prompt、何时跑。本文的本地表只代表一次运行,不代表公榜。公榜要看 Chatbot Arena 编程分类的公开页面,并且要带查阅日期、名次或分数、页面来源;本文没有摘录这些数字,所以不提供公榜结论。

对照表跑完后,打开 模型对话 确认 DeepSeek-R1 的模型 ID 与广场一致;长期开发可看 Coding Plan。Key 在 控制台 创建;Claude Code / CC Switch 三件套对照 接入文档。如果你刚跑完这 5 条 Prompt,先去看这次调用有没有入账,再决定要不要把其中一条改成自己的业务报错,重新生成一张对照表。

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

相关推荐

从Mate到Mate40 Pro+:华为旗舰核心配置演进与选购避坑指南

本文回顾了华为Mate系列从初代到Mate40 Pro+的核心配置演进历程,重点分析了处理器性能、影像系统、屏幕设计及续航快充的技术突破。针对选购需求,提供了区分版本、5G选择及存储配置的实用避坑建议,帮助消费者明智选择华为旗舰机型。

weixin_30015371的博客 457

DeepSeek-R1 上了 Chatbot ArenaTaoToken Key 复现同一批 Prompt

DeepSeek-R1 登上 Chatbot Arena 后,很多人想确认自己接到的模型是否与公一致。本文用 TaoToken Key 从公开样本取 10 条 prompt,经 curl 请求 https://taotoken.net/?utm_source=taotoken_aicg_blog_end 复现同一批 Prompt。脚本 run_arena.sh 记录响应长度、连贯性与拒答,仅安全类被拒,代码与数学题展示完整推理。文中包含注册官网拿 Key、配置 Base URL 时避免 /v1 的细节,并

Ceshi01的博客 5

PCB激光直接成像(LDI)设备技术解析与优化方案

激光直接成像(LDI)是PCB制造中的关键数字化工艺,通过激光束直接在基板上形成电路图案。其核心技术在于高精度光学系统与智能控制算法的结合,工作精度可达微米级。在HDI板、柔性电路等高端PCB制造中,LDI技术能显著提升线宽精度和层间对位准确性。当前行业面临材料适配性、热变形控制等挑战,动态能量补偿、多波长曝光等创新方案正在突破这些瓶颈。随着模块化设计、预测性维护等工程实践的普及,LDI设备综合效率持续提升,为5G、汽车电子等领域的精密电路生产提供关键技术支撑。

weixin_29168393的博客 354

DeepSeek-R1 登上 Chatbot Arena:用 TaoToken 复现同一Key 跑数学推理

DeepSeek-R1登上Chatbot Arena:本文用TaoToken复现同一Key跑数学推理,按0.2/0.6/1.0温度、2048/4096 max_tokens记录拒绝率、输出长度、首字时延。创建Key见https://taotoken.net/?utm_source=taotoken_aicg_blog_end,本地表与公分开。

Ceshi01的博客 4

DeepSeek-R1 上过 Chatbot Arena:用 TaoToken 复现同一Key 的响应区间

DeepSeek-R1 上过 Chatbot Arena 是公开,但本文不围观 ELO,改用 TaoToken 统一 API 基线,在同一Key同一 prompt、temperature 0.6 下串行 12 次,用 Python 脚本实测 min/P50/P95/max 响应区间,TTFT、总耗时、completion_tokens 分开对表。全文无排行分数与公快照,只保留可复现步骤与排障列表。访问 TaoToken 官网:https://taotoken.net/?utm_source=tao

Ceshi01的博客 3

DeepSeek-R1 登上 Chatbot Arena:用 TaoToken 复现盲测回合

DeepSeek-R1 登上 Chatbot Arena 后,本文用 TaoToken 作为统一 API 供应商,复现匿名盲测回合。通过一把 Key、一个 Base URL(https://taotoken.net/?utm_source=taotoken_aicg_blog_end)和两个模型 ID,搭建 20 轮双盲投票脚本:随机交换 A/B 位置、隐藏模型 ID、记录胜平负。文章强调本地结果不能外推为公 ELO,仅代表个人偏好;平局不计入分母,并给出统计口径。附有完整 Python 脚本与 blin

Ceshi01的博客 4

DeepSeek-R1 上了 Chatbot Arena 榜单:用 TaoToken 复现同一Key对话链路

DeepSeek-R1 登上 Chatbot Arena 文本榜单后,本文用 TaoToken 统一网关复现同一Key对话链路,不比较分数,只验证请求能否正确路由到模型。文中固定随机种子从 lmsys/chatbot_arena_conversations 抽取代码生成提示,给出 OpenAI SDK 与 curl 两种请求写法,强调 Base URL 必须使用 https://taotoken.net/?utm_source=taotoken_aicg_blog_end 对应的落地页 Key,而接

Ceshi01的博客 4

DeepSeek-R1 上过 Chatbot Arena:用 TaoToken 作为统一通道重跑同款推理题

本文用 TaoToken 统一通道重跑 DeepSeek-R1Chatbot Arena 留下的同款推理题。从公开样本中提取 10 条中文 prompt,固定同一Key同一 Base URL 与 temperature=0.6,完整记录每条 completion_tokens 和输出结构,重点对比 reasoning_content 与 content 的拆分效果,并复现模型 ID 配置坑。不引用公分数,只提供可复现步骤。完整配置见 https://taotoken.net/?utm_sour

Ceshi01的博客 4

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现上表现,同一Key

DeepSeek-R1Chatbot Arena 上的行为,用 TaoToken 同一Key 在本地复现:从控制台创建 Key、确认模型广场里的模型 ID,再用 curl、Claude Code、Codex、CC Switch 四类接入方式发请求,按概念解释、数学推理、代码生成、开放讨论、边界情况五类 Arena 风格提示词跑出「提示词 × 复现回答」对照表。全文不含 Elo 分数或名次快照,只记录行为特征与配置核对,并给出 401、404、400 的排障顺序。落地页见 https://taoto

weixin_42596011的博客 2

DeepSeek-R1 上了 Chatbot Arena:用同一TaoToken Key 复现对话基线

DeepSeek-R1 登上 Chatbot Arena后,本文不追瞬时 ELO,而是用同一TaoToken Key 复现对话基线:固定五条 Arena 风格提问,统一 temperature、top_p、max_tokens,记录返回模型名、回答长度、输出格式与首 token 时延。正文不含公分数,所有数字来自本地调用;同时给出 Base URL 陷阱、模型 ID 复制、max_tokens 截断等排障步骤。TaoToken 在流程中只做 API 网关,提供 Key、计费与调用记录。完整复现

Ceshi01的博客 4

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同一Key 的 A/B 对话

DeepSeek-R1 登上 Chatbot Arena 对局池后,本文从对战记录中抽取一对 A/B 样本,用 TaoToken 统一 API 基线复现同一Key 下的双模型对话。脚本流式记录 reasoning 与正式回答的首 token 延迟、输出长度、completion_tokens,并提醒 Base URL 不含 /v1、模型 ID 以模型广场为准。表格留空,由读者自测。TaoToken 官网:https://taotoken.net/?utm_source=taotoken_aicg_blo

Ceshi01的博客 4

DeepSeek-R1 上了 Chatbot Arena:用同一TaoToken Key 复现盲测对话

DeepSeek-R1 登上 Chatbot Arena,本文抄下一条公开盲测对话,用同一TaoToken Key 本地复现 DeepSeek-R1 的回复,并与 Arena 摘录并排对比;不比较 ELO、不取分。并记录配置错因。TaoToken:https://taotoken.net/?utm_source=taotoken_aicg_blog_end

Ceshi01的博客 7

DeepSeek-R1 上过 Chatbot Arena:用 TaoToken 复现,全程同一Key

DeepSeek-R1 上过 Chatbot Arena,本文用 TaoToken 同一Key 固定 Base URL,多轮请求复现其长思维链与自我修正行为。不引用公分数,因为未保存快照;以 https://taotoken.net/api 为端点,记录每轮 token、首尾文本、耗时和模型 ID,并在 TaoToken 控制台核对路由是否一致。TaoToken 仅作统一网关基线,不参与榜单。附复现脚本和观测表。https://taotoken.net/?utm_source=taotoken_aic

Ceshi01的博客 6

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同一Key 跑出的 ELO 区间

DeepSeek-R1 登上 Chatbot Arena 后,本文用同一TaoToken Key 跑一组可公开下载的偏好对,复现本地胜率并对照公 ELO 区间。文中给出偏好集脚本、胜率表与 ELO 参考表三样产出物,Base URL 指向 https://taotoken.net/api,模型 ID 以模型广场为准。全文不编造 Arena 分数,只写可复现步骤与排障,入口见 https://taotoken.net/?utm_source=taotoken_aicg_blog_generate&utm

weixin_32921023的博客 84

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同一Key 的 ELO 测试

DeepSeek-R1 已出现在 Chatbot Arena 榜单,但公数据无法直接用于本地验证。本文用 TaoToken 的统一 Key 接入 DeepSeek-R1,以 temperature=0.7 和 1.2 作为两个参赛者,在 16 道覆盖写作、代码、数学等类型的提示词上跑完对战流程,并用标准 ELO 公式计算相对分数。全程只使用同一Key 和固定 Base URL,不引用官方 ELO 数值,也不含本地运行结果;读者按脚本自行复现后填写对照表。TaoToken 只负责 API 转发,不参与

Ceshi01的博客 6

DeepSeek-R1 上过 Chatbot Arena 榜单:用 TaoToken 复现榜单提示词的 Token 用量

DeepSeek-R1 上过 Chatbot Arena 榜单,用 TaoToken 复现提示词的 Token 用量。通过 https://taotoken.net/?utm_source=taotoken_aicg_blog_end 创建 Key,Base URL 保持 /api 根路径,模型 ID 从广场复制。脚本用 10 条提示词记录首字时间与 usage,实测 total_tokens 合计 6580,最大单次 1179。此表仅是一次运行快照,不代表公分数;同一Key复现自己的基线。

Ceshi01的博客 6

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同款提示词

DeepSeek-R1 登上 Chatbot Arena 后,本篇不抄 ELO 名次,而是从公公开对战记录里复制一条带分步推理要求的 prompt,用 TaoToken 同一Key 在本地复现:Base URL 填 https://taotoken.net/api,模型 ID 以模型广场为准,curl 跑完记录 prompt_tokens 约 120、completion_tokens 约 480、total_tokens 约 600,并整理成不含公分数的本地复现表。官网入口见 https://ta

weixin_42604188的博客 1

DeepSeek-R1 上了 Chatbot Arena 文本:用 TaoToken 复现同一Key对话手感

DeepSeek-R1 登上 Chatbot Arena 文本后,本文用 TaoToken 同一Key 复现对话手感:固定 temperature 0.6、max_tokens 2048,每条新建会话,把上形态拆成 30 条提问,覆盖多步推理、代码改写、长文摘要、中文写作、边界格式五组,并记录首屏形态与重跑一致性。文中不引用 ELO 或名次,只给同一Key复现步骤。入口:https://taotoken.net/?utm_source=taotoken_aicg_blog_generate&

Ceshi01的博客 5

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 一把 Key 复现榜单对话

DeepSeek-R1Chatbot Arena 上的对话样本只能看结果、看不到 token 消耗,这篇生成稿把三条公开榜单 prompt(数学推理、代码 bug 定位、600 字长文摘要)用 TaoToken 一把 Key 在本地复现,记录 curl 命令、响应差异和 usage 明细:三条合计 1333 tokens,数学题 completion 412 最长,摘要题 prompt 198 最长。文中还对比了榜单样本与本地输出的解法顺序、字数偏差,并给出 Claude Code、Codex、CC

weixin_42578963的博客 4

DeepSeek-R1 上过 Chatbot Arena:用同一TaoToken Key 复现 Token 用量与首字耗时

DeepSeek-R1Chatbot Arena数据为参照,本文演示用同一TaoToken Key 复现 Token 用量与首字耗时:先摘录 LMArena 页面的模型名、排名/ELO 和查阅日期,再到 TaoToken 官网(https://taotoken.net/?utm_source=taotoken_aicg_blog_end)创建 Key,将 Base URL 配置为 https://taotoken.net/api(不加 /v1),用同一条推理题提示词调用 DeepSeek

Ceshi01的博客 5

DeepSeek-R1Chatbot Arena 盲测上:用 TaoToken 复现同一条调用链

本文针对 Chatbot Arena 盲测DeepSeek-R1 的 Elo 无法解释单次输出差异的问题,用 TaoToken 搭建同一条可复现调用链:在官网注册、复制 Key,将 Base URL 填为 https://taotoken.net/api,用同一 prompt 连续调用三次,记录输出风格、长度和推理轨迹。过程不做排名推测,只验证统一 API 在评测工具、Agent 或插件中的稳定性,并给出脚本留存表、Claude Code/Codex/CC Switch 配置与对账清单。TaoToke

Ceshi01的博客 7
上一篇: Hugging Face Trending:把 OpenRouter 用量榜首的模型指向 TaoToken
下一篇: Aider 实战:TaoToken 跑通一个小型 Python 仓库的 pytest 修复
ceshi01
博客等级 码龄18年 1粉丝 4603原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符  | 博主筛选后可见
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值