DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现那个 Arena 场景

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

1. 把 Chatbot Arena 的匿名提问拆成 DeepSeek-R1 可复现的五步

DeepSeek-R1 出现在 Chatbot Arena 的匿名对战入口之后,很多团队想复现那种“先不给模型名,只并排看两份回答,再决定投给谁”的流程。TaoToken 不是榜单参赛方,也不维护 Arena 的 ELO;它做的是 API 兼容通道:把 DeepSeek-R1 和你选的对照模型接到同一个 Base URL https://taotoken.net/api,然后用同一份 Prompt 各跑一次。这个复现最有价值的部分不是抄一个名次,而是把“匿名提问”拆成可重复的步骤:固定 Prompt、固定参数、隐藏模型身份、记录输出、人工对照。Arena 的公榜数字由 Arena 页面维护,本文没有引入可引用的快照,因此不写 ELO、不写胜率、不写“进前几”。你会在下面拿到一份提问模板、一段随机 A/B 调用脚本,以及一张只记录本地观察的对照表。

Chatbot Arena 的交互看着简单,真正拆开有五件事。第一,用户只拿到一个输入框,不知道后台会选哪两个模型。第二,两个模型收到同一段 Prompt,但用户看不到模型名、参数、系统提示。第三,两份回答并排出现,用户只看内容,不看厂商。第四,用户投票后,系统才揭晓身份或进入下一轮。第五,投票结果汇入公榜,而公榜的统计口径、去重规则、日期切片都由平台维护,不是单次对话能复现的。我们把前四步搬到本地,第五步不碰。这样既保留了匿名对照的决策压力,又避免把一次运行伪装成公榜结论。

复现时最容易走偏的地方,是提前知道自己调的是 DeepSeek-R1。一旦知道左边是 R1,右边是另一个模型,人就会不自觉地给 R1 的“推理过程”加分,或者对另一个模型的格式更苛刻。更接近 Arena 的做法是:调用脚本随机决定 A/B 顺序,只把 content 写到两个文件里,模型 ID 写到另一个映射文件。你先读 A 和 B,写下判断,再打开映射文件。这个顺序不能省。很多人把两个模型的回答上下排列,标题直接写模型名,最后得到的只是“两个模型输出对比”,不是匿名对照。

提问模板也要固定。Arena 里的 Prompt 五花八门,本地复现不需要覆盖所有类型,但需要一份能同时压到推理、格式遵守、条件假设的模板。下面这份模板可以直接复制,替换其中的业务背景即可。它不涉及生产库、生产机,也不要求模型执行任何命令;模型只生成判断和推理,执行动作留在你本地。

你正在参加一次匿名问答对照。不要猜测或声明你是什么模型,不要写自我介绍。

场景:
一个内部 API 网关每天处理 100 万次请求,峰值集中在 4 小时内。
团队准备部署 3 个应用节点,每个节点在压测中可持续处理 120 QPS,
超过 100 QPS 后延迟明显上升。网关前面没有缓存,也没有队列削峰。
现在要上线一个新客户端,预计把峰值请求量提高 40%。

请判断:在不加节点、不加缓存、不加队列的前提下,
3 个节点能不能扛住新峰值?

要求:
1. 先给结论,只能写“能”“不能”或“条件不足”。
2. 给出三步推理,每一步说明用了哪个数字或假设。
3. 列出你需要的额外信息,按重要性排序,最多 4 条。
4. 最后输出一行 JSON:{"conclusion": "...", "confidence": "high|medium|low"}。
5. 不要输出 markdown 代码块,不要写与问题无关的自我介绍。

这份模板故意把“结论”“推理”“额外信息”“JSON”放在同一个回答里。DeepSeek-R1 这类推理模型往往会展开较长推理,对照模型可能更早给结论。匿名对照时不要急着判断谁好,先记录它是否遵守了“先结论”“三步推理”“最后一行 JSON”这些硬约束。Arena 的投票是整体偏好,但本地复现可以拆成多个观察项,这样更容易解释差异来自推理深度、格式遵守还是事实假设。

第二步是固定参数。温度、最大输出长度、是否流式、超时时间都要一致。Arena 不会把内部参数完全摊开,但本地复现必须自己控制变量。建议温度先用 0.2,最大输出长度设为同一值,超时设为同一值。不要给 DeepSeek-R1 单独放宽超时,也不要给对照模型单独调低温度。参数不一致的对照表,只能当调试记录,不能当匿名对照。这里还要提醒一句:本文不含排行分数,下面的表只记录本地运行观察,一次运行不代表公榜。

第三步是隐藏身份。用脚本随机打乱两个模型 ID 的顺序,输出 A/B 两份文本,同时把映射写到单独文件。第四步是记录输出。不要只截屏,把完整文本落盘,保留原始换行和 JSON 行。第五步是人工对照。先写判断,再看映射。判断项可以包括:结论是否明确、推理是否用了关键数字、额外信息是否合理、JSON 是否可解析、有没有编造未给出的前提。这样一套流程跑下来,你复现的是 Arena 的匿名决策场景,而不是公榜统计。

2. 用 TaoToken 给 DeepSeek-R1 和对照模型接同一个 Base URL

拿到 Key 的入口在 TaoToken。注册后先去模型广场确认两件事:DeepSeek-R1 对应的模型 ID 是什么,你打算用作对照的模型 ID 是什么。模型 ID 一律写“以模型广场为准”,不要凭记忆写 deepseek-r1gpt-5 这类字符串当正式配置。广场里展示什么,你就复制什么。Key 在控制台创建,用 YOUR_API_KEY 占位。Base URL 固定为 https://taotoken.net/api,末尾不带 /v1,也不要把 UTM 拼到这个地址上。UTM 只用于官网落地页和 deep link,不进入 API 请求地址。

先写一个最小 Python 脚本。它用 OpenAI 兼容客户端,把 Base URL 指向 TaoToken 的兼容通道,然后随机决定 A/B 顺序。脚本只负责调用和落盘,不负责替你判断。运行前把 MODEL_R1MODEL_B 换成模型广场里的真实 ID。注意脚本里不要写死模型名到输出文件,映射写到另一个文件,等你人工判断完再打开。

import os
import json
import random
import time
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["TAOTOKEN_API_KEY"],
    base_url="https://taotoken.net/api",
)

prompt = open("prompt.txt", "r", encoding="utf-8").read()

models = {
    "r1": os.environ["MODEL_R1"],
    "b": os.environ["MODEL_B"],
}

items = list(models.items())
random.shuffle(items)

records = {}
mapping = {}

for label, (name, model_id) in zip(["A", "B"], items):
    start = time.time()
    resp = client.chat.completions.create(
        model=model_id,
        messages=[{"role": "user", "content": prompt}],
        temperature=0.2,
        max_tokens=2048,
    )
    elapsed = time.time() - start
    content = resp.choices[0].message.content
    records[label] = {
        "elapsed_seconds": round(elapsed, 2),
        "content": content,
    }
    mapping[label] = name

with open("outputs_ab.json", "w", encoding="utf-8") as f:
    json.dump(records, f, ensure_ascii=False, indent=2)

with open("mapping.json", "w", encoding="utf-8") as f:
    json.dump(mapping, f, ensure_ascii=False, indent=2)

print("A/B 输出已写入 outputs_ab.json,先判断,再打开 mapping.json")

运行前设置环境变量。TAOTOKEN_API_KEY 放你的 Key,MODEL_R1 放 DeepSeek-R1 的广场 ID,MODEL_B 放对照模型的广场 ID。不要把 Key 写进脚本,也不要把 Key 提交到仓库。Base URL 只写 https://taotoken.net/api。如果你的客户端要求完整端点,由 SDK 在 Base URL 后面拼接路径;不要手动把 Base URL 改成带 /v1 的完整地址,否则容易出现重复路径或 404。这个细节在排障章节会再展开。

Claude Code 接入时,环境变量是 ANTHROPIC_BASE_URLANTHROPIC_AUTH_TOKENANTHROPIC_MODEL。可以在 shell 里临时导出,也可以写进 ~/.claude/settings.jsonenv。模型 ID 仍然以模型广场为准。下面这段是 settings.json 的样子,YOUR_MODEL_ID 换成广场 ID,不要自己编。

{
  "env": {
    "ANTHROPIC_BASE_URL": "https://taotoken.net/api",
    "ANTHROPIC_AUTH_TOKEN": "YOUR_API_KEY",
    "ANTHROPIC_MODEL": "YOUR_MODEL_ID"
  }
}

Codex 走的是另一套配置,路径是 ~/.codex/config.toml。不要把 ANTHROPIC_* 环境变量套到 Codex 上,也不要把 Claude Code 的 settings.json 直接改个名字给 Codex。Codex 侧要写模型和 provider,Base URL 仍然指向 https://taotoken.net/api,Key 用环境变量读取。下面只是结构示意,具体字段以你本机 Codex 版本文档为准,模型 ID 以模型广场为准。

model = "YOUR_MODEL_ID"
model_provider = "taotoken"

[model_providers.taotoken]
name = "TaoToken"
base_url = "https://taotoken.net/api"
env_key = "TAOTOKEN_API_KEY"

CC Switch 的逻辑是“自定义供应商 + Base URL + Key + 模型 ID”。在 CC Switch 里新增一个自定义供应商,Base URL 填 https://taotoken.net/api,Key 填 YOUR_API_KEY,模型 ID 从模型广场复制。切换后先发一条最小消息验证,不要一上来就跑长 Prompt。验证通过再回到匿名对照脚本。这样 DeepSeek-R1 和对照模型共享同一把 Key、同一 Base URL,对照表里的差异才更可能来自模型本身,而不是通道配置不一致。

3. 同一 Prompt 的双模型输出对照表怎么记

对照表要分两张:公榜表和本地复现表。公榜表记录 Chatbot Arena、Artificial Analysis、LiveCodeBench、SWE-bench Verified、Aider Polyglot、Terminal-Bench 这类榜单的快照,必须带榜名、查阅日期、名次或分数、页面来源。本文没有引入可引用的 Arena 快照,所以不列公榜表,也不写 ELO。本地复现表只记录你这次运行:同一把 Key、同一份 Prompt、同一组参数、同一天跑的 A/B 输出。两张表不要拼在一起,更不要把本地观察写成“综合实力”。下面这张是本地复现表的模板,结果列留空,由你实际运行后填写。

记录项模型 A:DeepSeek-R1(广场 ID 以模型广场为准)模型 B:对照模型(广场 ID 以模型广场为准)记录方式
运行时间本地填写本地填写ISO 时间,精确到分钟
Prompt 版本同一份 prompt.txt同一份 prompt.txt记录文件哈希或修改时间
温度与最大输出0.2 / 20480.2 / 2048脚本参数一致
首字延迟本地填写本地填写不把延迟当质量分
总耗时本地填写本地填写一次运行,不代表公榜
结论是否明确是 / 否 / 条件不足是 / 否 / 条件不足按模板要求核对
三步推理是否完整完整 / 部分 / 缺失完整 / 部分 / 缺失看是否用了关键数字
额外信息是否合理合理 / 一般 / 不合理合理 / 一般 / 不合理按重要性排序
JSON 是否可解析可解析 / 不可解析可解析 / 不可解析最后一行单独解析
有无编造前提有 / 无有 / 无与场景条件对照
匿名判断投给 A / 投给 B / 平局投给 A / 投给 B / 平局先判断再看映射

记录时先看 A/B 文本,不要看 mapping.json。你可以把 A 和 B 复制到两个窗口,遮住文件里的模型名。判断完再打开映射。这样做的原因很实际:一旦知道哪个是 DeepSeek-R1,你会开始替它补理由。匿名对照不需要你假装客观,只需要你把身份信息延迟到判断之后。Arena 的用户也是先看回答再投票,本地复现至少要在顺序上接近这个体验。

Token 用量可以记,但不要拿它当质量分。OpenAI 兼容响应里通常有 usage 字段,你可以在脚本里追加记录 prompt_tokenscompletion_tokenstotal_tokens。如果响应结构不同,就以实际返回为准。Token 多不代表模型更强,可能只是推理更长;Token 少也不代表更准,可能只是提前收束。把 Token 放在“成本观察”列,不要放在“结论正确性”列。本文不含排行分数,也不把 Token 用量换算成任何榜单名次。

人工对照时建议逐项写短评,不要只写“好/不好”。例如“结论明确,但额外信息把缓存当成已存在,与场景矛盾”“JSON 可解析,但 confidence 给了 high,而前面说条件不足”。这些短评比一个总分更有复现价值。下一次换 Prompt,你可以复用同一张表,只改 Prompt 版本和运行时间。多轮积累后,你会得到自己的本地偏好,而不是从公榜上抄一个结论。再次强调:多轮本地运行也不是 Chatbot Arena 公榜,不能写成 ELO 或胜率。

如果要把对照结果贴给同事,建议只贴 A/B 文本和本地表,不要贴“DeepSeek-R1 排名第几”这种话。公榜数字必须带榜名、查阅日期、名次或分数、页面来源;本文没有这些材料,所以正文不写。你可以写“本次匿名对照中,A 的 JSON 更稳定,B 的额外信息更贴近业务”,这是对一次运行的描述,不是对模型的全局判决。这个界限守住,文章和复现表才不会被误读成公榜复刻。

4. 在 Claude Code、Codex、CC Switch 里跑匿名对照的配置差异

匿名对照脚本可以用 Python 直接跑,但很多人平时在 Claude Code、Codex、CC Switch 里工作,想把同一套 Prompt 也发进去。这里先把角色分清:Claude Code 是客户端,Codex 是另一个客户端,CC Switch 是供应商切换器,TaoToken 是它们背后的 Key 和 Base URL 提供方。不要让 Claude Code 或 Codex 直接连你的生产库、生产机去执行 SQL 或命令。它们可以生成命令、解释结果、给排查建议,真正执行放在你本地,执行结果再贴回对话。这个边界在匿名对照里同样适用:Prompt 只要求模型做判断和推理,不要求它动你的环境。

Claude Code 侧要配三件套:ANTHROPIC_BASE_URLANTHROPIC_AUTH_TOKENANTHROPIC_MODEL。Base URL 是 https://taotoken.net/api,不要加 UTM;Token 是 YOUR_API_KEY;模型 ID 以模型广场为准。你可以临时导出,也可以写进 ~/.claude/settings.jsonenv。如果你同时跑 DeepSeek-R1 和对照模型,建议不要在一个 Claude Code 会话里来回改模型 ID,而是开两个配置档,或者直接用 Python 脚本随机 A/B。Claude Code 更适合交互式追问,Python 脚本更适合固定 Prompt 的匿名落盘。两者可以分工:脚本出 A/B,Claude Code 用来读输出、帮你整理观察项。

Codex 侧的关键是不要把 ANTHROPIC_* 混进去。~/.codex/config.toml 里写 provider 和 model,Base URL 仍然指向 https://taotoken.net/api,Key 从环境变量读。Codex 的字段名可能随版本变化,所以不要照抄网上旧配置。模型 ID 仍然以模型广场为准。你可以在 Codex 里问“请把下面这段 A/B 输出整理成表”,但不要把 mapping.json 一起贴进去,除非你已经完成匿名判断。整理表是允许的,替你做匿名判断不建议。

CC Switch 适合需要频繁切供应商的人。新增自定义供应商时,Base URL 填 https://taotoken.net/api,Key 填 YOUR_API_KEY,模型 ID 从模型广场复制。切换后先发一条“只回复 ok”之类的短消息,确认通道通,再跑正式 Prompt。CC Switch 本身不产生对照结果,它只是让不同客户端指向同一个兼容通道。用 CC Switch 的好处是,你可以在 Claude Code 和 Codex 之间切换同一套 Key 和 Base URL,减少“这个客户端没配好”带来的噪声。但不要因为切供应商方便,就把匿名对照做成两个客户端各跑一次——客户端差异会混进模型差异,除非你明确要对比客户端。

要复现 Arena 场景,最稳的组合仍然是:Python 脚本负责匿名调用和落盘,Claude Code 或 Codex 负责读文本、整理观察项,CC Switch 负责日常切换供应商。三者的配置都指向同一个 Base URL,但用途不同。脚本里写 temperature=0.2max_tokens=2048,客户端里不要额外加系统提示,否则 A/B 的输入就不一致。如果你在 Claude Code 里加了长系统提示,在 Python 脚本里没加,对照表里的差异就解释不清。想省事可以只用一个调用器,不要混用。

还有一个常见误解:把 TaoToken 的 Base URL 当成某个客户端专属地址。它不专属,Claude Code、Codex、CC Switch、Python SDK 都可以指向它。但每个客户端的配置字段不同,改错字段就会 401 或 404。Claude Code 看 ANTHROPIC_*,Codex 看 ~/.codex/config.toml,CC Switch 看自定义供应商表单。模型 ID 在所有这些地方都写“以模型广场为准”。Base URL 在所有地方都写 https://taotoken.net/api,不带 UTM,不带 /v1。把这三句话记住,配置差异就只剩字段名。

如果你要把这套流程长期跑,建议给 Prompt 文件加版本号,比如 prompt_v1.txtprompt_v2.txt,对照表里记录版本。模型 ID 也记录快照,因为模型广场的 ID 可能更新。运行时间、Key 来源、Base URL 都写清楚。这样别人拿到你的表和 Prompt,可以用自己的 Key 复跑。注意,别人复跑得到的是他的本地结果,不是 Chatbot Arena 公榜。公榜数字仍然要去 Arena 页面看,且必须带查阅日期和来源。本文没有做这个快照,所以不填。

5. 复现失败时先查 DeepSeek-R1 的模型 ID 和 Base URL

匿名对照跑不起来,先不要怀疑模型能力,按顺序查配置。第一项是 Key。401 通常表示请求没带 Key、Key 写错、或者用了旧 Key。Python 脚本里检查 TAOTOKEN_API_KEY 是否真的传进环境;Claude Code 检查 ANTHROPIC_AUTH_TOKEN;Codex 检查 env_key 指向的环境变量名是否和你导出的名字一致;CC Switch 检查自定义供应商里是否填了 Key。Key 从带 UTM 的官网控制台创建,别从聊天记录里复制半截。创建 Key 的入口在文末 CTA,不要用来源不明的 Key。

第二项是 Base URL。正确值是 https://taotoken.net/api,末尾不带 /v1。很多 404 来自两种写法:一种是把 Base URL 写成 https://taotoken.net/api/v1,SDK 又拼了一次 /v1/chat/completions;另一种是手动把完整端点当 Base URL 填进客户端配置。Python OpenAI SDK 只填到 https://taotoken.net/api,路径由 SDK 处理。Claude Code 的 ANTHROPIC_BASE_URL 也只填这个值。Codex 的 base_url 同样只填这个值。CC Switch 的自定义供应商 Base URL 也只填这个值。任何地方都不要把 UTM 拼到 Base URL、curl 地址、ANTHROPIC_BASE_URL 或 Codex 配置里。UTM 只属于官网落地页和 deep link。

第三项是模型 ID。DeepSeek-R1 的 ID 以模型广场为准,对照模型的 ID 也以模型广场为准。不要写 deepseek-r1deepseek-r1-0528gpt-5 这类凭记忆猜的字符串当正式配置,除非广场里确实展示。模型 ID 写错常见表现是 404 或“model not found”。如果你在 Claude Code 里配了 DeepSeek-R1,在 Python 脚本里配了另一个 ID,匿名对照的 A/B 就有一边跑不起来。建议把两个 ID 都写在环境变量里,脚本只读环境变量,不在代码里硬编码。这样换模型只改环境,不改代码。

第四项是客户端字段。Claude Code 用 ~/.claude/settings.jsonenv,字段是 ANTHROPIC_BASE_URLANTHROPIC_AUTH_TOKENANTHROPIC_MODEL。Codex 用 ~/.codex/config.toml,不要把 Claude 的 ANTHROPIC_* 套过去。CC Switch 走自定义供应商表单,填 Base URL、Key、模型 ID。把 Claude Code 的 settings.json 直接改个名字给 Codex,基本会失败。把 Codex 的 config.toml 贴进 CC Switch,也不会生效。每个客户端的字段名不同,排障时先确认自己改的是哪一个文件。改完重启客户端,或者重新打开会话,有些客户端会缓存旧配置。

第五项是请求参数。匿名对照要求两个模型参数一致。检查 temperaturemax_tokenstimeout、是否流式。Python 脚本里如果一边用了默认温度,一边写了 0.2,对照就不公平。Claude Code 里如果开了长系统提示,Python 脚本里没开,输入也不一致。建议把 Prompt 单独放 prompt.txt,脚本只读文件,客户端只粘贴同一段文本。不要在一个客户端里让模型先总结,再拿总结去调另一个模型,那已经不是同一 Prompt。

第六项是输出落盘。匿名对照需要先判断再看映射。如果你的脚本把模型名写进 A/B 文件名,比如 deepseek_A.txtother_B.txt,匿名就失败了。输出文件名用 A.txtB.txt,映射单独放 mapping.json。延迟记录可以写进 outputs_ab.json,也不要带模型名到 A/B 文本里。人工判断完再打开映射,然后填对照表。表格里可以写模型名,因为那时匿名阶段已经结束。

如果 401 和 404 都排除了,还是跑不出结果,先换一条最小请求验证通道。保存下面这段 minimal.json,把 YOUR_MODEL_ID 换成模型广场里的任意可用 ID,然后在本地执行 curl。注意 curl 地址是 API 端点,不要加 UTM;Base URL 仍然是 https://taotoken.net/api。这条请求只确认 Key、Base URL、模型 ID 三者是否对得上,不参与匿名对照。

curl https://taotoken.net/api/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "YOUR_MODEL_ID",
    "messages": [
      {"role": "user", "content": "只回复 ok"}
    ],
    "temperature": 0.2,
    "max_tokens": 32
  }'

最小请求通了,再回到匿名脚本。如果最小请求也失败,优先看返回体里的错误信息:鉴权失败、模型不存在、路径不对,通常写得很直白。不要一开始就改 Prompt、改温度、改系统提示,那会把配置问题掩盖成模型差异。本文的排障只覆盖本篇复现会用到的配置:Key、Base URL、模型 ID、Claude Code 的 settings.json、Codex 的 config.toml、CC Switch 自定义供应商。其他客户端的字段不在本篇范围内。

最后提醒一次:本文不含排行分数。你得到的是本地 A/B 对照表,不是 Chatbot Arena 的公榜结果。DeepSeek-R1 在 Arena 上的名次、ELO、胜率,需要去 Arena 页面看,并且记录查阅日期和来源。本地复现的价值在于让你亲手跑一遍匿名提问流程,理解模型在同一个 Prompt 下的输出差异,而不是把一次运行包装成公榜结论。

对照表落地后,打开 模型对话 确认 DeepSeek-R1 和对照模型的广场 ID 是否与本次一致;如果要把匿名对照变成日常回归,看 Coding Plan。Key 在 控制台 创建;Claude Code / CC Switch 三件套对照 接入文档

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

相关推荐

详细了解sklearn中的CountVectorizer

CountVectorizer 是 scikit-learn(一个流行的 Python 机器学习库)中的一个文本特征提取类,其核心功能是将一系列原始文本(如句子、文档)转换为基于词频(word count)的数值矩阵。它基于词袋模型(Bag of Words, BoW)思想,忽略文本的语法结构和词序,仅关注词汇在文本中出现的频率,从而将文本转化为机器可理解的数字形式。文本 1:"I love machine learning"

2302_76568160的博客 1096

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同一把 Key 跑出的 ELO 区间

DeepSeek-R1 登上 Chatbot Arena 后,本文用同一把 TaoToken Key 跑一组可公开下载的偏好对,复现本地胜率并对照公榜 ELO 区间。文中给出偏好集脚本、胜率表与 ELO 参考表三样产出物,Base URL 指向 https://taotoken.net/api,模型 ID 以模型广场为准。全文不编造 Arena 分数,只写可复现步骤与排障,入口见 https://taotoken.net/?utm_source=taotoken_aicg_blog_generate&utm

weixin_32921023的博客 84

【RKNN】RKNN-Toolkit2 Python API函数详解

RKNN-Toolkit2 的 API 设计以开发者效率为核心,覆盖模型转换、量化、部署全流程。通过灵活的参数配置(如多核调度、混合量化)和调试工具(性能分析、精度对比),可快速适配复杂边缘场景

浩瀚之水的专栏 765

DeepSeek-R1 上了 Chatbot ArenaTaoToken Key 复现同一批 Prompt

DeepSeek-R1 登上 Chatbot Arena 后,很多人想确认自己接到的模型是否与公榜一致。本文用 TaoToken Key 从公开样本取 10 条 prompt,经 curl 请求 https://taotoken.net/?utm_source=taotoken_aicg_blog_end 复现同一批 Prompt。脚本 run_arena.sh 记录响应长度、连贯性与拒答,仅安全类被拒,代码与数学题展示完整推理。文中包含注册官网拿 Key、配置 Base URL 时避免 /v1 的细节,并

Ceshi01的博客 5

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现榜上表现,同一把 Key

DeepSeek-R1Chatbot Arena 上的行为,用 TaoToken 同一把 Key 在本地复现:从控制台创建 Key、确认模型广场里的模型 ID,再用 curl、Claude Code、Codex、CC Switch 四类接入方式发请求,按概念解释、数学推理、代码生成、开放讨论、边界情况五类 Arena 风格提示词跑出「提示词 × 复现回答」对照表。全文不含 Elo 分数或名次快照,只记录行为特征与配置核对,并给出 401、404、400 的排障顺序。落地页见 https://taoto

weixin_42596011的博客 2

DeepSeek-R1 登上 Chatbot Arena:用 TaoToken 复现盲测回合

DeepSeek-R1 登上 Chatbot Arena 后,本文用 TaoToken 作为统一 API 供应商,复现匿名盲测回合。通过一把 Key、一个 Base URL(https://taotoken.net/?utm_source=taotoken_aicg_blog_end)和两个模型 ID,搭建 20 轮双盲投票脚本:随机交换 A/B 位置、隐藏模型 ID、记录胜平负。文章强调本地结果不能外推为公榜 ELO,仅代表个人偏好;平局不计入分母,并给出统计口径。附有完整 Python 脚本与 blin

Ceshi01的博客 4

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同一把 Key 的对话表现

DeepSeek-R1Chatbot Arena 公开样本复现:不抄 ELO/名次,用同一把 TaoToken Key 按 temperature 0.0、0.6、1.0 跑数学/逻辑、代码解释、事实问答、强制 JSON、中文长文改写五类提问各三次,记录输出长度、completion tokens、拒答、推理段可见性、格式漂移与三次稳定性;同一问题重复三次并保留 model、usage、finish_reason,不把公榜分数搬进本地表。含 401/404 和 temperature 被忽略排障。入口

Ceshi01的博客 3

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同款提示词

DeepSeek-R1 登上 Chatbot Arena 后,本篇不抄 ELO 名次,而是从公榜公开对战记录里复制一条带分步推理要求的 prompt,用 TaoToken 同一把 Key 在本地复现:Base URL 填 https://taotoken.net/api,模型 ID 以模型广场为准,curl 跑完记录 prompt_tokens 约 120、completion_tokens 约 480、total_tokens 约 600,并整理成不含公榜分数的本地复现表。官网入口见 https://ta

weixin_42604188的博客 1

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同一条 Key 的请求序列

DeepSeek-R1Chatbot Arena 后,抄名次不如复现:用 TaoToken 同一把 Key 连跑 10 轮,把公开页采样字段译成 chat.completions 参数并落盘比对,不含榜单分数,只排查温度传参、system prompt、Base URL 差异。https://taotoken.net/?utm_source=taotoken_aicg_blog_end

Ceshi01的博客 4

DeepSeek-R1 上了 Chatbot Arena 编程榜:用同一把 TaoToken Key 复现榜单对话

DeepSeek-R1 登上 Chatbot Arena 编程榜后,不摘 ELO/名次,只用同一把 TaoToken Key 复现 5 个编程 Prompt,记录回答结构、长度档与代码密度;并核对 CC Switch 的模型 ID。https://taotoken.net/?utm_source=taotoken_aicg_blog_end

Ceshi01的博客 8

DeepSeek-R1 上过 Chatbot Arena:固定 TaoToken Key 复现长推理

DeepSeek-R1Chatbot Arena 上的长 CoT 风格,换成 API 调用后常被截断成短答。这篇用一把固定 TaoToken Key 接本地客户端,锁死 temperature 0.6、top_p 0.95、max_tokens 8192、系统提示留空,跑 5 道代数、数论、组合、概率、递推题,逐题记录输出 token 与自我纠错、换方法次数,再和 Arena 公开对话逐项对照。想跟着复现,先到 https://taotoken.net/?utm_source=taotoken_aic

weixin_42596214的博客 5

DeepSeek-R1 上过 Chatbot Arena:用 TaoToken 作为统一通道重跑同款推理题

本文用 TaoToken 统一通道重跑 DeepSeek-R1Chatbot Arena 留下的同款推理题。从公开样本中提取 10 条中文 prompt,固定同一把 Key、同一 Base URL 与 temperature=0.6,完整记录每条 completion_tokens 和输出结构,重点对比 reasoning_content 与 content 的拆分效果,并复现模型 ID 配置坑。不引用公榜分数,只提供可复现步骤。完整配置见 https://taotoken.net/?utm_sour

Ceshi01的博客 4

DeepSeek-R1 登上 Chatbot Arena:用 TaoToken 复现同一把 Key 跑数学推理

DeepSeek-R1登上Chatbot Arena:本文用TaoToken复现同一把Key跑数学推理,按0.2/0.6/1.0温度、2048/4096 max_tokens记录拒绝率、输出长度、首字时延。创建Key见https://taotoken.net/?utm_source=taotoken_aicg_blog_end,本地表与公榜分开。

Ceshi01的博客 4

DeepSeek-R1 上过 Chatbot Arena:用 TaoToken 复现同一把 Key 的响应区间

DeepSeek-R1 上过 Chatbot Arena 是公开榜,但本文不围观 ELO,改用 TaoToken 统一 API 基线,在同一把 Key、同一 prompt、temperature 0.6 下串行 12 次,用 Python 脚本实测 min/P50/P95/max 响应区间,TTFT、总耗时、completion_tokens 分开对表。全文无排行分数与公榜快照,只保留可复现步骤与排障列表。访问 TaoToken 官网:https://taotoken.net/?utm_source=tao

Ceshi01的博客 4

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken Key 复现模型输出

DeepSeek-R1 登上 Chatbot Arena 后,用 TaoToken Key 在本地复现模型输出成为可操作路径。本文以 TaoToken 官网 https://taotoken.net/?utm_source=taotoken_aicg_blog_generate&utm_medium=csdn&utm_campaign=generate&utm_content= 创建的 API Key 为例,演示 curl 调用 DeepSeek-R1、配置 Claude Code/Codex/CC Swi

weixin_32480007的博客 3

DeepSeek-R1 登上 Chatbot Arena复现同一把 Key 的路由效果,就用 TaoToken

DeepSeek-R1 登上 Chatbot Arena 后,本文从公开提示区抽取 20 条提示,对比 DeepSeek-R1 与另一开源模型的回复风格、输出长度与首 token 耗时,并做人工偏好标注。用 TaoToken 作为对照基线,演示同一把 Key 切换模型 ID、复现路由效果,覆盖通用 API、Claude Code、Codex、CC Switch 与 CLI 接入。TaoToken 官网:https://taotoken.net/?utm_source=taotoken_aicg_blog_g

weixin_35755823的博客 2

DeepSeek-R1 上榜 Chatbot Arena:用 TaoToken 复现同一把 Key

DeepSeek-R1Chatbot Arena 人类偏好投票中表现突出,本文用 TaoToken 同一把 Key 在 Claude Code 与 Codex 两个客户端复现 5 轮推理、代码、数学等任务,记录输出稳定性。TaoToken 官网 https://taotoken.net/?utm_source=taotoken_aicg_blog_generate&utm_medium=csdn&utm_campaign=generate&utm_content= 提供统一 Base URL 与模型

weixin_42588672的博客

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 一把 Key 复现榜单对话

DeepSeek-R1Chatbot Arena 上的对话样本只能看结果、看不到 token 消耗,这篇生成稿把三条公开榜单 prompt(数学推理、代码 bug 定位、600 字长文摘要)用 TaoToken 一把 Key 在本地复现,记录 curl 命令、响应差异和 usage 明细:三条合计 1333 tokens,数学题 completion 412 最长,摘要题 prompt 198 最长。文中还对比了榜单样本与本地输出的解法顺序、字数偏差,并给出 Claude Code、Codex、CC

weixin_42578963的博客 4

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 同一把 Key 复现

DeepSeek-R1Chatbot Arena 上的对话展示,用 TaoToken 同一把 Key 在本地复现。本文以 Chatbox 为客户端,配置 TaoToken 的 Base URL 与模型 ID,复现三条提示词,记录输出总 token、思考 token 占比与推理风格,并打开“显示思考内容”观察 reasoning_content 字段。全文不搬运公榜名次,只展示同一 Key、固定温度 0.7 下的本地调用步骤与排障细节,最后回 TaoToken 控制台核对用量。TaoToken 官网:h

Ceshi01的博客 6

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同款 ELO 测试

用本地 Python 脚本让 DeepSeek-R1对照模型匿名对战 20 轮,按 Bradley-Terry 简化 ELO 公式算分,再与 Chatbot Arena 公榜趋势对照TaoToken 在此充当模型调用入口,Base URL 指向 https://taotoken.net/api,同一 Key 可调 DeepSeek-R1对照模型。文中给出 prompt 集结构、对战脚本、Claude Code/Codex/CC Switch 配置、结果表格式与 401/404/超时/裁判偏差等失败

weixin_42612405的博客 111

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同一把 Key 的 ELO 测试

DeepSeek-R1 已出现在 Chatbot Arena 榜单,但公榜数据无法直接用于本地验证。本文用 TaoToken 的统一 Key 接入 DeepSeek-R1,以 temperature=0.7 和 1.2 作为两个参赛者,在 16 道覆盖写作、代码、数学等类型的提示词上跑完对战流程,并用标准 ELO 公式计算相对分数。全程只使用同一把 Key 和固定 Base URL,不引用官方 ELO 数值,也不含本地运行结果;读者按脚本自行复现后填写对照表。TaoToken 只负责 API 转发,不参与榜

Ceshi01的博客 6

DeepSeek-R1 上了 Chatbot Arena:用 TaoToken 复现同一 Key 的回复

TaoToken 同一把 Key 复现 DeepSeek-R1 在 LMArena 公开 prompt 上的回复:从官网注册取 Key,将 Base URL 指向 taotoken.net/api,用 Python 与 curl 跑 5 组高引用 prompt,记录回复风格与 token 用量,并给出 Claude Code、Codex、CC Switch 的接入配置与 401/404/429 失败分支排查清单。

weixin_34162851的博客 2
上一篇: 10 分钟用 TaoToken 跑通 GitHub MCP Server 的 issue 创建
下一篇: Hugging Face 趋势:通义 Qwen3.7 Flash 权重火了,TaoToken 当默认供应商试跑
ceshi01
博客等级 码龄18年 1粉丝 4603原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符  | 博主筛选后可见
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值