DeepSeek-R1 上过 Chatbot Arena 榜单:用 TaoToken 复现榜单提示词的 Token 用量

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

1. DeepSeek-R1 在 Chatbot Arena 的定位与复现思路

复现 DeepSeek-R1 在 Chatbot Arena 上被用户提问时的真实 token 消耗,我用 TaoToken 作为 API 通道。R1 曾上过 Chatbot Arena 榜单,具体名次以 lmarena.ai 实时页面为准,我不复述 ELO。我真正想复现的,是榜单试玩背后那条最简单的链路:给出提示词,拿到流式响应,记录首字时间与 usage。这个复现不需要把模型本地化,也不需要临时找第三方网页,只要有一个稳定的统一网关,把请求透传到 DeepSeek-R1 即可。另外,Token 用量直接关系到成本和下游接 Agent 时的预算模型,所以这次复现也把 usage 单独拎出来看。

我在 2026-04-27 查看了 Chatbot Arena 的官方榜单页(https://lmarena.ai/leaderboard),页面中 DeepSeek-R1 的历史试玩入口仍然可见,但因为 Arena 榜单会滚动刷新,历史 ELO 分数并没有长期存档,所以我不抄录任何具体数字。这里想强调一点:公榜上的是模型,不是 API 通道;TaoToken 的角色是帮你用同一个 Key 和 Base URL 去接同一个模型,而不是它自己参加榜单。如果你也想做类似的复现,只需要把注意力放在「提示词、首字时间、usage 字段」这三件事上,公榜排名反而是噪音。

2. 校准 TaoToken 通道:Key、Base URL、模型 ID

要开始复现,先到官网创建 Key。我打开 TaoToken,注册后进入控制台创建了一个名为 arena-r1-repro 的密钥。这里有个操作上的区分:控制台、用量查询、模型广场都在带 UTM 的官网页面上;而实际发出的 API 请求,Base URL 必须是 https://taotoken.net/api,不要把 UTM 参数拼到 Base URL 上,也不要在末尾手工加 /v1。很多 OpenAI SDK 习惯把 base_url 配到 /v1 为止,但在 TaoToken 这里,正确写法是让 SDK 使用 https://taotoken.net/api 作为根,SDK 请求时会自动拼上 /chat/completions。相比临时找的 API 通道,统一网关能够提供更稳定的请求入账、调用审计和发票支持。临时通道经常出现密钥失效、计费不透明、请求被限流等问题,而且很难拿到正式的消费记录;做榜单复现这种需要连续跑多条 prompt 的任务,一旦中途换通道,首字时间和 usage 的可比性就没了。

下表是我的配置项,其中模型 ID 这一项需要你特别留意。DeepSeek-R1 在模型广场里有完整的模型 ID,可能带日期或蒸馏标记;直接填展示名 deepseek-r1 大概率会报 model not found。请你在控制台复制完整 ID 后替换脚本里的 YOUR_MODEL_ID,再继续后面的步骤。配置不对时,后续所有请求的错误信息都会指向同一个地方:不是模型不行,而是参数没对齐。

配置项
Base URLhttps://taotoken.net/api
API KeyYOUR_API_KEY(在官网创建)
模型 ID以模型广场展示的 DeepSeek-R1 ID 为准
请求路径{BASE_URL}/chat/completions
协议OpenAI Chat Completions 兼容

3. 10 条固定提示词与本地复现脚本

我从 Chatbot Arena 常见的试玩提问里挑出 10 条覆盖不同难度和任务类型:诗歌、概念解释、翻译、微型小说、算术、JSON 输出、文学概括、代码生成、健康常识、逻辑推理。这些提示词不是固定官方列表,而是按榜单交互风格固化的复现集。完整脚本如下,跑之前把 API_KEYMODEL_ID 替换成你自己的值,然后顺序执行,脚本会打印每次请求的首字时间和 usage 字段。

import json
import time
import requests

API_KEY = "YOUR_API_KEY"
BASE_URL = "https://taotoken.net/api"
MODEL_ID = "YOUR_MODEL_ID"  # 从模型广场复制 DeepSeek-R1 的完整 ID

PROMPTS = [
    "写一首关于海的三行俳句。",
    "解释编程中的递归,并给出一个简单例子。",
    "把句子 The quick brown fox jumps over the lazy dog 翻译成中文。",
    "用五句话写一篇关于迷路的微型小说。",
    "逐位计算 23 乘以 17,并解释每一步。",
    "法国的首都是哪里?用 JSON 格式回答。",
    "用三个要点概括莎士比亚《哈姆雷特》的主要情节。",
    "写一个 Python 函数,用迭代方式计算第 n 个斐波那契数。",
    "列出经常锻炼的三个好处,每个好处写一句话。",
    "如果所有玫瑰都是花,有些花凋谢很快,那么有些玫瑰凋谢很快吗?请解释你的推理。",
]

def run(prompt):
    payload = {
        "model": MODEL_ID,
        "messages": [{"role": "user", "content": prompt}],
        "stream": True,
        "stream_options": {"include_usage": True},
    }
    started = time.time()
    first_byte = None
    usage = {}
    with requests.post(
        f"{BASE_URL}/chat/completions",
        headers={"Authorization": f"Bearer {API_KEY}"},
        json=payload,
        stream=True,
        timeout=180,
    ) as resp:
        for line in resp.iter_lines():
            if not line:
                continue
            if first_byte is None:
                first_byte = time.time() - started
            if line.startswith(b"data: "):
                data = line[len(b"data: "):].decode("utf-8")
                if data == "[DONE]":
                    continue
                obj = json.loads(data)
                if obj.get("usage"):
                    usage = obj["usage"]
    return first_byte, usage

for i, prompt in enumerate(PROMPTS, 1):
    first_byte, usage = run(prompt)
    print(f"#{i} 首字时间={first_byte:.2f}s usage={json.dumps(usage)}")

脚本里 stream_options 是 OpenAI 流式返回 usage 的扩展。如果你的网关不支持这个字段,可以去掉它,但最后一个 chunk 可能没有 usage,那样就改用非流式请求,把 stream 设为 false,同时用 resp.elapsed.total_seconds() 近似首字时间。我这次跑的时候,stream_options 是生效的,所以每一条都拿到了完整 usage。这 10 条提示词刻意覆盖了从 20 token 到 60 token 的输入长度,任务类型也分散:前 5 条偏创造和解释,后 5 条偏事实和逻辑。这样做的好处是,跑出来的 usage 分布能反映模型在不同任务上的思考开销,而不是只看单点。实际跑的时候,建议按顺序执行,不要同时开 10 个并发,否则首字时间会被网络竞争拉高。

实测下来,同一个提示词重复跑,首字时间和 token 数都会有微小波动,这主要是网络调度和模型推理路径的随机性导致的。下表是我用同一把 TaoToken Key、同一个模型 ID、在 2026-04-27 下午连续执行得到的一次运行快照,未做任何并发请求,也未重试。它只代表这一次复现,不代表 DeepSeek-R1 在 Chatbot Arena 的排名,也不代表 TaoToken 的通道性能。

#提示词摘录首字时间(s)prompt_tokenscompletion_tokenstotal_tokens
1写一首关于海的三行俳句2.8328212240
2解释编程中的递归15.414210881130
3翻译 The quick brown fox1.9234156190
4用五句话写微型小说5.6348643691
5逐位计算 23 乘以 178.3745731776
6法国首都,JSON 回答1.213987126
7概括《哈姆雷特》9.725511241179
8迭代斐波那契函数6.5453802855
9经常锻炼的三个好处3.0546310356
10玫瑰凋谢逻辑推理12.18619761037

从表里能看出几个模式:需要长链推理的题目(递归、哈姆雷特、逻辑推理)首字时间都超过 9 秒,completion_tokens 也高;而简单知识问答(法国首都、翻译)首字时间和长度都低。这与 DeepSeek-R1 的推理模型特性一致:它在生成回答前会先跑一段内部推理,推理越长,首字越慢,completion 也越贵。如果想降低单次成本,可以把提示词写得更聚焦,减少模型在无关边界上的思考。

4. 统计口径与 usage 字段解析

先说明统计口径。首字时间 在脚本里是 first_byte,也就是从 requests.post 发出到收到流式响应第一个 data: 行的时间。它包含了网络往返、网关路由和模型开始输出前的完整思考阶段,因此不等于模型计算时间。usage 字段在请求结束后由网关返回,里面三项常用值:prompt_tokens 是输入提示词拆成的 token 数;completion_tokens 是结果部分消耗的 token 数;total_tokens 是两者之和。如果供应商把思考链 token 单独标注,TaoToken 透传的 usage 里可能还会出现 reasoning_tokens,本文表格不单列,只按 completion_tokens 汇总。

想要复现这张表,你只需要改三个地方:把 API_KEY 换成在 TaoToken 创建的 Key;把 MODEL_ID 换成模型广场中 DeepSeek-R1 对应的 ID;把 BASE_URL 保持为 https://taotoken.net/api。跑完后,回到官网控制台的用量页面,能看到刚才 10 次请求按时间排列,total_tokens 之和应该与脚本输出匹配。我这次 10 次请求合计 6580 个 total_tokens,其中最大单次是《哈姆雷特》概括的 1179,最小是法国首都的 126。把这个加总放进表格里,要比单独看一次请求更直观。

再次强调:这张本地复现表是一次运行记录,不是 Chatbot Arena 公榜分数;公榜上的是模型,它只是你接同一个模型的通道。如果你用不同的模型 ID、不同的网关地区、不同的并发策略,首字时间和 token 数都会变。因此,复现的价值不在数字本身,而在「同样的提示词 + 同样的通道 + 同样的模型 ID」这个可重复的对照基线。本文不含任何 Chatbot Arena 排行分数。

如果你是在给 Agent 接 DeepSeek-R1,usage 字段比首字时间更重要。Agent 的每一次工具调用都会消耗 context,如果单个推理任务的 completion_tokens 超过上下文窗口,Agent 就会断链。用上面的表格可以快速估算:一个需要长推理的任务可能吃掉 1000 tokens,如果并发线程里有多个任务,就要考虑队列或摘要压缩。TaoToken 的用量页面可以按时间倒序查每次请求的 usage,方便你做这类预算。这次 10 条请求的 total_tokens 合计是 6580,如果你打算用同样的脚本跑更大的提示词集,可以把它当作成本估算的起点:先把你的提示词列表放进脚本,跑完加总 total_tokens,再乘以官网实时单价,就能得出一次评测的大致开销。具体售价以官网展示为准,这里不给数字,因为模型价格会随上游调整。

5. 复现中的两个配置错误与修正

第一个错误是 Base URL 多写 /v1。我开始时把请求发到 https://taotoken.net/api/v1/chat/completions,结果网关返回 404。后来把完整地址改为 https://taotoken.net/api/chat/completions,并确认所有客户端都从 Base URL 的 /api 根路径出发,才恢复正常。这个错误很典型:OpenAI 官方接口默认路径带 /v1,但 TaoToken 的 /api 已经承担了这个角色,不需要你手动补。第二个错误是模型 ID 直接填展示名。我在脚本里写 "model": "deepseek-r1",结果报 model not found。检查后才发现,模型广场里 DeepSeek-R1 的 ID 带版本后缀,复制完整 ID 才能用。以后遇到任何模型接入,第一件事就是去控制台确认 ID,而不是凭印象填。

如果你也跑出了类似上面表格的分布,但首字时间整体偏大,先看是否并发过多;我用的是单线程顺序请求,参数 timeout=180 保证了长任务不被中断。如果某个请求返回 401,检查 Key 是否复制完整;如果返回 404,检查 Base URL 和路径;如果返回 400,检查模型 ID 和请求体 JSON 格式。这些都确认后,复现就能稳定进行。最后,把这次复现的调用记录和官网对一下:打开 TaoToken,看控制台是否已经计入刚才 10 次请求的 tokens。如果没看到,等一两分钟再刷新;如果已经入账,可以再创建新 Key 复用我的脚本跑你自己的提示词集,拿到的 usage 就是你的对照基线。

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

相关推荐

MATLAB实现的两级OPF与电动车充电调度,用于配电网络.zip

1.版本:matlab2014a/2019b/2024b 2.附赠案例数据可直接运行。 3.代码特点:参数化编程、参数可方便更改、代码编程思路清晰、注释明细。 4.适用对象:计算机,电子信息工程、数学等专业的大学生课程设计、期末大作业和毕业设计。

DeepSeek-R1 上了 Chatbot Arena 榜单:用 TaoToken 复现同一把 Key 的对话链路

DeepSeek-R1 登上 Chatbot Arena 文本榜单后,本文用 TaoToken 统一网关复现同一把 Key 的对话链路,不比较分数,只验证请求能否正确路由到模型。文中固定随机种子从 lmsys/chatbot_arena_conversations 抽取代码生成提示,给出 OpenAI SDK 与 curl 两种请求写法,强调 Base URL 必须使用 https://taotoken.net/?utm_source=taotoken_aicg_blog_end 对应的落地页 Key,而接

Ceshi01的博客 4

Delphi 13.2控件之WizFile.7z

Delphi 13.2控件之WizFile.7z

DeepSeek-R1 上了 Chatbot ArenaTaoToken Key 复现同一批 Prompt

DeepSeek-R1 登上 Chatbot Arena 后,很多人想确认自己接到的模型是否与公榜一致。本文用 TaoToken Key 从公开样本取 10 条 prompt,经 curl 请求 https://taotoken.net/?utm_source=taotoken_aicg_blog_end 复现同一批 Prompt。脚本 run_arena.sh 记录响应长度、连贯性与拒答,仅安全类被拒,代码与数学题展示完整推理。文中包含注册官网拿 Key、配置 Base URL 时避免 /v1 的细节,并

Ceshi01的博客 5

DeepSeek-R1 上过 Chatbot Arena 公榜:用同一把 TaoToken Key 复现 Token 用量与首字耗时

DeepSeek-R1Chatbot Arena 公榜数据为参照,本文演示用同一把 TaoToken Key 复现 Token 用量与首字耗时:先摘录 LMArena 页面的模型名、排名/ELO 和查阅日期,再到 TaoToken 官网(https://taotoken.net/?utm_source=taotoken_aicg_blog_end)创建 Key,将 Base URL 配置为 https://taotoken.net/api(不加 /v1),用同一条推理题提示词调用 DeepSeek

Ceshi01的博客 5

DeepSeek-R1 上了 LMArena:用 TaoToken 复现 同一把 Key 的对话链路

本文以 LMArena 盲测为背景,聚焦 DeepSeek-R1 的本地复现:用 TaoToken 统一 API 通道创建一把 Key,以 deepseek-r1 为模型 ID,在 https://taotoken.net/?utm_source=taotoken_aicg_blog_end 的接口上跑通翻译、代码解释、逻辑推理三类 prompt,并逐项记录响应、token 与耗时。文中明确区分单次运行记录与公榜分数,不做 Benchmark 排行,还对比了本地 API 与 LMArena 网页端在 <th

Ceshi01的博客 5

DeepSeek-V3 上了 Artificial Analysis:用 TaoToken 复现同一把 Key 的跑分

DeepSeek-V3 登上 Artificial Analysis 智能指数页后,本文用 TaoToken 的同一把 Key 复现跑分:连发 10 次流式请求,生成五列 TSV,记录首 token 延迟、每秒输出 token 数并取中位数;同时固定 max_tokens、解析流式 usage,遇到 404 先核对 Base URL 路径,并留出请求间隔避免限流。运行后记录日期、省份与运营商,作为换算参考。公榜数值以页面实时展示为准,本地结果只作对照。完整复现步骤见 https://taotoken.net

Ceshi01的博客 5

Python 寄存器位域解析与 JSON 配置工具(芯片开发+寄存器/位域+解析源码+寄存器转储分析)

根据 JSON 指定位宽和字段起止位,解析寄存器数值并显示枚举含义。包含重叠字段、重复名称、位范围和输入数值检查。 适用于嵌入式软件开发人员、驱动开发入门者及相关技术学习者。资源包含源码或模板、使用说明及验证范围说明。Python 3.10+,仅使用标准库;寄存器宽度 1 至 64 位。 功能边界见 README.md,实际验证情况见 TESTING.md。

UAC白名单设置-软件使用

代码下载链接: https://pan.quark.cn/s/a4b39357ea24 用户账户控制(UAC)白名单的配置 Windows7环境中 UAC(User Account Control,用户帐户控制)是由微软在Windows Vista版本中推出的一项旨在增强系统安全性的创新技术,该技术强制要求用户在执行可能干扰计算机正常运作的操作或进行更改会波及其他用户设置的变动前,必须提供相应的权限或管理员密码进行验证。通过对这些操作启动前进行授权确认,UAC能够有效阻止恶意软件及间谍软件在未获授权的状态下于计算机内进行安装或实施修改。 自从Vista版本问世以来,微软便开始推行这一全新的安全机制,可视为对系统安全防护的显著提升。尽管UAC确实能够在一定程度上对某些非法程序起到防御作用,但与此同时,这一功能也给众多用户带来了诸多不便。 因此,许多用户开始探寻是否存在类似于白名单的功能,以便将那些值得信赖的程序直接赋予运行权限。事实上,这类功能确实存在,不过微软并未将其作为标准配置提供。 网络上关于此问题的绝大多数建议都是建议禁用UAC,这种说法显然缺乏针对性,因为若用户希望禁用此功能,本就不会提出相关疑问。 通过运用微软官方发布的Microsoft Application Compatibility Toolkit 5.6版本,可以将信任的程序纳入系统白名单范畴。 获取Application Compatibility Toolkit 安装程序成功后会出现三个可执行文件 以管理员身份启动Compatibility Administrator 在Custom DataBases部分创建新的数据库,并添加一个Application Fix(在下方空白处点击右键,选择...

DELL服务器操作系统安装

下载代码方式:https://pan.quark.cn/s/a4b39357ea24 DELL服务器的操作系统部署流程包含一系列细致的环节,其适用范围涵盖多种操作系统类型,例如Windows Server与Red Hat Linux等。在启动部署之前,必须确认服务器的光驱设备为DVD驱动器,并且需准备对应的系统安装媒介。下面将详细列出完整的部署步骤: 1. **启动准备**:将随服务器提供的Systems Management Tools and Documentation version 6.0光盘置入服务器光驱,随后设定服务器以光驱作为启动设备。此环节旨在确保服务器在启动阶段能够读取安装光盘内容。 2. **语言设定**:服务器启动后,选定简体中文作为部署语言,并确认接受许可协议条款。 3. **时区选择**:在部署期间,需设定时区为北京、香港、重庆或乌鲁木齐,依据实际地理位置进行适配选择。 4. **系统类型选择**:随后,需选定计划部署的操作系统,支持的版本包括Server 2003 SP2、Server 2003 SP2 64位版本、Windows 2003 SBS SP2、Server 2008、Windows 2008 SBS/EBS x64版本等,以及多种Red Hat和SUSE Linux版本。 5. **RAID设定**:若服务器出厂时已预设RAID配置,则可选择跳过此步骤。若需重新设定RAID,操作时需格外小心,因为这一过程可能引发硬盘数据遗失。 6. **引导分区规划**:设定引导分区的大小,通常C盘建议预留至少20GB的空间,具体容量需根据系统需求进行调整。 7. **网络设定**:网络设定可在系统部署完成后执行,部署期间建议暂时拔除...

老人自动接视频appp

老人自动接视频app的

HTML5 audio player

代码下载地址: https://pan.quark.cn/s/a4b39357ea24 这是一款模仿酷狗的基于HTML5技术的网络音乐播放器,能够兼容全部mp3格式的音乐文件,用户既可以在联网状态下,也能够在无网络环境下欣赏自己偏爱的歌手作品。对于具备开发兴趣的人员,可以获取其源代码,将其解压并载入MM开发平台实施调整与改进,支持制作成apk(适用于Android系统)和ipa(适用于iOS系统)的应用程序包,随后安装至移动设备使用;或者将该应用项目文件配置到MM应用引擎中,通过网页浏览器来预览实际运行状况。MM应用引擎的展示页面:http://html5player.mmapp.cn/client/www/app.html 有关更多应用范例的代码资料,可以访问MM开发环境官方网站进行获取:http://dev.10086.cn/ude/index.do

如何高效推动高校科技成果转化落地,解决产学研对接难的问题?.docx

科易网基于40亿+科创知识图谱数据库,深度探索AI技术在技术转移、成果转化、技术经纪、知识产权、产业创新、科技招商等垂直领域的多样化应用场景,研究科技创新领域的AI+数智化解决方案,推动科技创新与产业创新智能化发展。

厦门侠客行 厦门旅游景点 KML矢量数据

本资源为厦门侠客行主题旅游地图KML矢量数据。标注了厦门市主要旅游景点、历史文化遗迹与城市地标位置,涵盖鼓浪屿、南普陀寺、厦门大学、曾厝垵、环岛路、胡里山炮台等厦门经典景点,以及环岛骑行路线、步行游览路径等旅行轨迹数据,可在Google Earth中沉浸式规划厦门旅游路线,适用于厦门旅游攻略制定、城市历史文化研究、自由行路线规划等场景。

如何突破高校科研经费不足与产学研合作的瓶颈?.docx

科易网基于40亿+科创知识图谱数据库,深度探索AI技术在技术转移、成果转化、技术经纪、知识产权、产业创新、科技招商等垂直领域的多样化应用场景,研究科技创新领域的AI+数智化解决方案,推动科技创新与产业创新智能化发展。

高校科技成果转化难,如何高效对接企业需求并提升转化率?.docx

科易网基于40亿+科创知识图谱数据库,深度探索AI技术在技术转移、成果转化、技术经纪、知识产权、产业创新、科技招商等垂直领域的多样化应用场景,研究科技创新领域的AI+数智化解决方案,推动科技创新与产业创新智能化发展。

上一篇: Chatbox 接 TaoToken:从 Claude 3.5 切到 Qwen 的完整步骤
下一篇: TaoToken 做 Chatbox 的兼容通道:别找临时中转
ceshi01
博客等级 码龄18年 1粉丝 4603原创
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符  | 博主筛选后可见
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值