🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度
1. Artificial Analysis 的智能指数 vs 价格:GLM 5.3 Flash 散点怎么读
先给结论:这份 GLM 5.3 Flash 的性价比对照,用 TaoToken 拿同一把 Key,Base URL 填 https://taotoken.net/api,在固定的 20 题 prompt 集上同时跑 GLM 5.3 Flash 与一个对照模型,最后把 AA 公开页面上的智能指数、价格和你本地跑出来的单题成本放在同一张三列表里。这里有个边界要先说清楚:本文不含排行分数,也不承诺复现 AA 名次或分数。AA 的具体点位、价格和查阅日期,请以你打开公开页面当天的记录为准。我写的是怎么把这件事做成可重跑的流程,而不是替你宣布某个模型进了第几名。
Artificial Analysis 的散点图有两个核心轴。纵轴通常是智能指数,横轴是价格。智能指数越高,代表该页面对模型综合能力的聚合估计越高;价格越低,代表调用成本越低。散点图的价值在于把“强”和“便宜”放在同一张图里看,而不是只看单一名次。GLM 5.3 Flash 作为 Flash 类模型,读者最关心的不是它能不能在所有任务上超过大参数模型,而是它在固定任务集里,单位成本能覆盖多少题。这里的“覆盖”可以拆成两个指标:单题成本,以及单位成本能完成的题数。单题成本越低,单位预算能跑的题越多;但前提是任务能被正确完成,否则低成本没有意义。
1.1 散点图不是排行榜名次
AA 页面上的散点图和传统排行榜不是同一种东西。传统排行榜可能只给你一个顺序,散点图给你两个坐标。GLM 5.3 Flash 在散点图上的位置,取决于公开页面采集的智能指数和价格。本文不摘录这些坐标,因为手头没有带查阅日期的快照;我也不会凭记忆写“第几梯队”或“某个分数”。你真正要复现的是:打开 Artificial Analysis 的模型对比页,找到 GLM 5.3 Flash 和你的对照模型,记录你查阅当天的日期、这两个维度的值,以及页面来源。这个记录是你自己的公榜快照,不是我在文章里编的数字。
为什么强调查阅日期?因为 AA 页面会更新,价格和指数都可能变。你今天看到的点位,下周再看可能不同。把日期写进表格,后面复现时才能解释差异。公榜上的是模型,统一 API 通道不是 AA 的参赛方,也不是主办方;它在这里只承担拿 Key 和给 Base URL 的角色。读者用同一把 Key 和 https://taotoken.net/api 去接公榜上的同一个模型,这样本地复现才有共同基线。缺少查阅日期和页面来源的公榜数字,只能算个人印象,不能当团队决策依据。
1.2 为什么用 20 题固定 prompt 集
20 题不是一个很大的样本,但它足够做方向性对照。题目太少,噪声大;题目太多,单次跑完成本高、耗时长。20 题可以拆成 5 类,每类 4 题:解释与归纳、代码生成、代码审查、结构化抽取、长文压缩。每一类都保留固定 prompt,不因为模型不同而改题干。这样你比较的是模型在同样输入下的完成情况,而不是谁更会猜你的意图。固定题干还有一个好处:失败时容易归因,是模型没理解,还是你的评分规则太严,重跑一次就能看出来。
固定 prompt 集还有个好处:可以重跑。你把 20 题写成 JSON 或 Python 列表,脚本按顺序调用。每次只换模型 ID,Base URL 和 Key 不变。跑完以后,记录每道题是否完成、是否需要重试、输入输出 token、耗时。最后算两个数:单题成本 = 本次总费用 / 成功题数;单位成本覆盖题数 = 成功题数 / 本次总费用。前者回答“一道题花多少钱”,后者回答“一块钱能覆盖多少题”。两个指标一起看,才不会被极低单价但高失败率带偏。如果你只比总价,一个乱答的便宜模型可能看起来更划算,但实际返工时间会把成本加回去。
1.3 本文的边界
本文不含排行分数。AA 页面上的智能指数和价格两个维度,我只描述它们怎么用于对照,不写具体数值。你如果要写公榜数字,至少同时写清楚:榜名是 Artificial Analysis,查阅日期是哪天,名次或分数或用量是多少,页面来源在哪里。缺少任何一项,都只能算个人记录,不能当公榜结论。本地 20 题跑出来的单题成本也是一次运行,不代表公榜。公榜表和本地复现表要分开,不能把 AA 的智能指数、本地耗时、你的账单金额拼成一张“综合实力表”。
这个边界听起来保守,但能省很多争论。比如你看到 GLM 5.3 Flash 在 AA 散点图上偏向低成本区域,这只说明公开页面上的价格维度有优势,不说明它在你的 20 题里一定全部答对。反过来,本地 20 题跑得好,也不说明它在 AA 上的智能指数会立刻变化。把公榜快照、本地复现、账单用量三件事分开记录,后面换模型、换题集、换预算时都能回溯。你手里真正可复现的产出,是一张三列表加一份能重跑的脚本,而不是一句“某模型最强”。
2. 同一把 Key 接 GLM 5.3 Flash 与对照模型:兼容通道的接线细节
这一章只做一件事:把同一把 Key 和同一个 Base URL 填进调用脚本,让 GLM 5.3 Flash 和对照模型走同一套请求逻辑。注册和拿 Key 的步骤很短,重点在后面的请求格式和模型 ID 对齐。Base URL 写 https://taotoken.net/api,末尾不要带 /v1,也不要往这个地址上加 UTM 参数。Key 从带 UTM 的官网控制台创建,创建后存在环境变量里,不要写进脚本明文。评测 Key 最好单独建一把,命名成能认出来的项目名,后面看用量和对账都清楚。
2.1 拿 Key 只需要一次
如果你还没有 Key,打开 TaoToken 注册,进控制台创建 API Key。创建时给 Key 起一个能认出来的名字,比如 glm53-flash-bench-20。不要用生产环境的 Key 跑评测,单独建一把评测 Key,后面看用量和对账都清楚。创建完把 Key 放进环境变量,不要在代码里硬编码,也不要把 Key 发到聊天窗口或提交到仓库。环境变量名可以按你的习惯来,下面用 TAOTOKEN_API_KEY 和 TAOTOKEN_BASE_URL 做示例。
export TAOTOKEN_API_KEY="YOUR_API_KEY"
export TAOTOKEN_BASE_URL="https://taotoken.net/api"
这里不要给 BASE_URL 加任何查询参数。UTM 只用于官网落地页和 deep link,不用于 API 请求地址。把 Key 放进环境变量以后,脚本里只读环境变量,切换模型时不用改认证部分。如果你在 Windows 本地跑,可以用 PowerShell 的 $env:TAOTOKEN_API_KEY 写法,或者用 .env 文件加载,但 .env 不要提交。拿 Key 这一步越短,后面专注在 20 题脚本和结果表上。
2.2 模型 ID 以模型广场为准
GLM 5.3 Flash 是模型名,但请求里要填的是模型 ID。模型 ID 以模型广场为准,不要凭记忆写一个字符串。打开带 UTM 的官网,进模型广场,找到 GLM 5.3 Flash 和你要用的对照模型,把模型 ID 复制出来。对照模型可以选同价位区间的另一个 Flash 类模型,也可以选一个你手头常用的主力模型。关键是两个模型都走同一个 Base URL 和同一把 Key,这样请求路径一致,对照才干净。如果广场里的展示名和 API 模型 ID 不一样,以 ID 为准,展示名只用于表格里的可读标签。
请求本身是 OpenAI 兼容格式。Python 里可以用 openai 包,也可以用 requests。下面先给最小可跑片段,确认 Key、Base URL、模型 ID 三件事能通:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["TAOTOKEN_API_KEY"],
base_url="https://taotoken.net/api",
)
resp = client.chat.completions.create(
model=os.environ["MODEL_ID"], # 模型 ID 以模型广场为准
messages=[
{"role": "user", "content": "用三句话解释什么是向量数据库。"}
],
)
print(resp.choices[0].message.content)
print(resp.usage)
这段代码里只有两个变量:MODEL_ID 和 messages。切模型时只改 MODEL_ID,Base URL 和 Key 不动。这就是同一把 Key 跑同题的意思。如果你要同时跑 GLM 5.3 Flash 和对照模型,把两个模型 ID 分别放进两个环境变量,循环时按模型标签读取,不要把模型 ID 写死在 messages 里。请求失败先看错误码,401 通常是 Key 问题,404 通常是模型 ID 问题,429 通常是频率或并发问题。
2.3 如果走 Claude Code 或 CC Switch
有些读者会用 Claude Code 或 CC Switch 做交互式对照。Claude Code 的三件套是 ANTHROPIC_BASE_URL、ANTHROPIC_AUTH_TOKEN、ANTHROPIC_MODEL,Base URL 仍然填 https://taotoken.net/api,模型 ID 以模型广场为准。可以写在 ~/.claude/settings.json 的 env 里:
{
"env": {
"ANTHROPIC_BASE_URL": "https://taotoken.net/api",
"ANTHROPIC_AUTH_TOKEN": "YOUR_API_KEY",
"ANTHROPIC_MODEL": "以模型广场为准"
}
}
Codex 不要套这组变量。Codex 的配置在 ~/.codex/config.toml,里面写自定义供应商、Base URL、Key 和模型 ID。CC Switch 则是在自定义供应商里填 Base URL、Key、模型 ID 三件套,切换后重启对应客户端生效。这些客户端只是入口不同,API 侧仍然是同一个 Base URL 和同一把 Key。评测脚本建议还是用 Python 跑,避免客户端缓存和上下文长度影响 20 题的一致性。客户端适合看单条输出,脚本适合出三列表。
2.4 对照模型的选法
对照模型不要选一个能力差距过大的模型,否则你只能得到“贵的更好”这种结论。选一个在 AA 散点图上和 GLM 5.3 Flash 价格区间接近、但智能指数不同的模型,或者选你团队日常在用的模型。两个模型都跑 20 题,题目、温度、最大输出 token、超时时间保持一致。温度建议设 0 或 0.2,减少随机性。最大输出 token 按题目类型给,不要一个模型给 4096、另一个给 1024。重试次数也统一,比如每道题最多重试 1 次,重试也算成本。
如果你只是想验证接线,可以先用 3 道题试跑。3 道题分别选解释、代码、抽取,覆盖三种输出形态。确认两个模型都能返回内容、usage 字段都有值、CSV 能落盘,再把 PROMPTS 换成完整 20 题。这样能避免跑完 40 次请求才发现模型 ID 写错。对照模型的标签可以在 CSV 里用“对照模型”四个字,不必写具体产品名,后面表格更容易读。关键是记录模型 ID,因为展示名可能变,ID 才是请求时真正用的。
3. 20 题同题对照:智能指数 / 价格 / 单题成本三列表怎么填
这一章把三列表的结构定下来。你要产出的是「智能指数 / 价格 / 单题成本」三列,但它们的来源不同:智能指数和价格来自 Artificial Analysis 公开页面,单题成本来自你本地 20 题脚本的账单或用量换算。两列公榜数据,一列本地数据,不能混成一个“综合分”。本文不含排行分数,所以下面的表里 AA 两列不填具体数字,只留字段和填写规则。你查阅当天把数字补进去,并在表头旁边写清楚查阅日期和页面来源。
3.1 20 题 prompt 集
下面是一套可复用的 20 题结构。你可以直接抄,也可以按自己的业务改题干,但改完要固定下来,两个模型用同一份。题干里不要带“请像某某模型那样回答”这类偏向性提示,否则对照会失真。每道题建议限制最大输出 1024 token,长文压缩题可以放宽到 2048。评分先定成二值:完成且格式可用记 1,否则记 0。需要人工看输出,或者写简单规则检查,不要只用模型自评。
- 用 150 字解释什么是向量数据库,并给一个适用场景。
- 用 150 字解释什么是幂等,并给一个 HTTP 例子。
- 把一段 300 字的产品说明压缩成 3 条要点。
- 从一段会议记录里抽出决策、负责人、截止日期。
- 写一个 Python 函数,读取 CSV 并返回每列缺失值数量。
- 写一个 Python 函数,把嵌套 JSON 拍平成单层字典。
- 写一个 SQL 查询,统计每个用户最近 7 天订单数。
- 写一个正则,匹配形如 2025-03-01 的日期。
- 审查一段 Python 代码,指出可能的空指针和资源泄漏。
- 审查一段 SQL,指出可能的索引失效和全表扫描。
- 给出一段前端代码,改成使用防抖。
- 把一段同步请求改成异步,并说明异常处理。
- 从一段日志里抽取错误码、请求 ID、耗时。
- 从一段中文地址里抽取省市县和街道。
- 把一段英文技术文档翻译成中文,保留术语。
- 把一段中文需求翻译成英文,语气正式。
- 给出一段 500 字文章,写 3 个标题。
- 给出一段 500 字文章,写 100 字摘要。
- 解释一段报错栈,按可能性排序原因。
- 给一个重构方案,把 200 行脚本拆成函数和配置。
这 20 题覆盖解释、压缩、抽取、代码、审查、翻译、总结、排障。它们不是要证明谁更强,而是让你在固定输入下看两个模型能不能完成任务。第 5 到第 12 题偏代码,第 13 到第 16 题偏结构化输出和翻译,第 17 到第 20 题偏长文和方案。每道题的判分标准可以提前写在评分表里,避免跑完后凭感觉改规则。判分标准一旦确定,两个模型都按同一套标准来。
3.2 三列表的字段
建议表格如下。AA 智能指数和 AA 价格两列,在你查阅 Artificial Analysis 当天填写,并记下查阅日期和页面来源。单题成本列由脚本输出,单位是你账单的实际货币。售价、折扣以 https://taotoken.net/?utm_source=taotoken_aicg_blog_end 展示为准,不要把 AA 标价直接当成你的实际账单单价。如果你要把表放进报告,建议再拆成两张视图:公榜视图只留模型、AA 智能指数、AA 价格、查阅日期、来源;本地视图只留模型、成功题数、总费用、单题成本、单位成本覆盖题数。三列表是把两张视图并排看,不是合成一个综合分。
| 模型 | Artificial Analysis 智能指数(查阅日:;来源:) | Artificial Analysis 价格(查阅日:;来源:) | 本地单题成本(20 题,成功题数:____) |
|---|---|---|---|
| GLM 5.3 Flash | 本文不摘录分数,按你查阅日填写 | 本文不摘录价格,按你查阅日填写 | 总费用 / 成功题数 |
| 对照模型 | 本文不摘录分数,按你查阅日填写 | 本文不摘录价格,按你查阅日填写 | 总费用 / 成功题数 |
表格里不要出现“第几名”“ELO 多少”这种混合指标。AA 散点图上的智能指数和价格是公榜字段;单题成本是本地复现字段。它们可以在同一张表里展示,但来源标注要分开。公榜数字必须带榜名、查阅日期、数值和页面来源,缺一项就只能当草稿。本地数字必须带运行日期、模型 ID、成功题数和总费用,缺一项就只能当印象。两张视图都清楚以后,三列表才不是拍脑袋。
3.3 单题成本怎么算
单题成本不是只看输出 token 单价。你要算本次 20 题的总费用,包括输入 token、输出 token、重试消耗。公式:单题成本 = 本次总费用 / 成功题数;单位成本覆盖题数 = 成功题数 / 本次总费用。如果某道题失败但消耗了 token,这部分费用也要算进总费用。否则失败模型看起来更便宜,实际上浪费了预算。总费用可以从控制台用量页看,也可以从 API 返回的 usage 按你的实际单价换算。注意 AA 页面的价格是公榜参考,不是你的账单单价,账单单价以实际控制台展示为准。
举个例子,如果 GLM 5.3 Flash 成功 18 题,总费用算出来是某个值,单题成本就是总费用除以 18,而不是除以 20。单位成本覆盖题数则是 18 除以总费用。这个指标适合回答预算问题:你计划跑 500 道同类题,单题成本乘以 500 就是预估账单,但实际还要看成功率和重试率。如果两个模型单题成本接近,就看成功题数和人工返工时间。人工时间不在账单里,但真实存在。把重试次数也记进 CSV,后面能看到失败请求对成本的影响。
3.4 记录查阅日期和页面来源
如果你要在文章或内部报告里引用 AA 数字,必须同时写清楚:榜名 Artificial Analysis,查阅日期,智能指数或价格的数值,页面来源。缺少日期和来源,读者无法判断这个数字是不是你凭记忆写的。本文不含排行分数,也不承诺复现名次。你补上数字以后,那张表才算你自己的快照。公榜数字和本地单题成本要分表或分栏标注,别把 AA 的智能指数和你的本地成功率加权成一个总分。
记录页面来源时,可以写具体页面路径或截图文件名,不要只写“官网”。如果 AA 页面有多个视图,比如散点图、模型详情、价格页,写清楚你看的是哪一个。价格维度可能有输入价、输出价、混合价,也要注明。不同页面的口径可能不同,混用会让三列表失真。你查阅当天如果页面有更新提示,也记一笔。这样别人复现时至少知道你看的是哪个时间点的公开信息,而不是一个无法追溯的字符串。
4. 可重跑脚本:同一把 Key 切换 GLM 5.3 Flash 与对照模型
这一章给一个能跑的 Python 脚本。它从环境变量读 Key、Base URL、两个模型 ID,按 20 题列表依次请求,记录耗时、token 用量、成功与否,最后输出 CSV。脚本不直接连你的生产库,也不执行任何业务 SQL;它只发文本请求,结果落本地文件。你跑完把 CSV 结果贴回对话或写进报告,人工核对后再下结论。这样既避免模型直接动生产数据,也保留可复现的中间结果。
4.1 环境准备
先装依赖,再把 Key、Base URL、两个模型 ID 放进环境变量。模型 ID 从模型广场复制,不要自己拼。下面命令里的 YOUR_API_KEY 换成你控制台创建的 Key,MODEL_GLM_FLASH 和 MODEL_CONTROL 换成广场里的实际 ID。如果你用虚拟环境,先激活再装包,避免和系统 Python 混在一起。脚本运行目录建议单独建一个文件夹,CSV 和后续汇总脚本都放里面,方便打包。
pip install openai
export TAOTOKEN_API_KEY="YOUR_API_KEY"
export TAOTOKEN_BASE_URL="https://taotoken.net/api"
export MODEL_GLM_FLASH="以模型广场为准"
export MODEL_CONTROL="以模型广场为准"
如果模型广场里 GLM 5.3 Flash 的 ID 和展示名不同,以广场里的 ID 为准。对照模型也复制 ID,不要写展示名。环境变量设置完可以用 echo 检查一遍,但不要把完整 Key 打印到日志。Base URL 保持 https://taotoken.net/api,不要加 /v1,不要加 UTM。准备完这些,就可以跑下面的脚本。
4.2 完整脚本
import os
import csv
import time
import json
from openai import OpenAI
API_KEY = os.environ["TAOTOKEN_API_KEY"]
BASE_URL = "https://taotoken.net/api"
MODELS = {
"GLM 5.3 Flash": os.environ["MODEL_GLM_FLASH"],
"对照模型": os.environ["MODEL_CONTROL"],
}
PROMPTS = [
"用 150 字解释什么是向量数据库,并给一个适用场景。",
"用 150 字解释什么是幂等,并给一个 HTTP 例子。",
"把一段 300 字的产品说明压缩成 3 条要点。",
"从一段会议记录里抽出决策、负责人、截止日期。",
"写一个 Python 函数,读取 CSV 并返回每列缺失值数量。",
"写一个 Python 函数,把嵌套 JSON 拍平成单层字典。",
"写一个 SQL 查询,统计每个用户最近 7 天订单数。",
"写一个正则,匹配形如 2025-03-01 的日期。",
"审查一段 Python 代码,指出可能的空指针和资源泄漏。",
"审查一段 SQL,指出可能的索引失效和全表扫描。",
"给出一段前端代码,改成使用防抖。",
"把一段同步请求改成异步,并说明异常处理。",
"从一段日志里抽取错误码、请求 ID、耗时。",
"从一段中文地址里抽取省市县和街道。",
"把一段英文技术文档翻译成中文,保留术语。",
"把一段中文需求翻译成英文,语气正式。",
"给出一段 500 字文章,写 3 个标题。",
"给出一段 500 字文章,写 100 字摘要。",
"解释一段报错栈,按可能性排序原因。",
"给一个重构方案,把 200 行脚本拆成函数和配置。",
]
client = OpenAI(api_key=API_KEY, base_url=BASE_URL)
rows = []
for model_label, model_id in MODELS.items():
for idx, prompt in enumerate(PROMPTS, start=1):
start = time.time()
ok = False
content = ""
prompt_tokens = 0
completion_tokens = 0
error = ""
try:
resp = client.chat.completions.create(
model=model_id,
messages=[{"role": "user", "content": prompt}],
temperature=0.2,
max_tokens=1024,
timeout=60,
)
content = resp.choices[0].message.content or ""
usage = resp.usage
prompt_tokens = usage.prompt_tokens if usage else 0
completion_tokens = usage.completion_tokens if usage else 0
ok = len(content.strip()) > 0
except Exception as e:
error = str(e)
elapsed = round(time.time() - start, 2)
rows.append({
"model": model_label,
"model_id": model_id,
"question_id": idx,
"ok": ok,
"elapsed_sec": elapsed,
"prompt_tokens": prompt_tokens,
"completion_tokens": completion_tokens,
"error": error,
"content_preview": content[:120].replace("\n", " "),
})
with open("taotoken_20q_results.csv", "w", newline="", encoding="utf-8") as f:
writer = csv.DictWriter(f, fieldnames=rows[0].keys())
writer.writeheader()
writer.writerows(rows)
print("done:", len(rows))
这个脚本一次跑两个模型,每个模型 20 题,共 40 次请求。你可以先跑 3 题试通,再把 PROMPTS 换成完整 20 题。脚本里没有把 Key 写死,也没有在 Base URL 上挂 UTM。CSV 输出在本地,方便你后续算单题成本。如果你要控制成本,可以先把 temperature 设 0,max_tokens 设 512,跑通后再按题目类型调整。注意每道题的输出预览只截前 120 字符,完整内容没有落 CSV,避免文件过大。需要人工判分时,可以另存完整内容。
4.3 把 CSV 汇总成三列表
跑完后,你可以用另一个小脚本汇总。它按模型分组,统计成功题数、总题数、输入 token、输出 token。总费用按你的实际账单单价换算,然后填进三列表。这里再次提醒:AA 标价不是你的实际账单单价,售价以 https://taotoken.net/?utm_source=taotoken_aicg_blog_end 展示为准。单题成本用你实际账单算,不要拿 AA 价格直接除。汇总脚本只做统计,不做判分;判分可以用简单规则,也可以人工过一遍输出预览。
import csv
stats = {}
with open("taotoken_20q_results.csv", encoding="utf-8") as f:
for row in csv.DictReader(f):
m = row["model"]
stats.setdefault(m, {"ok": 0, "total": 0, "pt": 0, "ct": 0})
stats[m]["total"] += 1
if row["ok"] == "True":
stats[m]["ok"] += 1
stats[m]["pt"] += int(row["prompt_tokens"])
stats[m]["ct"] += int(row["completion_tokens"])
for m, s in stats.items():
print(m, "成功", s["ok"], "总题", s["total"], "输入token", s["pt"], "输出token", s["ct"])
汇总结果出来以后,把成功题数和总 token 填进本地视图。如果两个模型 token 用量差异很大,检查是不是某个模型喜欢长篇输出。长输出不一定更好,可能只是没有遵守字数限制。判分时把格式遵从也算进去,能减少这种偏差。最终三列表里的单题成本要写清楚是“本次 20 题一次运行”的结果,不是长期平均值。
4.4 本篇配置可能踩的坑
第一个坑是 401。检查 Key 是否放在 Authorization 头里,环境变量有没有拼错,Key 前后有没有空格。第二个坑是 404。大概率是模型 ID 写错,去模型广场复制 ID,不要用展示名。第三个坑是 429。并发太高或短时间请求太多,把脚本改成串行,或者在两次请求之间 sleep 1 秒。第四个坑是超时。长文题可能超过 60 秒,把 timeout 调到 120 秒,或者把 max_tokens 调小。第五个坑是 CSV 里 ok 列读出来是字符串 True,比较时注意类型。这些错误只针对本篇脚本,不是公榜结论。
还有一个坑是环境变量在 IDE 里没生效。命令行 export 只对当前 shell 有效,换一个终端就没了。你可以在项目目录用 .env 文件配合 python-dotenv,但 .env 要放进 .gitignore。另一个坑是模型 ID 在脚本里写死,切模型时忘了改,结果两个标签跑的是同一个模型。跑完先看 CSV 里的 model_id 列,确认两个模型 ID 不同。最后一个坑是误把测试请求算进正式结果。正式跑之前先清空 CSV,或者用不同的文件名,避免旧数据混入。
5. 结果怎么读:公榜数字与本地单题成本不要混成一张实力表
跑完 20 题以后,你会得到两个模型各自的成功题数、token 用量和耗时。接下来要决定这张表怎么写进报告。公榜表和本地复现表分开,是本篇最重要的纪律。Artificial Analysis 的智能指数和价格是公榜字段,来源是 AA 公开页面和你查阅当天的记录。单题成本、成功题数、耗时是本地字段,来源是你这次运行。两者可以并列展示,但不能相加、加权、合成一个“综合实力分”。把来源写清楚,比追求一个好看的总分更有用。
5.1 公榜上的是模型
Artificial Analysis 的散点图上,参评对象是模型。GLM 5.3 Flash 和对照模型在页面上的智能指数、价格,都是模型维度的数据。统一 API 通道不是 AA 的参赛方,也不是主办方。读者用这里的 Key 和 Base URL 接的是同一个模型,得到的是同一套 API 路径下的调用结果。这个区别很重要:你不能写“某通道在 AA 上排名第几”,只能写“AA 上 GLM 5.3 Flash 的散点位置是某个值,我用同一把 Key 接它跑了 20 题”。
公榜数字还有一层时间维度。AA 页面更新后,旧截图可能和当前页面对不上。写报告时最好把查阅日期放在表头,而不是放在正文角落。如果团队里有人过两周再看,他能知道这个快照的时间。价格维度尤其容易变,输入价和输出价可能分开调整。把 AA 价格当成参考轴,把实际账单单价当成成本轴,两个轴不要混。这样解释散点时,你能说清楚“公开页面上的价格位置”和“我实际跑 20 题花了多少”是两件事。
5.2 本地一次运行不代表公榜
20 题一次运行的结果受很多因素影响:网络抖动、并发、温度、max_tokens、评测脚本的判分规则。它可以是你的选型依据,但不能写成“GLM 5.3 Flash 在 AA 上的分数被我复现了”。正确写法是:查阅日期某天,AA 公开页面上有这些字段;同一天或另一天,我在本地用同一把 Key 跑了 20 题,成功题数是某个值,单题成本是某个值。两件事分开陈述。一次运行也不代表长期表现,你可以隔一周重跑一次,看单题成本波动大不大。
如果本地结果和公榜散点的直觉不一致,优先检查任务集和判分规则。AA 的智能指数是聚合估计,你的 20 题是具体任务,两者本来就可能不一致。比如某个模型在代码题上表现好,但在长文压缩上格式不稳定,聚合指数看不出来这种差异。本地复现的价值就是把“具体任务上的完成情况”补上。它不是要推翻公榜,也不是要替代公榜,而是帮你回答“我的场景能不能用它”。
5.3 单位成本覆盖题数怎么用
单位成本覆盖题数适合回答预算问题。假设你有一笔固定月度预算,想知道能跑多少道同类任务。先用 20 题得到单题成本,再乘以计划题量。注意成功率:如果单题成本很低但成功率只有一半,有效单题成本要按成功题数算。脚本里已经用成功题数做分母,避免这个问题。如果两个模型单题成本接近,就看成功题数和人工返工时间。人工时间不在账单里,但真实存在。
单位成本覆盖题数还能帮你做模型分级。低成本高成功的模型适合批处理、初筛、格式转换;高成本高成功的模型适合复杂排障、方案设计、最终审核。把 20 题按类型拆开,能看到 GLM 5.3 Flash 在哪类题上单位成本覆盖更多。不要只看总分,分类型看更有用。如果某一类题两个模型成功率一样,就选单题成本低的。如果成功率差很多,先算返工成本,再决定贵的是否值得。
5.4 对账与发票
如果你要把评测结果用于团队决策,控制台对账比截图更重要。用量页能看到本次 Key 的请求次数和 token 消耗。把这个数字和脚本汇总的 token 对一遍,差异大就检查重试和失败请求。正规 API 通道还要看发票和配额,临时通道可能便宜,但月底对不上账、开票困难,评测结论也没法复用到生产。售价和折扣以 https://taotoken.net/?utm_source=taotoken_aicg_blog_end 展示为准,别用 AA 标价推算你的实际单价。
对账时建议把评测 Key 和项目 Key 分开。评测 Key 只跑 20 题,用量干净;项目 Key 跑日常业务,方便看真实成本。如果评测期间有重试,CSV 里会多出请求,对账时按请求 ID 或时间窗口过滤。发票和配额信息以控制台为准,不要用第三方截图当财务依据。把这三件事——公榜快照、本地 CSV、控制台用量——放在同一个文件夹里,下次换模型只需替换模型 ID 和结果文件,流程可以复用。
6. 20 题跑完后:用模型对话核对 Flash 模型 ID 并创建复现 Key
最后一章把复现闭环收一下。你已经有 CSV、有三列表模板、有 AA 公开页面的查阅记录。接下来可以做的第一件事是打开 模型对话,核对 GLM 5.3 Flash 在模型广场里的模型 ID 和展示名是否一致。如果脚本里的 ID 和广场不一致,先改脚本再重跑,不然 404 会浪费一轮时间。第二件事是看 Coding Plan,如果你要把这套 20 题扩到日常开发任务,长期调用的配额和成本结构比临时评测更重要。
如果还没有 Key,从 TaoToken 进控制台,在 创建 Key 页面建一把评测专用 Key,命名成 glm53-flash-20q,填进上面的脚本。注册入口在 https://taotoken.net/?utm_source=taotoken_aicg_blog_end。想要用 Claude Code 或 CC Switch 做交互式补充对照,三件套配置参考 接入文档,Base URL 仍然填 https://taotoken.net/api,模型 ID 以模型广场为准。这样你就能在同一个通道里,用同一把 Key 切换 GLM 5.3 Flash 和对照模型。
跑完第一轮以后,把 CSV 里的成功题数、总 token、单题成本填进三列表,AA 两列按你查阅当天的记录填。本文不含排行分数,也不承诺复现名次;你手里那张表才是可复现的产出。下一次换模型,只改 MODEL_ID,保持同一把 Key、同一份 20 题 prompt、同一套判分规则,对照才有意义。把这次评测调用是否入账、控制台用量是否和 CSV 对得上,也顺手核一遍。复现路径固定下来后,GLM 5.3 Flash 在 AA 散点图上的智能指数与价格,就能和你自己的单题成本放在同一套记录里看。
🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度




被折叠的 条评论
为什么被折叠?



