
【导语:Kimi 和 GLM 等大模型虽强大但显存需求高,Cloudflare 的 Workers AI 团队提出三种技术手段,实现大模型在 GPU 上更省、更快地运行,吞吐量提升 41%,每 token 成本降低 30%。】

KV cache 是推理时最吃显存的部分,默认用 16 位精度(BF16)存储。Cloudflare 将其改成 8 位浮点(FP8, e4m3),缓存体积减半。在 Kimi K2.6 上,单次推理能容纳的上下文翻倍。虽然单次推理比 BF16 慢,但并发能力大幅提升,BF16 在 32 个并发请求时显存就撑不住,而 FP8 能跑到 64 并发,峰值吞吐量达到 2,192 tok/s,比 BF16 高约 41%,每 token 成本降低约 30%。并且在精度方面,BF16 和 FP8 KV cache 差异极小。

GLM 5.2 的 checkpoint 在 FP8 下较大,Cloudflare 把权重从 FP8 压缩到 INT4,checkpoint 缩小到 421 GB,每 GPU 只需约 52 GB。在 decode 阶段,由于搬的数据少,token 生成速度加快,低并发时比 FP8 快 55%,高并发时仍快 16%。而 prefill 阶段是计算密集型,INT4 反而比 FP8 慢约 15%,因此采用分离式部署,decode 用 INT4,prefill 用 FP8,且所有 benchmark 精度差异不超过 0.8 个百分点。

KV cache 量化和权重压缩使更多请求共享同一块 GPU 显存,为保证数百个请求同时读写的正确性,Cloudflare 加了一层 KV cache 完整性检查。通过给每个物理缓存页带一个 tag,在 decode 操作读缓存前先校验。在中型生产模型上,吞吐量和尾部延迟的开销都在 1% 以下,实现方式避免了 GPU 线程组之间的竞态,不需要该功能的部署可零开销使用。
编辑观点:Cloudflare 的推理优化思路为大模型发展提供新方向,不依赖增加 GPU,而是挖掘现有资源潜力,三种技术结合降本增效,且回馈开源社区,有望推动行业进步。

795

被折叠的 条评论
为什么被折叠?



