2026年7月开源LLM格局剧变:GLM 5.2 首次在Agentic Coding上击败GPT-5与Claude
2026年7月注定载入开源大模型史册。30天内,10款旗舰级开源模型密集发布。智谱AI的GLM 5.2以68.5%的SWE-Bench Pro得分首次超越GPT-5和Claude,宣告开源模型在"最难Agentic Coding基准"上反超闭源前沿。
七月井喷:30天10款旗舰密集发布
过去两年,开源模型在多数基准上逐步逼近闭源,但Agentic Coding——要求模型在真实代码仓库中执行多文件、多步修改——始终是OpenAI和Anthropic最后的堡垒。七月,这道墙被推倒了:
| 模型 | 发布日期 | 参数规模 | 许可 | 核心亮点 |
|---|---|---|---|---|
| GLM 5.2 | 7月8日 | 744B-A40B MoE | MIT | SWE-Bench Pro 68.5%,首次超越GPT-5/Claude |
| GLM 5.2 Air | 7月8日 | 106B-A12B MoE | MIT | 64GB Mac可运行,SWE-Bench Pro 58% |
| Qwen 4.1 | 7月2日 | 32B-A3B MoE | Apache 2.0 | SWE-Verified 80%,24GB Mac跑62 tok/s |
| DeepSeek R3 | 7月5日 | 685B-A37B MoE | MIT | AIME 2025 95%,推理最强 |
| Llama 5 405B | 7月6日 | 405B Dense | Llama 5 | MMLU 91%,知识面最广 |
| Kimi K3 | 7月7日 | ~1T-A32B MoE | MIT | 2M上下文,Agentic Coding领导者 |
GLM 5.2:架构即答案
GLM 5.2并非靠堆参数取胜,其核心在于极致的稀疏效率。
MoE架构参数:总参数量744B,每token仅激活40B(约5.4%)。这意味着推理成本仅相当于一个40B稠密模型,却能调动744B的知识容量。路由层采用256个专家中Top-8选取+1个共享专家的设计,在保持推理速度的同时最大化专家利用率。
为什么SWE-Bench Pro才是真正有说服力的基准:SWE-Verified已被多次质疑存在训练数据污染——大量测试用例泄露到了预训练语料中。SWE-Bench Pro是专门为此设计的防污染替代品,使用独立仓库、更复杂的多文件任务和更严格的评估框架。GLM 5.2在这项基准上的68.5%大致相当于Verified上的高80分段,且这是闭源实验室自己引用的基准。
# GLM 5.2 Air 本地部署(Ollama方式)
ollama run glm5.2:air # ~60 GB, MoE 12B active per token
# 或在MLX上获得Apple Silicon最佳性能
mlx_lm.generate --model mlx-community/GLM-5.2-Air-106B-A12B-4bit \
--prompt "Fix the failing tests in this repository"
在128GB Mac Studio上,GLM 5.2 Air通过MLX可达~34 tok/s;M4 Ultra 192GB上可达~38 tok/s。这是首次将前沿级Agentic Coder的能力带到消费级Apple Silicon上。
Mac端格局重塑:Qwen 4.1的普惠路线
与GLM 5.2 Air需要64GB内存不同,阿里Qwen 4.1 32B-A3B在仅24GB内存的Mac上实现了80% SWE-Verified得分和62 tok/s速度。Apache 2.0许可意味着零许可风险,对创业团队和IDE插件开发者尤为关键。
一个值得关注的对比:
| 指标 | GLM 5.2 Air | Qwen 4.1 32B-A3B |
|---|---|---|
| 参数量 | 106B (12B active) | 32B (3B active) |
| Mac最低内存 | 64 GB | 24 GB |
| SWE-Bench Pro | 58% | — |
| SWE-Verified | — | 80% |
| 速度 (消费级Mac) | ~30 tok/s | ~62 tok/s |
| 许可 | MIT | Apache 2.0 |
两个模型形成互补:GLM 5.2 Air面向有64GB+内存的专业开发者解决最难的Agentic Coding;Qwen 4.1面向24GB标准Mac用户提供"开箱即用"的高质量编码体验。
服务器级三强鼎立
在消费级硬件之上,DeepSeek R3、Llama 5 405B和Kimi K3构成服务器级三极,各自定义不同的能力上限:
- DeepSeek R3(MIT许可):AIME 2025达95%,数学推理无可争议的第一。685B-A37B MoE架构下每个激活参数的能力密度是三者最优。
- Llama 5 405B(Llama 5许可):MMLU 91%,知识广度第一。但405B稠密模型推理成本极高,即使在M4 Ultra 192GB上也只能跑~5 tok/s,对多数团队仅适合云端部署。
- Kimi K3(MIT许可):SWE-Bench Pro 66%,2M上下文窗口。对于需要在整个大型代码库上下文中执行数小时工具调用循环的自主编码Agent,Kimi K3是最强开源选项。
工程启示:开源生态的临界点
七月这一波密集发布背后有几个值得关注的趋势:
第一,MoE成为事实标准。10款旗舰中8款采用MoE架构。MoE不再是一个"可选方案",而是在参数规模与推理成本之间取得平衡的必选路径。
第二,MIT许可以惊人速度普及。GLM 5.2、DeepSeek R3和Kimi K3均采用MIT许可,这意味着最具竞争力的模型正在放弃定制化限制条款。与一年前Llama系的自定义许可相比,开源模型的可商用壁垒正在快速降低。
第三,"蒸馏同步发布"成为标配。GLM 5.2 Air、Qwen 4.1的3B-active版本、Phi-5 Large等,核心模型发布的同时发布消费级可运行的蒸馏版本已从加分项变为必选项。这表明实验室已经将"开发者能实际跑起来"作为产品设计的一环,而非发布后的附加任务。
第四,Agentic Coding成为主战场。无论GLM 5.2的SWE-Bench Pro、Kimi K3的Agentic SWE还是Qwen 4.1的SWE-Verified,所有厂商都将编码Agent能力作为核心宣传点。这说明行业共识已经形成:下一个杀手级应用不是聊天,而是能自主读取、修改和测试代码仓库的Agent。
展望
2026年下半年,可以预期两个方向加速演进:一是更多实验室将推出62%-70% SWE-Bench Pro区间的消费级蒸馏模型,二是开源Agent框架(如openJiuwen、AgentCube等)将与这些编码模型深度集成,形成"模型能力+编排框架"的完整技术栈。
2026年7月,开源LLM不再追赶闭源——它在Agentic Coding这个最重要的战场上,已经领先。
技术标签:#开源LLM #GLM5.2 #AgenticCoding #SWE-Bench #MoE架构 #Qwen4.1 #DeepSeekR3 #本地部署

1万+

被折叠的 条评论
为什么被折叠?



