PS
不定期更新一下大模型排行榜,主要是现在可用的模型太多了,不知不觉间就出现了很多模型,又宣称很牛逼。
2026-9-29
排名主要参考 Artificial Analysis(AA)v4.3.2:智能体任务占 30%、编程占 20%、科学推理占 20%、通用能力占 30%,再用 Arena 交叉验证。它主要测英文文本,因此以下更接近“综合解决问题能力排名”,对中文文风、语音和视频能力覆盖有限。
| 参考排名 |
模型及评测档位 |
AA 分数 |
排名理由与特点 |
| 1 |
Claude Opus 5.5 · max |
58 |
综合指数领先;Arena 网页开发也排第一,多个评测方向相互支持,综合第一的证据最充分。数据 |
| 并列 2 |
Claude Fable 5.1 · max |
53 |
综合能力处于顶层,Arena Agent 榜第一,尤其值得用于需要连续调用工具、推进任务的工作。数据 |
| 并列 2 |
GPT-6 Astra · max |
53 |
与 Fable 综合同分;Arena 网页开发第二、Agent 第三,工程执行能力有较强交叉证据。数据 |
| 并列 4 |
GPT-6 Sol · max |
48 |
综合成绩靠前,Arena 网页开发第五;AA 测试任务成本明显低于 Astra,适合兼顾能力与成本。数据 |
| 并列 4 |
Muse Spark 1.3 · max |
48 |
综合能力接近 Sol,文本偏好表现更好;支持图片、视频输入,输出速度也是优势。数据 |
| 并列 6 |
MiMo-V2.6-Pro |
46 |
开放权重模型中的领先者;综合分接近 Grok,AA 实测调用成本很低,国产模型中很有竞争力。数据 |
| 并列 6 |
Grok 4.7 · xhigh |
46 |
综合任务成绩较强,但聊天偏好榜表现明显较弱,说明其优势具有较强的任务依赖性。数据 |
| 并列 8 |
Qwen3.8 Max · 0902 |
45 |
综合成绩进入国产前列,0902 版本在 Arena 网页开发榜排第八,工程应用表现较强。数据 |
| 并列 8 |
GLM-5.3 · max |
45 |
开放权重中的强选手;综合成绩接近 MiMo,但该被测型号为文本输入,不能据此推断其视觉能力。数据 |
| 并列 10 |
Kimi K3 · max |
44 |
综合成绩接近 Qwen、GLM;Arena 文本和网页开发也有较好表现,属于有竞争力的开放权重模型。数据 |
| 并列 10 |
Step 5 Preview |
44 |
综合成绩进入国产前列,测试任务成本较低;目前应按预览版本评价。数据 |
Muse Spark 1.3 ·max是meta的新旗舰模型,与9月2日发布。龟龟,就觉得为什么meta的股价突然涨了10个点
MiMo-V2.6-Pro是小米的最新模型。
而Kimi K3·max是月之暗面的最新模型。
Step 5 Preview是阶跃星辰(StepFun)公司的旗舰基座大模型,听都没听说过的(
2026-8-30
| 参考排名 |
模型 |
8 月 AA 指数 |
理由 |
| 1 |
Claude Opus 5 · max |
63 |
综合成绩略领先;专业知识工作、文件交付和智能体编程是强项。当时 AA 的 GDPval-AA 与 AA-Briefcase 均由它领跑。 |
| 2 |
Claude Fable 5 · max,带 fallback |
62 |
与 Opus 5 非常接近,事实知识表现更强;但 Opus 5 在部分任务执行评测及成本上更有优势。 |
| 并列 3 |
GPT-5.6 Sol · max |
61 |
综合第一梯队,终端编程和科学推理突出;部分科学推理评测强于当时的 Claude。 |
| 并列 3 |
Grok 4.6 |
61 |
综合分追平 Sol;知识工作、工具调用和终端任务表现均较强,调用成本也是竞争优势。 |
| 并列 5 |
Kimi K3 · max |
60 |
国产领先模型之一,复杂知识工作和多步骤任务能力强;与 GLM 同分,事实知识评测更有优势。 |
| 并列 5 |
GLM-5.3 · max |
60 |
智能体能力提升明显;8 月发布评测中的 GDPval-AA 排第二,仅次于 Opus 5,并超过 Kimi K3。 |
2026-7-30
| 参考排名 |
模型及档位 |
当时 AA 分数 |
排名理由 |
| 1 |
Claude Opus 5 · max |
61 |
7 月 24 日发布后综合略领先;知识工作、复杂文件交付和智能体编程突出,GDPval-AA、AA-Briefcase 均取得当时最高成绩。 |
| 2 |
Claude Fable 5 · max,带 fallback |
60 |
与 Opus 5 接近;事实知识表现更强,但部分任务执行成绩和成本效率被 Opus 5 超过。 |
| 3 |
GPT-5.6 Sol · max |
59 |
综合能力紧随 Claude,编程与科学推理强;在 Codex 环境下的编程智能体评测中表现领先。 |
| 4 |
Kimi K3 · max |
57 |
国产领先模型,复杂知识工作、多文件分析表现突出;分析质量很强,部分交付物的呈现质量仍有差距。 |
| 5 |
Claude Opus 4.8 · max |
56 |
仍是强旗舰,但综合能力已被 Opus 5、Sol 和 Kimi K3 超过。 |
2026-6-30
| 参考排名 |
模型及评测档位 |
同期 AA 分数 |
主要理由 |
| 1 |
Claude Opus 4.8 · max |
61.4 |
综合领先,专业知识工作表现突出;同时提升终端操作和科学推理能力。 |
| 2 |
GPT-5.5 · xhigh |
约 60.2 |
编程、工具执行、长上下文推理很强;科学推理部分项目仍领先 Opus 4.8。 |
| 3 |
Claude Opus 4.7 · max |
57.3 |
知识工作和智能体任务较强,但已被 Opus 4.8 明显超过。 |
| 4 |
Gemini 3.1 Pro Preview |
57.2 |
知识、科学问答、科学编程和指令遵循表现突出。 |
| 5 |
GPT-5.4 · xhigh |
56.8 |
终端编程、研究级物理推理和长上下文推理是强项。 |
| 6 |
Qwen3.7 Max |
56.6 |
国产综合能力领先者,科学推理、编程和智能体能力进步明显,已接近上一代海外旗舰。 |