大模型ranking(不定时更新)

2026-10-01

PS

不定期更新一下大模型排行榜,主要是现在可用的模型太多了,不知不觉间就出现了很多模型,又宣称很牛逼。

2026-9-29

排名主要参考 Artificial Analysis(AA)v4.3.2:智能体任务占 30%、编程占 20%、科学推理占 20%、通用能力占 30%,再用 Arena 交叉验证。它主要测英文文本,因此以下更接近“综合解决问题能力排名”,对中文文风、语音和视频能力覆盖有限。

参考排名 模型及评测档位 AA 分数 排名理由与特点
1 Claude Opus 5.5 · max 58 综合指数领先;Arena 网页开发也排第一,多个评测方向相互支持,综合第一的证据最充分。数据
并列 2 Claude Fable 5.1 · max 53 综合能力处于顶层,Arena Agent 榜第一,尤其值得用于需要连续调用工具、推进任务的工作。数据
并列 2 GPT-6 Astra · max 53 与 Fable 综合同分;Arena 网页开发第二、Agent 第三,工程执行能力有较强交叉证据。数据
并列 4 GPT-6 Sol · max 48 综合成绩靠前,Arena 网页开发第五;AA 测试任务成本明显低于 Astra,适合兼顾能力与成本。数据
并列 4 Muse Spark 1.3 · max 48 综合能力接近 Sol,文本偏好表现更好;支持图片、视频输入,输出速度也是优势。数据
并列 6 MiMo-V2.6-Pro 46 开放权重模型中的领先者;综合分接近 Grok,AA 实测调用成本很低,国产模型中很有竞争力。数据
并列 6 Grok 4.7 · xhigh 46 综合任务成绩较强,但聊天偏好榜表现明显较弱,说明其优势具有较强的任务依赖性。数据
并列 8 Qwen3.8 Max · 0902 45 综合成绩进入国产前列,0902 版本在 Arena 网页开发榜排第八,工程应用表现较强。数据
并列 8 GLM-5.3 · max 45 开放权重中的强选手;综合成绩接近 MiMo,但该被测型号为文本输入,不能据此推断其视觉能力。数据
并列 10 Kimi K3 · max 44 综合成绩接近 Qwen、GLM;Arena 文本和网页开发也有较好表现,属于有竞争力的开放权重模型。数据
并列 10 Step 5 Preview 44 综合成绩进入国产前列,测试任务成本较低;目前应按预览版本评价。数据

Muse Spark 1.3 ·max是meta的新旗舰模型,与9月2日发布。龟龟,就觉得为什么meta的股价突然涨了10个点
MiMo-V2.6-Pro是小米的最新模型。
而Kimi K3·max是月之暗面的最新模型。
Step 5 Preview是阶跃星辰(StepFun)公司的旗舰基座大模型,听都没听说过的(

2026-8-30

参考排名 模型 8 月 AA 指数 理由
1 Claude Opus 5 · max 63 综合成绩略领先;专业知识工作、文件交付和智能体编程是强项。当时 AA 的 GDPval-AA 与 AA-Briefcase 均由它领跑。
2 Claude Fable 5 · max,带 fallback 62 与 Opus 5 非常接近,事实知识表现更强;但 Opus 5 在部分任务执行评测及成本上更有优势。
并列 3 GPT-5.6 Sol · max 61 综合第一梯队,终端编程和科学推理突出;部分科学推理评测强于当时的 Claude。
并列 3 Grok 4.6 61 综合分追平 Sol;知识工作、工具调用和终端任务表现均较强,调用成本也是竞争优势。
并列 5 Kimi K3 · max 60 国产领先模型之一,复杂知识工作和多步骤任务能力强;与 GLM 同分,事实知识评测更有优势。
并列 5 GLM-5.3 · max 60 智能体能力提升明显;8 月发布评测中的 GDPval-AA 排第二,仅次于 Opus 5,并超过 Kimi K3。

2026-7-30

参考排名 模型及档位 当时 AA 分数 排名理由
1 Claude Opus 5 · max 61 7 月 24 日发布后综合略领先;知识工作、复杂文件交付和智能体编程突出,GDPval-AA、AA-Briefcase 均取得当时最高成绩。
2 Claude Fable 5 · max,带 fallback 60 与 Opus 5 接近;事实知识表现更强,但部分任务执行成绩和成本效率被 Opus 5 超过。
3 GPT-5.6 Sol · max 59 综合能力紧随 Claude,编程与科学推理强;在 Codex 环境下的编程智能体评测中表现领先。
4 Kimi K3 · max 57 国产领先模型,复杂知识工作、多文件分析表现突出;分析质量很强,部分交付物的呈现质量仍有差距。
5 Claude Opus 4.8 · max 56 仍是强旗舰,但综合能力已被 Opus 5、Sol 和 Kimi K3 超过。

2026-6-30

参考排名 模型及评测档位 同期 AA 分数 主要理由
1 Claude Opus 4.8 · max 61.4 综合领先,专业知识工作表现突出;同时提升终端操作和科学推理能力。
2 GPT-5.5 · xhigh 约 60.2 编程、工具执行、长上下文推理很强;科学推理部分项目仍领先 Opus 4.8。
3 Claude Opus 4.7 · max 57.3 知识工作和智能体任务较强,但已被 Opus 4.8 明显超过。
4 Gemini 3.1 Pro Preview 57.2 知识、科学问答、科学编程和指令遵循表现突出。
5 GPT-5.4 · xhigh 56.8 终端编程、研究级物理推理和长上下文推理是强项。
6 Qwen3.7 Max 56.6 国产综合能力领先者,科学推理、编程和智能体能力进步明显,已接近上一代海外旗舰。