MODEL BENCHMARK · BETA
大模型排行榜
汇总十家公开模型榜单,展示当前前 30 名模型的上线时间、公开价格、评测完整度与本站共识分。
TOP 30当前总榜
10/10来源已接入
10-source v2当前共识版本
TEN-SOURCE CONSENSUS
综合能力排名
官方美元价格 / 百万 Token
汇率快照 2026-08-17;仅供比较,不是实时结算价| 排名 | 模型 | 展开详情 | |||||
|---|---|---|---|---|---|---|---|
| 01 | Claude Opus 5 (max)Anthropic | 85%8.5 / 10 家 | $5.00 | $25.00 | 92.6 | ||
| 02 | Claude Fable 5 (with fallback)Anthropic | 90%9 / 10 家 | $10.00 | $50.00 | 87.6 | ||
| 03 | GPT-5.6 Sol (max)OpenAI | 95%9.5 / 10 家 | $5.00 | $30.00 | 87.2 | ||
| 04 | Kimi K3 (max)Moonshot AI | 95%9.5 / 10 家 | $3.00 | $15.00 | 80.7 | ||
| 05 | Claude Opus 4.7 (max)Anthropic | 20%2 / 10 家 | $5.00 | $25.00 | 79.3 | ||
| 06 | Muse Spark 1.1 (xhigh)Meta | 20%2 / 10 家 | $1.25 | $4.25 | 71.6 | ||
| 07 | GPT-5.5 (xhigh)OpenAI | 20%2 / 10 家 | $5.00 | $30.00 | 69.0 | ||
| 08 | Claude Opus 4.8 (max)Anthropic | 70%7 / 10 家 | $5.00 | $25.00 | 66.9 | ||
| 09 | Qwen3.8 MaxAlibaba | 80%8 / 10 家 | $2.00 | $6.00 | 66.5 | ||
| 10 | Muse Spark 1.2 (xhigh)Meta | 60%6 / 10 家 | $1.25 | $4.25 | 66.1 | ||
| 11 | GPT-5.6 Terra (max)OpenAI | 80%8 / 10 家 | $2.00 | $12.00 | 63.4 | ||
| 12 | Gemini 3.5 Flash (high)Google | 20%2 / 10 家 | $1.50 | $9.00 | 53.4 | ||
| 13 | GPT-5.6 Luna (max)OpenAI | 90%9 / 10 家 | $0.20 | $1.20 | 48.1 | ||
| 14 | Claude Sonnet 5 (max)Anthropic | 85%8.5 / 10 家 | $2.00 | $10.00 | 45.9 | ||
| 15 | Grok 4.5 (high)xAI | 90%9 / 10 家 | $2.00 | $6.00 | 45.3 | ||
| 16 | DeepSeek V4 Pro 0813 (max)DeepSeek | 20%2 / 10 家 | $1.32 | $3.96 | 38.8 | ||
| 17 | Gemini 3.6 FlashGoogle | 70%7 / 10 家 | $1.50 | $7.50 | 36.3 | ||
| 18 | DeepSeek V4 Flash 0731 (max)DeepSeek | 65%6.5 / 10 家 | $0.44 | $1.32 | 35.2 | ||
| 19 | GLM-5.2 (max)Z.ai | 95%9.5 / 10 家 | $1.40 | $4.40 | 34.0 | ||
| 20 | Qwen3.7 MaxAlibaba | 80%8 / 10 家 | $2.50 | $7.50 | 31.9 | ||
| 21 | Kimi K2.6Moonshot AI | 20%2 / 10 家 | $0.95 | $4.00 | 31.0 | ||
| 22 | GLM-5.1Z.ai | 20%2 / 10 家 | $1.38 | $4.40 | 29.3 | ||
| 23 | Qwen3.7 PlusAlibaba | 20%2 / 10 家 | $0.40 | $1.60 | 20.7 | ||
| 24 | MiMo-V2.5-ProXiaomi | 60%6 / 10 家 | $0.43 | $0.87 | 17.7 | ||
| 25 | InklingThinking Machines | 60%6 / 10 家 | $1.00 | $4.05 | 17.3 | ||
| 26 | MiniMax-M3MiniMax | 70%7 / 10 家 | $0.30 | $1.20 | 15.2 | ||
| 27 | Gemini 3 Flash (reasoning)Google | 20%2 / 10 家 | $0.50 | $3.00 | 14.7 | ||
| 28 | Gemini 3.5 Flash-LiteGoogle | 50%5 / 10 家 | $0.30 | $2.50 | 10.8 | ||
| 29 | Grok 4.3 (high)xAI | 20%2 / 10 家 | $1.25 | $2.50 | 6.0 | ||
| 30 | Nemotron 3 UltraNVIDIA | 45%4.5 / 10 家 | $0.60 | $2.75 | 2.3 |
METHODOLOGY
10 家独立来源
每家来源固定占一票;同一运营方的多张榜单在组内平分,缺榜只降低完整度。
已接入Artificial AnalysisIntelligence Index v4.1.1 · 2026-08-17
在统一环境中复跑多项当前评测,衡量模型的综合能力。
已接入Epoch AI官方 benchmark_data.zip · 2026-08-10将五十多项跨时期评测拟合到同一能力尺度。
已接入LiveBenchLiveBench-2026-06-25 · 7 类平均以持续更新、答案可验证的七类任务衡量当前模型。
已接入LMArenaText · Style Control · 2026-08-12用匿名两两盲选补充客观题库无法覆盖的回答体验。
已接入EQ-BenchEQ-Bench 4 ELO · 2026-08-10 抓取观察模型在对话中的情绪、关系和复杂语境理解。
已接入Vals AIVals Index v1.2 · Overall · 2026-08-06综合金融、编码等专业任务,只把 Overall 作为一张来源票。
已接入MercorMean Score · ReAct + Loop · 2026-08-10 抓取衡量投行、咨询和法律等长流程专业任务。
已接入Agents’ Last ExamALE-V1 · Overall / Full · Pass Rate · 2026-08-10在真实沙箱环境中评估智能体完成跨领域任务的能力。
已接入DeepSWEDeepSWE v1.1 · Best Pass@1 · 113 tasks · 2026-08-07在统一 mini-swe-agent harness 下比较软件工程能力。
已接入llm20142026-08 月榜 · Reasoning 中位分 · 2026-08-10采用最新月度推理中位分;Agentic 八任务档位仅作明细,不强行折算。