259月2026

DAILY AI MODEL INDEX

大模型能力排行

把多份任务成绩放到同一把尺子上,既看能力,也把证据和限制讲清楚。

30 款模型23 项任务评测版本 LiveBench-2026-06-25数据核对 2026-09-25

中文EN

AIdaily 能力总榜 前 30 名

成本单位:美元 / 百万 Token

Token 消耗榜 评分方法与来源
01
GPT-6 Astra Max EffortOpenAI公开 API
日常分析和复杂推理都比较突出
上线日期2026-09-04
评测配置max
输入$10
输出$50
94.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
82.66
科学与复杂推理
94.73
编程
80.36
Agent / 真实编程任务
57.32
02
Claude Fable 5.1 Max EffortAnthropic公开 API
日常分析、推理、写代码和真实任务比较均衡
上线日期2026-09-01
评测配置max
输入$10
输出$50
93.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
80.92
科学与复杂推理
94.35
编程
86.38
Agent / 真实编程任务
66.06
03
Claude Fable 5 Max EffortAnthropic公开 API
理解需求和写代码都比较突出
上线日期2026-06-09
评测配置max
输入$10
输出$50
93.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
82.33
科学与复杂推理
92.82
编程
85.99
Agent / 真实编程任务
62.17
04
Claude Opus 5 Max EffortAnthropic公开 API
复杂推理和真实代码任务都比较突出
上线日期2026-07-24
评测配置max
输入$5
输出$25
93.1
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.67
科学与复杂推理
93.47
编程
81.45
Agent / 真实编程任务
65.20
05
更擅长整理信息、理解指令和完成日常分析
上线日期2026-09-02
评测配置xhigh
输入$1.25
输出$4.25
90.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
80.12
科学与复杂推理
92.80
编程
81.06
Agent / 真实编程任务
64.09
06
GPT-5.6 Sol Max EffortOpenAI公开 API
复杂推理和写代码都比较突出
上线日期2026-07-09
评测配置max
输入$5
输出$30
88.7
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
79.79
科学与复杂推理
93.93
编程
83.94
Agent / 真实编程任务
56.21
07
GLM-5.3智谱开放权重
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-08-18
评测配置default
输入$1.4
输出$4.4
85.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
73.13
科学与复杂推理
86.85
编程
78.95
Agent / 真实编程任务
60.91
08
Grok 4.6xAI公开 API
更擅长数学、科学问题和多步复杂推理
上线日期2026-08-12
评测配置default
输入$2
输出$6
84.1
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
76.47
科学与复杂推理
91.54
编程
76.78
Agent / 真实编程任务
57.02
09
复杂推理和写代码都比较突出
上线日期2026-09-22
评测配置max
输入$4
输出$20
83.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.44
科学与复杂推理
94.62
编程
89.25
Agent / 真实编程任务
71.72
10
Kimi K3月之暗面开放权重
更擅长整理信息、理解指令和完成日常分析
上线日期2026-07-16
评测配置default
输入$3
输出$15
83.1
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
78.54
科学与复杂推理
87.55
编程
81.45
Agent / 真实编程任务
62.17
11
写代码和处理真实代码仓库都比较突出
上线日期2026-09-22
评测配置xhigh
输入$4
输出$20
81.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.45
科学与复杂推理
93.73
编程
89.25
Agent / 真实编程任务
65.35
12
GPT-5.6 Terra Max EffortOpenAI公开 API
更擅长数学、科学问题和多步复杂推理
上线日期2026-07-09
评测配置max
输入$2.5
输出$15
80.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.61
科学与复杂推理
92.77
编程
78.25
Agent / 真实编程任务
54.95
13
复杂推理和写代码都比较突出
上线日期2026-04-16
评测配置max
输入$5
输出$25
78.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.58
科学与复杂推理
91.75
编程
81.83
Agent / 真实编程任务
50.50
14
Gemini 3.8 Flash HighGoogle公开 API
更擅长数学、科学问题和多步复杂推理
上线日期2026-09-02
评测配置high
输入$0.75
输出$3.75
78.1
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
74.40
科学与复杂推理
90.43
编程
72.49
Agent / 真实编程任务
54.24
15
GLM-5.3 Flash智谱开放权重
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-08-26
评测配置default
输入$0.15
输出$0.5
76.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
68.84
科学与复杂推理
79.44
编程
78.95
Agent / 真实编程任务
56.77
16
GPT-6 Sol Max EffortOpenAI公开 API
日常分析和复杂推理都比较突出
上线日期2026-09-22
评测配置max
输入$2
输出$10
76.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
78.35
科学与复杂推理
92.50
编程
81.77
Agent / 真实编程任务
52.88
17
更擅长写出正确代码和补全程序
上线日期2026-04-16
评测配置xhigh
输入$5
输出$25
75.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
74.31
科学与复杂推理
90.02
编程
82.09
Agent / 真实编程任务
50.66
18
Union AlphaStealth公开 API
更擅长写出正确代码和补全程序
上线日期2026-09-16
评测配置default
输入$0
输出$0
74.6
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
73.34
科学与复杂推理
88.02
编程
82.15
Agent / 真实编程任务
54.70
19
Grok 4.7 xHighxAI公开 API
更擅长整理信息、理解指令和完成日常分析
上线日期2026-09-21
评测配置xhigh
输入$2
输出$6
74.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.43
科学与复杂推理
89.17
编程
77.16
Agent / 真实编程任务
53.99
20
Qwen 3.8 Max阿里巴巴开放权重
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-07-19
评测配置max
输入$2
输出$6
73.6
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.39
科学与复杂推理
89.76
编程
72.87
Agent / 真实编程任务
64.65
21
GPT-6 Luna Max EffortOpenAI公开 API
更擅长写出正确代码和补全程序
上线日期2026-09-22
评测配置max
输入$0.1
输出$0.5
70.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
67.71
科学与复杂推理
85.45
编程
78.95
Agent / 真实编程任务
51.21
22
DeepSeek V4.1 Flash Max EffortDeepSeek开放权重
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-09-10
评测配置max
输入$0.15
输出$0.6
66.7
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
76.83
科学与复杂推理
89.99
编程
80.04
Agent / 真实编程任务
77.27
23
Gemini 3.7 Flash HighGoogle公开 API
更擅长整理信息、理解指令和完成日常分析
上线日期2026-08-13
评测配置high
输入$0.75
输出$3.75
64.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.78
科学与复杂推理
90.63
编程
78.89
Agent / 真实编程任务
58.28
24
Grok 4.5xAI公开 API
理解需求和处理真实代码任务都比较突出
上线日期待核实
评测配置default
输入$2
输出$6
58.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.79
科学与复杂推理
89.00
编程
68.59
Agent / 真实编程任务
56.46
25
更擅长整理信息、理解指令和完成日常分析
上线日期2026-04-23
评测配置xhigh
输入$5
输出$30
58.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
79.89
科学与复杂推理
92.76
编程
82.15
Agent / 真实编程任务
53.99
26
日常分析和复杂推理都比较突出
上线日期2026-03-05
评测配置xhigh
输入$2.5
输出$15
58.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.39
科学与复杂推理
91.13
编程
77.54
Agent / 真实编程任务
53.84
27
GLM-5.2智谱开放权重
更擅长写出正确代码和补全程序
上线日期待核实
评测配置default
输入$1.4
输出$4.4
54.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
70.76
科学与复杂推理
84.20
编程
79.65
Agent / 真实编程任务
51.77
28
Claude Sonnet 5 xHigh EffortAnthropic公开 API
复杂推理和真实代码任务都比较突出
上线日期待核实
评测配置xhigh
输入$3
输出$15
52.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
70.19
科学与复杂推理
90.82
编程
80.68
Agent / 真实编程任务
59.39
29
GPT-5.6 Luna Max EffortOpenAI公开 API
更擅长写出正确代码和补全程序
上线日期2026-07-09
评测配置max
输入$1
输出$6
49.7
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
70.24
科学与复杂推理
86.42
编程
82.91
Agent / 真实编程任务
48.43
30
DeepSeek V4 Pro 0813DeepSeek开放权重
更擅长数学、科学问题和多步复杂推理
上线日期2026-08-13
评测配置default
输入$0.435
输出$0.87
49.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
76.34
科学与复杂推理
90.46
编程
77.16
Agent / 真实编程任务
54.95

AIHOT 大模型共识能力排行 · AIHOT Consensus v1

汇总全网 7 家独立评测机构的 9 张权威榜单,用固定问题预算计算 AIHOT 共识分,直观呈现主流大模型的综合能力。

综合评测 30% + 真人盲选 10% + 专项评测 60%(编程设计 12% + 数学推理 12% + 写作表达 9% + 知识事实 6% + 视觉理解 6% + 工具办公 6% + 中文多语言 6% + 行业专业 3%)

只在具备至少 3 个独立证据家族和冻结锚点之间评估共识;缺榜只降低评测完整度与确定性,不直接扣分,也不把空缺权重转给别榜。

数据综合 Artificial Analysis、LiveBench、LMArena、Mercor、Vals AI、DataCurve 与 TapTap Maker 7 家独立机构。价格统一核对厂商官方公开定价。

状态链接会打开最新榜单;长图会写明分享时的数据日期。