108月2026

DAILY AI MODEL INDEX

大模型能力排行

把多份任务成绩放到同一把尺子上,既看能力,也把证据和限制讲清楚。

30 款模型23 项任务评测版本 LiveBench-2026-06-25数据核对 2026-08-10

中文EN

数据更新延迟,当前显示最后一次完整核验结果。最后完整核验: 本次未完成的信源: 厂商官方目录

AIdaily 能力总榜 前 30 名

成本单位:美元 / 百万 Token

01
Claude Fable 5 Max EffortAnthropic公开 API
日常分析、推理、写代码和真实任务比较均衡
上线日期2026-06-09
评测配置max
输入$10
输出$50
80.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
82.33
科学与复杂推理
92.82
编程
85.99
Agent / 真实编程任务
62.17
02
复杂推理和真实代码任务都比较突出
上线日期2026-07-22
评测配置max
输入$5
输出$25
78.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.67
科学与复杂推理
93.47
编程
81.45
Agent / 真实编程任务
65.20
03
GPT-5.6 Sol Max EffortOpenAI公开 API
复杂推理和写代码都比较突出
上线日期2026-07-09
评测配置max
输入$5
输出$30
78.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
79.79
科学与复杂推理
93.93
编程
83.94
Agent / 真实编程任务
56.21
04
Kimi K3月之暗面开放权重
理解需求和处理真实代码任务都比较突出
上线日期2026-07-16
评测配置default
输入$3
输出$15
77.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
78.54
科学与复杂推理
87.55
编程
81.45
Agent / 真实编程任务
62.17
05
更擅长整理信息、理解指令和完成日常分析
上线日期2026-04-23
评测配置xhigh
输入$5
输出$30
77.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
79.89
科学与复杂推理
92.76
编程
82.15
Agent / 真实编程任务
53.99
06
Qwen 3.8 Max阿里巴巴公开 API
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-07-19
评测配置max
输入$2
输出$6
76.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.39
科学与复杂推理
89.76
编程
72.87
Agent / 真实编程任务
64.65
07
理解需求和处理真实代码任务都比较突出
上线日期2026-08-05
评测配置xhigh
输入$1.25
输出$4.25
75.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
76.45
科学与复杂推理
90.60
编程
77.54
Agent / 真实编程任务
57.58
08
GPT-5.6 Terra Max EffortOpenAI公开 API
更擅长数学、科学问题和多步复杂推理
上线日期2026-07-09
评测配置max
输入$2.5
输出$15
75.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.61
科学与复杂推理
92.77
编程
78.25
Agent / 真实编程任务
54.95
09
Claude Sonnet 5 xHigh EffortAnthropic公开 API
更擅长在真实代码仓库里连续修改并解决问题
上线日期待核实
评测配置xhigh
输入$3
输出$15
75.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
70.19
科学与复杂推理
90.82
编程
80.68
Agent / 真实编程任务
59.39
10
日常分析和复杂推理都比较突出
上线日期2026-03-05
评测配置xhigh
输入$2.5
输出$15
75.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.39
科学与复杂推理
91.13
编程
77.54
Agent / 真实编程任务
53.84
11
更擅长写出正确代码和补全程序
上线日期2026-04-16
评测配置xhigh
输入$5
输出$25
74.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
74.31
科学与复杂推理
90.02
编程
82.09
Agent / 真实编程任务
50.66
12
复杂推理和写代码都比较突出
上线日期2026-04-16
评测配置max
输入$5
输出$25
74.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.58
科学与复杂推理
91.75
编程
81.83
Agent / 真实编程任务
50.50
13
更擅长在真实代码仓库里连续修改并解决问题
上线日期待核实
评测配置xhigh
输入$1.25
输出$4.25
73.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.18
科学与复杂推理
87.44
编程
77.16
Agent / 真实编程任务
58.54
14
Grok 4.5xAI公开 API
理解需求和处理真实代码任务都比较突出
上线日期待核实
评测配置default
输入$2
输出$6
72.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.79
科学与复杂推理
89.00
编程
68.59
Agent / 真实编程任务
56.46
15
更擅长整理信息、理解指令和完成日常分析
上线日期待核实
评测配置high
输入$2
输出$12
72.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
81.01
科学与复杂推理
87.52
编程
76.45
Agent / 真实编程任务
44.14
16
GPT-5.2 CodexOpenAI公开 API
更擅长写出正确代码和补全程序
上线日期2026-01-14
评测配置default
输入$1.75
输出$14
72.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.78
科学与复杂推理
83.24
编程
83.62
Agent / 真实编程任务
49.39
17
更擅长数学、科学问题和多步复杂推理
上线日期2026-02-05
评测配置high
输入$5
输出$25
72.1
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.16
科学与复杂推理
89.00
编程
78.18
Agent / 真实编程任务
48.99
18
GPT-5.6 Luna Max EffortOpenAI公开 API
更擅长写出正确代码和补全程序
上线日期2026-07-09
评测配置max
输入$1
输出$6
72.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
70.24
科学与复杂推理
86.42
编程
82.91
Agent / 真实编程任务
48.43
19
GPT-5.2 HighOpenAI公开 API
更擅长数学、科学问题和多步复杂推理
上线日期2025-12-11
评测配置high
输入$1.75
输出$14
71.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
73.25
科学与复杂推理
88.19
编程
76.07
Agent / 真实编程任务
50.25
20
Gemini 3.5 Flash HighGoogle公开 API
更擅长整理信息、理解指令和完成日常分析
上线日期2026-05-19
评测配置high
输入$1.5
输出$9
71.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.01
科学与复杂推理
85.12
编程
78.18
Agent / 真实编程任务
48.99
21
GLM-5.2智谱开放权重
写代码和处理真实代码仓库都比较突出
上线日期待核实
评测配置default
输入$1.4
输出$4.4
71.6
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
70.76
科学与复杂推理
84.20
编程
79.65
Agent / 真实编程任务
51.77
22
DeepSeek V4 Flash 0731DeepSeek开放权重
更擅长整理信息、理解指令和完成日常分析
上线日期2026-07-31
评测配置default
输入$0.14
输出$0.28
70.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
74.67
科学与复杂推理
86.71
编程
74.98
Agent / 真实编程任务
46.77
23
Gemini 3.6 Flash HighGoogle公开 API
更擅长整理信息、理解指令和完成日常分析
上线日期待核实
评测配置high
输入$1.5
输出$7.5
70.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
74.09
科学与复杂推理
85.78
编程
77.86
Agent / 真实编程任务
43.43
25
更擅长写出正确代码和补全程序
上线日期2025-11-01
评测配置high
输入$5
输出$25
69.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.75
科学与复杂推理
85.24
编程
79.65
Agent / 真实编程任务
39.70
26
Qwen 3.7 Max阿里巴巴公开 API
更擅长整理信息、理解指令和完成日常分析
上线日期待核实
评测配置max
输入$2.5
输出$7.5
69.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.19
科学与复杂推理
84.29
编程
74.22
Agent / 真实编程任务
43.59
27
Inkling xHigh EffortThinking Machines公开 API
更擅长在真实代码仓库里连续修改并解决问题
上线日期待核实
评测配置xhigh
输入$1.87
输出$4.68
69.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.11
科学与复杂推理
83.36
编程
71.02
Agent / 真实编程任务
49.39
28
Kimi K2.6 Thinking月之暗面开放权重
更擅长写出正确代码和补全程序
上线日期待核实
评测配置default
输入$0.95
输出$4
68.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
68.21
科学与复杂推理
81.83
编程
78.57
Agent / 真实编程任务
46.92
29
DeepSeek V4 ProDeepSeek开放权重
更擅长数学、科学问题和多步复杂推理
上线日期2026-04-24
评测配置default
输入$0.435
输出$0.87
67.7
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
71.67
科学与复杂推理
86.68
编程
69.99
Agent / 真实编程任务
42.63
30
GPT-5.4 Nano xHighOpenAI公开 API
更擅长数学、科学问题和多步复杂推理
上线日期2026-03-17
评测配置xhigh
输入$0.2
输出$1.25
67.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
65.78
科学与复杂推理
86.04
编程
70.84
Agent / 真实编程任务
46.77

AIdaily 综合能力参考 · Composite v1

四个支柱各占 25%。分数只反映同一 LiveBench 发布版中的任务表现,不代表中文能力、价格、速度、创作偏好或全部 Agent 工作。

通用能力 25% + 科学与复杂推理 25% + 编程 25% + Agent / 真实编程任务 25%

小分差不一定代表明显领先。缺少任一任务就不参加正式排名,缺失值不会补零或重新分配权重。

数据署名 LiveBench 与 Abacus.AI。AIdaily 对公开结果重新聚合为四支柱,这不是 LiveBench 官方总分;最擅长的一句话也不是厂商广告。

状态链接会打开最新榜单;长图会写明分享时的数据日期。