数据更新延迟,当前显示最后一次完整核验结果。最后完整核验: 本次未完成的信源: 厂商官方目录
排名模型 / 厂商最擅长上线日期评测配置输入输出AIdaily 能力分
01
日常分析、推理、写代码和真实任务比较均衡
上线日期2026-06-09
评测配置max
输入$10
输出$50
80.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 82.33
- 科学与复杂推理
- 92.82
- 编程
- 85.99
- Agent / 真实编程任务
- 62.17
官方页面LiveBench 原始数据
02
复杂推理和真实代码任务都比较突出
上线日期2026-07-22
评测配置max
输入$5
输出$25
78.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 75.67
- 科学与复杂推理
- 93.47
- 编程
- 81.45
- Agent / 真实编程任务
- 65.20
官方页面LiveBench 原始数据
03
复杂推理和写代码都比较突出
上线日期2026-07-09
评测配置max
输入$5
输出$30
78.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 79.79
- 科学与复杂推理
- 93.93
- 编程
- 83.94
- Agent / 真实编程任务
- 56.21
官方页面LiveBench 原始数据
04
理解需求和处理真实代码任务都比较突出
上线日期2026-07-16
评测配置default
输入$3
输出$15
77.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 78.54
- 科学与复杂推理
- 87.55
- 编程
- 81.45
- Agent / 真实编程任务
- 62.17
官方页面LiveBench 原始数据
05
更擅长整理信息、理解指令和完成日常分析
上线日期2026-04-23
评测配置xhigh
输入$5
输出$30
77.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 79.89
- 科学与复杂推理
- 92.76
- 编程
- 82.15
- Agent / 真实编程任务
- 53.99
官方页面LiveBench 原始数据
06
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-07-19
评测配置max
输入$2
输出$6
76.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 77.39
- 科学与复杂推理
- 89.76
- 编程
- 72.87
- Agent / 真实编程任务
- 64.65
官方页面LiveBench 原始数据
07
理解需求和处理真实代码任务都比较突出
上线日期2026-08-05
评测配置xhigh
输入$1.25
输出$4.25
75.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 76.45
- 科学与复杂推理
- 90.60
- 编程
- 77.54
- Agent / 真实编程任务
- 57.58
官方页面LiveBench 原始数据
08
更擅长数学、科学问题和多步复杂推理
上线日期2026-07-09
评测配置max
输入$2.5
输出$15
75.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 75.61
- 科学与复杂推理
- 92.77
- 编程
- 78.25
- Agent / 真实编程任务
- 54.95
官方页面LiveBench 原始数据
09
更擅长在真实代码仓库里连续修改并解决问题
上线日期待核实
评测配置xhigh
输入$3
输出$15
75.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 70.19
- 科学与复杂推理
- 90.82
- 编程
- 80.68
- Agent / 真实编程任务
- 59.39
官方页面LiveBench 原始数据
10
日常分析和复杂推理都比较突出
上线日期2026-03-05
评测配置xhigh
输入$2.5
输出$15
75.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 77.39
- 科学与复杂推理
- 91.13
- 编程
- 77.54
- Agent / 真实编程任务
- 53.84
官方页面LiveBench 原始数据
11
更擅长写出正确代码和补全程序
上线日期2026-04-16
评测配置xhigh
输入$5
输出$25
74.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 74.31
- 科学与复杂推理
- 90.02
- 编程
- 82.09
- Agent / 真实编程任务
- 50.66
官方页面LiveBench 原始数据
12
复杂推理和写代码都比较突出
上线日期2026-04-16
评测配置max
输入$5
输出$25
74.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.58
- 科学与复杂推理
- 91.75
- 编程
- 81.83
- Agent / 真实编程任务
- 50.50
官方页面LiveBench 原始数据
13
更擅长在真实代码仓库里连续修改并解决问题
上线日期待核实
评测配置xhigh
输入$1.25
输出$4.25
73.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.18
- 科学与复杂推理
- 87.44
- 编程
- 77.16
- Agent / 真实编程任务
- 58.54
官方页面LiveBench 原始数据
14
理解需求和处理真实代码任务都比较突出
上线日期待核实
评测配置default
输入$2
输出$6
72.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 75.79
- 科学与复杂推理
- 89.00
- 编程
- 68.59
- Agent / 真实编程任务
- 56.46
官方页面LiveBench 原始数据
15
更擅长整理信息、理解指令和完成日常分析
上线日期待核实
评测配置high
输入$2
输出$12
72.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 81.01
- 科学与复杂推理
- 87.52
- 编程
- 76.45
- Agent / 真实编程任务
- 44.14
官方页面LiveBench 原始数据
16
更擅长写出正确代码和补全程序
上线日期2026-01-14
评测配置default
输入$1.75
输出$14
72.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.78
- 科学与复杂推理
- 83.24
- 编程
- 83.62
- Agent / 真实编程任务
- 49.39
官方页面LiveBench 原始数据
17
更擅长数学、科学问题和多步复杂推理
上线日期2026-02-05
评测配置high
输入$5
输出$25
72.1
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.16
- 科学与复杂推理
- 89.00
- 编程
- 78.18
- Agent / 真实编程任务
- 48.99
官方页面LiveBench 原始数据
18
更擅长写出正确代码和补全程序
上线日期2026-07-09
评测配置max
输入$1
输出$6
72.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 70.24
- 科学与复杂推理
- 86.42
- 编程
- 82.91
- Agent / 真实编程任务
- 48.43
官方页面LiveBench 原始数据
19
更擅长数学、科学问题和多步复杂推理
上线日期2025-12-11
评测配置high
输入$1.75
输出$14
71.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 73.25
- 科学与复杂推理
- 88.19
- 编程
- 76.07
- Agent / 真实编程任务
- 50.25
官方页面LiveBench 原始数据
20
更擅长整理信息、理解指令和完成日常分析
上线日期2026-05-19
评测配置high
输入$1.5
输出$9
71.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 75.01
- 科学与复杂推理
- 85.12
- 编程
- 78.18
- Agent / 真实编程任务
- 48.99
官方页面LiveBench 原始数据
21
写代码和处理真实代码仓库都比较突出
上线日期待核实
评测配置default
输入$1.4
输出$4.4
71.6
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 70.76
- 科学与复杂推理
- 84.20
- 编程
- 79.65
- Agent / 真实编程任务
- 51.77
官方页面LiveBench 原始数据
22
更擅长整理信息、理解指令和完成日常分析
上线日期2026-07-31
评测配置default
输入$0.14
输出$0.28
70.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 74.67
- 科学与复杂推理
- 86.71
- 编程
- 74.98
- Agent / 真实编程任务
- 46.77
官方页面LiveBench 原始数据
23
更擅长整理信息、理解指令和完成日常分析
上线日期待核实
评测配置high
输入$1.5
输出$7.5
70.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 74.09
- 科学与复杂推理
- 85.78
- 编程
- 77.86
- Agent / 真实编程任务
- 43.43
官方页面LiveBench 原始数据
24
更擅长写出正确代码和补全程序
上线日期2026-02-17
评测配置medium
输入$3
输出$15
70.1
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.42
- 科学与复杂推理
- 85.88
- 编程
- 79.27
- Agent / 真实编程任务
- 42.63
官方页面LiveBench 原始数据
25
更擅长写出正确代码和补全程序
上线日期2025-11-01
评测配置high
输入$5
输出$25
69.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.75
- 科学与复杂推理
- 85.24
- 编程
- 79.65
- Agent / 真实编程任务
- 39.70
官方页面LiveBench 原始数据
26
更擅长整理信息、理解指令和完成日常分析
上线日期待核实
评测配置max
输入$2.5
输出$7.5
69.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 75.19
- 科学与复杂推理
- 84.29
- 编程
- 74.22
- Agent / 真实编程任务
- 43.59
官方页面LiveBench 原始数据
27
更擅长在真实代码仓库里连续修改并解决问题
上线日期待核实
评测配置xhigh
输入$1.87
输出$4.68
69.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.11
- 科学与复杂推理
- 83.36
- 编程
- 71.02
- Agent / 真实编程任务
- 49.39
官方页面LiveBench 原始数据
28
更擅长写出正确代码和补全程序
上线日期待核实
评测配置default
输入$0.95
输出$4
68.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 68.21
- 科学与复杂推理
- 81.83
- 编程
- 78.57
- Agent / 真实编程任务
- 46.92
官方页面LiveBench 原始数据
29
更擅长数学、科学问题和多步复杂推理
上线日期2026-04-24
评测配置default
输入$0.435
输出$0.87
67.7
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 71.67
- 科学与复杂推理
- 86.68
- 编程
- 69.99
- Agent / 真实编程任务
- 42.63
官方页面LiveBench 原始数据
30
更擅长数学、科学问题和多步复杂推理
上线日期2026-03-17
评测配置xhigh
输入$0.2
输出$1.25
67.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 65.78
- 科学与复杂推理
- 86.04
- 编程
- 70.84
- Agent / 真实编程任务
- 46.77
官方页面LiveBench 原始数据
同一厂商可以保留多款当前主力,避免只看一款就误判整个品牌。
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$1 / $6来源
复杂推理和写代码都比较突出
可用性公开 API阶段稳定接入api价格$5 / $30来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$2.5 / $15来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$5 / $30来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$0.75 / $4.5来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$0.2 / $1.25来源
日常分析和复杂推理都比较突出
可用性公开 API阶段稳定接入api价格$2.5 / $15来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$1.75 / $14来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$1.75 / $14来源
复杂推理和真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$5 / $25来源
日常分析、推理、写代码和真实任务比较均衡
可用性公开 API阶段稳定接入api价格$10 / $50来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$5 / $25来源
复杂推理和写代码都比较突出
可用性公开 API阶段稳定接入api价格$5 / $25来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$3 / $15来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$5 / $25来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$5 / $25来源
更擅长在真实代码仓库里连续修改并解决问题
可用性公开 API阶段稳定接入api价格$3 / $15来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$1.5 / $9来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$0.3 / $2.5来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$1.5 / $7.5来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段预览接入api价格$2 / $12来源
理解需求和处理真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$1.25 / $4.25来源
更擅长在真实代码仓库里连续修改并解决问题
可用性公开 API阶段稳定接入api价格$1.25 / $4.25来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$1.25 / $2.5来源
理解需求和处理真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$2 / $6来源
更擅长在真实代码仓库里连续修改并解决问题
可用性公开 API阶段稳定接入api价格$1 / $2来源
适合需要欧洲部署选择的通用企业任务
可用性普通用户可用阶段稳定接入consumer价格待核实来源
更擅长在真实代码仓库里连续修改并解决问题
可用性公开 API阶段稳定接入api价格$2 / $6来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$0.5 / $3来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$2.5 / $7.5来源
更擅长写出正确代码和补全程序
可用性开放权重阶段稳定接入api, weights价格$0.6 / $3.6来源
适合接入腾讯云服务处理中文日常任务
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合百度智能云里的中文问答和内容处理
可用性普通用户可用阶段稳定接入consumer价格待核实来源
更擅长整理信息、理解指令和完成日常分析
可用性开放权重阶段稳定接入api, weights价格$0.14 / $0.28来源
更擅长数学、科学问题和多步复杂推理
可用性开放权重阶段稳定接入api, weights价格$0.435 / $0.87来源
日常分析、推理、写代码和真实任务比较均衡
可用性开放权重阶段稳定接入api, weights价格$0.14 / $0.28来源
理解需求和处理真实代码任务都比较突出
可用性开放权重阶段稳定接入api, weights价格$3 / $15来源
更擅长写出正确代码和补全程序
可用性开放权重阶段稳定接入api, weights价格$0.95 / $4来源
更擅长在真实代码仓库里连续修改并解决问题
可用性开放权重阶段稳定接入api, weights价格$0.95 / $4来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$0.3 / $1.2来源
写代码和处理真实代码仓库都比较突出
可用性开放权重阶段稳定接入api, weights价格$1.4 / $4.4来源
更擅长在真实代码仓库里连续修改并解决问题
可用性公开 API阶段稳定接入api价格$1.87 / $4.68来源
只推荐普通用户或公开 API 可用的型号,按真实用途给出选择线索。
综合能力
日常分析、推理、写代码和真实任务比较均衡
可用性公开 API阶段稳定接入api价格$10 / $50来源
复杂推理和真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$5 / $25来源
复杂推理和写代码都比较突出
可用性公开 API阶段稳定接入api价格$5 / $30来源
编程与真实任务
日常分析、推理、写代码和真实任务比较均衡
可用性公开 API阶段稳定接入api价格$10 / $50来源
复杂推理和真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$5 / $25来源
理解需求和处理真实代码任务都比较突出
可用性开放权重阶段稳定接入api, weights价格$3 / $15来源
复杂推理
复杂推理和写代码都比较突出
可用性公开 API阶段稳定接入api价格$5 / $30来源
复杂推理和真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$5 / $25来源
日常分析、推理、写代码和真实任务比较均衡
可用性公开 API阶段稳定接入api价格$10 / $50来源
价格友好
理解需求和处理真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$1.25 / $4.25来源
更擅长在真实代码仓库里连续修改并解决问题
可用性公开 API阶段稳定接入api价格$1.25 / $4.25来源
更擅长在真实代码仓库里连续修改并解决问题
可用性公开 API阶段稳定接入api价格$2 / $6来源
开放权重
理解需求和处理真实代码任务都比较突出
可用性开放权重阶段稳定接入api, weights价格$3 / $15来源
写代码和处理真实代码仓库都比较突出
可用性开放权重阶段稳定接入api, weights价格$1.4 / $4.4来源
更擅长整理信息、理解指令和完成日常分析
可用性开放权重阶段稳定接入api, weights价格$0.14 / $0.28来源
暂无同口径能力排行。这里展示厂商公开的专项模型,不把不同模态硬凑成一个总分。
适合把文字说明直接变成可编辑的成品图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合追求清晰文字和写实细节的图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合中文创意图和多张参考图编辑
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合快速做出风格鲜明的视觉概念图
可用性普通用户可用阶段稳定接入consumer价格待核实来源
同一厂商可以保留多款当前主力,避免只看一款就误判整个品牌。
适合把文字说明直接变成可编辑的成品图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合追求清晰文字和写实细节的图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合中文创意图和多张参考图编辑
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合快速做出风格鲜明的视觉概念图
可用性普通用户可用阶段稳定接入consumer价格待核实来源
只推荐普通用户或公开 API 可用的型号,按真实用途给出选择线索。
本期新款 / 当前主力
适合追求清晰文字和写实细节的图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合把文字说明直接变成可编辑的成品图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合快速做出风格鲜明的视觉概念图
可用性普通用户可用阶段稳定接入consumer价格待核实来源
暂无同口径能力排行。这里展示厂商公开的专项模型,不把不同模态硬凑成一个总分。
适合生成连贯镜头和带声音的短视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合电影感画面和原生声音生成
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合长叙事和多种参考素材一起控制
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合控制视频预算并快速试做多个版本
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合生成动作连贯、镜头稳定的视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
同一厂商可以保留多款当前主力,避免只看一款就误判整个品牌。
适合生成连贯镜头和带声音的短视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合电影感画面和原生声音生成
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合长叙事和多种参考素材一起控制
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合控制视频预算并快速试做多个版本
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合生成动作连贯、镜头稳定的视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
只推荐普通用户或公开 API 可用的型号,按真实用途给出选择线索。
本期新款 / 当前主力
适合电影感画面和原生声音生成
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合生成动作连贯、镜头稳定的视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合控制视频预算并快速试做多个版本
可用性普通用户可用阶段稳定接入consumer价格待核实来源
暂无同口径能力排行。这里展示厂商公开的专项模型,不把不同模态硬凑成一个总分。
适合把文字快速变成自然语音
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合多人对话和更细的语气控制
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合情绪丰富的配音和多语言表达
可用性普通用户可用阶段稳定接入consumer价格待核实来源
同一厂商可以保留多款当前主力,避免只看一款就误判整个品牌。
适合把文字快速变成自然语音
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合多人对话和更细的语气控制
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合情绪丰富的配音和多语言表达
可用性普通用户可用阶段稳定接入consumer价格待核实来源
只推荐普通用户或公开 API 可用的型号,按真实用途给出选择线索。
本期新款 / 当前主力
适合把文字快速变成自然语音
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合情绪丰富的配音和多语言表达
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合多人对话和更细的语气控制
可用性普通用户可用阶段稳定接入consumer价格待核实来源
AIdaily 综合能力参考 · Composite v1
四个支柱各占 25%。分数只反映同一 LiveBench 发布版中的任务表现,不代表中文能力、价格、速度、创作偏好或全部 Agent 工作。
通用能力 25% + 科学与复杂推理 25% + 编程 25% + Agent / 真实编程任务 25%
小分差不一定代表明显领先。缺少任一任务就不参加正式排名,缺失值不会补零或重新分配权重。