排名模型 / 厂商最擅长上线日期评测配置输入输出AIdaily 能力分
01
日常分析、推理、写代码和真实任务比较均衡
上线日期2026-06-09
评测配置max
输入$10
输出$50
80.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 82.33
- 科学与复杂推理
- 92.82
- 编程
- 85.99
- Agent / 真实编程任务
- 62.17
官方页面LiveBench 原始数据
02
复杂推理和真实代码任务都比较突出
上线日期2026-07-24
评测配置max
输入$5
输出$25
78.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 75.67
- 科学与复杂推理
- 93.47
- 编程
- 81.45
- Agent / 真实编程任务
- 65.20
官方页面LiveBench 原始数据
03
复杂推理和写代码都比较突出
上线日期2026-07-09
评测配置max
输入$5
输出$30
78.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 79.79
- 科学与复杂推理
- 93.93
- 编程
- 83.94
- Agent / 真实编程任务
- 56.21
官方页面LiveBench 原始数据
04
理解需求和处理真实代码任务都比较突出
上线日期待核实
评测配置default
输入$3
输出$15
78.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 78.42
- 科学与复杂推理
- 87.10
- 编程
- 82.47
- Agent / 真实编程任务
- 64.65
官方页面LiveBench 原始数据
05
理解需求和处理真实代码任务都比较突出
上线日期2026-07-16
评测配置default
输入$3
输出$15
77.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 78.54
- 科学与复杂推理
- 87.55
- 编程
- 81.45
- Agent / 真实编程任务
- 62.17
官方页面LiveBench 原始数据
06
更擅长整理信息、理解指令和完成日常分析
上线日期2026-04-23
评测配置xhigh
输入$5
输出$30
77.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 79.89
- 科学与复杂推理
- 92.76
- 编程
- 82.15
- Agent / 真实编程任务
- 53.99
官方页面LiveBench 原始数据
07
更擅长整理信息、理解指令和完成日常分析
上线日期2026-08-13
评测配置high
输入$0.75
输出$3.75
76.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 77.78
- 科学与复杂推理
- 90.63
- 编程
- 78.89
- Agent / 真实编程任务
- 58.28
官方页面LiveBench 原始数据
08
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-07-19
评测配置max
输入$2
输出$6
76.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 77.39
- 科学与复杂推理
- 89.76
- 编程
- 72.87
- Agent / 真实编程任务
- 64.65
官方页面LiveBench 原始数据
09
更擅长数学、科学问题和多步复杂推理
上线日期2026-08-12
评测配置default
输入$2
输出$6
75.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 76.47
- 科学与复杂推理
- 91.54
- 编程
- 76.78
- Agent / 真实编程任务
- 57.02
官方页面LiveBench 原始数据
10
更擅长数学、科学问题和多步复杂推理
上线日期2026-07-09
评测配置max
输入$2.5
输出$15
75.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 75.61
- 科学与复杂推理
- 92.77
- 编程
- 78.25
- Agent / 真实编程任务
- 54.95
官方页面LiveBench 原始数据
11
复杂推理和真实代码任务都比较突出
上线日期待核实
评测配置xhigh
输入$3
输出$15
75.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 70.19
- 科学与复杂推理
- 90.82
- 编程
- 80.68
- Agent / 真实编程任务
- 59.39
官方页面LiveBench 原始数据
12
日常分析和复杂推理都比较突出
上线日期2026-03-05
评测配置xhigh
输入$2.5
输出$15
75.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 77.39
- 科学与复杂推理
- 91.13
- 编程
- 77.54
- Agent / 真实编程任务
- 53.84
官方页面LiveBench 原始数据
13
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-08-18
评测配置default
输入$1.4
输出$4.4
75.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 73.13
- 科学与复杂推理
- 86.85
- 编程
- 78.95
- Agent / 真实编程任务
- 60.91
官方页面LiveBench 原始数据
14
日常分析和复杂推理都比较突出
上线日期2026-08-13
评测配置default
输入$0.435
输出$0.87
74.7
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 76.34
- 科学与复杂推理
- 90.46
- 编程
- 77.16
- Agent / 真实编程任务
- 54.95
官方页面LiveBench 原始数据
15
更擅长写出正确代码和补全程序
上线日期2026-04-16
评测配置xhigh
输入$5
输出$25
74.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 74.31
- 科学与复杂推理
- 90.02
- 编程
- 82.09
- Agent / 真实编程任务
- 50.66
官方页面LiveBench 原始数据
16
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-08-21
评测配置default
输入$0.22
输出$0.66
74.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 76.93
- 科学与复杂推理
- 86.60
- 编程
- 68.20
- Agent / 真实编程任务
- 65.10
官方页面LiveBench 原始数据
17
复杂推理和写代码都比较突出
上线日期2026-04-16
评测配置max
输入$5
输出$25
74.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.58
- 科学与复杂推理
- 91.75
- 编程
- 81.83
- Agent / 真实编程任务
- 50.50
官方页面LiveBench 原始数据
18
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-08-14
评测配置default
输入$0.265
输出$0.65
73.7
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 74.53
- 科学与复杂推理
- 83.12
- 编程
- 75.69
- Agent / 真实编程任务
- 61.36
官方页面LiveBench 原始数据
19
理解需求和处理真实代码任务都比较突出
上线日期待核实
评测配置default
输入$2
输出$6
72.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 75.79
- 科学与复杂推理
- 89.00
- 编程
- 68.59
- Agent / 真实编程任务
- 56.46
官方页面LiveBench 原始数据
20
更擅长写出正确代码和补全程序
上线日期2025-12-18
评测配置default
输入$1.75
输出$14
72.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.78
- 科学与复杂推理
- 83.24
- 编程
- 83.62
- Agent / 真实编程任务
- 49.39
官方页面LiveBench 原始数据
21
更擅长数学、科学问题和多步复杂推理
上线日期2026-02-05
评测配置high
输入$5
输出$25
72.1
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.16
- 科学与复杂推理
- 89.00
- 编程
- 78.18
- Agent / 真实编程任务
- 48.99
官方页面LiveBench 原始数据
22
更擅长写出正确代码和补全程序
上线日期2026-07-09
评测配置max
输入$1
输出$6
72.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 70.24
- 科学与复杂推理
- 86.42
- 编程
- 82.91
- Agent / 真实编程任务
- 48.43
官方页面LiveBench 原始数据
23
更擅长数学、科学问题和多步复杂推理
上线日期2025-12-11
评测配置high
输入$1.75
输出$14
71.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 73.25
- 科学与复杂推理
- 88.19
- 编程
- 76.07
- Agent / 真实编程任务
- 50.25
官方页面LiveBench 原始数据
24
更擅长整理信息、理解指令和完成日常分析
上线日期2026-05-19
评测配置high
输入$1.5
输出$9
71.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 75.01
- 科学与复杂推理
- 85.12
- 编程
- 78.18
- Agent / 真实编程任务
- 48.99
官方页面LiveBench 原始数据
25
更擅长写出正确代码和补全程序
上线日期待核实
评测配置default
输入$1.4
输出$4.4
71.6
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 70.76
- 科学与复杂推理
- 84.20
- 编程
- 79.65
- Agent / 真实编程任务
- 51.77
官方页面LiveBench 原始数据
26
更擅长整理信息、理解指令和完成日常分析
上线日期2026-07-31
评测配置default
输入$0.14
输出$0.28
70.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 74.67
- 科学与复杂推理
- 86.71
- 编程
- 74.98
- Agent / 真实编程任务
- 46.77
官方页面LiveBench 原始数据
27
理解需求和写代码都比较突出
上线日期待核实
评测配置high
输入$1.5
输出$7.5
70.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 74.09
- 科学与复杂推理
- 85.78
- 编程
- 77.86
- Agent / 真实编程任务
- 43.43
官方页面LiveBench 原始数据
28
更擅长写出正确代码和补全程序
上线日期2026-02-17
评测配置medium
输入$3
输出$15
70.1
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.42
- 科学与复杂推理
- 85.88
- 编程
- 79.27
- Agent / 真实编程任务
- 42.63
官方页面LiveBench 原始数据
29
更擅长写出正确代码和补全程序
上线日期2025-11-01
评测配置high
输入$5
输出$25
69.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 72.75
- 科学与复杂推理
- 85.24
- 编程
- 79.65
- Agent / 真实编程任务
- 39.70
官方页面LiveBench 原始数据
30
更擅长整理信息、理解指令和完成日常分析
上线日期待核实
评测配置max
输入$2.5
输出$7.5
69.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
- 通用能力
- 75.19
- 科学与复杂推理
- 84.29
- 编程
- 74.22
- Agent / 真实编程任务
- 43.59
官方页面LiveBench 原始数据
同一厂商可以保留多款当前主力,避免只看一款就误判整个品牌。
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$1 / $6来源
复杂推理和写代码都比较突出
可用性公开 API阶段稳定接入api价格$5 / $30来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$2.5 / $15来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$5 / $30来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$0.75 / $4.5来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$0.2 / $1.25来源
日常分析和复杂推理都比较突出
可用性公开 API阶段稳定接入api价格$2.5 / $15来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$1.75 / $14来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$1.75 / $14来源
复杂推理和真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$5 / $25来源
日常分析、推理、写代码和真实任务比较均衡
可用性公开 API阶段稳定接入api价格$10 / $50来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$5 / $25来源
复杂推理和写代码都比较突出
可用性公开 API阶段稳定接入api价格$5 / $25来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$3 / $15来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$5 / $25来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$5 / $25来源
复杂推理和真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$3 / $15来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$0.75 / $3.75来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$1.5 / $9来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$0.3 / $2.5来源
理解需求和写代码都比较突出
可用性公开 API阶段稳定接入api价格$1.5 / $7.5来源
当前无法公开使用,不参加正式排行
可用性公开 API阶段预览接入api价格$2 / $12来源
当前无法公开使用,不参加正式排行
可用性预览阶段预览接入api, consumer价格$1.25 / $4.25来源
当前无法公开使用,不参加正式排行
可用性预览阶段预览接入api, consumer价格$1.25 / $4.25来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$2 / $6来源
复杂推理和写代码都比较突出
可用性公开 API阶段稳定接入api价格$1.25 / $2.5来源
理解需求和处理真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$2 / $6来源
更擅长在真实代码仓库里连续修改并解决问题
可用性公开 API阶段稳定接入api价格$1 / $2来源
适合需要欧洲部署选择的代码和企业智能体任务
可用性普通用户可用阶段稳定接入consumer价格待核实来源
更擅长写出正确代码和补全程序
可用性公开 API阶段稳定接入api价格$0.5 / $3来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$2.5 / $7.5来源
更擅长在真实代码仓库里连续修改并解决问题
可用性开放权重阶段稳定接入weights价格$0.265 / $0.65来源
更擅长在真实代码仓库里连续修改并解决问题
可用性开放权重阶段稳定接入weights价格$2 / $6来源
更擅长写出正确代码和补全程序
可用性开放权重阶段稳定接入api, weights价格$0.6 / $3.6来源
适合在腾讯云里处理中文任务和智能体工作
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合中文写作、问答和需要长时间推理的任务
可用性普通用户可用阶段稳定接入consumer价格待核实来源
更擅长在真实代码仓库里连续修改并解决问题
可用性公开 API阶段试验接入api价格$0.22 / $0.66来源
日常分析和复杂推理都比较突出
可用性开放权重阶段稳定接入api, weights价格$0.435 / $0.87来源
更擅长整理信息、理解指令和完成日常分析
可用性开放权重阶段稳定接入api, weights价格$0.14 / $0.28来源
更擅长数学、科学问题和多步复杂推理
可用性开放权重阶段稳定接入api, weights价格$0.435 / $0.87来源
日常分析、推理、写代码和真实任务比较均衡
可用性开放权重阶段稳定接入api, weights价格$0.14 / $0.28来源
理解需求和处理真实代码任务都比较突出
可用性开放权重阶段稳定接入api, weights价格$3 / $15来源
更擅长写出正确代码和补全程序
可用性开放权重阶段稳定接入api, weights价格$0.95 / $4来源
写代码和处理真实代码仓库都比较突出
可用性开放权重阶段稳定接入api, weights价格$0.95 / $4来源
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$0.3 / $1.2来源
更擅长在真实代码仓库里连续修改并解决问题
可用性开放权重阶段稳定接入api价格$1.4 / $4.4来源
更擅长写出正确代码和补全程序
可用性开放权重阶段稳定接入api, weights价格$1.4 / $4.4来源
更擅长在真实代码仓库里连续修改并解决问题
可用性开放权重阶段稳定接入weights价格$1.87 / $4.68来源
理解需求和处理真实代码任务都比较突出
可用性公开 API阶段稳定接入api, consumer价格$3 / $15来源
更擅长在真实代码仓库里连续修改并解决问题
可用性公开 API阶段试验接入api价格$0 / $0来源
只推荐普通用户或公开 API 可用的型号,按真实用途给出选择线索。
综合能力
日常分析、推理、写代码和真实任务比较均衡
可用性公开 API阶段稳定接入api价格$10 / $50来源
复杂推理和真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$5 / $25来源
复杂推理和写代码都比较突出
可用性公开 API阶段稳定接入api价格$5 / $30来源
编程与真实任务
日常分析、推理、写代码和真实任务比较均衡
可用性公开 API阶段稳定接入api价格$10 / $50来源
理解需求和处理真实代码任务都比较突出
可用性公开 API阶段稳定接入api, consumer价格$3 / $15来源
复杂推理和真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$5 / $25来源
复杂推理
复杂推理和写代码都比较突出
可用性公开 API阶段稳定接入api价格$5 / $30来源
复杂推理和真实代码任务都比较突出
可用性公开 API阶段稳定接入api价格$5 / $25来源
日常分析、推理、写代码和真实任务比较均衡
可用性公开 API阶段稳定接入api价格$10 / $50来源
价格友好
更擅长整理信息、理解指令和完成日常分析
可用性公开 API阶段稳定接入api价格$0.75 / $3.75来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$2 / $6来源
更擅长数学、科学问题和多步复杂推理
可用性公开 API阶段稳定接入api价格$2.5 / $15来源
开放权重
理解需求和处理真实代码任务都比较突出
可用性开放权重阶段稳定接入api, weights价格$3 / $15来源
更擅长在真实代码仓库里连续修改并解决问题
可用性开放权重阶段稳定接入weights价格$2 / $6来源
更擅长在真实代码仓库里连续修改并解决问题
可用性开放权重阶段稳定接入api价格$1.4 / $4.4来源
暂无同口径能力排行。这里展示厂商公开的专项模型,不把不同模态硬凑成一个总分。
适合批量生成和编辑速度快、成本低的图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合把详细文字要求变成可继续编辑的成品图
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合做出风格更大胆、质量更稳定且更懂个人审美的图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合需要先理解画面再生成或编辑的复杂图片任务
可用性普通用户可用阶段稳定接入consumer价格待核实来源
同一厂商可以保留多款当前主力,避免只看一款就误判整个品牌。
适合把详细文字要求变成可继续编辑的成品图
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合批量生成和编辑速度快、成本低的图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合需要先理解画面再生成或编辑的复杂图片任务
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合做出风格更大胆、质量更稳定且更懂个人审美的图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
只推荐普通用户或公开 API 可用的型号,按真实用途给出选择线索。
本期新款 / 当前主力
适合做出风格更大胆、质量更稳定且更懂个人审美的图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合批量生成和编辑速度快、成本低的图片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合需要先理解画面再生成或编辑的复杂图片任务
可用性普通用户可用阶段稳定接入consumer价格待核实来源
暂无同口径能力排行。这里展示厂商公开的专项模型,不把不同模态硬凑成一个总分。
适合用分镜控制动作连贯、带声音的多镜头视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合需要人物动作、表情和物理效果稳定的视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合用图片、视频和声音一起控制多镜头短片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合做带原生声音和精细镜头控制的电影感视频
同一厂商可以保留多款当前主力,避免只看一款就误判整个品牌。
适合做带原生声音和精细镜头控制的电影感视频
适合用图片、视频和声音一起控制多镜头短片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合需要人物动作、表情和物理效果稳定的视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合用分镜控制动作连贯、带声音的多镜头视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
只推荐普通用户或公开 API 可用的型号,按真实用途给出选择线索。
本期新款 / 当前主力
适合用图片、视频和声音一起控制多镜头短片
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合用分镜控制动作连贯、带声音的多镜头视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合需要人物动作、表情和物理效果稳定的视频
可用性普通用户可用阶段稳定接入consumer价格待核实来源
暂无同口径能力排行。这里展示厂商公开的专项模型,不把不同模态硬凑成一个总分。
适合情绪丰富的配音和多语言表达
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合多人对话和更细的语气控制
适合需要低延迟对话、工具调用和语音推理的应用
可用性普通用户可用阶段稳定接入api价格待核实来源
同一厂商可以保留多款当前主力,避免只看一款就误判整个品牌。
适合需要低延迟对话、工具调用和语音推理的应用
可用性普通用户可用阶段稳定接入api价格待核实来源
适合情绪丰富的配音和多语言表达
可用性普通用户可用阶段稳定接入consumer价格待核实来源
只推荐普通用户或公开 API 可用的型号,按真实用途给出选择线索。
本期新款 / 当前主力
适合情绪丰富的配音和多语言表达
可用性普通用户可用阶段稳定接入consumer价格待核实来源
适合需要低延迟对话、工具调用和语音推理的应用
可用性普通用户可用阶段稳定接入api价格待核实来源
AIdaily 综合能力参考 · Composite v1
四个支柱各占 25%。分数只反映同一 LiveBench 发布版中的任务表现,不代表中文能力、价格、速度、创作偏好或全部 Agent 工作。
通用能力 25% + 科学与复杂推理 25% + 编程 25% + Agent / 真实编程任务 25%
小分差不一定代表明显领先。缺少任一任务就不参加正式排名,缺失值不会补零或重新分配权重。