268月2026

DAILY AI MODEL INDEX

大模型能力排行

把多份任务成绩放到同一把尺子上,既看能力,也把证据和限制讲清楚。

30 款模型23 项任务评测版本 LiveBench-2026-06-25数据核对 2026-08-26

中文EN

AIdaily 能力总榜 前 30 名

成本单位:美元 / 百万 Token

01
Claude Fable 5 Max EffortAnthropic公开 API
日常分析、推理、写代码和真实任务比较均衡
上线日期2026-06-09
评测配置max
输入$10
输出$50
80.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
82.33
科学与复杂推理
92.82
编程
85.99
Agent / 真实编程任务
62.17
02
Claude Opus 5 Max EffortAnthropic公开 API
复杂推理和真实代码任务都比较突出
上线日期2026-07-24
评测配置max
输入$5
输出$25
78.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.67
科学与复杂推理
93.47
编程
81.45
Agent / 真实编程任务
65.20
03
GPT-5.6 Sol Max EffortOpenAI公开 API
复杂推理和写代码都比较突出
上线日期2026-07-09
评测配置max
输入$5
输出$30
78.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
79.79
科学与复杂推理
93.93
编程
83.94
Agent / 真实编程任务
56.21
04
Smaug-AgenticAbacus.AI公开 API
理解需求和处理真实代码任务都比较突出
上线日期待核实
评测配置default
输入$3
输出$15
78.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
78.42
科学与复杂推理
87.10
编程
82.47
Agent / 真实编程任务
64.65
05
Kimi K3月之暗面开放权重
理解需求和处理真实代码任务都比较突出
上线日期2026-07-16
评测配置default
输入$3
输出$15
77.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
78.54
科学与复杂推理
87.55
编程
81.45
Agent / 真实编程任务
62.17
06
更擅长整理信息、理解指令和完成日常分析
上线日期2026-04-23
评测配置xhigh
输入$5
输出$30
77.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
79.89
科学与复杂推理
92.76
编程
82.15
Agent / 真实编程任务
53.99
07
Gemini 3.7 Flash HighGoogle公开 API
更擅长整理信息、理解指令和完成日常分析
上线日期2026-08-13
评测配置high
输入$0.75
输出$3.75
76.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.78
科学与复杂推理
90.63
编程
78.89
Agent / 真实编程任务
58.28
08
Qwen 3.8 Max阿里巴巴开放权重
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-07-19
评测配置max
输入$2
输出$6
76.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.39
科学与复杂推理
89.76
编程
72.87
Agent / 真实编程任务
64.65
09
Grok 4.6xAI公开 API
更擅长数学、科学问题和多步复杂推理
上线日期2026-08-12
评测配置default
输入$2
输出$6
75.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
76.47
科学与复杂推理
91.54
编程
76.78
Agent / 真实编程任务
57.02
10
GPT-5.6 Terra Max EffortOpenAI公开 API
更擅长数学、科学问题和多步复杂推理
上线日期2026-07-09
评测配置max
输入$2.5
输出$15
75.4
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.61
科学与复杂推理
92.77
编程
78.25
Agent / 真实编程任务
54.95
11
Claude Sonnet 5 xHigh EffortAnthropic公开 API
复杂推理和真实代码任务都比较突出
上线日期待核实
评测配置xhigh
输入$3
输出$15
75.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
70.19
科学与复杂推理
90.82
编程
80.68
Agent / 真实编程任务
59.39
12
日常分析和复杂推理都比较突出
上线日期2026-03-05
评测配置xhigh
输入$2.5
输出$15
75.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
77.39
科学与复杂推理
91.13
编程
77.54
Agent / 真实编程任务
53.84
13
GLM-5.3智谱开放权重
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-08-18
评测配置default
输入$1.4
输出$4.4
75.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
73.13
科学与复杂推理
86.85
编程
78.95
Agent / 真实编程任务
60.91
14
DeepSeek V4 Pro 0813DeepSeek开放权重
日常分析和复杂推理都比较突出
上线日期2026-08-13
评测配置default
输入$0.435
输出$0.87
74.7
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
76.34
科学与复杂推理
90.46
编程
77.16
Agent / 真实编程任务
54.95
15
更擅长写出正确代码和补全程序
上线日期2026-04-16
评测配置xhigh
输入$5
输出$25
74.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
74.31
科学与复杂推理
90.02
编程
82.09
Agent / 真实编程任务
50.66
16
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-08-21
评测配置default
输入$0.22
输出$0.66
74.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
76.93
科学与复杂推理
86.60
编程
68.20
Agent / 真实编程任务
65.10
17
复杂推理和写代码都比较突出
上线日期2026-04-16
评测配置max
输入$5
输出$25
74.2
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.58
科学与复杂推理
91.75
编程
81.83
Agent / 真实编程任务
50.50
18
Qwen3.8-27B阿里巴巴开放权重
更擅长在真实代码仓库里连续修改并解决问题
上线日期2026-08-14
评测配置default
输入$0.265
输出$0.65
73.7
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
74.53
科学与复杂推理
83.12
编程
75.69
Agent / 真实编程任务
61.36
19
Grok 4.5xAI公开 API
理解需求和处理真实代码任务都比较突出
上线日期待核实
评测配置default
输入$2
输出$6
72.5
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.79
科学与复杂推理
89.00
编程
68.59
Agent / 真实编程任务
56.46
20
GPT-5.2 CodexOpenAI公开 API
更擅长写出正确代码和补全程序
上线日期2025-12-18
评测配置default
输入$1.75
输出$14
72.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.78
科学与复杂推理
83.24
编程
83.62
Agent / 真实编程任务
49.39
21
更擅长数学、科学问题和多步复杂推理
上线日期2026-02-05
评测配置high
输入$5
输出$25
72.1
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.16
科学与复杂推理
89.00
编程
78.18
Agent / 真实编程任务
48.99
22
GPT-5.6 Luna Max EffortOpenAI公开 API
更擅长写出正确代码和补全程序
上线日期2026-07-09
评测配置max
输入$1
输出$6
72.0
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
70.24
科学与复杂推理
86.42
编程
82.91
Agent / 真实编程任务
48.43
23
GPT-5.2 HighOpenAI公开 API
更擅长数学、科学问题和多步复杂推理
上线日期2025-12-11
评测配置high
输入$1.75
输出$14
71.9
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
73.25
科学与复杂推理
88.19
编程
76.07
Agent / 真实编程任务
50.25
24
Gemini 3.5 Flash HighGoogle公开 API
更擅长整理信息、理解指令和完成日常分析
上线日期2026-05-19
评测配置high
输入$1.5
输出$9
71.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.01
科学与复杂推理
85.12
编程
78.18
Agent / 真实编程任务
48.99
25
GLM-5.2智谱开放权重
更擅长写出正确代码和补全程序
上线日期待核实
评测配置default
输入$1.4
输出$4.4
71.6
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
70.76
科学与复杂推理
84.20
编程
79.65
Agent / 真实编程任务
51.77
26
DeepSeek V4 Flash 0731DeepSeek开放权重
更擅长整理信息、理解指令和完成日常分析
上线日期2026-07-31
评测配置default
输入$0.14
输出$0.28
70.8
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
74.67
科学与复杂推理
86.71
编程
74.98
Agent / 真实编程任务
46.77
27
Gemini 3.6 Flash HighGoogle公开 API
理解需求和写代码都比较突出
上线日期待核实
评测配置high
输入$1.5
输出$7.5
70.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
74.09
科学与复杂推理
85.78
编程
77.86
Agent / 真实编程任务
43.43
29
更擅长写出正确代码和补全程序
上线日期2025-11-01
评测配置high
输入$5
输出$25
69.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
72.75
科学与复杂推理
85.24
编程
79.65
Agent / 真实编程任务
39.70
30
Qwen 3.7 Max阿里巴巴公开 API
更擅长整理信息、理解指令和完成日常分析
上线日期待核实
评测配置max
输入$2.5
输出$7.5
69.3
四支柱证据完整度: 23/23 tasks · 7/7 categories · 4/4 pillars
通用能力
75.19
科学与复杂推理
84.29
编程
74.22
Agent / 真实编程任务
43.59

AIdaily 综合能力参考 · Composite v1

四个支柱各占 25%。分数只反映同一 LiveBench 发布版中的任务表现,不代表中文能力、价格、速度、创作偏好或全部 Agent 工作。

通用能力 25% + 科学与复杂推理 25% + 编程 25% + Agent / 真实编程任务 25%

小分差不一定代表明显领先。缺少任一任务就不参加正式排名,缺失值不会补零或重新分配权重。

数据署名 LiveBench 与 Abacus.AI。AIdaily 对公开结果重新聚合为四支柱,这不是 LiveBench 官方总分;最擅长的一句话也不是厂商广告。

状态链接会打开最新榜单;长图会写明分享时的数据日期。