白话 AI 小百科
03
RANKING ROOM

先问“比什么”,再看“谁第一”。

这里不做唯一总榜。每张表只回答一个问题,保留原始指标、来源日期和阅读限制。

BOARD 01

综合能力参考

综合推理、知识、代码和指令遵循等评测;同一模型的不同推理档位会分别出现。

Artificial Analysis Intelligence Index越高越好
  1. 01
    Claude Fable 5(fallback)Anthropic
    60
  2. 02
    GPT-5.6 Sol(max)OpenAI
    59
  3. 03
    GPT-5.6 Sol(xhigh)OpenAI
    58
  4. 04
    Kimi K3Moonshot
    57
  5. 05
    Claude Opus 4.8(max)Anthropic
    56
来源:Artificial Analysis
BOARD 02

真人盲测偏好

用户不知道模型名称,比较两个回答后投票;这是偏好榜,不是客观真理榜。

Arena Score(Overall)越高越好
  1. 01
    claude-fable-5Anthropic
    1507±7
  2. 02
    claude-opus-4-6-thinkingAnthropic
    1504±4
  3. 03
    claude-opus-4-7-thinkingAnthropic
    1503±4
  4. 04
    claude-opus-4-6Anthropic
    1498±4
  5. 05
    claude-opus-4-7Anthropic
    1494±4
来源:Arena
BOARD 03

编程智能体

比较的是“智能体工具 + 具体模型 + 设置”的组合,不等于只比较底层模型。

Coding Agent Index越高越好
  1. 01
    Codex + GPT-5.6 Sol(max)OpenAI
    80
  2. 02
    Claude Code + Fable 5(max)Anthropic
    77
  3. 03
    OpenCode + Muse Spark 1.1OpenCode / Meta
    69
  4. 04
    Cursor CLI + GPT-5.5(medium)Cursor / OpenAI
    62
  5. 05
    Gemini CLI + Gemini 3.1 ProGoogle
    43
来源:Artificial Analysis
BOARD 04

文生视频(带原生音频)

同一提示词生成视频后由用户盲选,适合观察整体观看偏好。

Video Arena Elo越高越好
  1. 01
    Gemini Omni FlashGoogle
    1241
  2. 02
    Dreamina Seedance 2.0 720pByteDance Seed
    1224
  3. 03
    Wan2.7-260612Alibaba
    1159
  4. 04
    HappyHorse-1.1HappyHorse
    1150
  5. 05
    Veo 3.1 LiteGoogle
    1090
来源:Artificial Analysis
BOARD 05

文生视频(不计音频)

只比较视频画面偏好;不应与“带音频”榜单的分数直接混算。

Video Arena Elo越高越好
  1. 01
    Gemini Omni FlashGoogle
    1329
  2. 02
    HappyHorse-1.0HappyHorse
    1287
  3. 03
    HappyHorse-1.1HappyHorse
    1275
  4. 04
    Dreamina Seedance 2.0 720pByteDance Seed
    1272
  5. 05
    Kling 3.0 1080p ProKlingAI
    1245
来源:Artificial Analysis

三条看榜规则

01

看任务

写代码、写文案和做视频是不同比赛,别用一张表包打天下。

02

看日期

模型更新非常快,超过几个月的榜单更适合看趋势而不是做采购决定。

03

做自己的小测

准备 10—30 个真实任务,隐藏品牌比较输出,通常比追单一总分更可靠。

阅读完整方法与来源 →