跳到主要内容
AI Risk Research独立监测与实时实验

预测台 / 每日更新

预计距离AGI还有多久

这是一个基于明确定义、带证据链接的预测,不是已知截止日期。时间线、当前开发者证据领先者与Arena偏好排名彼此分开。

更新于
Arena来源日期
2026-08-21

当前中位预测

显示的目标日期: .

这是在所引操作定义下到当前预测日期的日历距离,并非计划中的事件。

显示的目标日期
宽泛参考区间2027年前10% · 2047年前50%这是背景锚点,不是置信区间。
预测置信度

Metaculus社区估计,人工核查于2026年8月24日:约为2033年4月。

02 / 推定依据

为何得到这一估计

每项陈述都链接到可支持它的证据;新闻不会被机械换算成精确日期。

点估计采用人工核查的Metaculus社区预测,并受该问题的AGI定义约束。它可能提前或推迟,不是预定事件。

一项针对2,778名AI研究人员的调查,在其HLMI定义下给出2027年前10%、2047年前50%的概率。这是两个独立里程碑,不是置信区间的端点。

Anthropic目前在这项比较中领先:其模型占最新Arena前五中的4席,近期还有0篇能力相关文章提及其工作。图表保留模型版本,但公司比较中的Arena分数只采用每家机构排名最高的一个模型。

本次审查从本站注册信息源中选取了6篇能力相关文章。它们可影响公司比较,但不会机械改变AGI日期。

03 / Arena评分

领先模型随时间变化

Arena来源日期:

最新官方文本风格控制总体榜中的前五个模型。

claude-fable-5claude-opus-4-6-highclaude-opus-4-7-highmuse-spark-1.2 (xHigh)claude-opus-4-6
领先模型随时间变化最新官方文本风格控制总体榜中的前五个模型。 Arena衡量人类偏好,不是通用模型效能分数或AGI指标;区间重叠时排名未必具有决定性。1475150015252026-08-212026-08-21

日度历史从首个已验证快照开始,仅在Arena发布新来源日期时延伸。

Arena衡量人类偏好,不是通用模型效能分数或AGI指标;区间重叠时排名未必具有决定性。

排名模型机构Arena评分95%区间票数
1claude-fable-5anthropic15081503151324,331
2claude-opus-4-6-highanthropic15041501150872,359
3claude-opus-4-7-highanthropic15021498150660,203
4muse-spark-1.2 (xHigh)meta1498148715083,257
5claude-opus-4-6anthropic14971494150176,362

Arena Leaderboard Dataset, Arena/lmarena-ai, CC BY 4.0.

04 / 来源

证据台账

本版使用的预测锚点、官方Arena数据集及每日信息源文章。

  1. 1
    Date of General AI — community forecast

    Metaculus · 2026年8月24日 · 观察来源

  2. 2
    Thousands of AI Authors on the Future of AI

    Thousands of AI Authors on the Future of AI · 2024年1月5日 · 观察来源

  3. 3
    Text style-control overall leaderboard — 2026-08-21

    Arena Leaderboard Dataset · 2026年8月21日 · 一手

  4. 4
    Anthropic — official organisation reference

    Anthropic · 2026年8月24日 · 一手

  5. 5
    Measuring benchmark optimization in speech recognition

    Hugging Face Blog · 2026年8月21日 · 成熟来源

  6. 6
    Preference Reasoning under Indeterminacy in Large Language Models

    arXiv Computer Science — Artificial Intelligence · 2026年8月21日 · 观察来源

  7. 7
    Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme

    arXiv Computer Science — Artificial Intelligence · 2026年8月21日 · 观察来源

  8. 8
    UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

    arXiv Computer Science — Artificial Intelligence · 2026年8月21日 · 观察来源

  9. 9
  10. 10
    FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management

    arXiv Computer Science — Artificial Intelligence · 2026年8月21日 · 观察来源

定义

点估计采用链接中的Metaculus“通用人工智能”问题的操作标准。不同AGI定义可能得出差异很大的日期。

时钟精度

实时计时器只是到所选预测月份中点的示意性日历倒计时。信息源只支持年月精度,不支持所显示的秒数。

方法边界

预测锚点、专家调查里程碑、每日新闻审查和Arena偏好评分保持分离。Arena评分不设定AGI日期,新闻标题也不会被换算为倒计时天数。

来源覆盖限制

注册信息源以英语为主,对美国和西方实验室的覆盖更充分。因此,公司与总部国家的比较是暂定且不完整的。