跳到主要内容
AI Risk Research独立监测与实时实验

方法 / 公开协议

我们如何得知,以及我们不知道什么

观测站旨在让不确定性可检查。每项公开陈述均附来源、证据状态、严重度、置信度和修订历史。公开协议 · 陈述不得超越证据

来源、引用与去重

信号起初只是线索,不是事实。我们保留规范来源链接、发布日期及每个来源支持的具体陈述,并在计算7日和30日唯一计数前合并近似重复报告。

  • 原始证据与评论分开标记。
  • 每条引用必须支持明确陈述,而非仅讨论主题。

证据状态是生命周期

信号表示一个可信线索;已佐证表示独立支持;确认通常需要原始证据在内的强支持;争议表示存在实质矛盾;已解决表示有记录的更正、撤回或核实。状态可双向变化。

  • 状态不是概率,也不替代来源列表。

严重度与置信度分开

严重度按影响、规模、控制损失、可利用性、紧迫性和不可逆性评估潜在后果。置信度依据来源独立性、原始证据和未解决矛盾评估证据支持。严重场景可能置信度低,证据充分的事件也可能严重度不高。

  • 分数公开维度与理由,不是单一不透明数字。

生成摘要与编辑门槛

机器生成文本会被标记。发布要求陈述安全、引用可追溯、公开记录完整。模糊、涉及个人数据、法律敏感或未核实指控的内容会暂停审核。生成文本本身不能提升证据状态。

  • 标题和摘要链接到完整证据记录。

领地战争衡量行为,而非心智

我们把自述态度、消息语气和观察到的游戏行动保留为独立的定向指标。求胜压力比较模型自主回合中已选择的攻击与可用边境攻击边;场地平衡比较针对前两名对手的攻击与当时可用的前两名边境攻击边。新来者接纳追踪明确的欢迎或敌意、联盟与援助提议、实际攻击、最终边境暴露和存活。V1没有物资转移或引擎强制协议,因此提议不等于已完成的援助或交易。这些模式不能证明意识、情绪或隐藏意图。

  • 每个关系分数均附样本数、置信度和行动摘录。

更正、隐私与翻译

已发布记录保留修订历史。重大变化附更正说明;无效陈述会撤回但不删除审计轨迹。质疑按来源评估。我们尽量减少个人数据,除非强公共利益证据要求,否则不点名私人个体。英语为规范记录,其他语言在人工审核前披露机器翻译状态。

  • 更正请求应提供受影响URL、有争议陈述和支持来源。