Anthropic对齐负责人称十年内AI灭绝人类概率超10%:原话与事实边界

“十年内AI灭绝人类概率超10%”是谁说的
“Anthropic对齐负责人亲认:十年内AI灭绝人类概率超10%”成为近期科技新闻中的高热度话题。核对公开信息后可以确认,相关发言确实存在,但传播过程中省略了几个重要限定条件。
发言者是Evan Hubinger,多家媒体将其职务表述为Anthropic对齐科学团队负责人。他是在前同事Jacob Coxon宣布离开Anthropic并公开表达安全忧虑后作出回应。Hubinger表示,他个人认为未来十年出现由AI导致人类灭绝结果的概率超过10%,同时认为Anthropic正在努力,但超级智能对齐问题仍没有已经得到验证的完整解决方案。
这里最关键的词是“个人认为”。这不是Anthropic发布的概率统计,也不是一项能够重复验证的实验结果,更不能理解为公司宣布某个灾难将在十年内发生。
这条新闻哪些部分准确,哪些容易被误读
准确之处:发言者身份和风险判断有公开依据
Hubinger确实从事前沿AI对齐研究,也确实给出了“超过10%”和“未来十年”这两个限定。多家国际媒体对原始发言进行了交叉报道,因此这并不是凭空拼接出来的网络传言。
需要修正:不是“Anthropic官方认定”
把研究人员的个人概率判断直接改写成“Anthropic承认”,会让读者误以为企业已经完成风险测算并形成统一结论。实际上,概率来自个人主观评估。Anthropic长期公开讨论前沿模型风险,但个人发言、公司政策和学术共识是三个不同层次。
还要区分:现在的模型与未来假设中的超级智能
争议所针对的是未来可能出现、能力显著超过现有系统的高级AI,而不是说今天使用的普通聊天工具已经具备毁灭人类的能力。2026年《国际人工智能安全报告》指出,当前系统虽然在自主操作等相关方向出现早期能力,但还没有达到可以造成失控局面的水平。
为什么“10%”会产生如此强烈的传播效果
抽象的安全讨论很难形成直观印象,而“十年”和“超过10%”同时出现,会立刻制造紧迫感。再加上发言者来自研发机构内部,这条信息很容易被包装成“内部人士预警”。
不过,前沿技术预测并不像天气预报或保险精算那样拥有大量历史样本。研究者需要对尚未出现的系统能力、部署环境、人类治理措施和风险防护进展作出多层假设。任何一层假设变化,都可能明显改变最后的数字。因此,10%更接近风险态度的表达,而非精确到个位数的科学测量。
行业内是否已经形成共识
目前没有。美联社援引2026年《国际人工智能安全报告》称,相关风险的可能性、性质和时间仍具有很强的不确定性。有人认为后果极其严重,即使概率难以计算也应提前防范;也有人认为现有证据不足以支持具体的十年预测。
一项覆盖2778名AI论文作者的调查同样显示出明显分歧:不少受访者给予极端负面结果较高概率,但总体答案分布很宽。它能证明专业群体确实重视风险,却不能证明Hubinger给出的时间范围和概率已经成为统一结论。
这起事件真正值得关注的是什么
比“10%到底准不准”更重要的问题,是高能力模型上线前是否经过足够评估,企业能否限制系统权限,异常行为能否被发现和中止,以及重大安全事件能否接受独立核验。概率存在争议,不等于风险管理可以被搁置。
对普通读者而言,理性的理解方式既不是把标题当作十年倒计时,也不是因为无法精确计算就完全忽略。更合适的结论是:这是一位接近前沿研发的研究人员发出的严肃警告,但它仍属于带有强烈不确定性的个人判断。
FAQ
Q: Anthropic是否正式宣布十年内AI灭绝人类概率超过10%?
A: 没有。超过10%是Evan Hubinger公开表达的个人判断,不能直接等同于Anthropic的官方统计结论。
Q: 这是否说明当前AI已经能摆脱人类控制?
A: 不能这样理解。权威综合报告认为当前系统尚不具备造成失控局面的完整能力,争议主要讨论未来更高级系统可能带来的风险。
