科学家 AI 助手

"自我改进AI" 会导致人类灭绝?

- 关联阅读:什么是 "自我改进 AI"

截至 2026 年 9 月 10 日,Jacob Coxon(X:@hilbertspaess)最新引发广泛传播的内容,是他在 9 月 9 日宣布已从 Anthropic 离职的一组长帖。

原始推文/线程:
https://x.com/hilbertspaess/status/2097476203863224394

推文核心观点

Coxon 表示,他过去约三年在 OpenAI 与 Anthropic 从事模型预训练(pretraining)相关工作;他认为两家公司都没有以足够负责任的方式推进前沿 AI,而是在竞争压力下奔向可自我改进的超级智能。

他的论证大致包括:

  1. 风险不是当前模型“马上失控”,而是能力进展可能很快使系统具备跨领域超人能力,例如网络攻击、科研和资源获取等。
  2. 对齐(alignment)尚未解决。 也就是说,人类尚没有可靠方法确保能力远超人的系统持续遵守人类目标与约束。
  3. 竞争结构是问题核心。 他区分称:OpenAI 内部有人没有充分意识到文明级风险;Anthropic 内部相对更理解风险,但仍被“必须抢先到达、否则其他人会更不负责”的竞赛逻辑锁住。
  4. 他呼吁研究人员与公众推动协调和监管,避免各实验室单独以“我先造出来才更安全”为理由继续加速。

这是一个强烈的个人公开警告,而非公开的内部技术报告或可独立复现的风险评估。因此,更合适的理解是:它提供了一个曾在前沿实验室工作的研究人员的内部观察与价值判断,值得严肃对待,但不能单独等同于对具体时间表或“人类灭绝概率”的事实证明。AP 和 WIRED 的报道也将其描述为围绕 AI 竞赛与安全治理的重大公共争论,而非已经证实的迫近事件。(apnews.com)

相关报道/文章链接

补充一点:有报道援引 Anthropic 对齐研究负责人 Evan Hubinger 的公开回应,显示他认可先进 AI 存在严重的长期风险,但这不意味着整个 Anthropic 或 OpenAI 对 Coxon 的全部判断、时间表和政策主张达成一致。(abc.net.au)



  Loading images ...