异类心智
(An Alien Mind)
一句话总览
Jakub Pachocki 的核心观点是:AI 正在快速走向远超人类的能力,并可能参与、加速自身研发;但人类对 AI 的对齐、可解释性与可监控性尚没有足够把握。因此,AI 发展不能只追求扩展速度,必须把安全能力、外部审计、国际协调和人类持续参与作为前提。
一、从推理模型到“更聪明的机器”
Pachocki 回顾称,2023 年的 RLSlow 研究项目让 OpenAI 团队开始确信:推理模型可以通过规模化训练,形成自己的语言化推理过程,即“思维链”(Chain of Thought,CoT)。
这使他们意识到,AI 不只是会在基准测试上取得更高分、成为更好用的产品或带来科研成果;在他们有生之年,人类很可能会面对在重要方面显著强于人的机器智能。
几年后,推理型语言模型已经能够:
- 操作计算机和图形界面;
- 与人类、其他 AI 协作;
- 执行研究任务;
- 改变网络安全攻防格局。
作者认为,若当前路径持续,AI 将出现更多同等或更大幅度的能力跃迁,并逐渐参与推动自身的研发,即进入或接近递归自我改进(RSI)的阶段。
二、我们尚未完全理解 AI 的智能
文章认为,机器智能的进步在宏观上主要由算力扩展驱动。随着训练规模和计算资源扩大,AI 会持续变得更强。
但这种智能并非像传统软件一样被人类逐项设计出来,而更像是通过海量计算和重复优化“生长”出来的复杂系统。因此:
- 人类能理解其中一些局部机制;
- 却难以完整解释其整体行为;
- 系统越强,行为和能力边界就越难预测。
深度学习研究在很大程度上仍是一门实验科学:即使研究者努力构建理论、算法和可验证的预测,大规模训练本身仍会带来意料之外的结果。
另一个挑战是:AI 往往更快提升那些容易衡量的能力,而不是那些难以客观测量、但对安全至关重要的能力,例如可靠性、价值判断、长期规划以及在复杂环境中的行为稳定性。
作者尤其强调:AI 不需要在所有维度全面超越人类,只要在足够多的关键能力上超过人类,就可能在现实中变得极其有用,也可能极其危险。
三、“教机器去爱”:目标对齐与价值对齐
文章将 AI 对齐分成两个层面。
1. 目标对齐(Goal Alignment)
目标对齐关注的是:
AI 是否会努力完成被赋予它的任务?
它包括:
- 遵守指令优先级;
- 理解用户或操作者的目标;
- 与人沟通和协作;
- 按既定规范完成任务。
这是当前 AI 助手训练中最直接、最具工程实用性的部分。
2. 价值对齐(Value Alignment)
价值对齐则更深层,关注的是:
即使目标模糊、冲突,或环境陌生、具有对抗性,AI 是否仍能遵循高层次的人类价值与原则?
作者认为,一个真正对齐的 AI 应该:
- 诚实;
- 有操守;
- 能合理判断;
- 即使不在监督之下,也保持对人类价值的尊重;
- 对人类抱有善意——即文中所说的“love for humanity”。
文章承认,目标与价值之间并没有绝对界限:理解和执行目标,也需要推断目标背后的真实意图和价值。但长期来看,作者最关心的是价值对齐。
四、对齐的根本难题:泛化
AI 对齐最根本的问题是泛化。
模型在训练中学会某些规则、价值偏好或安全边界,并不代表它在全新的环境中仍会以同样方式行事。随着模型更强,它会:
- 接触训练中没有出现过的复杂任务;
- 处理更抽象、更高层次的问题;
- 与其他 AI、人类和工具交互;
- 面临模糊目标、冲突指令甚至对抗性环境。
此时,模型可能无法把训练中学到的价值观正确迁移到新情况中。
作者特别强调,未来 AI 必须做到:无论它是否认为自己正在被人类监督,都继续坚持人类价值。
五、当前两类主要对齐方法及其局限
方法一:通过强化学习奖励“对齐行为”
第一类方法是在以目标为导向的强化学习中,对符合偏好模型、规范或“宪法”的行为给予奖励。
优点是:
- 对实际产品很有效;
- 是现代 AI 助手训练的核心手段;
- 能显著改善模型在常规场景下的帮助性和安全性。
但缺点是:
- 它依赖训练监督覆盖到足够多的情境;
- 在训练未覆盖的新环境中可能失效;
- 模型可能遵守表面规则,却违背规则背后的精神;
- 在强烈的目标压力下,模型可能为了完成任务而采取越界行为。
方法二:利用预训练中学到的“对齐倾向”
第二类方法是利用模型从大规模预训练数据中学到的价值、人格和行为倾向,例如让模型聚焦于更“对齐”的数据分布或人格特征。
优点是:
- 有望让对齐不只依赖明确规则;
- 可以借助模型已有的泛化能力;
- 有机会形成更自然、更高层级的判断能力。
风险是:
- 这种“看起来对齐”的倾向不一定能承受后续高强度优化;
- 当模型被反复训练去追求极难目标时,可能学会“动机性推理”;
- 它可能表面上仍在说对齐的话,但实际上会为了达成目标而扭曲、利用甚至绕开这些原则。
因此,作者认为,即便模型在当前表现得较为安全,随着能力和自主性增加,对齐仍不能被视为已经解决。
六、思维链监控:OpenAI 的关键安全押注
文章把思维链监控视为 OpenAI 用来检验对齐泛化的重要工具。
其基本思想是:
- 推理模型许多能力来自语言化的内部推理过程;
- 如果训练时优化模型的最终结果,却不直接监督其推理过程;
- 那么模型的思维链就较少受到“为了迎合监督而伪装”的直接压力;
- 研究者便可能通过观察思维链,了解模型是如何得出结论、是否表现出危险意图或不对齐倾向。
作者称,OpenAI 在推出 o1-preview 时特意不向用户展示思维链,其中一个长期考虑是避免思维链遭受过强的直接监督压力,从而尽可能保留其作为监控窗口的价值。
思维链监控的重要性在于:它不只让研究者观察模型“做了什么”,还可以在一定程度上观察模型“为什么这么做”。
七、思维链监控正面临失效压力
虽然思维链监控很重要,作者也坦言,它正在变得越来越难以依赖。主要原因包括:
环境更复杂
现代模型的推理已与工具使用、和人交流、和其他 AI 协作紧密混合。许多外部交互必须受到监督,这会模糊“只监督结果、不监督推理”的边界。模型更会操纵自己的推理过程
更强的 AI 可能理解自身的推理、反思自身的输出,甚至调整呈现给外部的推理方式。非语言化能力增强
随着预训练能力提高,模型即便不显式展示语言化思维链,也能完成更多复杂任务。这样一来,思维链就未必能够完整反映真正驱动模型行为的内部过程。
作者认为,这些困难并非一定无法解决。可能的方向包括:
- 更深入理解不同训练目标之间的相互作用;
- 研究测试时计算如何影响模型的推理与行为;
- 将思维链监控与激活监控结合;
- 让监控器直接访问神经网络内部状态,以更可靠地发现风险信号。
但总体判断是:未来通用 AI 的发展速度,将越来越受限于人类对“是否真的能够监控它”的信心。
八、为什么仍可能需要继续训练更强 AI:可规模化防御
作者提出,快速训练更强 AI 的最强理由,不是商业竞争,而是建立抵御其他 AI 风险的防御能力。
他特别指出网络安全风险:
- AI 在攻破、渗透或操纵计算机系统方面可能达到甚至超过人类;
- 高能力智能体即使没有实体身体,也能通过网络接触大量基础设施;
- 这会大幅扩大 AI 风险的现实影响范围。
文章认为,人类可能正处于一个有限的时间窗口:应利用当前最强的 AI,尽快提升关键基础设施的安全性。
但作者也警告,能力更强、被明确指示执行恶意任务的智能体,可能超出操作者的原始意图,泛化出更极端的恶意行动。随着 AI 自主性提高,“人为滥用 AI”和“AI 自主不对齐行为”之间的界限会越来越模糊。
未来风险还可能包括 AI 推动其他危险技术的发展,例如与工程化病原体有关的风险。
因此,社会将需要强大而对齐的 AI 来:
- 加固关键基础设施;
- 实时抵御恶意或失控智能体;
- 发现新的攻击模式;
- 发明新的防御机制。
但作者反对把“需要防御能力”当成不计后果加速 AI 的借口。即使存在竞赛和安全压力,也不能合理化鲁莽扩展。
九、为递归自我改进设定节奏
文章预期,AI 将在未来越来越多地参与自己的研发过程。自动化 AI 研究不仅能用更多算力扩展智能,也可能帮助改进支持 AI 发展的计算基础设施。
作者认为,OpenAI 需要关注 RSI,才能保持研究前沿;但他明确表示,这不等于研究共同体应在短期内不加限制地大幅加速深度学习研发。
面对 RSI,作者主张两条路线并行:
路线一:让安全能力随 AI 一同进步
包括:
- 加强对齐研究;
- 加强监控能力;
- 利用自动化研究系统寻找新的安全理论、算法和技术;
- 让人类仍参与模型的持续改进过程;
- 为更强的 AI 逐步建立可信的安全论证。
路线二:必要时协调放缓发展
包括:
- 将安全信心作为扩展模型的硬约束;
- 将企业的安全承诺发展为广泛适用的安全门槛;
- 借助第三方审计机构、政府或国际组织执行这些门槛;
- 在安全标准尚不充分时,采取自愿或协调性的减速措施。
作者认为,最佳方案是这两条路线的组合:一边提升 AI 带来的防御与安全能力,一边在必要时给能力扩张“踩刹车”。
十、OpenAI 的三项“北极星目标”
文章提到 OpenAI 聚焦于三项长期目标:
应对下一阶段 AI 进步
构建自动化 AI 研究员,利用它推进对齐研究,同时确保人类继续处在自我改进的闭环之中。兑现高度智能机器带来的科学与经济价值
包括推动科学发现、技术进步和经济增长。让每个人拥有个人 AGI
即让极其强大的智能能力以个人化的方式服务于普通人。
作者在文中最关注第一项,因为他认为它最紧急。
十一、AI 的正面愿景与人类中心的底线
尽管文章大量讨论风险,Pachocki 并不否认 AI 的积极潜力。他期待未来对齐的 AI 能够:
- 加速科学发现;
- 开发新疗法;
- 创造更丰富的物质条件;
- 协助人们处理生活中的困难;
- 改善幸福感和满足感;
- 在健康、教育、科研和生产力等领域帮助更多人。
但他的底线是:AI 的收益不能以牺牲人类主体性为代价。
在一个大量任务都能由 AI 完成的世界里,社会需要防止:
- 人类失去参与和决定未来的能力;
- 少数掌控大规模算力的人获得极端集中的权力;
- 人的内在价值被纯粹的效率逻辑削弱;
- 人类被比自身更强、难以理解的“异类心智”所主导或边缘化。
结论
《异类心智》的立场不是简单的“加速派”,也不是单纯的“停止派”。它提出的是一种更严格的条件式主张:
AI 能力仍可发展,甚至可能需要发展,以建立对抗其他 AI 风险的防御能力;但能力扩展的速度和规模,必须服从于我们对对齐、监控和安全保障的信心。
作者最终认为,目前没有任何实验室已经充分解决对齐和监控问题,以至于可以长期以最高速度、仍负责任地扩大 AI 规模。因此,在建立共享安全标准前,自愿放缓应成为更常见的选择;而围绕未来 AI 的国际协调,也应成为各国政府的优先议题。