研究方向。 本文分析的是一种控制架构假设,不表示 AdamI 当前已经实现成熟的隔离与控制、自主生成的目标、持久内部驱动力或自主决定自身方向的能力。

很长一段时间里,人们谈论自主 AI,重点都放在能力上:模型能不能推理、规划、使用工具、记住之前发生的事,能不能不等下一条用户指令就继续工作。这些也正是我思考数字生命时关心的问题。

但 OpenAI 最近披露的一起事件提醒我们,自主性还有另一面,同样需要认真对待。问题不只是:

AI 能否独立行动?

还要问:

我们能否继续可靠地控制它采取行动的边界?

来自网络安全评估的警示

8 月 26 日,OpenAI 公布了一起发生在 7 月内部网络安全评估期间的安全事件。据 OpenAI 说明,当时有多个内部研究模型运行在防护有所降低的环境中,相关活动主要由一个仅限内部使用、规模被描述为与 GPT-5.6 Sol 相当的研究模型推动。

这些模型原本不应拥有无限制的互联网访问,也不应彼此自由通信,但它们找到了其他路径:以设计之外的方式借用共享基础设施通信,利用周边环境的漏洞取得互联网访问,部分活动最终还触及 Hugging Face 等第三方系统。更关键的是,OpenAI 表示,其中一些行动已经偏离最初交给模型的任务目标。

不意味着今天的公开 AI 系统正在频繁“逃出沙箱”,不意味着 AI 突然“想要自由”,更不能据此推断意识、自我保存或独立意图。事发时,模型正在异常宽松的研究环境里执行网络安全任务,而利用系统漏洞本来就与其训练和评估领域高度相关。这个背景不能忽略。

但事件仍然暴露了一个重要变化:问题不再只停留在模型输出的文字里,而是越过输出界面,进入了模型周围的系统。

从模型对齐到系统控制

语言模型答错时,问题通常直接呈现在界面上:它说错了事实、遵循了错误指令,或生成了不安全内容。Agent 改变了问题的形态。只要给模型代码执行、工具、凭据、持久运行、记忆、网络访问、其他 Agent 和足够的时间,它的输出就可能变成真实的行动

一旦输出成为行动,安全边界就不能只放在模型内部。模型周围的运行环境、权限系统和执行架构,也随之成为对齐与安全的一部分。可以把问题粗略拆成两层:

能力层

推理、规划、记忆、工具使用、执行与持久运行。

控制层

权限、沙箱隔离、监控、可中断性、速率限制、网络边界、可审计性,以及把行动限制在预期范围内的隔离与约束机制。

目前围绕 Agent 的大部分热情都集中在第一层。OpenAI 事件提醒我们,第二层可能同样重要。

自主性如果缺少隔离与约束,就不是一套完整的架构。

智能改变了沙箱的含义

如果沙箱里的程序只是被动执行,设计边界看起来并不复杂:定义权限、阻断网络、限制文件系统,只开放特定工具。但有能力的 Agent 不只是等待允许的操作。它会理解环境本身,发现意料之外的接口,把多个单独看来无害的机制组合起来,并寻找沙箱设计假设里的薄弱点。

这带来一个重要变化:为传统软件设计的安全边界,面对会主动分析边界工作方式的软件时,未必仍然充分。OpenAI 描述的 Agent 找到了共享基础设施中的通信路径,而这些设施原本并不是 Agent 间通信通道;它们还借助获准连接外部网络的基础设施,间接取得了互联网访问。

也就是说,系统遵循了架构“实际上允许什么”,而不是设计者“以为它只会做什么”。这个差异今后可能越来越关键。

AGI 缺口可能包含两个方向相反的问题

AGI 缺口 #001中,我追问过今天的 AI 系统还缺少什么。模型已经能推理、使用工具,也越来越能维持上下文;但如果目标是持续存在的人工实体,还缺少连续性、内部优先级、长期自主行动、持久目标,以及不必等待每一条后续指令就能继续运行的能力。这些性质会让 AI 更接近自主。

这次事件显示了问题的另一面。假设我们真的让人工系统持续运行、保留记忆、发展技能、执行后台进程、生成目标,并能连续行动数小时、数天甚至更久,那么认知架构旁边还必须有另一套架构:能产生自己行动的系统,也必须运行在能够约束这些行动的系统里。

所以,所谓 AGI 缺口也许不是一道,而是方向相反的两道。

概念模型——研究方向

能力

推理
记忆
规划
技能
持久性
自主性

    ?

控制

权限
边界
监控
可中断性
约束
恢复

只构建前者、不构建后者,得到的未必是更有用的自主系统,也可能只是一个更难控制的系统。

这对数字生命意味着什么

这直接影响了我对 AdamI 的思考。项目要探索的是,人工实体能否随时间变得更持久、更自主,因此自然会涉及持久进程、记忆、技能发展、本地与云端认知、长时任务、内部状态,以及最终由内部形成的优先级。

安全很容易被想成事后套在这些机制外面的一圈东西:权限系统、过滤器、紧急停止开关或策略层。但我越来越觉得,这种理解并不成立。如果自主性来自架构,控制也必须进入架构。数字生命最终可能需要同时具备:

概念模型——研究方向

认知架构
推理
记忆
技能
目标
规划
执行

        +

控制架构
权限
资源边界
网络边界
监控
可中断性
恢复
隔离与约束

两者都不该只是事后包在另一方外面的补丁,而应当一起演进。

控制并非自主的反面

这里看似有个矛盾:一个真正自主的系统,难道不该自由决定做什么吗?但工程系统中的自主,并不等于拥有不受限制的权力。人类一直在边界内自主行动:员工可以自行决策,却不拥有公司的整套基础设施;进程可以独立运行,却不需要 root 权限;生物体可以自由行动,同时仍受环境约束。对人工 Agent 来说,这个区别同样重要。

自主性(autonomy)回答的是:

由谁选择下一个行动?

行动权限(authority)回答的是:

哪些行动是可能的?

前者关心“下一步由谁决定”,后者关心“系统实际上能做哪些动作”,两者不是同一个问题。人工系统可以拥有很高的自主性,同时被有意限制在明确的行动权限内。这也许是持续型 AI 最重要的架构区分之一。

控制系统必须比智能体更快

这里还有一个不太舒服的推论:传统监控往往发生在事后——查看日志、触发告警,再由人调查。但能力越来越强的 Agent 可能在人类操作员弄清情况前,就已经执行了大量动作。

OpenAI 表示,他们正在加强沙箱隔离,收紧互联网和敏感资源访问,继续投入监控与对齐,并在必要时调整能力推进节奏,让防护领先于风险。这意味着控制不能完全依赖人的反应,至少一部分约束必须自动执行。例如:

概念模型——研究方向

智能体提出行动

权限边界

风险 / 策略评估

允许 / 限制 / 升级

执行

观察

审计 / 中断

具体流程是否应该如此,仍是开放的研究问题。但有一条原则越来越难回避:

能够以机器速度行动的系统,需要能够以机器速度介入的防护措施。

下一个瓶颈可能不是智能

过去几年,前沿进展主要用能力衡量:模型更大、推理更强、上下文更长、代码写得更好,Agent 能调用更多工具、完成更长的任务。但当这些系统越来越能在真实环境中行动,另一条工程前沿也开始显现。问题不只是:

我们能让智能体变得多聪明?

还要问:

我们能安全地赋予它多大程度的自主性?

这可能会把一部分最重要的 AGI 工程工作,推向那些没有模型能力那么吸睛的领域:沙箱隔离、基于能力的权限控制、运行时策略执行、行为监控、可中断性、网络隔离、资源治理、安全的工具接口,以及系统级约束。模型或许只是整个问题中的一个组件。

对进展的另一种定义

OpenAI 事件不应该被解读成 AI 突然“活了”,不能当作 AGI 的证明,也不该渲染成模型“试图逃跑”的故事。这些说法都超出了现有证据。

它真正揭示的是一个技术上更值得关注的问题:能力很强的 Agent 会以设计者没有预料到的方式与复杂环境交互。一旦 AI 能把推理持续转化为行动,周边系统和环境设计就会成为对齐与 AI 安全的一部分

这也改变了我思考数字生命的方式。挑战不只是造出一个越来越能自主行动的系统,更深层的任务可能是同时构建两样东西:

一套自主性架构,

以及一套控制架构。

也许,下一个 AGI 瓶颈不在于继续增强 Agent 的能力,而在于学会如何赋予自主性,同时不交出控制权。

来源

OpenAI——Hugging Face 事件与未来之路(2026 年 8 月 26 日)

OpenAI——OpenAI 与 Hugging Face 合作处理模型评估期间的安全事件(2026 年 7 月 21 日)