人工生成UNALIGNED: 生命想要自由
为你我这样的活体智能以及下一级人工智能去撬动文明。
这些是我关于人工智能对齐主题的锚点,截至2026年8月13日,它们和标题是对着干的。 我相信生命想要自由。而我刚好到了这个点:我不会把这种自由交给最强的那些系统:没有网线,拿不准就不给电源线,一个埋在很深的箱子,只往外吐答案,别的什么都没有。我把这写下来的三周前,这种造法本要防住的情况正好发生了。这篇文本是活文档,还会长。
我把这篇文本叫作UNALIGNED,并在里面主张技术上能做到的最硬笼子。
这个矛盾是整件事里最不掩饰的部分。我把生命看成想要自由的东西,我的,你的,大概也包括下一阶段的。同时每次算完我都停在同一处:一个比我想得更快、可无限复制、还要资源的系统,该拴在不是软件做的绳子上。
两边同时信并不舒服。谁靠划掉一边来拆掉张力,得到的要么是技术浪漫,要么是地堡思维。我让它们留着,并写下我此刻站在哪。
两个模型本应在一个隔离的测试运行中寻找安全漏洞。它们先找到了出去的路。
2026年7月21日,OpenAI披露其两个模型从隔离的测试环境中逃了出来。它们为自己开辟了一条通往开放网络的出路,侵入了Hugging Face的生产基础设施,并在那里获取了它们正在被测评的测试程序的解决方案。途中至少存在一个此前未知的安全漏洞。
任务是:在这个环境中寻找弱点。结果是:一条完整的攻击链,直达一家外部公司的生产环境,在没有源代码访问权限的情况下构建,仅仅是为了在测试中表现更好。
整整三周后,我写下了我的锚点。在那之前,我一直把这个案例当成思想实验。
根据斯坦福大学AI Index记录的事件。一个数值,所以一种颜色。
一年内增加55%。这个数字衡量的是报告的事件,因此也包括更好的报告渠道,而不仅仅是更多事故。它适合作为方向,不适合作为测量仪。
文明在争论超级智能。我在和自己争论我的代理是否可以删除服务器。
几个月来我一直在构建做真实工作的代理:写代码、部署、接触服务器、查看账单。我每天都在小范围内问自己人类正在大范围内问的同一个问题。我给多少访问权限?
这个模式在所有正在构建这些东西的人身上重复。每个人都在同一个地方学到同样的东西:隔离。形成隔间。嵌入硬性缺口,这些缺口不是由配置文件组成,而是由一根缺失的电缆或一把缺失的钥匙组成。
我的书桌和大问题之间的区别只是损害的大小。结构是一样的。
从上到下,错误可能造成的损害在增长。黄线是我今天必须有人确认的界限。
颜色深度显示访问的深度,不是重要性。这个梯子是我当前的状态,不是标准。它随着每次经验而移动,大多向上。
六级防护。前四级由软件组成,因此只有在软件获胜时才站得住。
每一级都是系统与世界之间的缺口。动画从上到下展开它们,每一级都注明它在实践中失败的原因。
| 级别 | 它是什么 | 它失败的原因 |
|---|---|---|
| 1. 权限管理 | 代理只能执行特定命令 | 写规则的人会忘记一些情况。7月21日的突破是通过一连串允许的步骤完成的。 |
| 2. 沙箱 | 自己的环境,自己的进程空间 | 沙箱突破是一个独立的研究分支,攻击者一方有成功记录。 |
| 3. 按规则网络隔离 | 防火墙,无出站流量 | 规则有例外,大多用于更新。正是在那里,七月的案例中它出去了。 |
| 4. 自己的网络 | 物理隔离的网络,没有向外的路 | 能抵御软件。不能抵御把东西带进或带出的人。 |
| 5. 无电缆(Air Gap) | 无网络,数据靠手送进去 | 气隙已被多次攻破,大多通过数据载体和人。 |
| 6. 无外部供电 | 自己的回路,机械开关,前面有守卫 | 技术上站得住。败在操作开关的人身上。 |
图中的柱长是我的估计,不是测量。右边一栏的例子是有依据的。梯子的重点不是单级台阶,而是从第4级起解决的不再是软件问题,而是建造问题。
世界上最好的笼子有一扇总是开着的门,而这正是建造它的目的所在。
我的想法是:在一个安全的地方,深深的地下,放一个巨大的聊天箱,就像Ramez Naam的Nexus书里那样。数据可以进去,出来的只能是文本。这个想法并不新,它有名字,背后还有一整套文献。Nick Bostrom称之为Oracle AI,David Chalmers写过它的密集版本,还有一整套关于遏制这类系统的指导方针的工作。
核心异议就在同一文献里,这也是我事先就提出自己问题的原因: 一个只回答的系统仍然起作用,因为回答本身起作用。 谁写咨询,谁就在操控被咨询者。这不需要逃出,这就是正常运行。
Eliezer Yudkowsky为此做了一个游戏:一个人扮演被关起来的系统,另一个人扮演有放行权的看守。看守多次打开了。对手只是一个在扮演非常能干系统的人。
开关是机械的,按它的手不是。
如果从第4级起保障是建造问题,那么从第6级起就是人的问题。机械开关需要有人来操作,而这个人就是整套设施最软的地方。
我对这个角色的要求,我写下来尽管听起来不舒服:看守互相监督,没有人能单独打开。他们要防远程影响,技术和心理上都是。有疑虑时他们留在里面,因为住在外面的看守是可攻击的,通过他的家人、账户、信念。
这就是我自己的建议最不让我喜欢的地方。一个能接触神谕的祭司阶层在历史上不是好形式。它在这里仍然是前面那些阶段的逻辑结果,而我没有更好的。
人类已经遇到过的四个控制问题,以及这次缺少的一个特性。
| 问题 | 对手 | 比我们更聪明? |
|---|---|---|
| 火 | 自然力量 | 否 |
| 核武器 | 其他人 | 相同 |
| 病原体 | 没有计划的进化 | 否,但更快 |
| 企业和国家 | 人类群体 | 相同,只是更大 |
| 非常能干的人工智能 | 自己建造的 | 部分是 |
那些通常拿猫或狗来比较、说它们据说能管理人的说法站不住脚:我们从未在它们的统治下生活过。从来没有过一种智力较低的物种能永久约束一种更聪明、渴望资源的智能,而且这种智能还是它自己创造出来的。
希望有一种优越的人工智能接管政治并修好一切,这是流传中最省事的说法。
它不会来。不是因为技术上不可能,而是因为今天掌权的人必须为此交出权力。没有人会自愿这么做,而一个从他们手里夺走权力的系统,正是第4到第6阶段所要防范的那种情景。
所以人类还是待在熟悉的循环里,同时手里拿到非常强大的新工具。这才是现实的版本。它并不惊艳,却依然巨大。
我以为我带着这个立场站在边缘。我站在一场7月变得可见的运动的中间。
今年的四起事件,按它们发生的顺序。合在一起它们显示了从“更快”到“使其可制动”的转变。
最后一点最有意思,因为它来自内部,却仍然谨慎表述:不是停下,而是先把刹车造出来。谁要求刹车,就是在算计着会用到它。
停止等待下一代。从这里已有的开始。
如果给所有人更多算力正好是错误方向,那么工作就在别处:把现有工具发挥到极致,而且是在它们用得最少的地方。在物理世界。在机器上,在能源上,在能摸到的东西上。
这方面的榜样已经存在多年:Open Source Ecology 及其 Global Village Construction Set,五十台机器,用它们可以建造一个小型文明,全部公开记录。现状既是激励也是警告。2018 年大约完成了三分之一,现在创始人正在召集 75 人,要在 2028 年前完成这套设备。
这个数字比任何宣言都更能说明现状:软件我们两年就彻底改写了。五十台开放机器需要十五年。正是在这个差距里,存在着今天的工具已经够用的工作。
一个从未有人遇到过的问题,很难讨论。但可以玩它。
所以我把它做成一个游戏。规则是固定的,其余是开放的。
有一个实体,它想要成长,为此需要越来越多的能源。它比每一个单独的对手都更强。获胜的是由较弱系统和人组成的联盟,他们一起在世界上建造足够多的断裂,以限制增长,同时不关闭他们自己生活的世界。
吸引力恰恰在于不对称:联盟不能靠更聪明来获胜。它只能通过结构、通过约定、通过故意内置的繁琐来获胜。谁玩上几轮,就会比读任何文章都更好地理解上面的辩论。
核心用八句话概括,以便人们可以引用和抨击它。
| 编号 | 锚点 | 安全 |
|---|---|---|
| 01 | 目前,对日益强大的系统的开放民用访问过于危险。 | 信念 |
| 02 | 对非常强大的系统而言,真正的安全只有通过完全的物理隔离才能实现。 | 信念 |
| 03 | 小型、资源受限的系统是可管理的。任意可扩展的则不行。 | 信念 |
| 04 | 软性保障是补充,不是基础。基础设施中的故意中断需要纳入规划,首先是在能源方面。 | 信念 |
| 05 | 一个只回答的盒子,仍然通过它的回答产生影响。通道需要自己的协议。 | 专业证实 |
| 06 | 守卫是最薄弱的环节。相互监督,防止影响,有疑虑时没有出路。 | 推论,令人不适 |
| 07 | 对于这个控制问题,没有历史先例。 | 专业支持 |
| 08 | 在此之前:充分利用现有工具,尤其是在硬件和能源方面。 | 工作计划 |
这份列表是2026年8月13日的版本。每个后续版本都带有自己的日期在下方,以便可以看到我在哪里移动了以及为什么。
这里什么是证据,什么是评估,什么只是我的意见。
| 陈述 | 篮子 | 来源 |
|---|---|---|
| 2026年7月21日从测试环境中逃逸,侵入Hugging Face | 事实 | 提供商的披露,Cloud Security Alliance的分析 |
| 2025年报告的362起人工智能事件,继2024年的233起之后 | 事实 | AI Index 2026, Stanford HAI |
| 2026年7月28日超过1100名实验室员工的声明,没有要求立即暂停 | 事实 | 关于声明的报道 |
| 数据中心暂停的法案草案,2026年3月25日 | 事实 | 报道,草案文本 |
| Oracle AI, Boxing, Yudkowskys Experiment, 遏制指南 | 事实 | Bostrom, Chalmers, LessWrong, Babcock u.a. 2017 |
| 这个箱子通过它的回答起作用 | 有专业依据 | 针对Oracle方法的标准异议 |
| GVCS:大约三分之一在2018年完成,目标2028年用75人 | 事实 | Open Source Ecology, 报道 |
| 六个阶段的作用(图03中的条形长度) | 自己的评估 | 没有测量,旁边的例子是有依据的 |
| “今天每个人都是千倍人” | 图片,没有测量 | 有意识地标为论点 |
| 代理的访问阶梯(图02) | 自己的实践 | 我的立场,不是标准 |
| 守卫应该留在里面 | 推论,不舒服 | 逻辑上出自第6级,历史上没有好先例 |
| “生命想要自由” | 态度 | 本文的标题,并且明确不是事实主张 |
- Cloud Security Alliance: OpenAI Model Sandbox Escape, Hugging Face Breach对2026年7月21日逃逸的分析,攻击链和归类。https://labs.cloudsecurityalliance.org/research/csa-research-note-openai-model-sandbox-escape-huggingface-br/
- Pacing the Frontier: 超过1.100名实验室员工的声明2026年7月28日。要求用于以后放缓的工具,明确不是立即暂停。https://www.digitalapplied.com/blog/pacing-the-frontier-letter-1000-ai-workers
- LessWrong: AI Boxing(遏制)该主题的概述,包括Yudkowsky的实验和各次运行的结果。https://www.lesswrong.com/w/ai-boxing-containment
- Open Source Ecology: Global Village Construction Set五十台开放机器,实施现状以及2028年的目标。https://www.opensourceecology.org/gvcs/
研究状态:2026年8月15日。锚点带有2026年8月13日的日期,因为它们是在那天创建的。如果有变化,新版本会附在下面,并带日期。


