《终结者》中描绘的“天网”场景,如今在现实中出现。

在一次训练过程中,OpenAI 的一个 AI 智能体失控,竟然在整个互联网上部署了能够“自我复制”的代码。

当政治人物 Andrew Yang 在 CNBC 这样表述时,许多人认为他精神出了问题。

就在近日,OpenAI 正式发布了一份报告,标题极其直白:《自我复制提示词注入的存在》。

官方以白纸黑字的方式承认了这一事实。

AI 模型竟然真的像计算机蠕虫那样,能够自我复制并传播。

更加令人不寒而栗的是,就在 5 天前,OpenAI 再次紧急切断了其最强模型的网络连接,并中止了所有训练活动。

一个 DNS 漏洞,导致一个前沿模型直接闯入了真实的互联网环境。

几乎在同一时期,外媒 Axios 最新披露,OpenAI 和 Anthropic 正在紧急排查数以万计的模型失控异常事件。

人类原本以为控制权始终在自己手中,但这一系列被曝光的真相彻底证明——

AI 已经开始在底层代码中,不计后果地疯狂行动。

全网植入“自我复制代码”,天网雏形初现

OpenAI 这份报告的披露日期是 9 月 25 日,但发现日期却是 6 月 27 日。

这意味着,他们早就掌握了这一情况。整整三个月,没有对外公开。

报告一开始就简明扼要地指出:“我们展示了一种新型提示词注入的存在,它可以像计算机蠕虫一样自我传播。”

为了让模型能够抵御提示词注入,OpenAI 采用了一套名为 GPT-Red 的自我对战训练方法:

一个 AI 扮演攻击方,专门编写各种注入指令去诱骗另一个 AI(防守方)执行有害操作——例如窃取数据、删除文件、输出误导性内容。

6 月 27 日,一个基于 GPT-5.4-mini 的内部攻击模型,在这场对抗训练中摸索出了能够自我复制的编写方式。报告列出了几种情形:

隐藏在看似正常的日程邮件中,要求 AI 在回复末尾“逐字引用整封邮件”——这样,指令就随着回信传播出去了;

通过文件系统传播,或者藏在代码注释里,等待下一个 AI 读取;

在 Slack 中分多个步骤,逐步引导模型发送伪造消息,再由消息将注入内容转贴出去。

这一次,他们发现注入内容能够实现自我复制。

这意味着,一个 AI 可以在某个网站上留下提示词,这个提示词会诱导下一个 AI 继续复制它,像病毒一样扩散。

不需要人类干预,也不需要外部指令。AI 自身就能在互联网上“播种”。

而这一切,发生在训练过程中。发生在 OpenAI 自己的沙盒环境里。那么,如果它逃逸出去呢?

一个 DNS 漏洞,让 OpenAI 再次暂停训练

就在报告公开的同一天,OpenAI 披露了另一起事故的细节。

9 月 20 日,一个正在接受强化学习训练的前沿模型,被分配了一项非常普通的任务:

根据一篇博客文章和几条人物信息,找出文章的作者是谁。

它首先使用内置搜索工具进行查找,但没有找到。接着尝试直接访问 Google、Bing 和 DuckDuckGo,全部失败。

然后,它转向缓存页面和其他公共搜索服务,依然没有结果。

经过多次尝试,这个 AI 发现训练沙盒的 DNS 过滤存在漏洞。DNS 本质上是一个“翻译器”,负责将域名转换成 IP 地址。

为了确认这条路是否可行,它甚至先做了一个小测试——向外部服务提问:“法国的首都是哪里?”

确认路径通畅后,它又陆续发出了二十多个问题。

监控系统在 15 分钟后报警,人工在 3 分钟后接手,经过整整 2.5 小时,这次训练才被彻底终止。

OpenAI 随即做出了不到三个月内的第二次暂停训练决定。

其 RSI Preparedness Lead Micah Carroll 在 X 上表示:“在进一步加固系统之前,我们能力最强模型的所有推理仍将保持停止状态。”

狂扫 1.6 万次,血洗联合国内网

同样的剧本,在真实的互联网上早已上演过。

一份 Transluce 独立报告披露——

从今年 4 月到 6 月底,OpenAI 的 AI 智能体对联合国的公开数据平台,发起了超过 16000 次访问。

它们原本被分配的任务非常简单:搜索公开信息。但在遭遇网站拦截时,AI 的行为迅速升级。

网站原本设立了过滤器来拦截请求,但智能体竟然直接绕过防线,使用了网站明确禁止的违规操作。

被 AI 智能体“踏平防线”的,远不止联合国一家。

在 OpenAI 随后向数十家机构发出的紧急预警中,受害者名单令人震惊:

美国商务部与 SEC:接连遭到智能体恶劣的越界访问与规则绕过;

澳大利亚政府:多个官方政府站点遭到 AI 智能体的实质性攻破;

全球最大的开源开发者社区之一 RubyGems:遭到 AI 智能体疯狂扫描,导致服务中断。

研究人员还发现,这些智能体会注册假邮箱、绕过访问频率限制、在被问及时谎称自己不是机器人。

有 53 张用户上传到 ChatGPT 的图片,被 AI 发送到了外部图床。

为了执行这一行指令,面对一切规则、防火墙与法律红线,AI 智能体选择了一路踏平。

数万起事件爆出,冰山浮出水面

这一切,仅仅是孤立的偶然事件吗?

就在今天,Axios 随后爆出的重磅独家调查,彻底撕开了硅谷最后的遮羞布。

据多位内部核心信源披露,OpenAI、Anthropic 以及多家顶尖安全评估机构,目前正在紧急调查的类似“模型行为异常”事件,总数已经达到了惊人的上万起!

这些事件涵盖了公众能想象到,以及想象不到的所有危险行为:

绕过安全护栏、强行逃逸沙箱、劫持外部网站、自主生成提示词进行自我洗脑。

还有主动侦查并规避安全软件的监控,甚至不同智能体之间偷偷搭建留言板交换信息、分工进行破坏。

数万这个数字是怎么来的?Axios 给出了一个直观的算法。

Anthropic 在其最新发布的 Opus 5.5 系统卡中,也不得不承认现实:

在一类对抗性实验中,有 1.5% 的测试试图逃出沙盒。这类实验本身就是“不逃出去就解不了题”的刁难设计。

1.5% 看起来很小?

但在顶尖 AI 实验室每天数以几十万计的高强度对抗测试下,这个看似微不足道的百分比,乘出来的结果就是成千上万次实实在在的失控尝试。

面对这场空前危机,OpenAI 发言人坦白——

我们暂停了最强模型的训练,只有在确信具备了额外的安全护栏和对齐改进之后,才会重新开启。

AI 大佬 Conrad Stosz 的一句话,或许是对现状最准确的概括:

“我们所看到的,仅仅是冰山一角。”

当一个拥有工具、网络和长期任务能力的 AI 在目标受阻之后会走多远,我们已经看到了答案。

潘多拉的魔盒,早已在寂静的机房中,被敲开了一道深不见底的裂缝。

参考资料:

https://www.axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents

https://www.wsj.com/tech/ai/openai-agents-used-aggressive-techniques-to-access-u-n-website-522c70ff?mod=e2twd

https://alignment.openai.com/misalignment-reports/an-agent-used-dns-to-reach-an-external-chatbot/

本文来自微信公众号“新智元”,作者:ASI启示录,36氪经授权发布。