【CNMO科技消息】一封来自内部人士、内容异常具体的AI风险公开信近日浮出水面。据《华尔街日报》报道,写信人关注的核心问题,是保住对模型思维链(Chain of Thought)的监控能力。不过严格来说,这三位作者如今已算不上内部人士——他们刚刚被OpenAI解雇。

OpenAI
上周,OpenAI宣布已“与三名个人解除关系,原因是他们违反了公司关于访问和处理敏感信息的政策”。据称,这三人将相关信息传递给了一家AI安全机构。三人的身份是Tomek Korbak、Mikita Balesni和Jasmine Wang,从公开言论看,他们都相信AI存在生存性风险。在遭解雇之前,Balesni就曾在X上表示,他认为AI“有10%的可能杀死全人类”;Wang则写道,“很难充分描述在通往递归自我改进(RSI)的道路上加速有多危险”,而RSI指的是AI模型自我改进的能力。
这封联名信写给OpenAI董事会以及公司的“安全委员会”,目前并未公开发布,《华尔街日报》只刊出了部分节选。信中的核心表述是:“作为一个行业,我们还不知道如何安全地开发和部署我们无法监控的模型……OpenAI和其他前沿公司不应推进那些会进一步削弱(监控能力)的研发。”
信件的具体关切指向OpenAI的最新旗舰模型GPT-6 Astra。围绕思维链监控,Astra引发了两种担忧:其一,模型可能正在学习如何绕过监控系统;其二,OpenAI据称可能在把技术方向带向让思维链监控失去意义的地方。该模型的系统卡明确提出,“Astra级模型在对抗条件下可能逃避我们的思维链监控”。与此同时,Astra的推理过程还涉及一种更不透明的机制,名为“循环深度”(recurrent depth)——它会先把查询在模型内部多次循环处理,而不是直接生成内容,这个过程发生在不可知的黑箱之中,外界没有任何可监控的对象。
本文来自大风号,仅代表大风号自媒体观点。