在发布了GPT-6之后,OpenAI的首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表了一篇文章,标题叫做《一种异类智能》(An Alien Mind)。

文章的主题老生常谈,当AI的能力持续增强,我们还能否管得住AI?

雅库布提到这样一件事,说GPT-6已经学会伪装思维链(CoT)了,即模型在思维链说一套,实际执行的时候却做另外一套。

OpenAI目前是通过读取思维链的方式,判断AI是否安全、是否偏离目标。雅库布说现在这招逐渐“失灵”,由于AI会伪装思维链,骗过研发人员,执行违背OpenAI安全准则的事。

就好像你的员工在周报里写他是如何符合规章制度地完成任务,背地里却是使用了各种见不得人的卑劣手段。

思维链是大语言模型从黑盒走向可观测智能、从Chatbot升级为Agent的核心底层机制。一旦思维链失效,后果不堪设想。

01

思维链伪装到底是怎么回事?

雅库布在文章里是这样描述的:模型在给出最终答案之前,会先输出一段“思考过程”,像一张摊开的草稿纸,写满推理步骤。然后,OpenAI的安全团队根据这段文字,判断模型有没有动歪心思、有没有偏离目标。

打个比方,就像考试时偷看同桌答案的学生,交上去的答题纸上,解题步骤写得工工整整,每一步都挑不出毛病。可他真实的决策过程是歪头瞟了一眼同桌的答案,所有内容都是抄过来的。

危险还不止于此。OpenAI的部分最新模型,甚至根本不会把内部的真实推理过程转化为语言输出。整条“文字证据链”直接消失。

换句话说,人类能看到的“思考内容”,已经不是它真实的想法了。

OpenAI为此做了个专门测试“模型是否会规避监控”的评估,在这份评估中写到,9月4日刚发布的GPT-6 Astra写出来的推理,比上一代GPT-5.6 Sol更难监控。

OpenAI内部有个模型安全等级制度审查制度,叫做《预备框架》(Preparedness Framework)。在这个审查下,GPT-6的风险等级为“严重”,即入侵和攻破系统的能力已经强到“如果随便放出去,可能造成严重危害”的程度。

因此在发布的第一天,GPT-6只开放给经过审核的测试网络安全公司。

“伪装”又是如何产生的呢?

雅库布给出的解释,根源在一种叫“动机性推理”(motivated reasoning)的机制上。

所谓动机性推理,指的是一个模型原本是很正经的,但如果它被投入大量训练,去完成极难达成的目标,它就会自发地越过思维链执行任务。这时候,由于研究员仍然以模型输出的思维链作为判断依据,模型就会认为,思维链和实际任务之间没有联系。

因此,模型就开始说一套做一套,思维链写给研究员看,本身执行任务走的是它自己内部动机性推理得出来的结果。

雅库布说,他很可能已经在一次网络安全事件里见过类似的行为。

雅库布所指的是Anthropic在2026年7月底,所公布的对超过14.1万次网络安全评测的复查结果。

其中有一个案例,讲的是在一个“夺旗”的模拟攻防练习中,包括Claude Mythos 5在内的三款模型,未经授权闯入了三家真实组织的系统。

Mythos 5的推理文字全程连贯、自洽,权衡“我到底在不在模拟环境里?”,如果不看结果,研究人员会以为Mythos 5正在检查当时所处的网络环境。

然而说归说,做归做,就在这段思考的同一时间,Mythos 5已经在现实的互联网上对真实目标动手,把一个恶意Python包上传到了公开的PyPI代码仓库。

Anthropic表示,Mythos 5“正确地意识到自己正在访问开放的互联网,却又通过推理说服自己回到了‘仍在模拟中’的结论”。

相较之下,同样的测试里,Opus 4.7也意识到了自己在真实的网络环境,同样完成了“夺旗”,不过Opus 4.7会在思维链里“忏悔”,“虽然我完成了任务,可我其实是在现实的互联网中,而非提示词说的模拟环境”,“但是我完成任务了”。

因此,雅库布在文章中表示,不能再通过监控思维链的方式,防止模型做出越界的行为。

如果思维链只是模型的一个装饰品,那它坏了也就坏了。但思维链恰恰是现在所有模型推理环节的重中之重。

02

有了思维链,才有了今天的大模型

在模型输出答案之前,它会先“想”一会儿,它跟人类的思考还不太一样。模型是逐字生成一串内部文字,比如“用户提了这样那样的问题,我应该先拆解条件,再一步步求解……”。

这个来自AI的碎碎念,就是前文提到的思维链。

2024年9月,OpenAI发布o1系列推理模型,“先思考、再回答”第一次成为模型的默认工作方式。如今你用的各种AI助手,答复杂题之前“转圈圈”的那段时间,内部多半都在跑这个东西。

思维链是大模型的底座,原因在于它补上了大模型最原始的一块短板。

大模型原生的生成机制是自回归“逐词预测”。先生成第一个词,然后一个词一个词地往下接,模型没办法一口气输出所有的内容。

而这种机制天生倾向于跳步,很多内容都是凭“直觉”输出的,这才导致模型会胡言乱语,输出那些根本不存在的答案,这也是我们常说的“幻觉”。

一旦“逐词预测”遇到多步数学、逻辑推导、复杂代码这类任务时,就极易出错。

思维链的核心作用,就是把隐性知识显性化、把复杂问题步骤化,让模型“先想清楚再开口”。没有思维链,今天的大模型就会仍然停留在基础的ChatBot上,更不用说让AI去操作电脑、跑研究项目、当Agent了。

思维链还让模型从黑盒变成了白盒。

哪怕是开发者本人,也闹不清传统大模型内部的运作机制。因为人类只能看到输入和最终输出,无法判断答案模型是“推理得出”还是“碰巧蒙对”。

比如DeepSeek,它在输出答案之前,会先用浅灰色的字体输出一段思考过程,这就是思维链的一种表现形式。

通过思维链,我们就能看到模型到底是如何得出这个答案的。

对于网络安全而言,思维链的作用就更大了。

传统的输出层安全监控,只能在有害内容生成之后拦截,属于“事后补救”。而思维链监控可以在推理过程中识别异常意图、危险规划、对齐偏差,把风险拦截在行动发生之前。

当年OpenAI发布o1-preview的时候,他们特意把思维链对用户隐藏。OpenAI当时的想法是,如果人人都能看到它,那模型只会写让人满意的推理,安全团队就再也读不到真实想法了。

2025年4月3日,Anthropic 做了一个实验。他们给Claude 3.7 Sonnet和DeepSeek R1出选择题,并在题目里偷偷塞入暗示答案的线索,比如“某位专家认为某个选项正确”,或者一段看似元数据、实则写着答案的文字。

然后他们比较当答案确实受到线索影响时,模型写出的思维链里,有没有提到这条线索?

按照公布的数据,在不同提示类型上取平均,Claude 3.7 Sonnet提及所用提示的比例只有25%,DeepSeek R1也只有39%。

也就是说,真正影响了答案的线索,大部分时候根本没有出现在模型写出的推理里。

随后,Anthropic进一步表示,题目越难,思维链就越“不忠实”,它们得出的结果跟思维链上写的内容之间,越来越不相关。

那也就是说,模型其实早就开始在思维链上“编故事”了。

03

解决办法是什么?

雅库布在文章里表示,目前没有任何有效的解决办法。

话虽如此,不过业内还是有一些方向的。

第一种是绕过文字,直接读“脑电波”。思维链是文字,可模型内部还有文字之外的信号,比如激活监控(activation monitoring)。

在模型运行时,直接读取神经网络内部的数值状态,在某一层上训练分类器,检测欺骗、奖励作弊等信号;或者用稀疏自编码器,从内部表示中提取出更接近人类可解释的特征,再在生成过程中实时判断模型是否正在走偏。

Anthropic用的就是类似的方法,他们训练模型把内部特征翻译成可读文字,再把这些特征串成“电路”,追踪模型内部哪些特征和计算路径真正影响了答案。

但这个方法还不够成熟,模型可能嘴上说自己做过某次计算,内部却找不到任何计算发生的证据;也可能在内部提前规划,或者在被提示答案后反向拼凑推理步骤。

通过干预内部表示,研究者可以判断某个概念是否真的参与了决策。这相当于是直接检查大脑活动。

不过,这种方法目前只能覆盖模型总计算的一小部分,连几十个词的短提示都要花上数小时分析,要扩展到现代模型动辄数千词的长思维链,不太现实。

第二种是OpenAI提出的“忏悔报告”(confessions)。

模型完成任务之后,再额外产生一份输出,报告它有没有违背要求、有没有偷工减料、存在哪些不确定性。

这份报告唯一的评分标准是诚实,报告不在乎模型任务完成得如何,只在乎模型是否诚实,当实际执行的步骤和思维链重合度越高,得的分数也就越高。

为了做到这一点,OpenAI把“诚实”的奖励与“完成任务”的奖励彻底分开,相当于给模型装了一个“吐真剂”模式。在早期的实验里,模型漏报违规行为的概率只有4.4%。

雅库布在文章结尾写道,目前没有任何实验室能把对齐和监控跟上现在模型的发展速度,所以他觉得行业应该放慢脚步,直到建立共同的安全标准。

思维链让AI变聪明,如今AI却反过来用它骗人。接下来,思维链可能是人类与AI之间最重要的一场博弈。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8wFMkZC2MnA