
轰轰烈烈的大蒸馏时代,要结束了!
就在9月2日,Anthropic一记重拳,直接改写了API规则,彻底切断了套壳大模型和蒸馏者的后路。

曾经,无数公司为了省去巨大的算力成本和漫长的训练时间,选择通过API套取头部顶尖模型的推理过程,然后用这些数据来训练自己的「小模型」。
但今天以后,这种可能性,不复存在了。
Claude Fable 5.1 封杀「思考块」篡改
Anthropic这次发布的Fable 5.1,推出了堪称史上最严反蒸馏机制。
核心动作,就是死死锁住「思考块」。
什么是「思考块」?
简单来说,就是AI在给你最终答案之前,脑子里进行的CoT过程。

Claude 进行心算时思维过程中复杂、并行的路径
在API调用中,Claude会将这些推理步骤以「思考块」的形式返回给用户。
在正常的多轮对话中,开发者会把这些思考块连同系统提示词、工具和历史消息一起再发回给Claude,以便让模型记住上下文,保持对话的连贯性。
但偏偏就是这个机制,成了蒸馏者们的机会。
他们发现了一个巨大的漏洞:只要在多轮对话中,偷偷修改思考块前后的上下文(比如篡改早期的系统提示或历史消息),就能打破Claude的防御机制,甚至能诱导Claude吐出它原本隐藏的底层推理逻辑!


针对这一乱象,Anthropic在Fable 5.1中毫不留情地推出「上下文一致性验证」的新规。
1.原路返回,一字不差:API现在将严格验证客户端发回来的「思考块」,是否与当初产生它的系统提示、工具和历史消息完全一致。
2.动了手脚?直接报错!只要系统发现上下文被修改,哪怕一点点都会匹配失败,API将直接返回错误提示,拒绝服务。
而且,为了照顾到那些确实需要修改上下文的合法开发者(比如需要压缩上下文长度来省钱),Anthropic提供了一个「非严格模式」。
在这个模式下,你的请求可以通过,但是,系统会直接把「思考块」全部删除! 模型将在完全看不到之前推理过程的情况下,强行作答。
这一招,可谓是釜底抽薪。

当 Claude 被问及一个较简单与一个较困难的问题时,忠实推理与动机性(不忠实)推理的例子
工业级蒸馏,到底有多疯狂?
Anthropic至于发这么大火,搞出这么严格的限制吗?
答案是:至于,而且极其必要。
因为目前的非法蒸馏,已经演变成了工业级规模。
在过去的一年里,Anthropic的安全团队观测到了令人触目惊心的滥用现象。
这些专业的「蒸馏黑客」们并不是用一个账号每天问几个问题,而是使用数以千计的虚假账户,通过自动化的脚本,夜以继日地在API端疯狂「薅羊毛」。

他们的操作手法极具隐蔽性和攻击性。
上文说过,虽然Anthropic早就对Claude的核心思考块进行了加密,但黑客们使用了「上下文注入」和「对话重写」的技术。
这种做法就像是给Claude进行「催眠」,让它在逻辑错乱中,主动把自己加密的推理过程给解密、打印出来。
因此,很多小参数模型,并没有经历从零开始的算力堆叠和算法创新,只是背下了顶尖AI的答题思路,就做到了性能比肩。
更可怕的是,这种做法直接触及了红线,导致安全保障的崩塌。
AI失控的最大隐患
如果说商业利益的损失只是让Anthropic「肉痛」,那么「能力与安全的脱钩」,则让整个AI安全界感到恐惧。
这也是Anthropic决定痛下杀手的核心动机。
众所周知,像Claude、GPT-4这样的大模型,在拥有极高智商的同时,也接受了极其严苛的「价值观对齐」和安全训练。它们知道不能教人制造炸弹,不能编写恶意勒索软件,不能发表仇恨言论。
这种「能力+ 安全护栏」的双重绑定,是大型AI公司耗费上千万美元进行RLHF和红蓝对抗才建立起来的。

但是,蒸馏模型完美地避开了这道安全网!
当蒸馏者通过修改上下文,强行套取Claude的「思考块」时,他们只提取了那部分高智商的「推理能力」,却根本无法继承底层的安全保障。
就像一个邪恶组织,克隆了爱因斯坦的智商,却没有克隆爱因斯坦的道德感和同理心。
用这种非法蒸馏手段训练出来的系统,会莫名其妙地继承它们原本不该拥有的高级逻辑和代码能力。
但由于它们本身是一个「低保障、弱护栏」的底层模型,它们会毫不犹豫地响应黑客的请求,去生成网络攻击脚本,或者协助进行生物武器的研发。
「能力和安全的脱钩,是当今AI最大的风险。」
新规落地:谁受影响?
这次打击,会影响到正经开发者吗?
不用怕,Anthropic采取了精准的「分阶段执行」策略,力求将误伤降到最低。
首当其冲的,是「新账户」。
根据官方文件,此次限制率先从滥用最集中的新账户切入。针对 Fable 5.1 模型,该更新仅适用于在 2026年8月31日 12:00:00 AM UTC 之后创建的新 API 账户。
以下人群,可以彻底放心,你们完全不受影响。
1.现有 API 账户:现有的老账户在 Fable 5.1 上暂不受影响。这给了合法开发者充足的时间去调整。
2.消费端普通用户:如果你只是在使用网页版的 Claude.ai,或者是 Claude Code、Claude Cowork 等官方产品的C端用户,或者通过第三方套壳产品正常聊天,你不会受到任何干扰。

对于受到影响的 API 开发者,你需要注意什么?
如果你之前的应用集成中,恰好用到了「在对话中途重写早期轮次」的技术(比如为了省钱而做的上下文压缩,或者在对话中途强行注入新的系统提醒),你需要立刻开始调整你的代码逻辑了。

为了应对这一变化,Anthropic提供了完善的迁移指南。开发者有两个选择。
选择一:保持上下文的绝对一致。把原来的思考块、系统提示和工具一字不差地传回去。
选择二:在API请求中选择加入「非严格模式」 。在这个模式下,即便你修改了上下文,API也不会报错中止,而是会自动且静默地删除请求中的受影响的思考块。
虽然这会让模型在接下来的对话中「忘掉」之前的具体推理过程,但至少能保证你的对话或任务不被中断。
需要提醒的是:虽然目前该规定存在豁免期,但 Anthropic 已经明确表态——「保留思考」机制将在未来的模型版本中适用于所有账户!
现有的缓冲窗口期,也是有限的。
意外之喜:造福老实人
并且,这次新规之后,还隐藏着一个对于合法开发者的好处——成本的大幅降低和响应速度的飞跃。
这是怎么做到的?
核心就在于「上下文一致性」。
在过去,因为开发者可以随意修改上下文,导致模型每次接收到的请求都是「全新」的。这不仅耗费算力,而且速度极慢。
现在,新规强迫所有人必须保持「思考块」及其周围的系统提示、历史消息完全一致,不得篡改。
这在技术上创造了一个完美的条件:提示词缓存可以实现极高频率的命中!
现在,API服务器可以轻松地将之前的对话上下文直接缓存下来。当下一轮对话请求到来时,系统直接从缓存中调取数据,瞬间完成匹配。
其结果就是:API的响应时间大幅缩短,延迟直线下降,同时开发者的API调用成本也会显著降低!
这一招「无心插柳」,可以说是真金白银地补贴了老老实实的开发者。
总之,这次新规,对于整个AI行业来说,无疑是一个分水岭。
小参数锤爆大模型的故事,或许会少很多。
退潮之后,是谁在裸泳?
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8wAGYfIHlY8

小同爱分享3 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享6 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享