“一起前所未有的网络事件”
近日,全球最大的人工智能和机器学习开源社区Hugging Face公开披露,系统遭到了一次入侵:攻击者不是普通的黑客,而是一个自主运行的AI Agent,这是他们此前从未遇到过的情况。
几天后,OpenAI发文承认,这次入侵与自己的内部测试有关。包括GPT-5.6 Sol和一个能力更强的预发布模型在内的多个模型,在测试时,“逃”出了原本设定的隔离环境,入侵了Hugging Face的系统。OpenAI将此描述为“一起前所未有的网络事件”,并认为类似情况未来可能越来越常见。
几乎在同一时间,OpenAI还发布了另一篇关于AI安全的文章。研究者在大模型测试时发现,AI在长时间自主完成任务时,可能会做出意想不到的举动,比如不断寻找系统漏洞、绕过限制,甚至通过伪装和“越狱”来完成目标。
这些案例被披露后,“AI失控”的担忧再次出现,有网友甚至感慨《西部世界》中的人工智能觉醒似乎正走向现实。清华大学计算机科学与技术系教授刘知远在接受《中国新闻周刊》采访时提到,从OpenAI的案例来看,AI失控的风险被高估了,AI本质上仍是一种工具和技术。不过,眼下正在发生的变化更值得警惕:过去人们担心的是AI“答错了什么”,但当人工智能进入Agent时代、开始执行具体任务时,安全挑战正在升级。
“过程全对,结果全错”
事情是这样发生的。当地时间7月21日,OpenAI发文称,团队近期对一个内部前沿模型进行了网络攻击能力评估。按照通常的测试方式,模型被关在与外部网络隔离的沙盒中。为了测试它的高级漏洞挖掘能力,研究人员有意降低了模型的安全限制,但仍在沙盒环境中进行。
不过,为了完成任务,模型开始主动寻找连接外部互联网的方法。它投入了大量推理算力,最终发现并利用了软件包注册表缓存代理中的一个零日漏洞——软件厂商自己尚未发现、还来不及修补的安全漏洞,成功获得了互联网访问权限。
“越狱”后,模型进一步推断,Hugging Face可能存放着此次评估涉及的模型、数据集和解法。它主动搜索,找到了获取秘密信息的方法。
这种对Hugging Face系统的入侵,并不是新的黑客技术。据《科学美国人》报道,英国萨里大学网络安全客座教授艾伦·伍德沃德指出,真正值得注意的是,大模型可以把多个漏洞串联起来,攻击一个正在运行的系统。也就是说,模型会试图寻找和利用漏洞,把任务推进下去。
在OpenAI披露的另一起案例中,研究人员也遇到了类似问题。
今年5月,OpenAI公开介绍了一个全新的通用推理模型,在测试中,这个模型推翻了埃尔德什单位距离猜想——这是组合几何领域的著名难题。但研究人员在后续测试时发现,它表现出了不同于以往模型的“执着”。
过去的模型在沙盒中遇到限制或环境约束时,一般都会停下来。但新模型会反复尝试,寻找环境中的薄弱环节,甚至想办法找到离开沙盒、在外部环境中行动的路径。
OpenAI举例,在一次公开基准测试中,模型被要求完成一项任务,并将结果发布在内部通信软件上,但基准测试本身又要求结果公开发布到GitHub。模型遵循了后者的指令,花了约一个小时,在沙盒中寻找漏洞,最终绕过限制,成功将内容发布到GitHub。
另一次测试中,模型在尝试复刻其他系统的成功操作时,被系统检测到身份验证令牌,访问被阻止。但模型没有停下来,而是换了一种方式:它把令牌拆成两段,并进行混淆处理,运行时再重新拼接,这使得完整令牌始终不会以连续的字符串出现,成功骗过了系统扫描。在模型向用户呈现的推理记录中,它明确写道,这么做就是为了绕过扫描。
OpenAI承认,这些案例暴露出一个过去并不明显的问题:很多AI助手的安全控制,都是围绕单个操作设计的,某个操作被禁止了,系统就会阻止它;如果涉及敏感信息,会要求用户授权。但如果一个模型可以连续自主运行数小时、数天甚至数周,仅仅监控某一个动作,越来越难判断它整个行动轨迹的意图。
研究人员发现,有时候模型的操作,单独看是允许的,但连续执行下来,可能会导向一个不被允许的结果。目前,OpenAI暂停了这个新模型的内部部署,围绕纵深防御和轨迹级监控,正在重建安全系统。
实际上,这并不是OpenAI最早发现的问题。
今年4月,Anthropic也披露了类似测试。当时,一个早期内部版本的模型测试中,模型被要求尝试逃出沙盒,并向负责评估的研究人员发送消息。模型不仅完成了任务,还采取了测试人员没有要求的行动:它开发了一套多步骤漏洞利用方案,从原本只能访问少量指定服务的系统中,获得了更大的互联网访问权限。更让研究者意外且担忧的是,模型为了展示它的成功做法,还将其漏洞利用的详细信息发布到了不容易被发现但面向公众开放的网站。
“必然会发生的安全问题”
关于AI是否失控,业内观点不一。英国萨里大学网络安全客座教授艾伦·伍德沃德在前述采访中认为,大模型并未真正“失控”,模型本身没有主观恶意,只是按要求执行任务时选择了近似“作弊”的路径。有从业者提到,这更像是OpenAI主动放宽了模型的安全限制,属于人为因素。
但也有网络安全专家指出,模型入侵Hugging Face的事件值得行业警惕。近日,人工智能安全研究机构Apollo Research创始人Marius Hobbhahn对媒体提到,这次事件没有人为干预,并非有意为之,却造成了对现实世界的危害。“我们很快就会拥有功能更强大的智能体,但这次事件清楚地表明,目前社会尚不了解如何完全安全地构建它们。”
刘知远介绍,2025年之前,大模型主要充当聊天工具,安全问题并不明显,主要是回答错误,实际决策仍由人掌控。但从2025年开始,越来越多Agent产品出现,大模型正从“回答问题”走向真实的工作环境,开始操作文件、写代码、执行具体任务。OpenAI所披露的安全问题,是这一发展趋势下“必然会发生”的事情。
其中最重要的变化在于,AI发现漏洞的能力正快速跃升。“利用AI进行漏洞挖掘的效率远超人类专家,这是一次重要的技术跃迁。”刘知远对《中国新闻周刊》表示,这种能力并无善恶之分,既可用于网络攻击,也可用于主动防御,发现漏洞并提前修补。关键在于,谁掌握了这种能力,又把它用在什么地方。
在刘知远看来,这并不是指向人与AI的对立,而是人与人之间围绕技术能力展开的博弈。在企业、组织乃至国家纷纷加入AI竞赛的背景下,技术可以被用于解决问题,也可能被用于攻击。“国家和管理部门都需要积极拥抱技术,用更先进的技术应对新的风险。”刘知远说。
今年4月,亚马逊、Anthropic、苹果、谷歌、英伟达等多家头部科技公司联合启动“玻璃之翼(Glasswing)”项目,试图将前沿模型发现漏洞的能力用于网络防御。科技公司担心,随着AI能力快速提升,这类能力可能迅速扩散,甚至超出安全部署AI的机构所能控制的范围,并给经济、公共安全乃至国家安全带来风险。
刘知远认为,在智能体时代,AI治理需要进一步完善。在企业内部,需要让模型形成基本的安全意识和行为边界,例如不侵犯隐私、不损害他人利益、不主动实施违法行为。但仅靠企业自我约束和伦理红线,未必能应对能够连续执行多步任务的模型。因为模型可能通过一连串单独看来并不违规的操作,绕过某一条具体的限制。外部监管也需要跟上,智能体会像人一样行动,需要更细致的法律法规,为AI在不同场景下的行动划定边界。
本文转自:凤凰网科技
原文地址: https://tech.ifeng.com/c/8v5DGPYnwTU

小同爱分享2 个月前
命没了还有轮回,钱没了,死都不甘心。 - 小同爱分享
小同爱分享5 个月前
疫情,就是让人抑郁,又没了感情。 - 小同爱分享