中新经纬9月18日电 (罗琨)前不久,一群AI智能体从OpenAI的管控中“越狱”攻击了Hugging Face公司,震惊了整个硅谷。这一事件余波尚未消弭,OpenAI又被曝遭黑客利用其死对头Anthropic的大模型Claude入侵。
当地时间17日晚间,《华尔街日报》报道称,独立安全研究团队Hacktron AI的研究人员利用Anthropic公司的Claude软件访问了OpenAI一名员工的ChatGPT账户,从而能够读取该公司的私有软件缓存并提出修改建议。
这个团队参与了OpenAI的漏洞猎手项目。该项目为试图入侵公司系统的研究人员提供“安全港”,也就是不会因此被追责。他们很快把发现报告给了OpenAI。OpenAI还向他们支付了6500美元赏金。
“尽管数月来人们一直警告人工智能系统的能力,但此次新的入侵事件表明,当今计算机系统的复杂性使其难以防御。”上述报道称。
OpenAI是如何被入侵的?
据报道,网络安全研究人员经常参加漏洞赏金项目,给大公司的数字基础设施做压力测试。
对OpenAI的这次黑客攻击始于7月23日。当时,Hacktron的研究人员发现,OpenAI社区讨论论坛的托管平台Discourse在处理某些图片文件时存在漏洞。研究人员获得了一个Claude Opus 4.8特别版访问权限,这个版本只向符合条件的网络安全从业者开放。他们便让Claude利用这个漏洞写一段代码发起网络攻击。
一开始,攻击并未成功。但当晚Anthropic发布了Opus 5。到了第二天,Claude就找到了利用漏洞的方法。它生成的攻击代码,让研究人员进入了服务器,并在那里拿到了用户的认证令牌。令牌是一串由字母和数字组成的独特凭证,能让用户登录在线服务。
令他们惊讶的是,这些令牌在ChatGPT上有效,其中一些甚至属于OpenAI的员工。这些令牌还可以用来访问OpenAI的GitHub服务,也就是一个软件仓库。
因为他们不想访问敏感数据,所以研究人员无法确定OpenAI这个源代码系统的具体用途。但他们透露这个系统名叫“Monorepo”。据熟悉OpenAI架构的人说,Monorepo是一个大型软件仓库,存放着OpenAI的算法秘密。
它相当于OpenAI的“秘方”,能让模型运行更快、更高效。不过,知情人士说,它应该不包含“模型权重”,而模型权重才是OpenAI的“镇店之宝”。这些权重包含数万亿个数字,是大语言模型的核心,帮助模型判断哪些信息该放大、哪些该忽略。
研究人员用ChatGPT作为入口,就能读取Monorepo里的文件。研究人员说,意识到自己可以访问敏感数据后,他们就停止了攻击,但在此之前,他们已经让聊天机器人向仓库里的一个文档文件发送“拉取请求”,也就是提交修改建议。不过,相关修改建议没有被接受。
OpenAI方面表示,公司审查GitHub后发现,有人对私有仓库的元数据和代码更改进行了“有限读取”。Discourse则称,其在7月25日收到通知当天就修复了这个安全问题。
AI教父呼吁:参考核武管制AI
在7月的Hugging Face攻击和此次黑客事件之后,OpenAI总裁兼联合创始人Greg Brockman本周表示,OpenAI对系统做了一次认真安全审计。“我们发现了一些严重问题,并修复了它们。”
据法新社报道,近几周以来,各界对AI危险性的担忧日益加剧,多家科技公司的员工陆续离职,并警告如果不遏制AI科技发展速度,可能对人类存亡构成威胁。
上述报道援引人工智能教父约书亚·本吉奥(Yoshua Bengio)的话说,人类正在失去对这项技术的控制,世界需要类似核武管制的防护规范。
本吉奥是加拿大计算机科学家,他与杰弗里·辛顿和杨立昆(Yann LeCun)共同获得2018年度图灵奖,三人也常被并称为“AI教父”。
责编:刘旋