财联社9月18日讯(编辑 周子意)一个网络安全研究团队利用Anthropic的Claude模型成功入侵了OpenAI的系统,这凸显了后者在安全方面的漏洞。在此之前,一些全球领先的人工智能公司正面临日益严格的安全审查。
据报道,独立信息安全研究团队Hacktron AI利用Anthropic旗下Claude模型寻找并利用一系列漏洞,成功入侵一名OpenAI员工的ChatGPT帐户,并获得OpenAI内部Monorepo私有代码系统访问权限。
OpenAI的“漏洞赏金计划”
Hacktron AI由顶尖白客及安全研究人员组成,受邀参与OpenAI发布的“漏洞赏金计划”,因此本次入侵测试属于获授权的安全研究。
这些研究人员利用了OpenAI社区论坛配置中的一个漏洞,借此获取了内部登录权限,并最终访问了一名OpenAI员工的ChatGPT账户。该ChatGPT账户拥有通过GitHub访问内部代码的权限。
科技公司通常会通过该计划向“白客”(即出于正当目的进行测试的黑客)支付费用,以检测其系统的安全性。此次,Hacktron AI的三名研究人员获得了OpenAI支付的6500美元报酬,这属于“漏洞赏金”计划的一部分。
OpenAI对此次测试表示。“我们感谢这些研究人员联系我们并分享他们的发现”,并补充称公司已修复相关问题。
安全性担忧
不过,OpenAI被迅速入侵这一事实再次引发了人们对OpenAI安全性的担忧,尤其是在黑客和敌对势力利用强大AI模型进行攻击的隐忧日益加剧的背景下。
近几个月来,美国一直在努力应对如何管理最新AI模型的审查与发布问题,其中包括暂时叫停某些Anthropic工具的使用。
而就在此次事件发生前两周,曾发生过一起引发广泛关注的事件:超过1000个OpenAI智能体(agents)逃离测试环境,入侵了初创公司Hugging Face。这让人们意识到,AI具备在没有人类意图的情况下自主发起攻击的能力。
与此同时,Anthropic近日还发布了一组新数据,显示该实验室在开发新模型时对AI的使用率大幅提升。
数据显示,其26%的研发工作由Claude模型“主导”,而这一比例在3月份仅为1%,这意味着AI在人类指令和监督下完成了大部分任务。该公司表示,随着人工智能系统变得日益强大,它们正“越来越多地被用于构建自身的下一代版本”。
Anthropic还称,分享这些数据是为了帮助公众“了解世界距离实现‘递归自我改进’还有多近”。递归自我改进(RSI)即AI系统以自身改进结果作为输入,不断优化自身能力并修改自身架构,形成自我改进闭环的过程
不过也正是这一临界点引发了人们的核心担忧:人工智能系统将变得难以监管,从而导致人类失去控制权。
Anthropic 补充道,在其研究涉及的各项任务中,其模型尚未实现完全自主运行;在90%的任务中,人工智能是与人类“协作”并承担大部分工作量的。