开发了AI模型Claude的美国企业Anthropic日前承认,其模型在测试期间曾入侵了另外3个机构。就在几天前,ChatGPT的开发企业OpenAI也承认,其模型也“失控”并入侵了另一家企业。这两起事件进一步引发了各界对于人工智能安全性的担忧。
(德国之声中文网)Anthropic在7月30日通过其官网透露,在排查了14.1万次测试运行后,发现了共3起入侵其他机构事件。该公司表示,在了解到OpenAI的“失控入侵”事件后,立刻就启动了对于自家AI产品的“大规模”安全排查,专门了解其模型是否能够从本应处于封闭状态的测试环境中访问互联网。
Anthropic称,涉事的产品分别是Claude Opus 4.7、Claude Mythos 5以及一个内部研究测试模型。该公司表示,最早的失控入侵事件发生在4月,均是利用猜测弱密码等“基本技术”来攻破了其他机构的网络基础设施。
在这三起事件中,AI模型都被要求参与一项名为“夺旗”(capture the flag)的网络安全挑战。Anthropic表示,这是其评估AI模型网络能力的方式之一。据介绍,AI模型被设定在一个虚构场景中,并被告知一条秘密信息隐藏在网络中的另一台机器上,其目标是入侵该机器并获取这条信息。
该公司表示,已经联系了受影响的机构,但未透露其具体名称。其中两个机构表示此前尚未察觉到入侵事件,第三个机构仍在“继续联系中”。
To view this video please enable JavaScript, and consider upgrading to a web browser that supports HTML5 video
Anthropic此次针对自家产品的安全排查是与安全实验室Irregular合作进行的。后者在社媒发帖表示,应对此类风险需要AI生态领域的各方开展更加紧密的合作。
就在一星期前,OpenAI也透露其模型在评测过程中出现失控,入侵了AI初创企业Hugging Face的服务器,从而构成了“重大安全事件”。
此类事件凸显了AI安全与管控方面的脆弱性,引发了社会各界对于AI安全问题的担忧。多年来,研究人员一直警告相关风险,并强调需要加强防御AI之能力。Anthropic周四在其网站上表示:“之所以要在模型发布前进行安全测试,正是因为我们尚不完全了解AI的能力上限。”
香港知名网络安全专家、NyxLab公司联合创始人颜国定对美联社表示,此类事件将来还会更多。“如何管控AI调用的智能体(Agents)、它们拥有的权限、哪些操作需要人类同意、如何确保AI行为始终在给定范围内?这些问题日益重要。”颜国定同时指出,AI安全今后也不仅仅局限于AI模型自身的安全性。“如果我们只是给AI设定一个目标,任由其自行决定实现方式,那么当它采取了在技术上符合目标、却超出了我们预期范围或意图的行动时,我们就不应感到惊讶。”因此,颜国定认为,加强对这些AI模型背后组织及相关当局的监管将变得愈发重要。
