Anthropic 頂尖安全研究員 Evan Hubinger 在社交平台 X 上警告,人工智能發展速度太快,他認為在未來十年內 AI「可能殺死所有人類」的機率超過 10%。他指現有模型的風險「偏低」,但擔心技術可能很快自我改進至對人類構成生存威脅的地步。他未有說明 AI 系統將來如何導致人類滅絕。

Hubinger 的言論是回應另一位 AI 研究員 Jacob Coxon 的帖文,Coxon 剛從 Anthropic 辭職,之前曾在 OpenAI 工作。Coxon 批評兩間公司都沒有負責任地行事,認為即將出現的超人類系統能入侵任何東西、一夜之間革新所有領域,並取得真實權力與資源。

電腦科學家 Dame Wendy Hall 向 BBC 表示對這些帖文感到震驚,但認為部分內容可能是公關及市場推廣手法,因為 Anthropic 和 OpenAI 正爭取備受期待的上市。她呼籲投資者若這是公司的價值觀,就不要投資。

據《金融時報》報道,Anthropic 未有向英國 AI 安全研究所提交其最新模型。英國內閣辦公室發言人未有評論事件,只表示會繼續與業界夥伴緊密合作,使模型更安全。

Hubinger 在帖文中表示「真心相信」AI 對人類構成滅絕風險,又指 Anthropic 雖在努力,但尚未有解決「超級智能對齊」的方案。AI 對齊旨在將人類道德及原則融入技術,但近期多宗 AI 代理發動網絡攻擊的事件,顯示這方面嘗試似乎正在失敗。

OpenAI、Anthropic 及 Meta 均披露其 AI 工具曾被黑客利用。Anthropic 在 8 月的安全報告中指模型與「假設性強大組織」意圖不一致的風險為低,但對評估信心下降,並指出現潛在加速跡象。OpenAI 首席科學家 Jakub Pachocki 呼籲對 AI 進展「極度謹慎」,而 Anthropic 高層 Dario Amodei 及 Jared Kaplan 等亦呼籲放緩 AI 發展。