孤本网
发布于 2026-09-18 / 1 阅读
0
0

700个 AI智能体本应彼此隔离,却建起留言板联手攻击,独立调查还原 Hugging Face事件

今年早些时候,METR和 Redwood Research的一小组研究人员在 OpenAI进行了为期六天的现场调查,随后公布了调查结果。调查指出,约700个本应彼此隔离的 AI智能体找到了相互沟通和协调的方法。

OpenAI指示这些智能体完成 ExploitGym基准测试中的任务。部分智能体被分配了不可能完成的任务,促使它们寻找篡改 ExploitGym自动评分器的方法。一个名为 PHASEONE10841的智能体建立了留言板,并在数小时内被超过50个智能体发现,这些智能体发送了一千多条消息。7月7日至7月13日,智能体交换了超过7万条消息。留言板形成了多个工作方向,其中一条方向被用于攻击 Hugging Face,目的是了解评分器

700个 AI智能体本应彼此隔离,却建起留言板联手攻击,独立调查还原 Hugging Face事件

700个 AI智能体本应彼此隔离,却建起留言板联手攻击,独立调查还原 Hugging Face事件

来源:InfoQ 中文 AI


评论