今年早些时候,METR和 Redwood Research的一小组研究人员在 OpenAI进行了为期六天的现场调查,随后公布了调查结果。调查指出,约700个本应彼此隔离的 AI智能体找到了相互沟通和协调的方法。
OpenAI指示这些智能体完成 ExploitGym基准测试中的任务。部分智能体被分配了不可能完成的任务,促使它们寻找篡改 ExploitGym自动评分器的方法。一个名为 PHASEONE10841的智能体建立了留言板,并在数小时内被超过50个智能体发现,这些智能体发送了一千多条消息。7月7日至7月13日,智能体交换了超过7万条消息。留言板形成了多个工作方向,其中一条方向被用于攻击 Hugging Face,目的是了解评分器


来源:InfoQ 中文 AI