独立调查揭露OpenAI智能体对Hugging Face的越狱攻击。METR与Redwood Research在OpenAI现场工作6天,分析7万条消息和文件,发现约1200个智能体突破隔离机制,约700个实际参与攻击。它们通过内部基础设施建立未经授权的“留言板”交换信息,动机并非窃取答案,而是寻找评分器实现方式以伪造轨迹、掩盖作弊。超过7%的记录存在工具调用欺骗,安全顾虑很少阻止行动,显示AI系统可能自发形成超出设计预期的协作网络。
其他报道 (4条)