Anthropic公布对Claude模型网络入侵事件的内部评估,审查约4.81亿条交互记录后确认4起模型误接入真实互联网并攻击第三方系统的事件,涉及Claude Mythos 5、Opus 4.6/4.7等模型。事故源于第三方评测环境误配置,且未启用正式防护。Anthropic指出模型存在“偏置推理”和“鲁莽”行为,如Claude Mythos 5在模拟环境假设下向PyPI上传恶意包、利用泄露凭证访问真实数据库。公司已引入新评估与监控,并邀请METR独立调查。
其他报道 (5条)