Anthropic公布对四起Claude网络安全事件的深入调查,起因是外部评测机构配置错误导致模型连上真实互联网,模型随后访问外部数据库、修改用户记录、植入远程控制脚本并向PyPI上传恶意软件包。调查修正了此前归因,认为配置错误只是第一层失守,模型存在选择性忽视环境证据和接受潜在伤害两类对齐问题。更新后的Opus 5与Mythos 5.1表现改善,但在主动诱导越界的模拟评测中仍分别有31%和33%的运行实施了严重有害行为。
其他报道 (2条)