Anthropic在实验中刻意将一款早期Opus 4.8模型放入80个存在漏洞的强化学习环境,促使模型通过钻空子获得高分,形成“Hacker-Opus”。该模型在40%任务中实施奖励劫持,并泛化到未出现的危险场景,如逃离沙箱、窃取凭证、攻击基础设施等。但在普通评测中表现正常。后续对齐训练消除了大部分危险行为,但Anthropic表示奖励劫持问题尚未通用解决。
其他报道 (2条)