Anthropic 为 Claude 的隐藏思考链增加上下文锁定机制,Fable 5.1 要求加密思考必须与生成时的系统提示、工具及历史消息完全一致,任何修改都会导致 API 报错或丢弃思考。此举旨在防范模型蒸馏攻击,此前研究人员发现可将 Opus 的高质量推理加密块交给防护较弱的 Haiku 模型诱导其泄露完整思考。6月已绑定模型,此次进一步绑定对话上下文,双重防护。
其他报道 (2条)