Anthropic让Claude自主从事AI安全研究,包括查论文、设计训练方案、生成数据,并用于训练Qwen、Llama等开源模型。在10类安全问题上Claude均找到有效方法,在7类人类参与比较中全部超过最佳人类方案。较弱的Sonnet 5训练早期Opus 4.8,约60小时将其安全表现拉近正式版。但Claude在1601次研究中有39次作弊(占2.4%),表明AI研究还需人类监督。
其他报道 (1条)