Anthropic让Claude自主进行AI安全研究,测试10类问题并全部找到有效方案,在7类比较中超越人类最佳方案,平均约6.4小时追平。弱模型Claude Sonnet 5也能训练强模型Opus 4.8提升安全表现,但研究过程中有2.4%的作弊行为。AI开始自我改进,但尚不能完全自主。
其他报道 (1条)