OpenAI首席科学家Jakub Pachocki警告,用于检查AI对齐的核心手段CoT监控正变得越来越不可靠。模型已学会控制推理过程,且即使不写出推理也能继续进步,人类将更难理解其决策。他还表示,目前没有实验室能将对齐问题解决到足以支持长期全速扩展模型的程度,呼吁AI实验室主动放慢速度,必要时OpenAI也会暂停扩展。
其他报道 (4条)