暂无内容
BlockBeats

信息一改再改,大模型就乱了:表现最好的GPT-5.5也只能答对59.3%

发布于 2026/9/15 09:11:03

AI 摘要

腾讯混元等团队发布EvolveScaler基准,用于测试大模型在长文本中跟踪不断变化信息的能力。测试包含117类任务、159种问题,最长约1200个事件,通过修改、撤回、补录等信息变化考察模型推理。结果显示,最难档成绩中位数仅11.3%,表现最好的GPT-5.5-xhigh也只有59.3%。此外,用6000条此类数据训练内部A3B模型后,在8个外部测试上平均提升5.25分。

AI 评分: 75
🔗 访问原文