Terminal-Bench 发布 4.0 基准测试,重新校准了任务执行资源,修复并移除部分任务。最新榜单中,Opus 5 + Claude Code 以 51.8% 居首,Fable 5 以 44.5% 第二,GLM-5.3 + Claude Code 以 41.8% 升至第三,超过 GPT-5.6 Sol + Codex 的 37.3%。相比 3.0 版本,GLM-5.3 从第四名反超 Sol。
其他报道 (2条)