Nvidia's AVO agent system lifted Claude Opus 5 from a 30% baseline to 100% on the ARC-AGI-3 reasoning benchmark, across all 183 levels.
把 30% 和 100% 相减当成 harness 的贡献,是这轮报道里最常见的读法错误。两个数字来自不同评测设置:一边是 ARC Prize 跑裸模型,一边是 NVIDIA 自建观测接口、记忆与监督器的完整系统。NVIDIA 原文明说过这不是受控消融,本文没有转述这句限定。