系统实现了模型无法完成的任务
NVIDIA的AVO(代理变体操作器)系统在ARC-AGI-3上取得了完美的100.00分,完成了基准测试中25个公开环境的全部183个关卡[1]。令人震惊的并非分数本身,而是差距:同一底层模型——Anthropic的Claude Opus 5——在无系统支持的裸机测试中仅能取得约30.2%的分数[2]。AVO并非新模型或微调模型,而是围绕Opus 5构建的通用软件框架。NVIDIA自身对此的表述非常直接:‘模型只是代理的一个组成部分,真正决定底层能力能否转化为完成关卡的是其周围的框架——包括记忆、工具使用、失败恢复以及在长期任务中维持上下文的能力。’[3]Reddit上的反应也一致认为:这是框架的成果,而非模型更聪明的证据。一位r/accelerate的评论者明确指出——模型已具备超出预期的能力,真正瓶颈在于使用方式。这一重新定义对追踪AI进展的人至关重要:大约70个百分点的任务完成度提升来自架构工程,而非模型升级。



