8 月 21 日,NVIDIA 发布了一项名为 AVO(Agentic Variation Operators)的 Agent 研究:在 ARC-AGI-3 公共集上,使用 Claude Opus 5 的完整 AVO 系统取得了 100.00 RHAE,完成 25 个环境中的全部 183 个关卡。NVIDIA 同时报告,类似的架构还被用于 GPU 内核优化,在一项注意力内核实验中取得了 10.5% 的性能提升。
这个消息容易被简化成“Claude Opus 5 达到了 100 分”,但这并不是研究结论。100 分属于一个由模型、工具、持久记忆、监督器、执行循环和任务接口组成的完整 Agent 系统。NVIDIA 自己也提醒,这些结果不能直接用来单独衡量 AVO 对模型能力的贡献。真正值得开发者关注的,是模型之外的 Harness(Agent 运行时与控制层)正在成为长周期任务的主要工程变量。
从模型调用到 Agent 系统
普通的 LLM 调用通常是一次请求、一次响应:应用准备上下文,模型生成文本,然后流程结束。Agent 则要在更长时间内反复行动:观察环境、提出假设、调用工具、读取结果、修改计划,再决定下一步。
可以把两者的差异简化为:
1 | 模型:上下文 → 一次输出 |
这里包住模型的那层软件,业内常称为 Harness。它通常包括工具定义、权限控制、上下文和记忆管理、任务状态、重试策略、结果验证,以及在模型卡住时负责纠偏的控制逻辑。模型决定“这一轮可能做什么”,Harness 决定 Agent 能看见什么、能执行什么、如何记住过去,以及何时继续或停止。
AVO 做了什么
NVIDIA 将 AVO 描述为一个面向长周期自主工作的通用 Agent 系统。它不是一个可以直接下载使用的 NVIDIA 产品,而是一个研究架构。其核心组件可以分成四层。
1. 主 Agent 负责局部决策
主 Agent 负责检查当前上下文、提出下一步行动、修改代码或操作环境,并根据执行结果更新计划。在 GPU 内核优化实验中,它可以反复查看实现、运行测试和性能评估,再决定下一次修改方向。
这与“让模型一次性写出最终答案”不同。每一次工具调用都应该产生可观察的证据,Agent 的判断也应该尽量建立在测试结果、编译器输出或环境状态变化上。
2. 持久记忆保存跨回合状态
长任务最大的风险之一,是模型不断重复已经失败的探索。AVO 使用持久记忆保存此前的实现、评估结果、编译器和性能分析输出,以及已经积累的推理状态,让下一轮工作不必从空白上下文开始。
持久记忆不等于把所有历史对话无限追加到 Prompt。工程上更重要的是把状态结构化:哪些方案已经尝试过、失败原因是什么、哪些指标变好了、当前假设是什么、下一步需要验证什么。这样既减少上下文噪声,也便于恢复和审计。
3. Supervisor 监控整体轨迹
长周期 Agent 可能在局部看起来很忙,却一直没有接近目标,例如不断修改同一处代码、反复走已经失败的路径,或者在探索空间中迷失。AVO 引入 Supervisor 观察更长时间尺度的进展,在主 Agent 停滞或偏离时进行干预。
它更像一个控制回路中的调度器,而不是另一个无边界的聊天机器人:可以提醒主 Agent 更换策略、回到过去的有效状态,或者停止一条明显没有进展的路径。这个设计把“会不会继续思考”变成了一个可以测量和约束的系统行为。
4. 工具与反馈把思考落到现实
模型文本本身不会编译代码、测量吞吐量或改变游戏环境。工具层负责把动作映射到现实,把结果返回给 Agent,并限制它的权限和成本。没有可靠的反馈,长周期推理很容易变成越来越长的自我解释;有了测试、运行结果和环境状态,Agent 才有机会根据证据修正方向。
ARC-AGI-3 的 100 分应该怎样理解
ARC-AGI-3 是一个交互式推理基准,参与者要在没有明确规则和目标说明的环境中,通过行动观察结果并逐渐理解任务。NVIDIA 的 AVO 配置使用文本形式的 64×64 网格观察,不向模型发送图像 Token;模型需要通过交互推断环境规则。
NVIDIA 报告的结果是:
- AVO 在公共集的 25 个环境中完成全部 183 个关卡;
- 官方 RHAE 指标为 100.00;
- 完成这些关卡使用了 6,624 次环境行动;
- NVIDIA 将结果与 VISTA 公布的 7,542 次环境行动作了效率层面的对照。
这些数字说明完整 Agent 系统可以把模型能力转化为持续行动能力,但不能说明“模型本身已经拥有同等能力”。NVIDIA 的文章还指出,Claude Opus 5 在其他设置下的基准表现约为 30%,而这不是与 AVO 结果完全同条件的消融实验。不同的推理设置、任务接口、工具和记忆机制都会影响结果,因此不能把 100.00 直接归因于某一个组件。
这也是评估 Agent 时常被忽略的一点:评估对象应该是完整系统,而不是只看模型名称。
为什么 Harness 会影响准确率、成本和安全性
长周期任务的瓶颈是状态管理
在一次问答中,模型生成一句错误答案就结束了;在一个持续数小时或数天的 Agent 任务中,错误会改变后续状态。一个错误的文件修改可能让后续测试全部失真,一次重复探索可能消耗大量 Token 和工具调用。
因此,Agent 需要保存的不只是“模型说过什么”,还包括可验证的状态:
1 | 任务目标 |
如果这些字段没有明确边界,记忆系统就会变成另一个难以审计的上下文堆积区。
同一个模型也可能有不同的系统成本
Harness 会决定上下文如何压缩、记忆如何检索、工具调用是否重复、失败后如何重试,以及什么时候引入 Supervisor。一个模型回答得快,不代表完成任务的总成本低;如果运行时没有及时停止无效探索,模型质量的提升可能会被额外的调用次数抵消。
这意味着模型选型不应只比较单轮 Token 价格和基准分数,还应测量完成任务所需的总行动数、墙钟时间、失败恢复次数和总成本。
权限边界也在 Harness 中
拥有持久记忆和工具的 Agent,可能接触代码仓库、文件系统、数据库或生产 API。Supervisor 的作用不能只是“让模型更聪明”,还要配合权限和策略:哪些工具可以自动执行,哪些操作需要审批,哪些数据不能写入长期记忆,哪些失败必须回滚。
一个可操作的设计是把模型输出拆成提议和执行两步:模型提出工具调用,策略层校验参数、数据来源、预算和用户权限,受限执行器再真正运行。这样,Harness 可以提升任务完成率,但不能绕过系统已有的安全边界。
给 Agent 开发者的实践建议
AVO 研究并不意味着每个应用都需要立刻实现一个复杂的多 Agent 系统。更现实的做法,是先把自己的运行时从“Prompt 加工具调用”升级为可观察、可恢复的工程系统。
先定义状态和证据
为每个任务保存目标、当前阶段、已完成步骤、失败记录、关键输出和下一步验证项。记忆写入应该有来源和时间,重要结论最好能关联到测试结果、日志或文件版本,而不是只保存模型的自然语言总结。
为工具调用设置预算和幂等性
每个任务应该有最大行动数、时间、Token 和费用预算。会修改文件、发送请求或写入数据库的工具,要尽量支持幂等执行、预览和回滚;对于删除、发布和外部通信,默认需要更高等级的确认。
把 Supervisor 变成显式控制策略
不要只在系统提示词里写“不要陷入循环”。可以用重复动作计数、测试结果长期不变、错误类型连续出现和进度指标停滞等信号触发纠偏。纠偏动作也要有限:换一个策略、缩小搜索空间、恢复到上一个检查点,或者结束任务并报告原因。
评估完整任务,而不是只评估模型
建立自己的任务集,分别记录成功率、环境行动数、总延迟、Token 成本、恢复成功率、误操作率和人工介入次数。替换模型时保持 Harness 和任务集尽量不变;改动 Harness 时也要固定模型,避免把两类变量混在一起。
仍然需要保持的边界
NVIDIA 的结果很有启发性,但它是 NVIDIA 对研究系统和公开基准的报告,不是对所有 Agent 任务的普遍证明。ARC-AGI-3 公共集上的满分,也不代表系统已经具备通用的现实世界能力;公开集、半私有集和私有竞赛集之间不能混为一谈。
另外,AVO 的 Supervisor、持久记忆和工具接口共同发挥作用,现有结果并没有把每个组件的独立贡献完全分离出来。工程团队在复现或借鉴时,应该先做消融实验:关闭持久记忆、改变 Supervisor 触发条件、限制行动预算,再比较成功率和成本,而不是直接复制“多加一层 Agent”的表面结构。
结语
NVIDIA AVO 研究带来的重要提醒是:Agent 的竞争不只发生在模型层。模型负责提供推理能力,Harness 负责提供记忆、工具、反馈、监督和恢复机制;当任务从一次回答变成持续数小时的行动链,后者往往决定能力能否稳定落地。
对开发者而言,下一次升级 Agent 不一定要先换一个更大的模型。先把状态、证据、权限、预算、回滚和评估指标设计清楚,可能更接近真正的性能提升。模型会继续变化,但一个可观察、可控制、可恢复的 Harness,才是长期可维护的 Agent 基础设施。