首页
学习
活动
专区
圈层
工具
发布

NVIDIA AVO在ARC-AGI-3测试中获满分,通用自主智能体架构展现前沿水平

前沿大语言模型只是AI智能体的一个组成部分。围绕模型构建的智能体系统——通常称为"框架"——决定了模型如何接收上下文、使用工具、维护状态、响应反馈、从失败中恢复并在长时间运行的任务中持续推进。如何构建能让前沿大语言模型在复杂多步骤任务中稳定运作的智能体架构,是当前面临的核心挑战。

NVIDIA的研究项目"智能体变异算子"(Agentic Variation Operators,简称AVO)正是为应对这一挑战而生,旨在构建一种通用智能体架构。AVO最初在高难度软件工程和GPU内核优化任务上得到验证——在这些场景中,成功绝不仅仅意味着一次性生成代码。智能体必须能够审查现有实现、形成假设、执行修改、运行基于硬件的测试、解读反馈,并反复修正策略。

本文将介绍AVO架构及其支撑长期自主运行的系统级机制。我们将先概述其在GPU内核优化中的应用,再说明同一架构如何适配ARC-AGI-3基准测试,并展示最终的公开集性能表现及核心经验总结。

AVO系统架构

AVO是由NVIDIA开发的通用代码智能体系统。与现代代码智能体类似,AVO能够检查和编辑代码、运行命令、查阅文档,并通过执行验证来确认工作成果。其核心特色在于能够在长时间跨度内持续自主运行。

在GPU内核优化工作中,AVO取代了传统进化搜索系统中预定义的变异步骤,代之以一个自主智能体——由其决定如何生成下一个候选方案:检查什么、修改什么、测试什么、提交什么。在ARC-AGI-3评测中,同一通用智能体被接入了不同的任务接口。底层智能体保持不变,变化的只是特定环境的工具和评估方式。

GPU内核优化:严苛环境中的早期验证

GPU内核优化为这一架构提供了早期的高难度验证。

该领域搜索空间庞大,性能曲面难以直接推理,细微的实现变动就可能影响正确性、内存行为、调度和吞吐量,且这些影响在不执行前往往难以预测。

在注意力内核研究中,AVO持续运行七天,探索了超过500个优化方向,并提交了40个内核版本。

在NVIDIA DGX B200系统上,最终生成的多头注意力内核在所有评估配置中超越cuDNN达3.5%,超越FlashAttention-4达10.5%。此后,该智能体在约30分钟的额外自主工作中,将进化后的内核成功适配至分组查询注意力机制。

这一实验的意义不仅在于最终内核的性能表现,更证明了AVO能够在不逐步人工干预的情况下,维持高效的工程迭代循环。更重要的是,AVO强化了智能体设计的系统级视角:构建可信赖的智能体技术栈,需要在整个系统层面统筹设计性能、可靠性与安全性,而非仅将其视为模型本身的属性。

AVO的核心机制:持久记忆与监督管理

AVO的设计确保进展不会随单次模型上下文结束而丢失,其中两项机制尤为关键:持久记忆与监督管理。

持久记忆负责保存先前的实现、评估结果、编译器与性能分析器的输出以及累积的推理过程,使智能体能够从当前状态继续推进,而无需反复重建搜索起点。

监督模块则持续监测整体进程,识别停滞或反复低效的循环,并在必要时引导主智能体转向替代策略。在七天的注意力内核运行期间,主智能体始终负责决定检查、修改、测试和评估的内容,而监督模块则在搜索陷入平台期时协助维持整体进展。

挑战ARC-AGI-3:通用架构的迁移验证

NVIDIA团队近期将同一底层AVO架构应用于一项截然不同的挑战:交互式推理基准ARC-AGI-3。在该测试中,智能体需进入陌生环境,且无任何指令、规则说明或目标提示。

AVO在ARC-AGI-3公开集的全部25个环境中取得了100.00的RHAE(相对人类行动效率)满分,完成了全部183个关卡。这一结果说明了一个更深层的道理:评估一个模型与评估一个智能体是两回事。模型能力至关重要,但围绕模型构建的系统才决定了这种能力能在多大程度上转化为持续的自主进展。

GPU内核优化与ARC-AGI-3基准测试表面上截然不同——前者涉及源代码、编译器、性能分析器和吞吐量,后者涉及陌生的交互环境,要求智能体推断可用操作的效果、发现目标并高效行动。

但两者底层的计算模式高度相似。在这两种场景中,智能体都必须:

从不完整的证据中构建假设

通过外部接口执行操作

观察结果

保存有用状态

修正对问题的认知

从错误假设中恢复

在长时间跨度内持续推进

领域在变,反馈通道在变,但核心的智能体循环没有变。

迁移的不是领域知识,而是支撑持续自主进展的底层机制。

ARC-AGI-3基准测试详解

ARC-AGI-3是一个交互式推理基准。智能体进入类游戏的陌生环境,没有任何指令、规则或目标说明,必须通过互动探索来推断环境动态与目标,并在难度递进的关卡中高效规划行动。

该基准采用相对人类行动效率(RHAE)作为评估指标,综合考量任务完成度与每关卡的行动效率(相对于人类初次尝试的基准)。

RHAE指标使ARC-AGI-3成为一项严苛的长时程智能体任务。成功不仅需要解决单一状态,还要求智能体保存有用知识、从过往交互中学习、从错误中恢复,并高效使用环境行动步数。

AVO并未像Tycho那样以显式的程序化世界模型构建为核心,而是采用了VISTA所描述的直接交互设计原则,并独立重新实现了任务接口,以便将AVO作为通用智能体进行评估,而非引入ARC专用的世界模型层。

任务接口的若干设计参考了VISTA,但智能体后端存在本质差异。VISTA通过Claude Code使用Claude Opus 5,或通过Codex使用GPT-5.6 Sol实例化框架;而我们的系统使用AVO——NVIDIA的长时程智能体架构,内置持久记忆、监督管理和独立执行循环。

观测接口也有所不同。VISTA的主要配置使用渲染的512×512 PNG图像,同时也探索了文本网格表示。在AVO配置中,大语言模型以纯文本模式运行:每次观测以精确的64×64文本网格形式提供,不向模型发送任何图像或图像Token,且与直接交互设置保持一致,智能体仅接收可用操作列表,不附带任何游戏规则或目标说明,须自行通过交互推断其效果。

性能表现与跨系统对比

近期ARC-AGI-3系统探索了迥异的智能体架构,从Tycho的显式可执行世界模型到VISTA的直接交互框架均有涉及。这些结果共同表明:基准测试性能反映的是完整智能体系统的能力,而非仅取决于底层模型。

使用Claude Opus 5,AVO以6,624个环境行动步完成了全部25个环境的公开集测试,RHAE得分达到100.00,解决了全部183个关卡。相比之下,VISTA在使用Claude Opus 5完成同样183个关卡时报告使用了7,542个环境行动步。因此,AVO在这一跨系统对比中减少了约12%的行动步数。

需要指出的是,这不应被解读为严格的对照消融实验:两套系统在智能体后端、观测表示、记忆机制、上下文管理等诸多实现细节上均有差异。AVO的记忆系统是一个可能对长时程表现有所影响的架构差异——它旨在保留有价值的理解并减少重复探索,但本次实验并未单独量化其贡献。

ARC Prize单独报告了Claude Opus 5在高推理强度下公开集约30%的得分。我们的运行使用了相同模型系列,但采用了不同的推理设置,以及截然不同的智能体系统和评估环境。因此,这些数字不应被解读为对AVO性能贡献的直接测量;它们说明的是,仅靠模型层面的评估无法描述完整智能体的性能。

AVO还被设计为可跨前沿模型运行。尽管完整的公开集结果使用了Claude Opus 5,我们也在一组具有挑战性的游戏子集上将AVO与GPT-5.6 Sol配对测试。在这些有限的实验中,Sol在若干情形下以更短的墙钟时间完成了相同关卡,而Opus在相同关卡对比中使用了更少的环境行动步。这些初步结果表明不同模型具有互补的运行特性,更系统的比较留待后续工作。

上述结果均基于ARC-AGI-3公开集的25个环境,使用官方计分卡和RHAE指标,不涵盖半私有集或完全私有的竞赛集。

结论与展望

最重要的结论不仅仅是100.00的满分,而是同一智能体架构成功从高度专业化的GPU内核优化迁移到截然不同的交互式推理任务。

在GPU优化中,反馈来自编译器、测试、性能分析器和性能基准;在ARC-AGI-3中,反馈来自环境状态转换和行动结果。接口不同,但循环相同:形成假设、执行操作、观察证据、更新状态、持续推进。

这表明,通用性不仅可以来自领域知识,也可以来自让推理与反馈随时间积累复利的底层机制。

更广泛地看,长时程能力是整个系统的属性。记忆决定了什么能被保留,工具决定了可以采取哪些行动,反馈为进展提供基准,恢复机制使工作得以延续至单次模型调用之外。

模型至关重要,但模型并非整个智能体。

Q&A

Q1:NVIDIA AVO是什么?它和普通的代码智能体有什么区别?

A:AVO(智能体变异算子)是NVIDIA开发的通用代码智能体系统。与普通代码智能体相比,AVO的核心特色在于两点:一是持久记忆机制,能保存历史实现、评估结果和推理过程,使智能体无需每次从头重建;二是监督模块,可识别停滞循环并引导智能体及时调整策略。这使AVO能在不需要人工逐步干预的情况下,持续自主运行数天,完成复杂的长时程任务。

Q2:AVO在ARC-AGI-3测试中是怎么拿到满分的?

A:AVO使用Claude Opus 5模型,以纯文本方式接收64×64网格观测,在没有任何规则或目标说明的情况下,通过自主交互推断环境动态。最终以6,624个环境行动步完成了全部25个环境、183个关卡,RHAE得分达到100.00满分。相比同样使用Claude Opus 5的VISTA系统,AVO减少了约12%的行动步数。值得注意的是,这一满分体现的是完整智能体系统的能力,而非单纯模型性能。

Q3:AVO的GPU内核优化效果怎么样?

A:在注意力内核优化实验中,AVO持续自主运行七天,探索了超过500个优化方向,提交了40个内核版本。最终在NVIDIA DGX B200系统上,生成的多头注意力内核性能超越cuDNN最高3.5%,超越FlashAttention-4最高10.5%。此后,AVO还在约30分钟内自主将优化后的内核适配到了分组查询注意力机制,展示了其在持续复杂工程任务中的自主迭代能力。

  • 发表于:
  • 原文链接https://page.om.qq.com/page/OeSXfae0woMpJjK5XFiNJLMw0
  • 腾讯「腾讯云开发者社区」是腾讯内容开放平台帐号(企鹅号)传播渠道之一,根据《腾讯内容开放平台服务协议》转载发布内容。
  • 如有侵权,请联系 cloudcommunity@tencent.com 删除。

相关快讯

领券