首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >TairosAgent

TairosAgent

修改于 2026-08-27 16:25:31
8
概述

TairosAgent 是腾讯 Robotics X 实验室与福田实验室联合发布的具身原生智能体框架,专为机器人本体设计,提供具身模型接入、任务调度与运行承载能力。该框架通过感知反应、认知决策、探索沉淀三层系统,将混元具身大模型的能力高效嵌入机器人应用,帮助开发者降低从模型调用到机器人任务落地的工程化门槛。TairosAgent 是 Tairos 具身智能开放平台(钛螺丝)的核心组件之一,于 2026 年世界人工智能大会首次发布,并随平台升级全面开源。

一、TairosAgent 的感知反应层是如何工作的?

1. 持续接收多模态信息

感知反应层是 TairosAgent 三层系统中最贴近物理世界的一层,负责以约 15Hz 的频率持续接收来自摄像头、力觉传感器、触觉传感器等多模态信息流,并实时做出快速调整。这一层对应人类神经系统中的"脊髓反射"——不需要经过深度思考,就能对碰撞、失衡、力觉突变等突发情况做出条件反射式的响应。

2. 与底层执行系统协同

感知反应层与更低频的执行系统配合工作:感知反应层以约 15Hz 运行,负责环境信息的实时采集与初步处理;执行系统以更高频率(500Hz 至 1000Hz)运行,像条件反射一样瞬间处理碰撞与失衡等安全关键事件。触觉反馈的延迟约为 1~2 毫秒,视觉反馈约为 15~30 毫秒,感知反应层需要根据这些信息的时间尺度差异,协调不同频率的响应。

3. 为上层提供结构化感知数据

感知反应层不仅负责"接收"信息,还将原始传感器数据加工为结构化的环境表征,包括物体位置、空间关系、地形信息等,供认知决策层进行更高层次的推理与规划。这种分层设计使得不同频率、不同安全等级的任务可以各司其职,避免让大模型以底层控制的高频率运行而导致算力无法承受。

二、TairosAgent 的认知决策层是如何工作的?

1. 复杂任务理解与推理

认知决策层是 TairosAgent 的"大脑",负责理解用户的自然语言指令,进行复杂推理,并将模糊的任务目标拆解为一系列可执行的策略步骤。例如,当用户说"帮我准备一份广式腊肠饭",认知决策层会结合工具调用(如网络搜索菜谱)识别顾客意图,并规划出从"打开电饭煲盖子"到"启动电饭煲"共十个步骤的长程任务链。

2. 动态调整与自我纠错

在执行长程任务过程中,认知决策层支持随时打断与重新规划。例如,顾客在机器人做饭过程中追加"我还有个朋友过来,米饭有点少"的新需求,机器人可以重新规划任务、多加一份米饭。当机器人用夹爪按电饭煲开关第一次失败时,能够实时纠正错误进行第二次尝试。这种"懂需求、会拒绝、能闭环"的能力,使搭载 TairosAgent 的机器人在复杂长序列人机交互任务中的成功率超过 80%。

3. 外部工具调用与自我演进

认知决策层具备外部工具调用能力,可通过网络搜索、知识库查询等方式获取完成任务所需的补充信息。同时,该层能够通过机器人与现实环境及基于物理仿真的虚拟环境交互,不断强化学习并自我演进,逐步建立对动态场景、自身能力以及物理约束的深刻理解。

三、TairosAgent 的探索沉淀层是如何工作的?

1. 环境记忆积累

探索沉淀层负责将机器人在与物理世界交互过程中获得的经验进行沉淀和复用。其中,环境记忆使机器人通过多模态感知系统实时构建并维护对周围环境的表征——例如在执行浇水任务时,机器人会自动记忆沿途工卡的位置,使其在后续任务中能够快速定位目标,显著提升任务执行效率。

2. 情境化技能学习

机器人通过与外界的持续交互,自然融合语言、视觉和空间多模态信息,构建起情境化记忆。例如,工作人员对机器人进行示范教学后,机器人建立起"给这层楼的盆栽浇水"这一语言指令与具体动作、空间位置之间的关联,形成情境绑定。此后,当收到类似指令时,机器人能够基于已沉淀的经验快速调用对应技能。

3. 跨任务知识迁移

探索沉淀层还支持将已学到的技能迁移到新任务中。通过统一动作表征,UMI(无本体)设备采集的示教数据可以迁移到不同机械臂上,实现跨本体的技能复用。这使得机器人在面对新增 SKU 时,留给数据采集和模型后训练的时间可压缩到不到 3 天。

四、TairosAgent 如何维护环境记忆、本体记忆与任务记忆?

1. 环境记忆

环境记忆记录机器人对周围物理世界的认知,包括物体位置、场景布局、地形特征等空间信息。机器人通过多模态感知系统实时构建三维层次化地图,将亲身经历的环境信息组织为语义丰富、空间关系完备的结构化表征。这种记忆使机器人能够在后续任务中快速检索和定位目标,无需重新探索已知环境。

2. 本体记忆

本体记忆记录机器人自身的状态信息,包括各关节的位置、速度、力矩等运动学参数,以及当前电量、负载能力等运行状态。通过持续维护本体记忆,TairosAgent 能够准确感知自身的能力边界,在任务规划时避免超出机器人物理极限的动作,并在出现异常时及时采取保护措施。

3. 任务记忆

任务记忆记录历史任务的执行过程和结果,包括已完成的任务步骤、遇到的障碍及解决方案、用户的偏好和反馈等。这些信息帮助机器人在面对相似任务时参考过往经验,优化执行策略,提升任务完成的效率和成功率。三类记忆协同工作,使 TairosAgent 能够在长时间尺度上持续积累和复用经验。

五、TairosAgent 与混元具身大模型如何协同工作?

1. 与 Hy-Embodied-VLM 协同

Hy-Embodied-VLM-1.0 是混元具身大模型中的视觉语言模型,负责"看懂"图像、空间和场景,相当于机器人的"右脑"。TairosAgent 通过感知反应层接收的视觉信息,交由 VLM 进行空间理解与场景语义解析,将图像、深度信息和点云数据转化为可理解的环境描述,为上层认知决策提供感知基础。该模型仅以约十分之一的计算量就逼近上一代旗舰性能,更适合机器人端直接部署。

2. 与 Hy-Embodied-RxBrain 协同

Hy-Embodied-RxBrain-1.0 是具身原生的世界认知模型,负责认知、规划和对未来状态的想象,相当于机器人的"大脑"。TairosAgent 的认知决策层调用 RxBrain 进行任务分解和策略规划时,RxBrain 不仅生成语言形式的任务步骤,还会预测每个子任务完成后物理世界应该呈现的状态——即"做完以后应该是什么样"。这种"裂脑"设计让视觉状态进入信息通路,拓宽了认知带宽。

3. 与 Hy-Embodied-VLA 协同

Hy-Embodied-VLA-0.5 是视觉-语言-动作模型,负责将高层目标转化为连续的、可纠错的动作,相当于机器人的"小脑"。TairosAgent 通过感知行动联合接口调用 VLA,实现从"看见"到"做到"的关键闭环。VLA 依托超一万小时高精度人类示教数据训练,在第三方 RoboDojo 评测中取得仿真综合第一,支持零样本泛化和小样本快速适配。

六、TairosAgent 的硬件适配层如何实现跨本体部署?

1. 统一硬件抽象层

TairosAgent 通过硬件抽象层(HAL)将不同机器人本体的传感器、执行器和控制系统差异封装为统一接口。无论是双足人形机器人、四足机器狗、机械臂还是轮式机器人,上层模型、智能体和工具链都可以基于同一套标准化接口接入,无需针对每种本体单独开发适配逻辑。

2. 标准化 Skill 接口

在 HAL 之上,TairosAgent 提供标准化的 Skill 接口,使技能应用可以跨不同形态的机器人实现即插即用。开发者将机器人的各项能力封装为 Skill 后,这些技能可以在不同机型之间复用和迁移,彻底打通机器人生态。

3. 快速适配的实际效果

这种"乐高式"组合显著降低了跨本体部署的开发门槛。Tairos 平台最初部署需要三个月,后缩短至五天,最近接入越疆机器狗仅用一天。目前 TairosAgent 已支持 agibot_x2、unitree_g1、engineai_pm01、dobot_rover、kuavo_5 等多款机型,覆盖双足/轮式人形、四足、机械臂等多构型机器人,支持夹爪、灵巧手等多种末端执行器。

七、TairosAgent 的响应时间为什么能缩短到 2~3 秒?

1. 分层运行、各司其职

响应时间缩短的核心原因在于 TairosAgent 采用了分层运行架构,让不同类型的智能以不同频率运行,而不是让一个单体模型以同一种频率包办所有认知和身体控制。最上层认知系统按需唤醒,负责复杂任务理解;中间层感知行动系统以约 15Hz 持续运行;最下层执行系统以更高频率处理安全关键事件。各层独立运行、互不阻塞,避免了"让大模型等底层控制"或"让底层等大模型"的延迟困境。

2. 原生设计避免通用框架开销

与从通用智能体框架改造而来的方案不同,TairosAgent 从设计第一天起就为机器人本体而生。通用框架(如 OpenClaw)服务的是数字系统里的智能体,其操控的"身体"相当于浏览器——浏览器可以等,机器人却不能。腾讯 Robotics X 实验室曾将机器人能力封装为 Skill 交给通用框架调度,结果"整个效果非常之差",响应时间长达几十秒。TairosAgent 通过原生设计将响应时间压缩到 2~3 秒,这个时间主要对应上层任务理解与智能体交互。

3. 闭环训练保持响应精度

分层运行并不意味着模型之间彼此割裂。TairosAgent 采用"分层运行、闭环训练"的策略:不同模型在推理时承担不同职责和频率,训练时仍然可以根据任务结果、动作表现和环境反馈进行联合优化。这既保留了端到端学习的能力,又把已经明确的物理约束提前写入架构,确保在低延迟的同时不牺牲任务完成的准确性。

八、TairosAgent 如何实现任务被打断后的恢复?

1. 实时任务状态维护

TairosAgent 在执行长程任务过程中,会持续维护当前任务的执行状态,包括已完成的步骤、正在执行的步骤、待执行的步骤以及各步骤之间的依赖关系。当用户打断提出新需求时,认知决策层不需要从头开始规划,而是基于已有状态进行增量调整。

2. 增量式重新规划

当任务被打断时,TairosAgent 会根据新的用户意图,在已有任务状态的基础上进行增量式重新规划。例如,在导览场景中,游客中途打断机器人询问某个展台的具体问题,TairosAgent 会判断这是临时提问还是结束导览的信号,如果是前者则回答后自动恢复到原导览路线,如果是后者则结束当前任务。

3. 导航场景中的恢复能力

在导航、讲解等典型场景中,TairosAgent 的打断恢复能力表现尤为突出。机器人需要同时处理"走的路对不对""有没有撞到东西""用户问了什么问题""是不是要结束任务"等多重信息,TairosAgent 通过三层系统的协同,在 2~3 秒内完成状态判断和策略调整,确保任务流程的自然连贯。

九、TairosAgent 在 Tairos 平台整体架构中处于什么位置?

1. 平台架构中的定位

Tairos 具身智能开放平台整体架构分为模型层、智能体层和工具层三个部分。TairosAgent 位于智能体层,与持续在线具身智能体 Apexio 共同构成平台的智能体矩阵。模型层包含 Hy-Embodied 系列具身基座模型(VLM、VLA、RxBrain)以及规划大模型、多模态感知模型、感知行动联合大模型;工具层包含 RoboFusion(本体通信)、HAL(硬件抽象层)、建图和语料工具、仿真平台、数据平台等。

2. 承上启下的枢纽角色

TairosAgent 在平台中扮演承上启下的枢纽角色:向下通过 HAL 和标准化 Skill 接口接入不同形态的机器人本体,向上调用混元具身大模型的能力,将模型层的"左右脑""大脑""小脑"和物理身体整合成完整的系统。它让机器人形成一个持续感知、持续决策、持续行动的整体,是连接模型能力与本体硬件的关键中间层。

3. 与 Apexio 的分工

在智能体层内部,TairosAgent 与 Apexio 各有侧重。TairosAgent 是具身原生智能体框架,面向机器人模型应用,提供具身模型接入、任务调度与运行承载能力,帮助开发者将模型能力高效嵌入机器人应用;Apexio 是内化模型能力的 Always-On 具身智能体,面向自主具身 agency,使机器人能够保持持续在线,在真实物理环境中持续感知、交互、决策与行动。两者通过智能体的调度能力协同工作。

十、TairosAgent 与通用智能体框架相比有什么优势?

1. 原生设计 vs 通用改造

通用智能体框架(如 OpenClaw)本质上是为数字系统设计的,其操控的"身体"是浏览器或 API,而非物理机器人。将这类框架改造用于机器人任务时,需要处理大量的适配工作,且难以满足物理世界对实时性和可靠性的要求。TairosAgent 从架构设计之初就针对机器人任务的特点进行原生设计,感知反应、认知决策、探索沉淀三层系统全部围绕具身任务构建,避免了通用框架的适配开销。

2. 响应速度优势

在导航、讲解、被打断后恢复等典型场景中,TairosAgent 的响应时间为 2~3 秒,而通用框架的响应时间长达几十秒。这一差距源于两者对"时间"的不同理解——通用框架按互联网请求的响应时间设计,而 TairosAgent 按物理世界的运行频率设计,分层架构使不同时间尺度的任务各得其所。

3. 跨本体部署优势

通用框架通常需要为每种机器人本体单独开发适配层,而 TairosAgent 通过 HAL 和标准化 Skill 接口,实现了"一次开发、多本体部署"。开发者无需关心底层硬件差异,即可将同一套技能部署到不同形态的机器人上,显著降低了具身智能应用的开发门槛。

十一、TairosAgent 为什么要做原生设计而不是从通用框架改造?

1. 物理世界的时间尺度差异

腾讯 Robotics X 实验室主任张正友指出,机器人面对的世界并不是按照同一种速度运行的。触觉反馈只有约 1 毫秒,底层运动控制以 500Hz 至 1000Hz 运行,感知行动系统以约 15Hz 运行,而认知系统可以按需唤醒进行深度思考。让一个单体模型以同一种频率包办所有认知和身体控制,在物理上不可行——如果让大模型以底层控制的高频率运行,算力难以承受;让底层动作等待大模型,延迟又变成安全风险。

2. 通用框架的"浏览器思维"

张正友用一个比喻解释了通用框架的局限:"OpenClaw 操控的身体相当于浏览器,不是机器人。"浏览器可以等几十秒再响应,机器人却不能——一个任务从下达到响应要几十秒,"肯定受不了"。物理世界中的碰撞、失衡、力觉变化必须瞬间处理,这与数字世界的请求-响应模式有本质区别。

3. 具身数据的稀缺性

与互联网文本数据相比,具身数据的采集昂贵、效率低,物体、光线、本体和场景一旦变化,原有数据就可能失效。与其等待模型从有限数据中自行发现合理结构,不如先将不同频率、不同感知和不同安全等级的任务进行分工,把已经明确的物理约束提前写入架构。这种"分层运行、闭环训练"的设计,是在具身数据远未充足条件下的务实选择。

十二、TairosAgent 如何解决机器人"缸中之脑"的问题?

1. 打通感知与行动的闭环

"缸中之脑"是指当前最聪明的人工智能虽然擅长逻辑、文本与问答,却缺少与物理世界直接互动的闭环,未必真正理解物体的位置、空间与可操作性。TairosAgent 通过将语言、视觉、空间认知、身体控制和环境反馈连通起来,在"感知—身体—行动"的闭环里接受验证,让机器人不仅能够"想",还能够"做",并在做的过程中持续学习和修正。

2. 从离身到具身的范式跃迁

TairosAgent 体现了腾讯"从离身走向具身、从分裂的模块走向整体的闭环"的技术思路。传统机器人系统往往将感知、决策、控制等模块独立开发、分别优化,模块之间缺乏有效的信息流通。TairosAgent 通过三层系统的设计,将"左右脑""大脑""小脑"和身体整合成一个可行动的系统,让智能在物理世界中形成完整闭环。

3. 真实场景中的持续验证

TairosAgent 的闭环能力不是停留在仿真环境中,而是在真实物理场景中持续验证和迭代。Hy-Embodied-VLA-0.5 已进入日化品工厂进行生产实测,作业成功率超过 95%;导览机器人已在敦煌莫高窟、景德镇等真实场景上岗运营;养老机器人"小六"在养老院中测试帮忙做家务、取快递、推轮椅等任务。这些真实场景的反馈不断反哺模型和框架的优化。

十三、TairosAgent 的部署和安装流程是怎样的?

1. 安装安装器

开发者首先需要在机器人本体上安装 TairosAgent 安装器。通过一条命令即可完成安装:

代码语言:javascript
复制
curl -o- https://cdn.tairos.tencent-cloud.com/downloads/packages/installer/latest/install.sh | bash

安装完成后刷新环境变量,使用 tairos-install --help 验证安装是否成功。安装器支持后续通过 tairos-install upgrade 升级到最新版本。

2. 安装执行器

新建一个空目录作为工作目录,进入后执行 tairos-install install,安装器会进入交互式机型选择界面,开发者选择目标机型后,安装器自动下载并安装对应的执行器。安装完成后,工作目录下会出现启动脚本 run_all.sh、HAL 产物、SDK 产物以及 gateway/adapter 产物等。

3. 配置与启动

首次启动前,建议执行 ./run_all.sh --setup-host 进行宿主机修复,然后执行 ./run_all.sh --preflight 进行启动前自检。启动时通过交互式提示输入 Tairos 账号与密码,或通过环境变量 LOGIN_PHONELOGIN_PASSWORD 提供凭据。启动成功后,可通过浏览器访问 http://[机器人ip]:3100/chat 与机器人交互,也可通过配置 QQ 机器人渠道实现 QQ 对话。

十四、TairosAgent 的开发者如何接入和调试?

1. 网页对话与设置页

TairosAgent 提供基于浏览器的网页对话界面和设置页面。开发者通过 http://[机器人ip]:3100/chat 即可与机器人进行自然语言交互,测试任务理解和执行效果;通过 http://[机器人ip]:3100/settings 可以图形化查看和修改配置,无需手动编辑 YAML 文件。

2. 配置 Adapter 与渠道插件

Adapter 配置文件位于执行器目录下的 tairosagent_linux_*/.tairosagent/tairosagent.yaml,包含 gateway、plugins 和 channels 三层配置。开发者可根据需要启用或关闭 QQ 机器人渠道,填写来自 QQ 开放平台的 appId 和 clientSecret。配置修改后重启 gateway 即可生效。

3. 常用运维与调试命令

TairosAgent 提供了一系列运维命令方便开发者调试:./run_all.sh --status 查看 HAL、tairosagent 和容器状态;./run_all.sh --down 停止服务;docker logs -f hal_dev 查看 HAL 容器日志。执行器更新支持全量更新和按需更新两种模式,后者可选择特定执行器并指定版本。

十五、TairosAgent 在导览场景中有哪些落地案例?

1. 敦煌莫高窟数字展示中心

2026 年元旦,部署了 Tairos 感知大模型与规划大模型的宇树 G1 型号 AI 导览机器人"小莫"在敦煌莫高窟数字展示中心上岗实习,成为全国首个结合具身智能大模型在文博场景落地的 AI 导览人形机器人。该项目由敦煌研究院、腾讯、宇树科技及相关企业共同发起,敦煌研究院基于官方授权的原始文献和学术研究成果构建高质量敦煌主题知识语料库,腾讯 Robotics X 实验室提供 Tairos 具身智能大模型。

2. 景德镇南麓遗址导览

腾讯 SSV 数字文化实验室、腾讯 Robotics X 实验室、宇树科技及景德镇陶文旅集团联合推出 AI 智能导览机器人,在景德镇陶阳里景区南麓遗址为游客提供专业且生动的文化讲解。机器人基于"景德镇瓷业文化遗存"多模态 AI 数据集,帮助公众更好地理解文化遗产和瓷业历史。

3. 上海国瓴展厅导览

在上海国瓴律师事务所上海全球总部展厅,搭载 Tairos 具身大模型的宇树 G1 机器人承担展厅讲解员角色,为来访客户讲解国瓴发展历史、价值观及已取得的相关成就。同时,机器人能结合完备的知识库为客户提供律所业务咨询服务,如根据需求推荐对应领域的律师。

十六、TairosAgent 的三层架构为什么能长期保持稳定?

1. 对应物理世界的时间尺度差异

张正友判断,三层架构可能在相当长时间内保持稳定,因为它对应的不是某一代模型的性能限制,而是物理世界本身存在的时间尺度差异。触觉反馈约 1 毫秒、底层运动控制 500Hz~1000Hz、感知行动约 15Hz、认知按需唤醒——这些频率差异是物理世界的固有属性,不会因模型迭代而消失。"分层我认为是比较合理的一个架构,这个架构在很长的时间里面不太会变。"

2. 分层运行、闭环训练

三层架构并非简单地将模型拆分为三个独立模块,而是"分层运行、闭环训练"。不同模型在推理时承担不同职责和频率,训练时仍然可以根据任务结果、动作表现和环境反馈进行联合优化。这条路线不是反对端到端,而是质疑让一个单体模型以同一种频率包办所有认知和身体控制的设计——它试图保留端到端学习的能力,同时把已经明确的物理约束提前写入架构。

3. 持续演进而非推倒重来

TairosAgent 的架构稳定性并不意味着技术停滞。在保持三层结构稳定的前提下,每一层都在持续演进:感知层引入更高精度的触觉和力觉传感器,认知层从纯语言推理升级为"语言+视觉状态"的双通道认知,行动层通过更多示教数据和强化学习不断提升泛化能力。这种"结构稳定、能力持续进化"的设计,使 TairosAgent 能够在保持架构兼容性的同时,不断吸收模型和硬件的进步。

相关文章
  • 打破“缸中大脑”,腾讯发布「具身智能全栈方案」
    503
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券