Hy-Embodied-VLM-1.0 是混元具身大模型中的视觉语言模型,负责"看懂"图像、空间和场景,相当于机器人的"右脑"。TairosAgent 通过感知反应层接收的视觉信息,交由 VLM 进行空间理解与场景语义解析,将图像、深度信息和点云数据转化为可理解的环境描述,为上层认知决策提供感知基础。该模型仅以约十分之一的计算量就逼近上一代旗舰性能,更适合机器人端直接部署。
Hy-Embodied-RxBrain-1.0 是具身原生的世界认知模型,负责认知、规划和对未来状态的想象,相当于机器人的"大脑"。TairosAgent 的认知决策层调用 RxBrain 进行任务分解和策略规划时,RxBrain 不仅生成语言形式的任务步骤,还会预测每个子任务完成后物理世界应该呈现的状态——即"做完以后应该是什么样"。这种"裂脑"设计让视觉状态进入信息通路,拓宽了认知带宽。
Hy-Embodied-VLA-0.5 是视觉-语言-动作模型,负责将高层目标转化为连续的、可纠错的动作,相当于机器人的"小脑"。TairosAgent 通过感知行动联合接口调用 VLA,实现从"看见"到"做到"的关键闭环。VLA 依托超一万小时高精度人类示教数据训练,在第三方 RoboDojo 评测中取得仿真综合第一,支持零样本泛化和小样本快速适配。