一个没有经过任务训练的机器人,整理了一间陌生厨房

过去几年,让机器人完成「整理厨房」这种任务的标准路径是:采集数百小时演示数据、训练一个专门策略、在同一间实验室里反复调参——换一个房间、换一组物体,往往就要重来一遍。2026年9月底,Stanford与Caltech团队发布的HomeBody系统给出了另一种答案:一台Unitree G1人形机器人,没有为「整理厨房」训练过任何控制层,由GPT-6 Astra直接调用一组可组合的技能,在从未见过的厨房里完成了「把咖啡袋集中到岛台、扔掉变质牛奶盒和果汁盒」这类长程任务。代码已在GitHub开源。

这件事的意义不在于机器人又学会了一个新任务,而在于它验证了一个正在成形的范式:通用视觉语言模型(VLM)可以直接充当机器人的大脑,而机器人开发的核心工作,正在从「训练策略」转向「构建让模型能用起来的基础设施」。

HomeBody的技术栈:三层解耦的「模型即大脑」架构

细看项目页面披露的实现细节,HomeBody的架构可以拆成三层,每一层都在做减法。

第一层是感知与空间记忆。 机器人先被赋予角色(“你是一个厨房机器人,请探索这个空间”),然后自主选择有价值的视角进行探索,采集iPhone视频、D435i相机观测、LiDAR扫描(配合SLAM)、关节姿态和Astra自主选择的路径点。这些数据被统一到一个共享坐标系中——G1本体通过Super Odometry定位,SLAM地图与仿真重建结果用ICP(迭代最近点)配准对齐。关键在于:机器人把自我视角的相机观测连同描述性内容存进这个空间记忆,即使物体离开当前视野,它也知道东西在哪、自己相对它在哪。这是长程任务的前提——「取药」演示中,药瓶初始完全不可见,机器人靠存储的关键帧定位到抽屉、打开、取出、递给人,再用另一只手扔掉变质纸盒。

第二层是Real2Sim数字孪生。 HomeBody用Astra作为Real2Sim智能体,在NVIDIA Isaac Sim中从机器人自己采集的数据构建数字孪生。这里有个容易被忽略的工程细节:仅靠视频重建,模型只能从外观估计房间尺寸;HomeBody额外提供SLAM测得的几何约束,让重建在几何、语义、视觉三个维度上都足够准确——因为导航需要精确几何,而不只是「看起来像」。数字孪生让高层VLM能够在超出自我视野的空间范围上做推理,相当于给模型一张可以「想象」的地图。

第三层是可扩展技能库。 导航、抓取、放置、开抽屉、从抽屉取物——这些技能共享统一的接口(目标+执行结果),VLM在部署时组合调用。技能库明确支持接入学习型策略、经典算法或任何其他控制器,这意味着新能力的添加变成了接口工程,而不是重新训练。执行层的局部重试和视觉反馈负责纠正操作误差,而执行结果会回流给VLM——当某个动作或转移失败时,模型据此修正下一步决策。

三层之间的耦合被压到最低:换一个更强的VLM,感知层和技能层几乎不用动。这正是「换模型即换大脑」的技术含义。

范式的经济学:从「每任务一策略」到「模型升级红利」

传统机器人学习(尤其是模仿学习和强化学习路线)的经济学是糟糕的:每个任务一份专门数据、一份专门策略、一份专门维护。数据采集成本随任务数量线性增长,而策略的泛化能力极差。VLA(视觉-语言-动作)模型路线试图用一个端到端大模型统一感知与动作,缓解了泛化问题,但训练成本高企、且模型与特定本体深度绑定。

HomeBody代表的第三条路——VLM直接做高层决策+轻量技能库做底层执行——改写了成本结构:

  • 数据成本前置一次化。 探索和建图是环境级的,不是任务级的;一次探索的成果被所有后续任务复用。
  • 模型升级红利自动兑现。 GPT-6 Astra的推理能力提升、下一代模型延迟下降,都会直接转化为整个系统的能力提升,无需重新训练任何机器人侧组件。这与当下「换一个更强VLM就能整体升级」的开发体验完全同构——就像软件工程师换用更强的LLM,应用代码一行不改。
  • 长尾任务边际成本趋零。 「把咖啡袋放岛台、扔掉变质的纸盒」这种组合式指令,在传统范式下每个组合都是新任务,在这里只是模型的推理输入。

一个恰当的类比是:这相当于机器人领域的「操作系统+应用」分工。技能库是系统调用,空间记忆是文件系统,数字孪生是进程的虚拟地址空间,而VLM是调度一切的用户程序。程序可以随便换,内核稳定迭代。

瓶颈同样清晰:延迟、硬件、成本的三重天花板

HomeBody团队自己列出的限制值得认真对待,因为它们定义了这条路线的落地曲线。

推理延迟是第一约束。 高层决策依赖VLM的生成式推理,而长程任务需要密集的「决策-执行-反馈」循环。Astra的延迟直接决定了机器人从「看到失败」到「改换策略」的反应速度——在真实物理环境里,这意味着执行中间态的不确定性窗口。这也是为什么执行层需要局部重试机制来兜底:能靠视觉反馈自己纠正的,别麻烦大脑。如果下一代模型把延迟压到亚秒级,这套架构的能力上限会显著抬升。

本体硬件是短板。 报道明确提到手指舵机过热的问题。当「大脑」足够聪明、开始高频调用精细操作技能时,廉价本体的机电耐久就成了瓶颈。讽刺的是,智能的提升会放大硬件的不足——模型越想多做,电机越容易过热。

算力成本决定商业形态。 每台机器人背后跑着一个前沿VLM的持续推理,这笔账在实验室里可以忽略,在商用部署里就是核心成本项。它会把行业推向两种形态之一:要么边缘推理的模型蒸馏与量化取得突破,要么「机器人即服务」的云端大脑模式成为默认——后者又反过来受制于网络延迟。

值得注意的是,这三重天花板没有一个是架构层面的根本缺陷,全是工程与供应链问题。这正是判断一条技术路线前景时的关键区分:范式风险已经清除,剩下的都是可迭代的风险。

更深一层:空间记忆正在成为机器人的「私有知识资产」

HomeBody架构里最值得放大的一点,是空间记忆的资产属性。机器人花时间探索一间厨房,产出的数字孪生和空间索引不会随任务结束而消失——它是这间厨房的持久「知识」。

这带来一个此前被低估的推论:具身智能的商业护城河可能不在模型,而在环境数据。模型是同一家的,谁的机器人对这栋写字楼、这家医院、这个仓库的空间记忆更深、更新更快,谁的服务就更值钱。清洁、巡检、仓储这些场景的竞争,会逐渐从「谁的机器人更聪明」变成「谁的环境画像更完整」。而Real2Sim管线让这份画像还能用于离线验证新任务流程——先在数字孪生里试跑,再到物理世界执行——这实际上把机器人运维也纳入了「仿真优先」的软件工程范式。

对从业者的三点启示

第一,机器人团队的能力画像正在改变。 当训练策略的工作被接口工程取代,团队需要的是SLAM/建图、仿真重建、技能接口设计、以及VLM提示与上下文工程的人才。「给模型喂对信息」的能力——如何组织空间记忆、如何呈现执行反馈——正在成为具身智能领域的上下文工程。

第二,技能库是比模型更接近用户的生态位。 模型层已被巨头锁定,但「把一个特定动作做成可靠、可组合的技能」依然是脏活累活,也是开源社区和创业公司的空间。HomeBody技能库里那个「接入你自己的技能」按钮,就是这一生态位的产品化表达。

第三,落地曲线可能比预期陡峭。 过去对人形机器人的保守预期,很大程度建立在「每个任务都要训练」的旧范式上。一旦范式切换完成,机器人能力的增长就绑定到了LLM能力增长这条已被验证的曲线上——而那条曲线的最显著特征,恰恰是每年都超出预期。当延迟、硬件、成本三重天花板被逐一击穿时,具身智能的商业化不会是线性的。

结语

HomeBody整理的那间厨房里,真正被整理的是机器人开发的范式本身:训练控制层被移除了,取而代之的是空间记忆、数字孪生和技能库这三件基础设施。大脑不再长在机器人身上,而是住在云端,随每一次模型升级而免费进化。

这或许就是2026年具身智能最深刻的变化:机器人的智能,第一次变成了可以「热插拔」的部件。剩下的悬念只在于——延迟、舵机和账单,哪一个先被解决。


参考来源:Stanford TML HomeBody项目页、The Decoder报道、GitHub (Stanford-TML/homebody)、AI洞察日报 2026-09-28