清华现场无脚本:机器狗指挥人类协作称重,Physical AGI 走出迷雾
当业界还在为 Physical AGI 的技术路线争论不休时,清华大学的一支团队选择了一种最直接也最大胆的方式回应——把机器狗拉到几十位观众面前,无脚本、无预设、即兴出题,现场演示。
2026 年 7 月,一念 Unisonmind 团队在清华举办了一场不同寻常的展示。没有排练过的演示视频,没有提前准备的 benchmark,观众可以现场任意出题。这不仅是技术验证,更像是对 Physical AGI 是否真实存在的一次公开质证。
现场三重奏:看图、指挥、估算
搭载 Unisonmind 端侧大脑的机器狗「哮天」,在三个完全不同的任务中展示了令人印象深刻的泛化能力。
第一个任务:看图走迷宫。主持人在黑板上随手画了一幅简笔画,机器狗理解这是身后的三维迷宫。主持人在图上圈出一个位置,它便走到实地寻找对应物体。最精彩的一幕是主持人随手画了一个「8」字——哮天先反问「能不能走捷径」,得到肯定后抄了近路,随即又严格按图行进剩下的路径。
第二个任务:指挥人类称重。机器狗需要指挥人类助手使用天平,给随机找来的几个物品称重。这需要同时调用物理智能、语言交流、行动规划和社会协作——不是单一维度的智能,而是一个多智能面协同的完整行为序列。
第三个任务:估算瓶内剩水。一位观众临时拿出两瓶喝过的矿泉水,问瓶子里还剩多少水。这不是预设题目。哮天看了一眼,说:「你先把矿泉水瓶标签撕了。」——它知道透明瓶身才能做视觉判断。然后给出了一个合理的估算。
同一个大脑,不同的身体
更值得关注的是,同一个 Unisonmind 端侧大脑被装进了不同的本体:另一只机器狗、一台人形机器人、一台电动轮椅。身体在变,认知底座不变。所有这些设备在真实世界环境中实时运行,形成持续的「感知—行动—反馈」闭环。
这意味着 Unisonmind 不是为某个特定机器人定制的感知模块,而是一套可跨本体迁移的通用认知系统。对于长期被「一机一脑」困住的具身智能行业来说,这无疑是一个重要的范式信号。
技术底座:「3+1」统一世界 Token 空间
现场表现的背后,是一念团队的「统一世界 Token 空间」架构。团队用「3+1」来概括其核心特征:
第一,全模态 Any-to-Any。视频、图像、声音、文字和动作在同一个模型中输入和输出,不做模态切分。第二,理解与生成统一。路线被看见、指令被理解、状态被预判、行动被生成、声音被输出——所有这些发生在同一个模型内部,不需要多个模型串联。第三,全链路 Runtime。模型常驻运行,每 18 毫秒与世界状态对齐一次,在持续的反馈中自我修正。最后,端侧本体部署。整套模型直接跑在机器狗、人形机器人和轮椅的端侧硬件上,不依赖云端。
这「3+1」解释了为什么机器狗能在三个迥异任务之间无缝切换:语言、空间、物理、行动和协作,在同一个常驻运行的模型里随任务临时组合、自然协同,而不是切换不同的「技能包」。
Physical AGI 的门槛之争
这场演示之所以重要,在于它为 Physical AGI 提供了一个可验证的判断标准。过去,行业对 Physical AGI 的讨论容易陷入两种极端——要么停留在概念层面对未来无限畅想,要么退缩到虚拟 benchmark 的分数上争论。而一念团队的演示选择了一个更原始也更可靠的标尺:人类智能。
从人类多元智能理论出发,Physical AGI 的核心定义是同一个通用认知系统以实体为载体进入真实世界,在开放环境中持续组织多维度智能,并在环境反馈中自主迭代。这不是一个「语言模型加机械臂」的拼装,而是一个认知系统面对不同对象时自然分化出的多维度能力。
清华现场的每一件事都在验证这个定义:同一个大脑、真实世界闭环、无预设任务、多元智能协同。从这个意义上说,Physical AGI 不再是模糊的技术想象——它已经走出了定义的迷雾,踏上了真实世界的土地。