AI 读过一切,却没经历过任何事:Ropedia 发布 HOMIE Gen2,给具身智能补「经验」这一课
8 月中旬,新加坡的一场公开演讲上,南洋理工大学副教授、Ropedia 首席科学家刘子纬抛出了一个问题:为什么读过整个互联网的 AI,进了物理世界,却连一杯咖啡都冲不好?
他的回答是:“AI 读过一切,却几乎没有经历过任何事情。它从未真正冲过一杯咖啡,自然也不知道该怎么做。”

刘子纬教授在新加坡演讲的现场照片
这种分裂在今天的 AI 身上随处可见:感知模型能把冲咖啡的教程讲得头头是道,生成式模型能合成一段以假乱真的冲咖啡视频;可一旦真的伸出机械臂,同样的智能常常连一次可靠的抓取都完成不了。能听懂,能想象,就是做不好。这道裂缝,此刻正卡着整个具身智能行业。
AI 科技评论了解到,就在这场演讲之后不久,由联合创始人兼 CEO 陈昭熹与联合创始人兼 CTO洪方舟共同创办的 Physical AI 公司Ropedia,正式发布了新一代多模态采集系统HOMIE Gen2。这套关于“经验”的判断,最终落到了一台约 380g 的头戴设备上:让 AI 从人类真实行为中,补上它缺失已久的“经验”这一课。对于这台设备要做的事,CEO 陈昭熹有一个很形象的说法:“学做一道菜,只看别人做的视频,可能知道最后成品长什么样;但真正亲手做过,才会知道什么时候下锅、该用多大力、食材发生了什么变化。”HOMIE Gen2 要做的,就是把这些真实操作中的动作、时机和环境变化完整记录下来,让机器人学到的不只是结果,还有过程。

Ropedia 发布 HOMIE Gen2
01
从“看见世界”到“经历世界”
HOMIE Gen2 背后的“经验”思路,其实可以追溯到刘子纬教授更早的研究之中。
他的团队做过一个名为 EgoLife 的项目:六个人共同生活七天,录下约五十小时的第一视角视频,并同步了外部视角、音频、视线与动作。模型要在这些数据里回答的,不是“画面里有什么”,而是一些更接近生活本身的问题:那罐咖啡豆昨天被谁挪去了哪里?上一次冲煮为什么失败?用他的话说,这是在为物理世界构建“记忆层”。在他看来,真正的 Physical AI 要能跨越数小时、数天甚至不同的人去推理,这是语言模型从未面对过的时间尺度。

刘子纬教授团队的 EgoLife 项目,发表于 CVPR 2025
除了时间之外,他还反复强调另一个常被忽略的约束:行动。今天的 AI 可以慢慢想,物理世界却不会停下来等模型想完。“物理智能,是延迟约束下的智能。”这句话划出了具身智能与数字智能的分界线:后者只需要答对,前者必须在毫秒之间答对。
跨越时间的记忆、延迟约束下的行动,两条线索指向同一个结论:机Physical AI 需要的,不再只是关于世界的描述,而是真实发生在物理世界中的完整经验。
02
什么才算“人类经验”
每一代AI系统都从不同的数据基本单元中学习,学习来源定义了智能的上限。感知 AI 把像素变成标签,回答“那里有什么”;生成式 AI 把提示词变成内容,回答“它可能是什么样子”;Physical AI 的基本单元则是一个完整的经验片段,它把行动、后果和下一次行动串在一起,回答“如果我这样做,会发生什么,下一步该怎么办”。
基于这一判断,Ropedia 进一步给“经验”划出了明确的边界:视频不是经验,RGB、动作捕捉、深度中的任何单一模态都不是,把它们简单叠在一起也不是;只有当动作、意图、环境、时序上下文与多模态信息同时在场、互相对齐,一段记录才配得上这个词。

Ropedia HOMIE GEN2 Demo
换一个角度说:语言模型学的是人类写下来的东西,Physical AI 要学的,是人类做了什么、世界如何回应、接下来又发生了什么。文字可以被爬取,经验却必须在真实世界中发生。
在此基础上,Ropedia 进一步将这一趋势概括为 Human Experience Scaling Law:机器人能力,将随着高质量人类经验的规模化增长而持续提升。经验从哪来?“人类不是要被过滤掉的噪声,而是最能理解丰富的物理世界的老师。”刘子纬教授这样认为。
业内的最新进展,也验证了这个判断。Generalist AI 刚发布的具身基础模型 GEN-1.5 展示了 physical prompting(物理提示):把几秒钟的人类演示放进上下文,机器人不经重新训练就能上手新任务,并且单次演示的平均成功率约六成,这意味着:人类经验,可以直接成为模型的输入。
事实上,“从人身上采集数据”这条路线的有效性早有共识:公开研究显示,即便只用单摄像头的第一视角视频,从两万小时堆到百万小时,规模定律始终成立。当然,这只是"经验"的最低配,既然最低配已然有效,那么上限就看谁采得完整。竞争的焦点,正从「能不能采到」转向「采得够不够完整」。
03
一份答卷:HOMIE Gen2
要把这样的“经验”真正记录下来,HOMIE Gen2 从这三个关键词出发:
•沉浸式人类经验:设备用 4 目全景实现 360° 覆盖,外加 4 路空间音频,把人看到的、听到的、身处的环境一次收齐;多台设备还能同步作业,从不同的人、不同的视角记录同一个场景。
•丰富的多模态理解:设备把十余种模态压进同一时间轴、同一坐标系,多传感器同步精度做到 50µs。这意味着任何一帧画面,都能找到与它严格对应的动作、深度与标注。
•开箱即用的高精度训练级数据,交付物必须开箱即用。据 Ropedia 基于金标准样本集的测试:空间定位平均相对误差约千分之二,手部 21 关键点动捕平均误差 4.68 mm,深度范围误差低于 2.5%,动作语义标注准确率 96.0%。

HOMIE Gen2 “沉浸式”采集人类经验
更关键的变化是 HOMIE Gen2 硬件本身为“随时随地采经验”做好了准备:不需要任何外部布置,可以在家庭、工厂、商场等开放环境里全天候、自然地工作,多传感器之间的同步精度达到 50µs。据 Ropedia 介绍,它的部署速度比上一代方案快约 10 倍,采集成本降到约 1/12.5。这样一台约 380g、可连续采集约 13 小时的设备,承担的是整套体系最前端的一环:尽可能完整、准确地把真实世界中的人类经验记录下来。

04
全栈基础设施:
一台设备,三层系统
刘子纬教授认为:“如果经验是稀缺资源,那么就必须有人把它工业化。” 对 Ropedia 来说,这件事的起点不是模型,而是采集。采集那一刻丢掉的信息,后续任何算法都补不回来,因此硬件成为整套体系最先要解决的一环。联合创始人兼 CEO 陈昭熹把它称作“物理世界进入数字世界的入口”。
但真正把经验变成可规模化生产的数据资产,靠的不只是一台设备。在Ropedia的体系里,这是一整套会自我演进的基础设施,自下而上分为三层:硬件采集经验,数据基础设施加工经验,模型理解经验并反哺整个系统,最终以 Xperience Dataset 的形式向客户交付。
在这三层里,硬件是入口;数据基础设施用智能体驱动的流水线,把处理从手工调参推进到自动化;模型层则在自有数据上训练统一多模态模型,既自动标注新流入的经验,也部署回硬件,为下游策略模型提供能力。

Ropedia 自研的自我演进基础设施
这套流程已经有了可观察的产出。此前发布的 Xperience-10M,包含约 1,000 万个真实世界交互片段、1 万小时带音频的第一视角视频,总规模接近 1PB。按照 Ropedia 的设计,数据交付也不是这条链路的终点:模型在训练中暴露出的能力缺口,会反过来影响下一轮采集什么、如何采集,让采集、处理与模型训练形成持续反馈。
过去十二个月,这个硬件更迭了四次,而四代硬件其实在解决同一个问题:从“能够采到经验”,走到“能够稳定、规模化地生产经验”。3D 打印的原型机“竹蜻蜓”验证了采得到;第二代 R-Ego 卖出了第一台,证明了可商业化的路径;Gen1 走向产品化,撑起了 Xperience-10M 的发布;今天的 Gen2 完成规格与佩戴系统的整体升级,让人类经验的大规模工业化生产成为可能。这个品类的想象空间,也远不止于采集。CEO 陈昭熹在近期访谈中提到,HOMIE 的形态在未来几代还会继续演化,但核心能力不变:一台随身的可穿戴 AI 助手,随时随地帮助人类理解身边的世界。据 AI 科技评论了解,这家公司至今已服务超过 20 家全球机器人及基础模型团队。
在那场演讲的结尾,刘子纬教授给行业留了一句话:“不要只是构建更大的大脑,而要构建更好的经验闭环。”过去二十年,互联网把人类知识数字化,喂出了大语言模型;Ropedia 押注的是下一个二十年:把人类经验数字化,喂出真正能做事的机器。