亮源新创连发三项技术:LightNav-0把2000+真实场景搬进仿真,单模型零样本迁移四种机器人本体
亮源新创过去一个多月发布LightParkour、LightNav-0和Light REACT,分别覆盖全身运动技能扩展、通用导航与韧性控制;官方称LightNav-0已发布模型、代码和技术报告。
AI解读:亮源新创过去一个多月连续公开三项技术:跑酷全身运动LightParkour、通用导航LightNav-0、韧性控制Light REACT。三者方向不同,但都指向同一件事——让机器人的能力不靠逐个任务堆人力和数据,而是能持续规模化扩展。
对做机器人的人来说,最直接的信息是导航模型的训练数据来源变了。LightNav-0用Real2Sim2Real把2000多个互联网真实场景转成可复用仿真环境,生成4000多小时视觉、语言和动作经验,用于导航后训练,而不是全靠真机遥操作采集。
LightNav-0的验证重点不是单个基准测试,而是零样本迁移:在10个仿真设置里做指令跟随、目标导航和具身视觉跟踪,同一个模型直接迁移到人形、四足、轮式和飞行机器人。官方同时发布了模型、代码和技术报告,说明这套能力至少在实验范围内可被外部复核。
不过三项技术目前都只有公开实验数据,没有大规模商用部署的成本或稳定性数据。LightNav-0的泛化结论、Light REACT的损伤恢复效果,都还需要在更多真实任务中验证。对普通读者来说,这条新闻短期不改变任何现成产品。
亮源新创在过去一个多月连续发布三项机器人技术:LightParkour、LightNav-0和Light REACT。官方将它们分别定位为全身复杂运动技能扩展、通用导航基础模型和全身韧性控制,并称三者共同服务于“规模化预训练、规模化对齐、规模化部署”的三段范式。
其中LightNav-0公布了较完整的实验设置:基于Real2Sim2Real数据引擎,将2000多个互联网来源的真实场景转换为可复用仿真环境,生成4000多小时视觉、语言和动作经验,用于导航后训练;官方同时发布了模型、代码和技术报告。
LightNav-0:2000+真实场景转仿真,4000+小时导航经验
导航是机器人进入真实环境后的基础能力。亮源新创指出,通用导航与传统导航的区别在于,它需要面对不同环境、不同任务、不同视角甚至不同机器人本体,不能只“记住怎么走”。
LightNav-0采用Real2Sim2Real数据引擎,将2000多个互联网来源的真实场景转换为可反复使用的仿真环境,形成4000多小时视觉、语言和动作后训练经验。同一个场景可以产生不同目标、不同路线、不同视角和不同任务,摄像机几何也可以随训练变化,以避免模型只适应某一种固定机器人视角。
官方公布了一个实验结果:在当前实验范围内,扩大环境覆盖度比单纯增加相同环境里的轨迹数量,更能稳定提升泛化能力。这一结论限于其公开实验范围。
- 数据来源:2000+互联网真实场景转仿真
- 后训练数据量:4000+小时视觉、语言和动作经验
- 泛化结论:环境覆盖度比同环境轨迹数量更重要(限于当前实验范围)
Point CoT把导航拆成空间推理再生成动作
导航的第二个问题是如何把视觉和语言理解变成行动。以“走到沙发右边”为例,理解“沙发”并不困难,难的是判断沙发在哪里、右边在哪里、哪里可以通行,以及生成怎样的运动轨迹。
LightNav-0引入Point CoT:模型先在图像空间预测目标点和可通行点,再生成后续动作token,推理过程从“视觉+语言直接生成动作”变成“视觉语言理解→空间推理→动作生成”。官方称在公开的8项消融评测中,引入Point CoT后平均任务成功率提高8.4个百分点,SPL提高5.7个百分点。
随后,LightNav-0通过RVQ动作编码器将连续机器人轨迹压缩为3个动作token,使视觉、语言、空间位置和机器人动作进入统一的模型训练框架。官方称其训练流程包括具身推理(ER)中期训练、具身监督微调(SFT)和在线强化学习(RL)。
- 中间表示:图像空间中的目标点与可通行点
- 消融结果:8项公开评测平均任务成功率+8.4个百分点,SPL+5.7个百分点(官方数据)
- 动作表示:连续轨迹压缩为3个动作token
零样本迁移四种本体,官方发布模型与代码
LightNav-0没有把验证停留在一个机器人或一个基准测试里。在10个仿真设置中,它覆盖指令跟随、目标导航和具身视觉跟踪等任务;在真实机器人部署中,同一个模型零样本迁移到人形、四足、轮式和飞行机器人等不同本体。
官方表示,这一验证重点考察模型在环境、任务和机器人本体变化条件下的零样本泛化能力。
模型、代码和技术报告均已发布。
- 仿真验证:10个设置,覆盖指令跟随、目标导航、具身视觉跟踪
- 真机验证:同一模型零样本迁移人形、四足、轮式、飞行机器人
- 开放范围:模型、代码、技术报告已发布
LightParkour:一段动作种子扩展成技能分布,50Hz跑在机载平台
LightParkour处理的是全身复杂接触技能。它先从真实人类动作中恢复一段简短的动作种子,再把动作和对应障碍物一起放入物理仿真;仿真重新建立动作、障碍物、接触力和机器人执行器约束之间的关系。机器人成功完成当前动作后,系统提高障碍物难度,并把成功轨迹作为下一轮训练的参考。
官方给出的例子是:从一段针对45厘米障碍物的初始动作出发,逐步生成覆盖至75厘米障碍的参考轨迹,对应90厘米高的Lightbot 0约83%的身高。整个扩展过程中,只有最初的动作和障碍物需要人工对齐。
多专家蒸馏把行走和三项复杂接触技能整合到一个统一策略中,技能切换也不再依赖人工规则。部署时不需要外部技能标签,也没有人工编写的状态机。模型只使用胸前深度相机、本体感知和速度指令,以50Hz在机载计算平台上运行,不需要运行时参考轨迹、外部运动捕捉或机外状态估计。
- 初始条件:45厘米障碍动作种子,扩展到75厘米障碍
- 本体参考:Lightbot 0身高90厘米,75厘米约合83%
- 运行条件:胸前深度相机+本体感知+速度指令,50Hz机载运行
- 蒸馏结果:行走与三项复杂接触技能进入统一策略,无人工状态机
Light REACT:不看故障标签,用64帧上下文推断身体状态
Light REACT全称REsilient humAnoid ConTrol(韧性人形机器人控制),目标是在身体条件变化后,尽可能利用剩余的全身能力继续移动:正常走、跛行、单腿跳,双腿无法维持直立时让手臂参与支撑切换到爬行。
训练阶段,系统针对不同损伤状态建立多个教师策略,覆盖执行器失效、关节锁定和膝部折叠约束三类损伤,再通过多教师蒸馏整合到一个可部署的学生策略中。部署阶段模型不会获得故障标签,只能看到本体感知、动作指令和过去一段时间内身体的响应,必须通过交互历史判断身体状态变化。
亮源新创比较了多层感知机(MLP)、循环神经网络(RNN)和Transformer三种策略结构,结果显示使用64帧因果上下文窗口的Transformer能更充分覆盖教师策略的行为能力。
官方还加入偏好强化学习(Preference RL)做行为对齐:经过该阶段,公开实验中直立行为比例从约42%提高到约76%,爬行行为从约45%下降至约16%。
- 三类损伤:执行器失效、关节锁定、膝部折叠约束
- 上下文窗口:64帧因果上下文,Transformer覆盖更充分
- 对齐结果(公开实验):直立行为约42%→约76%,爬行约45%→约16%
同期的上下文学习工作:Skild AI S1、Generalist AI GEN-1.5、RoboTTT
亮源新创在文中引用了其他团队的工作作为参照。今年8月,Skild AI发布S1:模型观看一次新任务视频示范后,不修改模型权重,也不针对该任务重新做后训练,就可以尝试直接执行。在公开的未见长程任务实验中,同样使用10万小时预训练数据时,视频上下文版本成功率达到66%,语言提示基线为9%。Skild AI将传统机器人面对新任务仍需“收集数据—微调模型”的方式类比为机器人仍处在“BERT时代”。
Generalist AI随后发布的GEN-1.5同样展示一次示范下的任务适应:通过3—12秒的单次示范,在不进行梯度更新的情况下,在10类短程任务中取得59%的平均成功率;使用每项任务约5分钟数据进行10步梯度更新后,平均成功率提升至83%。
RoboTTT把机器人可利用的历史信息扩展到8000个时间步。同一模型使用8K上下文训练,相比1K版本闭环表现提升62%,论文由此将上下文长度(Context Length)提出为机器人基础模型一个新的Scaling维度。
亮源新创指出,这些工作的架构、数据和任务并不相同,不应归为同一条技术路线;S1和GEN-1.5的上下文核心是外部任务示范,Light REACT的上下文来自机器人自身交互历史,二者共享的是利用上下文减少显式人工适配的思路,而不是同一种能力。
- Skild AI S1:10万小时预训练数据下,视频上下文成功率66%,语言提示基线9%
- Generalist AI GEN-1.5:3—12秒单次示范、无梯度更新,10类短程任务平均成功率59%;10步梯度更新后83%
- RoboTTT:8K上下文相比1K版本闭环表现提升62%(论文数据)