产品量子位·原文 2026年9月10日

大晓机器人等发布HSImul3R:首个可仿真人–场景交互重建框架,已入选ECCV 2026

大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室发布人–场景交互重建框架HSImul3R,团队称其为首个面向非标定稀疏视角输入、实现稳定可仿真重建的框架。在HSIBench三档任务中,其交互稳定率为53.68%、30.56%、13.92%,人–场景三维穿模率从HSfM的69.51%降至22.90%。

AI解读:这条新闻解决的是一个很具体、也很别扭的问题:三维重建出来的“人坐在椅子上”看着对,扔进物理仿真器里椅子就倒、人体穿模。视觉正确和物理成立是两回事,而机器人最终要面对的是重力、碰撞和接触,不是渲染截图。

HSImul3R的做法是把物理仿真器从最后的裁判变成重建过程中的监督者。正向用面向场景的强化学习优化人体运动,反向用直接仿真奖励优化三维场景,目标是让人和场景在仿真里真的接触、真的稳定。这套思路直接影响做具身智能、机器人数据管线的人:人类视频不再只是被观看的素材,而可能变成可仿真、可学习的动作先验。

限制也很清楚。三档任务里最难一档的交互稳定率只有13.92%,穿模率仍有22.90%,说明复杂交互、多物体和动态环境还差得远。目前公开的是论文、项目页和GitHub链接,团队自己也说这条路线处于早期阶段,距离大规模可用还有距离。

大晓机器人联合南洋理工大学S-Lab、上海人工智能实验室发布人–场景交互重建研究HSImul3R,该成果已被ECCV 2026正式接收。团队将其定义为首个面向非标定稀疏视角输入、实现稳定可仿真(Simulation-Ready)人–场景交互重建的框架,并进一步支持单目视频输入。来源为量子位获授权转载的大晓机器人稿件。

评价标准从“视觉正确”改为重力、接触与交互稳定

HSImul3R针对的是三维视觉中的“感知—仿真鸿沟”:传统方法主要关注人和场景是否重建得像、是否对齐,但一个视觉上准确坐在椅子上的人体,进入物理仿真后椅子可能因结构缺失倒下,人体也可能与椅面严重穿模。

团队将重力稳定性、真实接触和交互稳定性纳入核心评价标准。为此构建了面向人–场景交互的HSIBench,直接检验重建结果能否在物理仿真中稳定交互。数据集包含19个场景物体、超过50段人体动作序列和300个独立交互实例,由3名参与者完成,每个案例从16个视角同步采集。与传统三维重建基准更关注几何误差不同,HSIBench将人–场景交互稳定性(Stability-HSI)作为核心指标之一。

物理闭环双向优化:正向改人体,反向改场景

HSImul3R提出物理闭环(Physics-in-the-Loop)双向优化框架,让物理仿真器从最终检验工具变成重建过程中的主动监督者。

正向过程采用面向场景的强化学习(Scene-targeted Reinforcement Learning)优化人体运动,在运动跟踪基础上加入场景交互约束,通过人体关键接触点与物体表面的空间关系,使优化后的动作既忠实于原始观测,又能与当前场景保持正确、稳定的接触。团队举例:一段“坐在椅子上”的动作经过普通运动优化后,人体可能为了保持平衡而偏离椅子,人没摔倒但“坐椅子”这一交互已经消失。

反向过程采用直接仿真奖励优化(Direct Simulation Reward Optimization,DSRO),利用交互后的仿真反馈反向优化三维场景。团队将仿真反馈划分为从“物体在重力下失稳”到“人与物体实现稳定交互”的四种状态,只有当物体自身稳定、交互后仍保持稳定、且人与物体之间确实形成有效接触时,重建才被认为真正成立。因此一把椅子即使单独放在地面上不会倒,如果人坐上去就倾覆,或人与椅子最终完全分离,仍不算重建对。

HSIBench测试:三档稳定率与穿模率数据

实验结果显示,在Easy、Medium和Hard三档任务中,HSImul3R的人–场景交互稳定率分别达到53.68%、30.56%和13.92%,而HSfM分别为10.52%、4.50%和2.66%;人–场景三维穿模率从HSfM的69.51%降至22.90%。

从人类视频到Unitree G1:完整链路已打通

团队将优化后的人体动作迁移至Unitree G1人形机器人,贯通“日常图像/视频→三维人–场景交互重建→物理仿真优化→人形机器人动作迁移→真实机器人执行”的完整链路。具体做法是先将优化后的人体运动重定向至Unitree G1,再以这些动作作为先验,在仿真环境中训练全身控制策略,最终直接部署到真实G1上,使机器人能够在现实环境中复现相应的人–场景交互,即从Real-to-Sim再完成Sim-to-Real。

论文题为《HSImul3R: Physics-in-the-Loop Reconstruction of Simulation-Ready Human–Scene Interactions》,团队同时公开了arXiv、项目页和GitHub链接。团队在稿件中表示,这条路线仍处于早期阶段,复杂交互、多物体场景和动态环境依然存在大量挑战。

信息来源

量子位原始来源