昆仑万维黎曼动力发布 Riemann-1.0:20 万小时人类视频训出的机器人世界模型,RoboCasa-365 登顶
在 WAIC 2026(世界人工智能大会)前夕,昆仑万维旗下具身智能子公司黎曼动力正式发布了其首款通用机器人世界动作模型 Riemann-1.0。首秀即登顶:在机器人圈公认难度最高的家务操作基准 RoboCasa-365 上取得 62.6%,比此前 SOTA 高出 8.4 个百分点——该榜单上大部分模型仍在 50% 以下。
Riemann-1.0 的技术路线印证了具身智能今年的一条合流趋势:VLA(视觉-语言-动作)与世界模型两条路线取长补短。模型基于扩散架构,提出全因果的动作-视频联合建模框架,把视觉动态、环境状态和机器人动作序列放进同一个生成过程统一学习,并为本体各异的 41 种机器人设计了专属动作映射模块。
训练数据是另一个看点:23.2 万小时总量中,大头是 20 万+ 小时的人类第一视角视频(做饭、叠衣服、收拾桌面),而非昂贵的真机机器人数据。为解决人类视频没有机器人动作标签的核心难题,团队自研了自动化处理流水线:畸变矫正、VLM 细粒度切分配标注、六类废片质检、手部 3D 姿态重建并换算进世界坐标系,把「人干活录像」变成机器可读的动作教材。这与 Being-H0.7(20 万小时)、Generalist AI GEN-1(50 万小时)同属「海量人类视频预训练 + 少量真机对齐」范式,Riemann-1.0 是国内较早把该范式完整工程化跑通的选手。
据昆仑万维官方公众号,董事长兼 CEO 方汉在 WAIC 专场论坛上将 2026 称为「世界模型元年」。需要说明的是,62.6% 的成绩为官方自报、尚待榜单方收录确认;真机 demo 视频展示的是桌面收拾等家务场景,距离通用家庭服务仍有距离。但对于关注具身智能的读者,这条「人类视频 → 世界动作模型」的工程化路径值得持续跟踪。