思考 · 推演 · 行动,融于一体 Reason. Imagine. Act. In One Unified Foundation Model

Pelican-Unify 1.0 是面向具身智能的大一统基础模型,打通“思考—推演—行动”的完整闭环。通过统一表征,模型协同学习思维链推理、未来场景视频预测与底层动作生成,使机器人理解任务目标、预判行动结果,并在真实世界中自主决策与执行。

思考 / 推演 / 行动

UNIFIED WORLD-ACTION MODEL

统一理解、未来推演与行动生成

Pelican-Unify 将环境与意图理解、具身视频生成和动作生成统一于一个模型闭环。

PELICAN-UNIFY IN ACTION

模型演示

DATA INFRASTRUCTURE

持续生长的高质量数据基建

145万小时

数据总量

1500%

较 Unify 1.0 阶段增长

20+

真机数据覆盖

多源数据经过双智能体协同处理,进入高质量数据池并用于模型训练,效果反馈持续回流

MULTIMODAL UNDERSTANDING

多模态环境与意图理解

VLM 融合人类指令与连续多模态观测,持续理解环境、任务进展和机器人状态,为具身推理、世界模型与动作生成提供统一认知基础。
VLM COGNITION统一语义表征指令 × 视觉 × 状态 × 历史
01多模态场景与意图理解

联合理解任务指令、当前画面与历史视觉,识别场景、目标对象、机器人状态及任务意图。

02长程任务进度理解

持续跟踪完整任务过程,而非仅判断单个动作。

03状态变化与执行条件判断

根据连续观测识别环境与机器人状态变化,判断下一步操作条件是否满足。

04下一子任务推理与规划

结合任务目标、当前状态与执行历史,推理下一步操作,形成“场景理解—状态判断—进度跟踪—行动规划”的连续链路。

05异常理解与失败归因

识别异常与失败原因,为重新规划和恢复执行提供依据。

多模态理解演示
VLM DEMO连续任务理解与下一步规划

VIDEO GENERATION

视频生成功能力

模型采用多流建模(Multi-Stream Modeling),联合生成主视角、腕部与第三人称视角 RGB 图像,以及深度、边缘、分割、动作序列和相机轨迹等多模态信息,支持以下能力:
RGBDEPTHEDGEMASKACTIONCAMERA
多层次泛化生成

支持背景、物体类别及长程多任务组合的逐层泛化。

背景泛化胶带转移|科幻海底
背景泛化玉米装盘|海岛沙滩
背景泛化双臂折叠 T 恤|太空舱
背景泛化盘子摆放|木星空间站
交叉泛化蛋糕装盘|餐桌场景
交叉泛化晶体装盘|炼金工房
交叉泛化托盘移动|炼金工房
交叉泛化晶体插槽|太空工作站
组合泛化三任务组合|法老墓室
组合泛化六任务组合|海底王国
组合泛化三任务组合|空中飞艇
组合泛化四任务组合|太空舱
跨视角泛化生成

仅需主视角首帧与任务指令,即可同步生成主视角和腕部视角视频。

>
香蕉入篮主视角
香蕉入篮左腕视角
香蕉入篮右腕视角
开锅盖主视角
开锅盖左腕视角
开锅盖右腕视角
取出红色木块主视角
取出红色木块左腕视角
取出红色木块右腕视角
4D 生成

支持灵活指定多模态条件与生成目标,实现可控的跨视角、多模态联合生成。

4D 生成木块堆叠
4D 生成关闭微波炉
4D 生成打开调料罐
Sim2Real 生成

基于仿真任务示例生成真实场景执行数据,降低迁移成本。

Sim2Real方块入盒
Sim2Real小球入盘
Sim2Real酒瓶摇晃

VIDEO-ACTION CO-TRAINING LOOP

视频与动作协同训练,共同提升

Pelican Unify 采用 VLM 条件化的 Unified DiT 架构。模型融合多视角画面、语言指令、历史视觉与机器人动作,在统一主干中联合建模视觉变化和动作关联,并分别预测未来视觉状态与可执行动作,实现任务理解、未来预测和机器人控制的端到端统一。
视频—动作协同训练对比03 VIDEOS
协同训练对比折叠床上衣物
协同训练对比双臂倒酒与摇晃
协同训练对比使用工具拉近木块

ROBOT DEMOS

Pelican-Unify 真机 Demo

通过真实机器人任务视频,展示模型从任务理解到动作执行的完整效果。
真机任务 Demo 01
真机任务 Demo 02

PELICAN-UNIFY

统一理解、未来推演、行动生成

Top