数据总量
思考 · 推演 · 行动,融于一体 Reason. Imagine. Act. In One Unified Foundation Model
Pelican-Unify 1.0 是面向具身智能的大一统基础模型,打通“思考—推演—行动”的完整闭环。通过统一表征,模型协同学习思维链推理、未来场景视频预测与底层动作生成,使机器人理解任务目标、预判行动结果,并在真实世界中自主决策与执行。
思考 / 推演 / 行动
UNIFIED WORLD-ACTION MODEL
统一理解、未来推演与行动生成
Pelican-Unify 将环境与意图理解、具身视频生成和动作生成统一于一个模型闭环。
PELICAN-UNIFY IN ACTION
模型演示
DATA INFRASTRUCTURE
持续生长的高质量数据基建
较 Unify 1.0 阶段增长
真机数据覆盖
MULTIMODAL UNDERSTANDING
多模态环境与意图理解
VLM 融合人类指令与连续多模态观测,持续理解环境、任务进展和机器人状态,为具身推理、世界模型与动作生成提供统一认知基础。VLM COGNITION统一语义表征指令 × 视觉 × 状态 × 历史
联合理解任务指令、当前画面与历史视觉,识别场景、目标对象、机器人状态及任务意图。
持续跟踪完整任务过程,而非仅判断单个动作。
根据连续观测识别环境与机器人状态变化,判断下一步操作条件是否满足。
结合任务目标、当前状态与执行历史,推理下一步操作,形成“场景理解—状态判断—进度跟踪—行动规划”的连续链路。
识别异常与失败原因,为重新规划和恢复执行提供依据。
多模态理解演示
VIDEO GENERATION
视频生成功能力
模型采用多流建模(Multi-Stream Modeling),联合生成主视角、腕部与第三人称视角 RGB 图像,以及深度、边缘、分割、动作序列和相机轨迹等多模态信息,支持以下能力:
RGBDEPTHEDGEMASKACTIONCAMERA
多层次泛化生成
支持背景、物体类别及长程多任务组合的逐层泛化。
跨视角泛化生成
仅需主视角首帧与任务指令,即可同步生成主视角和腕部视角视频。
>4D 生成
支持灵活指定多模态条件与生成目标,实现可控的跨视角、多模态联合生成。
Sim2Real 生成
基于仿真任务示例生成真实场景执行数据,降低迁移成本。
VIDEO-ACTION CO-TRAINING LOOP
视频与动作协同训练,共同提升
Pelican Unify 采用 VLM 条件化的 Unified DiT 架构。模型融合多视角画面、语言指令、历史视觉与机器人动作,在统一主干中联合建模视觉变化和动作关联,并分别预测未来视觉状态与可执行动作,实现任务理解、未来预测和机器人控制的端到端统一。视频—动作协同训练对比03 VIDEOS
ROBOT DEMOS
Pelican-Unify 真机 Demo
通过真实机器人任务视频,展示模型从任务理解到动作执行的完整效果。PELICAN-UNIFY
京公网安备11011202100775号