具身智能(Embodied AI)正在成为 AI 领域最受关注的方向之一。要让机器人像人类一样理解并操作物理世界,模型离不开海量、高质量、贴近真实的操作数据。但真实世界操作数据面临数据稀缺、采集困难、标注昂贵、格式混乱、训练低效等困境。
穹彻智能(Noematrix)是国内具身智能领域的头部厂商,聚焦多本体的“数据—训练—部署”全链路基础设施。在穹彻的技术体系中,“伴随式数据采集”是一项关键创新——通过手持式通用操作接口(UMI,Universal Manipulation Interface)等设备,让人无需真机、在自然操作中就能产出大量训练数据。而这些数据中最具价值、也最难处理的一类,就是UMI 手持夹爪采集数据:一只搭载广角(鱼眼)相机的手持夹爪,在人手自然操作中同步记录第一视角视觉画面、末端 6DoF 位姿轨迹与夹爪开合状态,天然携带了“手-物体”操作的精确视觉与动作上下文,是模仿学习最通用的 manipulation 先验。
想象一下:研究人员拿着一个手持设备(UMI)做各种动作——拿起杯子、翻转物体、打开抽屉。设备上的鱼眼相机记录下多视角画面,同时记录夹爪的位置、姿态、开合状态。这些数据对训练机器人非常宝贵,但要变成模型能"吃"的训练数据,中间隔着四道难关:
• 位姿恢复——计算密集型任务。手持采集没有外部动捕设备,需要从鱼眼视频中用视觉SLAM算法重建夹爪的6DoF位姿轨迹。视频一多,算力需求成倍膨胀。
• 相机标定——重度依赖算力。手持夹爪多用大广角鱼眼镜头,画面严重畸变且缺乏标定信息。需要先做鱼眼去畸变,再估计焦距与相机内外参,同样是逐帧处理的重计算任务。
• 动作分割——人工成本高、周期长。连续操作中,一个原子动作何时结束、下一个何时开始,难以人工界定。同时需要自动质检轨迹是否在机器人关节限位内,还要给每个片段配上自然语言指令(如"拿起杯子")。靠人工切分、校验与标注,成本高、周期长,根本无法规模化。
• 数据量极大——单机扛不住。数百小时视频叠加去畸变、SLAM位姿重建、VLM标注等多重处理,单机算力根本无法承载。而且链路长、任务耗时久,任何一个环节中断都可能让整批处理前功尽弃。
从这些难关指向四个工程诉求:能够按需扩缩、扛住高负载的数据处理框架;覆盖周期调度、批量重跑与手动触发等多场景的编排框架,调度整条数据产线;数据产线的每条数据、每个任务的血缘都需要可追溯;围绕 AI 全生命周期的训推平台,并与数据平台无缝衔接。
破局:跑在云上的 UMI Data+AI Pipeline
穹彻智能联合阿里云,基于 MaxCompute(MaxFrame)+ DataWorks + Hologres + PAI 构建端到端自动化 UMI 数据处理产线,将原本依赖人工、单机跑批、容易中断的流程,变成稳定运行、弹性扩展、全程自动的工业化生产线。

(穹彻智能 UMI Data+AI Pipeline 架构图)
MaxCompute MaxFrame 重构数据生产链路
MaxFrame 作为 MaxCompute 上的分布式 AI 计算引擎,为产线提供弹性算力与自定义镜像:数百小时视频的多重处理任务被拆分到分布式资源,GPU 承担 SLAM 位姿重建与 VLM 多模态推理,CPU 负责去畸变、切分、时间对齐、质检、动作计算与导出。SLAM、鱼眼去畸变、位姿重建等第三方模型以 DataFrame 算子形式分布式运行,无需为上云重写算法。
原生 AI Function 让产线直接在数据处理链路中调用 VLM、LLM、Embedding 等大模型。语义标注环节使用原生 QwenVL 为动作片段生成语言指令,无需自建推理服务,即可低成本完成大规模批量多模态推理。
每个处理阶段独立落表,支持断点续跑;单个视频片段失败只记录、不阻塞全局;通过 OSS 挂载、镜像预热与 GPU 显存复用,保障长时间大批量任务稳定运行。最终输出符合 LeRobot 标准的数据集:data/ 存放逐帧 state(10 维)与 action(10 维)Parquet,videos/ 存放原子动作 MP4,meta/ 以 JSONL 记录语言指令,可被 LeRobotDataset 直接加载并对接 pi0、GR00T、OpenVLA 等主流 VLA 模型。
DataWorks 统一调度编排
DataWorks 提供企业级智能调度能力:精细化周期调度支持分/时/日/周/月/年及自定义日历,支持多任务复用同一日历;一键式补数据支持历史回溯与重算,可选择独立容器资源组、按并发分组快速回刷;多元化触发支持 API/Webhook/消息中间件事件驱动及人工手动触发;异常修复支持自动重试、AI 诊断与基线延迟预警,保障数据按时产出。
Hologres 支撑 episode 元数据服务
MaxCompute MaxFrame 离线产出标准数据集后,Hologres 作为实时数仓承接 episode 元数据,为样本检索、标注/审核、训练数据管理、任务统计等业务系统提供统一在线入口。这一层聚焦在线数据服务:既要支撑高并发、低延迟的条件检索,又要让离线产线持续写入的新数据实时可见。
Hologres 的行列共存存储与实时写入能力,天然适合"高并发点查 + 持续写入"的一体负载,无需另建 KV 或搜索引擎。写入侧批量同步 episode 并按样本维度增量更新训练元信息;读取侧支持精确点查与多条件组合检索,跨多张元数据表灵活关联。读写统一省去在线库与分析库之间的数据搬迁,保证一致性与实时性。
PAI 加速模型迭代
PAI 将模型开发、分布式训练、性能调优与仿真验证几个环节衔接起来。LeRobot 数据集产出后,研发人员在 PAI-DSW 中挂载数据与自定义镜像完成调试与小规模验证;配置稳定后迁移至 PAI-DLC 开展多卡分布式训练;最终通过 PAI-EAS 加载模型、数据与评测配置,针对数据标注、轨迹质量、动作稳定性和场景泛化等维度验证。
针对 LingBot-VLA 训练链路,性能 Profile 显示热点集中在 Attention 计算。PAI-TurboX 结合实际计算图评估优化空间:FlashAttention 路径评估计算路径、QKV 布局及上下游算子;FlexAttention 路径启用自动调优,按输入形状选择更优 Kernel;针对动态 Attention Mask 分析重复编译及编译等待影响;结合数据预处理、序列打包、CPU 与 DataLoader 调度持续定位端到端等待与空转。收益通过同条件 A/B 测试确认,排除 Warm-up 与首次编译后比较稳态吞吐、Step Time、GPU 利用率、显存占用及训练指标一致性。
评测结果反馈至数据筛选、训练参数和模型结构调整,形成"数据生产—模型训练—性能调优—部署评测—结果反馈"的持续迭代闭环。
成果与展望
合作落地后,穹彻智能在多个维度获得实质改变:
• 数据处理全程"自动驾驶",吞吐提升 10 倍以上,全流程无人工干预 • 多模态标注实现大规模自动打标 • 弹性算力峰值扩展至 10 万+ CU,绕开本地 IDC 扩展瓶颈 • 模型训练效率提升约 50%
本次合作验证了具身智能"数据-模型"全链路可以自动化、规模化跑在云上。当数据不再是瓶颈,模型迭代持续提速,机器人的能力边界就有了新的想象空间。未来双方将继续深化在世界模型等前沿场景的联合创新,推动"具身智能,丰富现实世界"愿景落地。
关注阿里云Agent Native数据实战录,用数据实践驱动企业Agentic智能进化
了解本期方案详情(链接https://help.aliyun.com/zh/maxcompute/user-guide/maxframe-overview-1?spm=a2c4g.11186623.help-menu-27797.d_2_6_3_0.51e325fa9g29fc&scm=20140722.H_2592896._.OR_help-T_cn~zh-V_1)