Pillar 1 — 数据采集 & 处理 (Data Collection & Processing)¶
最终更新: 2026-09 · owner: Youngjin · volatility: 中(数据集版本·大小为高) 除非另有标注,各条目继承页面元数据(owner/updated/volatility)。按条目指定 owner 时在条目页脚补充。 ← 返回 index
L0 TL;DR: Physical AI 的瓶颈不是模型架构,而是机器人行为数据的量·多样性·质量。真实数据(遥操作2)昂贵又缓慢,开放数据集则是许可证的雷区,合成数据3到现在才成为实战管道。SA 的角色是为客户设计"从哪里获取数据,以及在 AWS 上用什么管道把它变成可训练的形态"。
本支柱中客户最常问的问题 Top 3¶
- "机器人学习数据去哪找?开放数据集直接用可以吗?" → 开放机器人数据集(⚠️ 先看许可证)
- "真实数据不足,能用合成数据来补吗?" → 合成数据生成、Cosmos WFM
- "我们机器人的遥操作/ROS bag9 数据怎么在 AWS 上做成训练管道?" → 数据管道参考架构、格式 & 转换
稳定原理(几乎不变): 机器人数据分为 (1) 遥操作/真实数据 —— 高质量·高成本·低多样性,(2) 合成/仿真数据 —— 低成本·高多样性·存在域间差异7,(3) 开放/网络数据 —— 用于预训练·注意许可证。实战配方几乎总是 "开放数据集预训练 → 合成数据增强 → 少量真实演示微调" 的三段混合。
graph LR
O["开放/网络数据<br>预训练"] --> LAKE[(S3 数据湖)]
SYN["合成/仿真<br>增强"] --> LAKE
TEL["遥操作/真实数据<br>微调"] --> LAKE
LAKE --> PIPE["转换 · 质检<br>Glue / Batch"]
PIPE --> TRAIN["训练管道<br>SageMaker / HyperPod"]
规模感 — 数据金字塔
[1]: 三层的代表性规模为 (1) 互联网图像·文本 ~58.5 亿 pair(LAION-5B),(2) 人类第一人称作业视频 3,670 小时(Ego4D — 931 人·74 个城市·9 个国家),(3) 机器人遥操作 ~100 万回合(episode)(OXE 合计;单一数据集如 DROID 为 76k)。各层单位不同(pair·小时·episode),只能作数量级比较 — 若放到同一坐标轴上,就会引用出根本不存在的比率。两个核心洞察:① 含有关节命令(joint command)的层只有最底层(遥操作) — 上面两层能给出物体知识·动作顺序,但绝对给不出 action。② 仿真不是这个金字塔的一层 — 它不是被采集而是被生成的,其规模不由"能雇人多少小时"决定,而由算力决定(→ pillar-3)。所以本支柱的实务问题归根结底是"能从上层榨取出多少最底层"。
1. 开放机器人数据集 🟢 GA¶
L0 TL;DR: VLA1 预训练的事实标准语料库。但由于每个数据集的许可证决定了能否商业分发,如果客户计划将模型权重商用发布,许可证审计就是第一步。
客户需求/问题: "没有从零收集数据的余力,想用公开的先起步。但这个用在商用产品上可以吗?"
解决方案概览 [1]:
- Open X-Embodiment (OXE) —— ~1M+ 回合(episode)4、22 个 embodiment5、整合了 60 余个数据集。OpenVLA·RT-2-X·π0·GR00T 的标准预训练语料库。⚠️ 许可证按组件不同(多为 CC-BY-4.0/Apache-2.0,部分为 research-only)→ 商用则必须按组件进行法务审计。
[1]arxiv 2310.08864 - DROID —— 76,000 条遥操作轨迹、350 小时、Franka。许可证 CC-BY-4.0(对商业友好)。微调阶段的标准。
[1]droid-dataset.github.io - AgiBot World —— ~1,003,672 条轨迹(~43.8TB),规模最大。⚠️ 许可证 CC BY-NC-SA 4.0 = 非商业。研究·基准测试可以,但不可分发商用衍生权重。
[1]arxiv 2503.06669 - RoboMIND —— 107k 条轨迹、4 个 embodiment、含 5k 失败演示(珍贵)。许可证需在 HF 上再次确认。
[1]arxiv 2412.13877
AWS 映射: S3(数据湖)+ FSx for Lustre(训练时无需下载的高速通道)+ SageMaker/HyperPod。数据集从 Hugging Face Hub 或原始来源镜像到 S3 后使用。
决策标准:
- 目标为商用产品 → 以 DROID / RoboMIND(确认许可证)为主,排除 AgiBot World,OXE 仅筛选可商用的组件。
- 研究·PoC·内部基准测试 → 可全部使用(含 AgiBot World)。
- 若与特定 embodiment(自家机器人)形态不同,则仅用于预训练,前提是用真实演示微调。
graph TD
Q{商业部署计划?} -- 是 --> C{数据集许可证}
Q -- 研究 · PoC · 基准测试 --> ALL["全部可用<br>含 AgiBot World"]
C -- CC-BY-4.0 --> DROID["DROID 🟢<br>对商业友好"]
C -- 按组件混合 --> OXE["OXE ⚪<br>仅筛选可商用组件"]
C -- CC BY-NC-SA 4.0 --> AGI["AgiBot World ⛔<br>不可商业分发"]
客户案例: 案例待定(未确认韩国公开案例 —— 目前多数韩国机器人企业为 NVIDIA 阵营)。
➡️ 后续行动: 若客户有商用计划,则 ① 确认目标 embodiment → ② 提供数据集许可证审计表(按 OXE 组件)→ ③ 提议"S3 镜像 + FSx Lustre 训练通道"PoC。仅在首次会议就点出许可证风险,即可建立信任。
🔗 相关资产: (内部数据集许可证审计模板 —— 需编写 ⚠️)
🔄 易变数据(版本·大小 —— 更新对象)
| 数据集 | 规模 | 许可证 | 可商用 | 确认日 |
|---|---|---|---|---|
| OXE | ~1M+ ep, 22 embodiment | 按组件混合 | 部分(需审计) | 2026-07 |
| DROID | 76,000 轨迹, 350h | CC-BY-4.0 | ✅ | 2026-07 |
| AgiBot World | ~1.0M 轨迹, 43.8TB | CC BY-NC-SA 4.0 | ❌ 非商业 | 2026-07 |
| RoboMIND | 107k 轨迹, 失败 5k | 需 HF 确认 | ⚠️ 未确认 | 2026-07 |
注意: 部分聚合方将 DROID 标为"92,233 ep/Apache-2.0",但这被推测为 LeRobot-v3 重新打包,官方为 76k/CC-BY-4.0。引用时使用官方数值。
2. 合成数据生成 — Isaac Sim SDG + Replicator 🟢 GA¶
L0 TL;DR: 在真实数据不足的感知(perception)·操作任务中,用仿真器大量生成连标注都自动附好的训练数据。NVIDIA Isaac Sim 5.x 已 GA 且开源,进入门槛低。
客户需求/问题: "我们工厂/仓库环境的数据几乎没有。标注成本也承受不起。能用仿真生成吗?"
解决方案概览 [1]: 用 Isaac Sim 的 Replicator 以域随机化6(光照·纹理·姿态·相机)为基础,通过编程方式(Replicator Functional API)生成合成图像/分割/边界框。Isaac Sim 5.0 GA(2025-08 SIGGRAPH)、开源(GitHub)、5.1 GA,6.0 为 GTC'26 早期开发者版本(2026-03/06)。[1] developer.nvidia.com, github.com/isaac-sim
- 基于 WFM 的数据增幅 — GR00T-Dreams/DreamGen
[1]/[3]: 从少量真实演示生成"dream"轨迹以增幅训练数据的路径。NVIDIA 宣称将 GR00T N1→N1.5 更新所需的数据获取从人工遥操作约 3 个月 → 约 36 小时(DreamGen, arXiv:2505.12705)。⚠️ 时间缩短数值为厂商自报 — 仅作方向性指标引用。
AWS 映射: 在 EC2 G6e(L40S)·G7e(RTX PRO 6000 Blackwell) GPU 实例上运行 Isaac Sim + 用 AWS Batch 并行化大规模离线数据生成作业 + 存入 S3。用 NICE DCV 进行远程流传输(→ 参见 pillar-3)。
决策标准:
- 感知任务(检测·分割·姿态估计)→ 合成数据 ROI 极高(标注免费)。
- 操作策略(manipulation policy) → 仅靠合成域间差异大。务必并行真实演示微调 + sim-to-real 方法论(→ pillar-4)。
- Isaac Sim vs 开源(Genesis/MuJoCo)的选择 → decisions。
客户案例: 案例待定(未确认韩国明确案例)。
➡️ 后续行动: 提议"EC2 G6e/G7e + AWS Batch 的 Isaac Sim SDG 管道"研讨会。若客户有实际环境的 CAD/USD 资产,可用 1 天 PoC 演示合成数据集样本生成。
🔗 相关资产:
- Playbook: pillar-3 仿真
- (内部 Isaac-on-AWS 研讨会 deck —— 需确认 ⚠️)
- VAMS — Visual Asset Management System —— awslabs。集中管理 USD 场景·点云·CAD 等视觉资产(版本·血缘·查看器),用于仿真环境与训练数据管理。CDK 无服务器,near-production-grade
3. NVIDIA Cosmos World Foundation Models 🟢 GA(开放模型 · AWS 为自托管算力)¶
L0 TL;DR: 预测·生成物理世界的基础模型8,用来制作仿真资产·未来帧·行为仿真以做数据增强。因为是开放权重,可在 AWS 算力(EKS/Batch/G7e)上自托管 —— 但 ⚠️ AWS 并非 NVIDIA 指定的 Cosmos 托管主机(→ pillar-3)。"用世界模型生成的数据来训练可实际部署的策略"也仍处于早期采用者阶段。
客户需求/问题: "无法逐一制作仿真器场景。想自动生成多样的现实场景。"
解决方案概览 [1]/[3]: Cosmos WFM 提供合成世界生成 + 视觉推理 + 行为仿真。Cosmos 3 为最新(2026-05-31 发布,GTC Taipei 2026-06 公布)。FieldAI·Skild AI·Generalist AI 等用于数据生成。[1] nvidianews.nvidia.com
- ⚠️ Hype 警戒: "令人印象深刻的生成演示"与"用该数据训练的策略已实际部署"是两回事。后者目前仅有少数早期采用者案例 → 实战成熟度按 Preview 级别对待。
AWS 映射 [3]: 自托管参考架构 —— 客户自行在 Amazon EKS(实时)或 AWS Batch(大规模离线合成数据生成)上运行 Cosmos NIM 容器。GA 的是 AWS 算力服务(EKS/Batch/G7e),而非"Cosmos-on-AWS 产品"。[3] aws.amazon.com/blogs/hpc/running-nvidia-cosmos-world-foundation-models-on-aws
决策标准:
- 需要大量多样性的感知·导航数据 → 值得尝试。
- 将其作为精密操作策略的唯一数据源 → 仍有风险。定位为辅助增强。
客户案例: NAVER Labs —— 用街景·空间数据构建 "Seoul World Model" 时使用 Cosmos(2026-06 与 NVIDIA 签约)。⚠️ NVIDIA 阵营(非 AWS) [3]。Doosan Robotics —— 在 Agentic Robot OS 中整合 Cosmos(NVIDIA 阵营)[3]。
➡️ 后续行动: 韩国机器人客户对 Cosmos 感兴趣 → 以"因为是开放权重,可在 AWS EKS/Batch/G7e 上自托管"的角度提议(把 NVIDIA 阵营客户引导到 AWS 算力)。要诚实地并列说明它并非托管主机、且实战训练验证尚处早期阶段。
🔗 相关资产: pillar-2 模型训练 · pillar-3 仿真
4. 机器人学习数据管道参考架构 🟢 GA¶
L0 TL;DR: 采集(遥操作/传感器/ROS bag)→ S3 湖 → 转换·质检 → FSx Lustre 训练通道 → HyperPod 训练 → 验证。各服务全部 GA,但面向机械臂操作机器人的端到端公开案例尚不存在(诚实的空白地带)。
客户需求/问题: "我们收集的原始数据(机器人日志、相机、ROS bag)只是堆在 S3 里。想让它流动成可训练的形态。"
解决方案概览 [1]:
- 采集/存储: S3(原始数据湖,用分层管理成本)
- 转换/标注: AWS Glue/Batch(格式转换·质量过滤),必要时 SageMaker Ground Truth(标注 —— 但无机器人专用公开案例)
- 训练通道: 将 FSx for Lustre 挂载为 SageMaker 训练通道 → 无需下载即可高速 read
- 训练: SageMaker HyperPod(→ pillar-2)
graph LR
SRC["遥操作 · 传感器<br>ROS bag"] --> S3[(S3 数据湖)]
S3 --> CONV["转换 · 质检<br>Glue / Batch"]
CONV --> FSX["FSx for Lustre<br>训练通道"]
FSX --> HP["SageMaker HyperPod<br>训练"]
HP --> VAL["验证"]
各服务在管道中实际提供的能力 [1](docs 2026-07 核实):
| 服务 | 技术要点 | 机器人数据视角 |
|---|---|---|
| S3 | 近乎无限扩展的对象存储 + 存储类别分层(不常读的原始数据移入低成本层) | 原样堆放遥操作原始数据·ROS bag 的落地区 |
| FSx for Lustre | 通过 DRA(data repository association)与 S3 关联的并行文件系统 —— 训练任务无需先从 S3 下载即可像文件系统一样高速随机访问,减少重复轮次的 S3 请求费用 | 消除大规模回合洗牌·反复读取的瓶颈 |
| Glue | 无服务器 ETL11 —— 爬虫解析 schema,作业执行格式转换·质量过滤 | 部署 rosbag→LeRobot/RLDS 自定义转换器的位置(第 5 节) |
| Batch | 容器批处理作业的排队·调度,多节点并行(MNP)·GPU 作业,可联动 FSx | 数千回合转换·合成数据生成的大规模并行化 |
| Ground Truth | 人在回路的标注人力·工作流 | 机器人数据大多自动标注 —— 用于成功/失败复核等辅助场景 |
| HyperPod | → 参见 pillar-2 的训练栈表格 | 这条管道的最终消费者 |
AWS 映射: S3 · FSx for Lustre · Glue · Batch · SageMaker Ground Truth · HyperPod。(全部 GA)
决策标准:
- 数据集 < 数 TB、访问模式简单 → S3 直接流式(HyperPod/LeRobot streaming)即够,可省略 FSx。
- 反复 epoch·大规模·随机访问瓶颈 → 引入 FSx for Lustre。
- 标注量大且需人工检查 → Ground Truth。但机器人数据大多为自动标注(仿真/遥操作记录),必要性低。
客户案例: Zoox —— 用 SageMaker HyperPod 训练多模态 AV 基础模型,在 64+ GPU 上达 95% 利用率 [1]/[3]。⚠️ 是自动驾驶(AV)而非机械臂操作机器人 —— 仅作为参考架构依据使用,禁止夸大为机械臂操作案例。
➡️ 后续行动: 在白板上为客户画出参考架构图(S3→FSx→HyperPod),用客户的数据规模·访问模式判断是否需要 FSx。若源头为 ROS bag,则与下面第 5 项(转换缺口)关联。
🔗 相关资产: pillar-2 模型训练 · decisions: GPU 获取策略
5. 数据格式 & 转换 — LeRobot v3 / RLDS 🟢 GA¶
L0 TL;DR: 机器人数据的两种主导格式10是 RLDS(基于 TFDS,VLA 训练管道原生消费)与 LeRobotDataset v3(Parquet+MP4,HF 生态互换标准)。ROS 2 bag → 训练格式的转换没有标准工具,需要定制,而这正是 AWS 管道的机会。
客户需求/问题: "我们的数据是 ROS 2 bag,但 VLA 训练代码要 RLDS/LeRobot。怎么转换?"
解决方案概览 [1]:
- LeRobotDataset v3.0 —— 将多个回合打包进单个 Parquet,用 MP4 视频 + 元数据管理边界,Hub 原生流式。
lerobot >= 0.4.0,最新为 v0.6.0(2026-07-06)。NVIDIA 也正将数据集以 LeRobot v3 重新分发(互换标准化推进中)。[1]github.com/huggingface/lerobot - RLDS —— OpenVLA·RT-2-X·π0·GR00T 原生消费。仍是 VLA 训练标准。
- ⚠️ 缺口: lerobot 仓库中没有原生 ROS 2 bag 转换器。rosbag2 → LeRobot/RLDS 的大规模转换要 DIY。
AWS 映射: 将定制的 rosbag2→LeRobot/RLDS 转换器以容器形式放到 AWS Glue/Batch 上做大规模并行转换 + 存入 S3。HyperPod/训练阶段用 S3 流式或 FSx。
决策标准:
- 训练框架为 LeRobot 系 → LeRobotDataset v3。
- OpenVLA/GR00T/π 系官方配方 → RLDS。
- 源头为 ROS 2 bag → 在管道初期就设计转换作业(事后追加成本大)。
客户案例: 案例待定。
➡️ 后续行动: 若客户数据为 ROS bag,则提议在管道设计第 1 天就纳入"基于 Glue/Batch 的 rosbag2→LeRobot 转换作业"(SA 主动点出即可获得极大信任)。应将可复用的转换器沉淀为内部资产。
🔗 相关资产: (内部 rosbag2 转换器 —— 新开发机会 ⚠️)
6. 遥操作数据采集管道 🟡 Preview(开放 HW 为 🔵 Research-only)¶
L0 TL;DR: 高质量真实演示的源头。开放遥操作硬件(ALOHA/GELLO)处于研究·DIY 阶段,而实战大规模遥操作是人形机器人企业的非公开数据工厂。SA 要处理的点不是硬件,而是把遥操作流采集·存储·净化到 AWS 的管道。
客户需求/问题: "想把人远程操控机器人收集的演示实时采集·存储并送入训练队列。"
解决方案概览 [1]/[4]:
- 开放 HW: ALOHA/Mobile ALOHA(双臂低价遥操作)、GELLO(<$300 主导臂,MIT 许可证)—— 在实验室被广泛复制但无商用产品 SKU,Research-only。
[1] - 实战: Figure·1X·Physical Intelligence·Tesla 运营 VR 装置遥操作场(每天数小时)。⚠️ 证据仅为媒体·演示级别,无公开管道
[4]。 - SA 焦点: 遥操作遥测流 → S3 采集 → 自动标注(成功/失败、任务标签)→ 制作成训练数据集。
AWS 映射: IoT Core/Kinesis(流采集)→ S3 → Glue(净化·标注)→ [第 5 项格式转换] → 训练。(边缘连接见 pillar-4)
决策标准:
- 目标为少量·高质量演示(微调)→ 遥操作投资价值高。
- 目标为大量多样性(预训练)→ 合成/开放数据更具成本效益。遥操作仅限用于最后的微调。
客户案例: 案例待定(缺乏公开管道)。
➡️ 后续行动: 若客户正在收集遥操作数据,则为其标准化"采集流 → S3 → 自动标注 → 训练队列"管道。谨慎推荐开放 HW 本身(明确标注 research-only)。
🔗 相关资产:
- Playbook: pillar-4 边缘部署 · radar: ALOHA/GELLO
- LeRobot 遥操作数据采集 on Greengrass 示例 —— aws-samples。以 Greengrass v2 自定义组件将 SO-ARM101(Leader/Follower)+ 双摄像头遥操作按 LeRobot v3 格式记录→自动上传 S3。可在 Web 控制台通过 MQTT 远程控制 + KVS 直播(WebRTC/HLS)·回合(episode)回放,已在 Jetson AGX Thor 上验证。"采集→S3"标准化演示的首选候选。⚠️ README 明示仅供教学·演示 —— 禁止用于生产环境(MIT-0)
- Android PAI 数据采集应用 —— aws-samples。现场智能手机视频+IMU→S3 离线队列上传。⚠️ 早期示例
本支柱的诚实现实(SA 必读)¶
- AWS 机械臂操作机器人数据管道没有公开的端到端案例。 实际依据只有 (a) Cosmos 自托管 on EKS/Batch(参考架构)、(b) Zoox HyperPod(AV)、(c) Agility on EC2 G7e。机械臂操作的 S3/Glue/Ground Truth/FSx 管道是设计模式/机会,而非经过验证的部署 —— 不要对客户说得好像已经存在。
- 韩国机器人领军者(NAVER、Doosan)目前为 NVIDIA 阵营。 这既是威胁也是机会 —— AWS 定位为"运行 Cosmos/Isaac 的最佳算力·数据平台"才是诚实且有胜算的角度。
- 许可证是首要风险。 仅点出 AgiBot World(规模最大)为非商业这一事实,就能赢得客户信任。
owner: Youngjin · updated: 2026-09 · volatility: 中(数据集版本·大小在折叠块中为高)· sources: [1] 官方/论文, [3] 厂商博客, [4] 未经验证
-
VLA (Vision-Language-Action) — 以相机图像(Vision)与自然语言指令(Language)为输入、直接输出机器人动作(Action)的基础模型。对它说"把杯子拿起来",它就会生成关节运动。🎥 NVIDIA Isaac GR00T N1 介绍 ↩
-
遥操作(teleoperation) — 由人通过 VR 控制器·主导臂等远程操控机器人并记录示范动作的数据采集方式。质量最高,但人的时间会直接变成成本。🎥 Stanford Mobile ALOHA 遥操作演示 ↩
-
合成数据生成(SDG, Synthetic Data Generation) — 用仿真器自动生成训练图像与标注(标签)的技术。最大优点是标注成本趋近于零。🎥 Isaac Sim Replicator SDG 教程 ↩
-
回合(episode)/轨迹(trajectory) — 机器人从开始到结束执行一个任务的一次完整记录。它是观测(相机·传感器)与动作(关节命令)的时间序列组合,是机器人学习数据的基本单位。 ↩
-
embodiment(具身形态) — 机器人的物理形态·自由度·传感器配置。即使模型相同,机械臂与人形机器人的 embodiment 不同,数据·策略无法直接移植。 ↩
-
域随机化(Domain Randomization) — 随机改变仿真的光照·纹理·物体位置·相机角度·物理参数来生成数据或进行训练的技法。让模型学到在任何环境下都通用的特征 — 缩小 sim-to-real 差距的代表性处方。 ↩
-
域间差异(domain gap) — 由于仿真与现实的差异(物理·视觉),在仿真中表现良好的模型在实物上性能下降的现象。处理这一差距的方法论是 pillar-4 的 sim-to-real。 ↩
-
世界基础模型(WFM, World Foundation Model) — 为预测·生成物理世界的下一场景而训练的大型模型。通过文本·视频提示生成物理上合理的视频·场景,用于增强机器人学习数据。🎥 NVIDIA Cosmos 介绍 ↩
-
ROS bag(rosbag2) — 机器人操作系统 ROS 2 将话题(传感器·命令流)整体录制的标准日志格式。它是机器人公司原始数据的事实默认形态,但无法直接用于训练,需要转换。 ↩
-
RLDS / LeRobotDataset — 机器人学习数据的两大存储格式。RLDS 基于 TensorFlow Datasets,主要 VLA 训练代码可直接读取;LeRobotDataset(v3)是基于 Parquet+MP4 的 Hugging Face 生态标准。 ↩
-
ETL(Extract-Transform-Load) — 提取源数据并转换·加载为可训练·可分析形态的数据处理模式。在机器人管道中,"ROS bag → 训练格式转换 + 质量过滤"就是 ETL。 ↩