InfiData 是一个面向社区共建的大规模机器人操作基础模型训练数据集项目。
我们的目标不是只发布一份数据,而是联合更多实验室团队,建立一套可持续演进的 Multi-Context 数据标准,让不同机器人平台、不同采集流程、不同任务场景的数据可以稳定整合、统一标注、持续复用。
我们希望把分散在各团队的机器人数据,逐步沉淀为一个可共享、可追溯、可扩展的数据底座,服务机器人基础模型训练与评测。
InfiData 的长期目标:
- 形成跨实验室可复用的数据标准和工具链。
- 支持从模仿学习到长时序规划的训练范式。
- 降低新团队数据接入成本,实现规模化共建。
- 让高质量上下文标注成为默认配置,而不是附加项。
InfiData 覆盖从真实世界数据采集、数据处理与治理,到 VLA 训练、评测和主动数据改进的完整闭环。
传统机器人数据通常只包含图像、状态和动作。InfiData 在此基础上标准化了更丰富的训练上下文:
- 任务语义:task 与 subtask。
- 未来目标:subgoal,例如 real_future 帧指针。
- 质量信号:quality、mistake、success。
- 机器人上下文:robot_type、control_mode、domain。
- 数据来源上下文:source_dataset 与相关元数据。
- 多视角对齐:统一视频路径与帧索引规则。
这使得数据可以同时支持:
- 动作策略学习。
- 分层策略与子任务建模。
- 失败恢复与鲁棒性训练。
- 世界模型与多模态语义对齐。
InfiData/
├── README.md
├── schemas/
│ ├── robot_episode.schema.json
│ ├── segment_annotation.schema.json
│ ├── human_video.schema.json
│ ├── web_multimodal.schema.json
│ └── subgoal.schema.json
├── configs/
│ ├── dataset_sources/
│ ├── robots/
│ └── tasks/
├── scripts/
│ ├── convert/
│ │ ├── convert_aloha_cosmos_mini.py
│ │ └── convert_droid_mini.py
│ ├── annotate/
│ ├── subgoals/
│ └── validate/
├── examples/
│ ├── aloha_mini/
│ └── droid_mini/
├── video2tasks/
└── tools/
目前仓库已经包含:
- 两个可运行转换示例:ALOHA mini、DROID mini。
- 统一 schema 与配置组织方式。
- 一个可用于自动分段与指令生成的 video2tasks 模块。
机器人数据以 episode 为基本单元,每个 episode 对应一个 parquet 文件,每行表示一个 timestep。
机器人 episode schema 定义在 schemas/robot_episode.schema.json。
最小必需字段:
- episode_index
- frame_index
- timestamp
- observation.state
- action
- task
- subtask
- robot_type
- control_mode
- quality
- speed_bin
- mistake
- success
- source_dataset
常用扩展字段:
- observation.qvel
- observation.effort
- action_relative
- video.cam_.path 与 video.cam_.frame_index
- subgoal.real_future.cam_.path 与 subgoal.real_future.cam_.frame_index
- domain
分段标注 schema 定义在 schemas/segment_annotation.schema.json,标准存储文件是 meta/segments.jsonl。
核心字段:
- episode_index
- segment_index
- start_frame
- end_frame
- task
- subtask
- annotation_status
可选字段:mistake、annotator、reviewer。
推荐标注状态流:
- auto_placeholder
- vlm_pseudo
- human_labeled
- reviewed
- approved
examples/aloha_mini:
- ALOHA-Cosmos-Policy 的最小转换示例。
- 每个 episode 一个 parquet。
- 包含 episodes、segments、tasks、robots、stats 元数据。
examples/droid_mini:
- DROID 的最小转换示例。
- 包含 3 个 episode parquet。
- 包含标准相机映射和 real_future 子目标帧指针。
- 当前 subtask 为自动占位分段,便于先打通流程。
video2tasks 可用于长视频自动分段与指令草稿生成,典型流程:
- 生成候选切分点。
- 生成片段级任务指令。
- 写回 segments.jsonl,状态为 vlm_pseudo。
- 人工复核后推进到 reviewed 或 approved。
参考文档:
- video2tasks/README.md
- video2tasks/README_CN.md
python -m venv .venv
source .venv/bin/activate
pip install -U pip
pip install numpy pandas pyarrow tqdm h5pypython scripts/convert/convert_aloha_cosmos_mini.py \
--aloha_root /path/to/ALOHA-Cosmos-Policy \
--out_root examples/aloha_mini \
--num_episodes 3python scripts/convert/convert_droid_mini.py \
--droid_root /path/to/DROID \
--out_root examples/droid_mini \
--num_episodes 3如果你希望团队数据接入 InfiData,建议按以下步骤进行:
- 对齐机器人定义:robot_type、control_mode、相机键命名。
- 提供 mini 样本:先提交 3 到 20 个 episode 验证格式。
- 明确字段映射:原始字段到 schema 字段逐项映射。
- 产出转换脚本:放到 scripts/convert 并附说明。
- 完成分段流程:自动分段、VLM 伪标、人工复核。
- 补齐元信息:来源、许可证、标注规则、已知限制。
为了保证跨团队合并训练的可用性,建议建立以下检查:
- 结构检查:schema 合法性与字段完整性。
- 时序检查:frame_index 连续性、segment 边界合法性。
- 语义检查:task/subtask 命名一致性。
- 统计检查:state/action 维度和数值分布可解释。
- 追溯检查:source_dataset、robot_type、domain 信息完整。
近期:
- 完善 scripts/validate 的自动校验能力。
- 完善 scripts/annotate 的半自动标注流程。
- 扩展更多公开数据源转换器。
中期:
- 建立跨实验室数据接入模板。
- 建立统一 benchmark 划分与版本管理。
- 发布更完整的标注指南与审核规范。
长期:
- 形成持续更新的大规模共建机器人数据社区。
- 支撑机器人基础模型训练与评测的通用数据底座。
欢迎高校、研究院、企业实验室、独立开发者参与共建。
优先欢迎的贡献:
- 新数据源转换脚本。
- 自动分段与标注优化。
- 质量校验工具。
- 高质量真实场景标注样例。
提交建议附带:
- 数据来源与许可证。
- 字段映射规则。
- 标注状态与审核流程。
- 已知限制与后续计划。
