数据集

Egocentric-100K

builddotai/Egocentric-100K

查看上游原文 ↗
上游访问:需要申请 本站服务:可咨询 内容检查:AI 辅助整理并检查 许可证:apache-2.0 上游版本:fae604b751b2

中文简介

builddotai/Egocentric-100K 是 builddotai 在 Hugging Face 发布的数据集仓库,当前卡片主要关联机器人任务。本站固定记录上游版本 fae604b751b2,同步到 44197 个文件,文件元数据合计 23.21 TB;访问状态为“需要申请”,许可证字段为“apache-2.0”。

UPSTREAM README

上游模型卡 / 数据集卡

在 Hugging Face 查看原文 ↗

【README 卡片中文译介】

以下内容依据上游仓库 builddotai/Egocentric-100K 的固定版本 README、卡片字段和文件元数据进行中文结构化整理。它保留便于选型的关键信息,完整技术细节、代码示例和许可文本请同时查看上游原文。

【资源概览】
builddotai/Egocentric-100K 是 builddotai 在 Hugging Face 发布的数据集仓库,当前卡片主要关联机器人任务。本站固定记录上游版本 fae604b751b2,同步到 44197 个文件,文件元数据合计 23.21 TB;访问状态为“需要申请”,许可证字段为“apache-2.0”。

【适用方向】
适合评估具身智能、机器人学习、自动驾驶或强化学习研究流程。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。

【版本与规格】
固定版本:fae604b751b2。 任务标签:机器人任务。 数据集卡名称:Egocentric-100K。 上游页面记录的最近更新时间:2026-02-16。

【文件信息】
上游 API 返回 44197 个文件,文件元数据合计 23.21 TB。 已保存文件清单中的主要扩展名:.tar 72 个、.json 27 个、无扩展名 1 个。 当前较大的文件包括:factory001/worker011/part028.tar(1.00 GB);factory001/worker013/part033.tar(1023.94 MB);factory001/worker015/part040.tar(1023.76 MB)。 仓库文件较多,本站仅保存前 100 条文件元数据;完整清单请查看上游仓库。

【运行或处理环境】
仓库文件元数据合计 23.21 TB。仅按下载、解压和临时文件估算,建议至少预留约 27.85 TB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。

【使用边界】
许可证显示为“apache-2.0”,具体用途限制、附加政策和归属要求仍以上游原文为准。 该仓库需要由用户本人按上游要求申请访问,是否批准及何时批准由资源权利方决定。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。

已有简体中文译文 · Codex 基于固定版本 README 与上游元数据生成中文结构化译介 · 2026-07-26 00:51

Egocentric-100K is the largest dataset of manual labor. You can visualize the dataset here. Egocentric-100K is state-of-the-art in hand visibility and active manipulation density compared to previous in-the-wild egocentric datasets. The complete 30,000 frame evaluation set is available at Egocentric-100K-Evaluation. Dataset Statistics Attribute Value Total Hours 100,405 Total Frames 10.8 billion Video Clips 2,010,759 Median Clip Length 180.0 seconds Mean Hours per Worker 7.06 Storage Size 24.79 TB Format H.265/MP4 Resolution 256p (456x256) Frame Rate 30 fps Camera Type Monocular head-mounted fisheye Audio No Device Build AI Gen 1 Camera Intrinsics Each worker folder contains an intrinsics.json file with calibrated camera parameters for that worker's device. The intrinsics use the OpenCV fisheye model (Kannala-Brandt equidistant projection) with 4 distortion coefficients (k1-k4). All values are scaled appropriately for the 456x256 resolution. Example intrinsics.json: { "model": "fisheye", "image_width": 456, "image_height": 256, "fx": 137.98, "fy": 138.23, "cx": 232.17, "cy": 125.37, "k1": 0.3948, "k2": 0.1798, "k3": -0.2753, "k4": 0.0793 } Dataset Structure Egocentric-100K is structured in WebDataset format: builddotai/Egocentric-100K/ ├── factory001/ │ ├── worker001/ │ │ ├── intrinsics.json # Camera intrinsics for this worker │ │ ├── part000.tar # Shard 0 (≤1GB) │ │ └── part001.tar # Shard 1 (if needed) │ ├── worker002/ │ │ ├── intrinsics.json │ │ └── part000.tar │ └── ... │ ├── factory002/ │ ├── worker001/ │ │ ├── intrinsics.json │ │ └── part000.tar │ └── ... │ └── ... Each TAR file contains pairs of video and metadata files: part000.tar ├── factory001_worker001_00001.mp4 # Video 1 ├── factory001_worker001_00001.json # Metadata for video 1 ├── factory001_worker001_00002.mp4 # Video 2 ├── factory001_worker001_00002.json # Metadata for video 2 └── ... # Additional video/metadata pairs Each JSON metadata file has the following fields: { "factory_id": "factory_002", "

公开页仅展示原文摘录;完整模型卡或数据集卡请前往上游仓库查看。

适用场景

适合评估具身智能、机器人学习、自动驾驶或强化学习研究流程。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。

规模与格式

固定版本:fae604b751b2。 任务标签:机器人任务。 数据集卡名称:Egocentric-100K。 上游页面记录的最近更新时间:2026-02-16。

文件说明

上游 API 返回 44197 个文件,文件元数据合计 23.21 TB。 已保存文件清单中的主要扩展名:.tar 72 个、.json 27 个、无扩展名 1 个。 当前较大的文件包括:factory001/worker011/part028.tar(1.00 GB);factory001/worker013/part033.tar(1023.94 MB);factory001/worker015/part040.tar(1023.76 MB)。 仓库文件较多,本站仅保存前 100 条文件元数据;完整清单请查看上游仓库。

上游文件元数据

  • .gitattributes2.40 KB
  • factory001/worker001/intrinsics.json292 B
  • factory001/worker001/part000.tar1015.21 MB
  • factory001/worker001/part001.tar1014.75 MB
  • factory001/worker001/part002.tar481.05 MB
  • factory001/worker002/intrinsics.json292 B
  • factory001/worker002/part003.tar1015.33 MB
  • factory001/worker002/part004.tar1017.29 MB
  • factory001/worker002/part005.tar267.49 MB
  • factory001/worker003/intrinsics.json292 B
  • factory001/worker003/part006.tar1013.31 MB
  • factory001/worker003/part007.tar1017.03 MB

硬件建议

仓库文件元数据合计 23.21 TB。仅按下载、解压和临时文件估算,建议至少预留约 27.85 TB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。

注意事项

许可证显示为“apache-2.0”,具体用途限制、附加政策和归属要求仍以上游原文为准。 该仓库需要由用户本人按上游要求申请访问,是否批准及何时批准由资源权利方决定。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。

获取、校验与交付

咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。

第三方资源声明

本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。