数据集

PLM-Image-Auto

facebook/PLM-Image-Auto

查看上游原文 ↗
上游访问:公开 本站服务:可咨询 内容检查:AI 辅助整理并检查 许可证:llama3.2 上游版本:0d00690c035b

中文简介

facebook/PLM-Image-Auto 是 facebook 在 Hugging Face 发布的数据集仓库,当前卡片主要关联图文理解与多模态生成、文本生成与推理。本站固定记录上游版本 0d00690c035b,同步到 34 个文件,文件元数据合计 27.39 GB;访问状态为“公开”,许可证字段为“llama3.2”。

UPSTREAM README

上游模型卡 / 数据集卡

在 Hugging Face 查看原文 ↗

【README 卡片中文译介】

以下内容依据上游仓库 facebook/PLM-Image-Auto 的固定版本 README、卡片字段和文件元数据进行中文结构化整理。它保留便于选型的关键信息,完整技术细节、代码示例和许可文本请同时查看上游原文。

【资源概览】
facebook/PLM-Image-Auto 是 facebook 在 Hugging Face 发布的数据集仓库,当前卡片主要关联图文理解与多模态生成、文本生成与推理。本站固定记录上游版本 0d00690c035b,同步到 34 个文件,文件元数据合计 27.39 GB;访问状态为“公开”,许可证字段为“llama3.2”。

【适用方向】
适合评估图文理解、视觉问答、文档或场景解析等多模态任务。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。

【版本与规格】
固定版本:0d00690c035b。 任务标签:图文理解与多模态生成、文本生成与推理。 语言字段:en。 规模分类:1K<n<10K, 10K<n<100K, 100K<n<1M, 1M<n<10M, 10M<n<100M。 上游页面记录的最近更新时间:2025-04-21。

【文件信息】
上游 API 返回 34 个文件,文件元数据合计 27.39 GB。 已保存文件清单中的主要扩展名:.parquet 32 个、.md 1 个、无扩展名 1 个。 当前较大的文件包括:obj365/train-00000-of-00001.parquet(1.25 GB);arxivqa/train-00000-of-00001.parquet(1.16 GB);sa1b/train-00002-of-00004.parquet(902.29 MB)。

【运行或处理环境】
仓库文件元数据合计 27.39 GB。仅按下载、解压和临时文件估算,建议至少预留约 32.86 GB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。

【使用边界】
许可证显示为“llama3.2”,具体用途限制、附加政策和归属要求仍以上游原文为准。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。

已有简体中文译文 · Codex 基于固定版本 README 与上游元数据生成中文结构化译介 · 2026-07-26 00:51

Dataset Card for PLM-Image Auto [\[📃 Tech Report\]](https://arxiv.org/abs/2504.13180) [\[📂 Github\]](https://github.com/facebookresearch/perception_models/) Sythetic image captions and QAs used in PLM, please refer to the paper, Section 3, for more details. The sythetic annotations covers: SA1B, Openimages, Obejct365, ArxivQA, UCSF, PDFAcc. Dataset Structure Image Captions (SA1B, Openimages, Obejct365) Data fields are : `image_id`: a `string` feature, unique identifier for the image. `image`: a `string` feature, the actual image path in the correspoding data folder. `conversations`: a `list` of `dict` feature, with the actual prompt and caption used to train PLM. A sample from SA1B Captions looks as follows: Image Captions and QA (ArxivQA) Data fields are : `uuid`: a `string` feature, unique identifier for the sample. `image`: a `string` feature, the actual image path in the correspoding data folder. For instance `2004.07107/figure_0_0.jpg` represent the paper id `2004.07107`, Page 0, and Figure 0. `conversations`: a `list` of `dict` feature, with the actual conversation used to train PLM. A sample from SA1B Captions looks as follows: Document QA (UCSF, PDFAcc) Data fields are : `uuid`: a `string` feature, unique identifier for the sample. `image`: a `string` feature, the actual image path in the correspoding data folder. For instance `pdfa-eng-train-0045/3018390_0.jpg` represent the paper shard `pdfa-eng-train-0045`, Document 3018390, and Page 0. `conversations`: a `list` of `dict` feature, with the actual conversation used to train PLM. A sample from SA1B Captions looks as follows: Data Stats | | Sample | Type | | ----------- | ----------- | ----------- | | sa1b | 9360168 | Captions | | obj365 | 3439046 | MCQAs | | openimages | 1740864 | Captions | | arxivqa | 1859680 | Captions+ QAs | | pdfacc | 12024670 | QAs | | ucsf | 5953490 | QAs | Licensing Information This data is an output from Llama 3.2, and subject to the Llama 3.2 license (https://github.com/meta-llama

公开页仅展示原文摘录;完整模型卡或数据集卡请前往上游仓库查看。

适用场景

适合评估图文理解、视觉问答、文档或场景解析等多模态任务。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。

规模与格式

固定版本:0d00690c035b。 任务标签:图文理解与多模态生成、文本生成与推理。 语言字段:en。 规模分类:1K<n<10K, 10K<n<100K, 100K<n<1M, 1M<n<10M, 10M<n<100M。 上游页面记录的最近更新时间:2025-04-21。

文件说明

上游 API 返回 34 个文件,文件元数据合计 27.39 GB。 已保存文件清单中的主要扩展名:.parquet 32 个、.md 1 个、无扩展名 1 个。 当前较大的文件包括:obj365/train-00000-of-00001.parquet(1.25 GB);arxivqa/train-00000-of-00001.parquet(1.16 GB);sa1b/train-00002-of-00004.parquet(902.29 MB)。

上游文件元数据

  • .gitattributes2.45 KB
  • arxivqa/train-00000-of-00001.parquet1.16 GB
  • obj365/train-00000-of-00001.parquet1.25 GB
  • openimages/train-00000-of-00001.parquet665.55 MB
  • pdfacc/train-00000-of-00016.parquet403.89 MB
  • pdfacc/train-00001-of-00016.parquet403.99 MB
  • pdfacc/train-00002-of-00016.parquet404.09 MB
  • pdfacc/train-00003-of-00016.parquet404.14 MB
  • pdfacc/train-00004-of-00016.parquet403.88 MB
  • pdfacc/train-00005-of-00016.parquet403.92 MB
  • pdfacc/train-00006-of-00016.parquet403.97 MB
  • pdfacc/train-00007-of-00016.parquet403.97 MB

硬件建议

仓库文件元数据合计 27.39 GB。仅按下载、解压和临时文件估算,建议至少预留约 32.86 GB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。

注意事项

许可证显示为“llama3.2”,具体用途限制、附加政策和归属要求仍以上游原文为准。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。

获取、校验与交付

咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。

第三方资源声明

本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。