中文简介
Salesforce/grounding_dataset 是 Salesforce 在 Hugging Face 发布的数据集仓库,当前卡片主要关联图文理解与多模态生成。本站固定记录上游版本 0bf2eb717343,同步到 77 个文件,文件元数据合计 32.31 GB;访问状态为“公开”,许可证字段为“上游卡片未声明”。
上游模型卡 / 数据集卡
【README 卡片中文译介】
以下内容依据上游仓库 Salesforce/grounding_dataset 的固定版本 README、卡片字段和文件元数据进行中文结构化整理。它保留便于选型的关键信息,完整技术细节、代码示例和许可文本请同时查看上游原文。
【资源概览】
Salesforce/grounding_dataset 是 Salesforce 在 Hugging Face 发布的数据集仓库,当前卡片主要关联图文理解与多模态生成。本站固定记录上游版本 0bf2eb717343,同步到 77 个文件,文件元数据合计 32.31 GB;访问状态为“公开”,许可证字段为“上游卡片未声明”。
【适用方向】
适合评估图文理解、视觉问答、文档或场景解析等多模态任务。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。
【版本与规格】
固定版本:0bf2eb717343。 任务标签:图文理解与多模态生成。 语言字段:en。 规模分类:10K<n<100K。 上游页面记录的最近更新时间:2025-10-03。
【文件信息】
上游 API 返回 77 个文件,文件元数据合计 32.31 GB。 已保存文件清单中的主要扩展名:.parquet 75 个、.md 1 个、无扩展名 1 个。 当前较大的文件包括:data/train-00050-of-00075.parquet(686.80 MB);data/train-00049-of-00075.parquet(635.60 MB);data/train-00061-of-00075.parquet(625.62 MB)。
【运行或处理环境】
仓库文件元数据合计 32.31 GB。仅按下载、解压和临时文件估算,建议至少预留约 38.78 GB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。
【使用边界】
上游卡片没有提供明确许可证字段,下载、训练、商用或再分发前必须打开原始仓库确认授权条件。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。
Grounding Dataset A comprehensive, high-quality dataset for GUI element grounding tasks, curated from multiple authoritative sources to provide diverse, well-annotated interface interactions. Overview This dataset combines and standardizes annotations from five major GUI interaction datasets: **Aria-UI** **OmniAct** **Widget Caption** **UI-Vision** **OS-Atlas** Dataset Schema Each sample contains the following fields: | Field | Type | Description | Example | |-------|------|-------------|---------| | `dataset` | string | Source dataset identifier | "ariaui", "omniact", "widget_caption", "ui_vision", "os_altas" | | `uuid` | string | Unique sample identifier | "0ce7f27b-0d76-4276-a624-39fc1836b46e" | | `image` | PIL.Image | Screenshot/interface image | RGB image object | | `bbox` | list[int] | Bounding box coordinates [x1, y1, x2, y2] | [33, 75, 534, 132] | | `instruction` | string | Action-focused instruction | "Tap the Search Maps field" | | `description` | string | Visual element description | "Dark gray, rounded search bar with magnifying glass icon" | | `function` | string | Functional purpose | "Use this input field to find a specific location" | | `combine` | string | Comprehensive instruction | "At the top of the left sidebar, tap the dark gray search bar..." | | `org_caption` | string | Original caption from source | "search maps" | Dataset Characteristics Domain Coverage **Desktop Applications**: Native desktop software interfaces **Web Interfaces**: Browser-based applications and websites **Mobile Interfaces**: Touch-based mobile applications **Operating Systems**: System-level interface interactions Applications This dataset supports research and development in: Model Training **Vision-Language Models**: Training models to understand GUI screenshots **Grounding Models**: Learning to locate elements based on natural language **Multimodal Understanding**: Combining visual and textual information Usage Examples Licensing This dataset inherits licenses from it
适用场景
适合评估图文理解、视觉问答、文档或场景解析等多模态任务。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。
规模与格式
固定版本:0bf2eb717343。 任务标签:图文理解与多模态生成。 语言字段:en。 规模分类:10K<n<100K。 上游页面记录的最近更新时间:2025-10-03。
文件说明
上游 API 返回 77 个文件,文件元数据合计 32.31 GB。 已保存文件清单中的主要扩展名:.parquet 75 个、.md 1 个、无扩展名 1 个。 当前较大的文件包括:data/train-00050-of-00075.parquet(686.80 MB);data/train-00049-of-00075.parquet(635.60 MB);data/train-00061-of-00075.parquet(625.62 MB)。
上游文件元数据
.gitattributes2.40 KBdata/train-00000-of-00075.parquet63.15 MBdata/train-00001-of-00075.parquet224.47 MBdata/train-00002-of-00075.parquet370.03 MBdata/train-00003-of-00075.parquet334.92 MBdata/train-00004-of-00075.parquet344.63 MBdata/train-00005-of-00075.parquet349.98 MBdata/train-00006-of-00075.parquet386.59 MBdata/train-00007-of-00075.parquet445.69 MBdata/train-00008-of-00075.parquet456.13 MBdata/train-00009-of-00075.parquet449.51 MBdata/train-00010-of-00075.parquet427.64 MB
硬件建议
仓库文件元数据合计 32.31 GB。仅按下载、解压和临时文件估算,建议至少预留约 38.78 GB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。
注意事项
上游卡片没有提供明确许可证字段,下载、训练、商用或再分发前必须打开原始仓库确认授权条件。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。
获取、校验与交付
咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。
本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。