中文简介
bowang0911/webfaq_cleaned 是 bowang0911 在 Hugging Face 发布的数据集仓库,当前卡片主要关联上游卡片所列任务。本站固定记录上游版本 62b5921f98ca,同步到 69 个文件,文件元数据合计 26.52 GB;访问状态为“公开”,许可证字段为“上游卡片未声明”。
上游模型卡 / 数据集卡
【README 卡片中文译介】
以下内容依据上游仓库 bowang0911/webfaq_cleaned 的固定版本 README、卡片字段和文件元数据进行中文结构化整理。它保留便于选型的关键信息,完整技术细节、代码示例和许可文本请同时查看上游原文。
【资源概览】
bowang0911/webfaq_cleaned 是 bowang0911 在 Hugging Face 发布的数据集仓库,当前卡片主要关联上游卡片所列任务。本站固定记录上游版本 62b5921f98ca,同步到 69 个文件,文件元数据合计 26.52 GB;访问状态为“公开”,许可证字段为“上游卡片未声明”。
【适用方向】
适合在明确数据字段、拆分和许可证后,用于上游卡片所列任务相关的训练、评测或研究。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。
【版本与规格】
固定版本:62b5921f98ca。 任务标签:上游卡片所列任务。 上游页面记录的最近更新时间:2026-05-28。
【文件信息】
上游 API 返回 69 个文件,文件元数据合计 26.52 GB。 已保存文件清单中的主要扩展名:.parquet 67 个、.md 1 个、无扩展名 1 个。 当前较大的文件包括:en/train-00000-of-00024.parquet(312.90 MB);en/train-00012-of-00024.parquet(312.81 MB);en/train-00021-of-00024.parquet(312.70 MB)。
【运行或处理环境】
仓库文件元数据合计 26.52 GB。仅按下载、解压和临时文件估算,建议至少预留约 31.82 GB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。
【使用边界】
上游卡片没有提供明确许可证字段,下载、训练、商用或再分发前必须打开原始仓库确认授权条件。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。
webfaq_cleaned A cleaned, multilingual question–document dataset across 44 languages, ~58.5M Q–D pairs total, intended as a contrastive training / retrieval-eval corpus. Derived from `PaDaS-Lab/webfaq`. The source data is web-scraped FAQ pages. The raw input contained large amounts of SEO doorway pages, casino spam, e-commerce listing pages whose review snippet didn't match the product query, near-duplicate templates, and broken encodings. This dataset applies a multi-layer cleaning pipeline to filter that noise while preserving the substantive Q&A. Schema Each row is a single Q–D pair: | field | type | description | |----------|--------|----------------------------------------| | query | string | the question | | document | string | the answer / supporting passage | One config per language; one `train` split per config. Usage Languages 44 languages, sorted by final row count. `source` = rows pulled from the original `PaDaS-Lab/webfaq` shards; `kept` = rows remaining after cleaning. | lang | source | kept | kept% | lang | source | kept | kept% | |---|---:|---:|---:|---|---:|---:|---:| | en | 49,275,346 | 40,817,655 | 82.8% | ro | 546,709 | 378,587 | 69.2% | | fa | 969,748 | 841,712 | 86.8% | fi | 641,009 | 373,519 | 58.3% | | ar | 1,000,000 | 829,000 | 82.9% | th | 502,215 | 355,047 | 70.7% | | tr | 1,000,000 | 820,040 | 82.0% | el | 494,019 | 349,025 | 70.7% | | fr | 1,000,000 | 805,753 | 80.6% | hu | 363,866 | 283,635 | 78.0% | | nl | 1,000,000 | 802,485 | 80.2% | no | 316,320 | 248,062 | 78.4% | | de | 1,000,000 | 798,319 | 79.8% | he | 391,084 | 188,530 | 48.2% | | es | 1,000,000 | 797,885 | 79.8% | sk | 177,748 | 141,875 | 79.8% | | it | 1,000,000 | 796,614 | 79.7% | bg | 164,015 | 134,795 | 82.2% | | pt | 1,000,000 | 793,637 | 79.4% | lt | 119,192 | 89,490 | 75.1% | | ru | 1,000,000 | 784,173 | 78.4% | is | 91,630 | 64,358 | 70.2% | | pl | 1,000,000 | 782,624 | 78.3% | lv | 79,443 | 59,446 | 74.8% | | vi | 1,000,000 | 723,073 | 72.3% | ca | 80,189 | 57,740 | 7
适用场景
适合在明确数据字段、拆分和许可证后,用于上游卡片所列任务相关的训练、评测或研究。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。
规模与格式
固定版本:62b5921f98ca。 任务标签:上游卡片所列任务。 上游页面记录的最近更新时间:2026-05-28。
文件说明
上游 API 返回 69 个文件,文件元数据合计 26.52 GB。 已保存文件清单中的主要扩展名:.parquet 67 个、.md 1 个、无扩展名 1 个。 当前较大的文件包括:en/train-00000-of-00024.parquet(312.90 MB);en/train-00012-of-00024.parquet(312.81 MB);en/train-00021-of-00024.parquet(312.70 MB)。
上游文件元数据
.gitattributes2.45 KBar/train-00000-of-00001.parquet169.56 MBaz/train-00000-of-00001.parquet2.84 MBbg/train-00000-of-00001.parquet37.20 MBbn/train-00000-of-00001.parquet12.14 MBca/train-00000-of-00001.parquet8.84 MBcs/train-00000-of-00001.parquet71.31 MBda/train-00000-of-00001.parquet111.84 MBde/train-00000-of-00001.parquet127.50 MBel/train-00000-of-00001.parquet87.46 MBen/train-00000-of-00024.parquet312.90 MBen/train-00001-of-00024.parquet312.03 MB
硬件建议
仓库文件元数据合计 26.52 GB。仅按下载、解压和临时文件估算,建议至少预留约 31.82 GB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。
注意事项
上游卡片没有提供明确许可证字段,下载、训练、商用或再分发前必须打开原始仓库确认授权条件。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。
获取、校验与交付
咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。
本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。