中文简介
ruggsea/infini-news-corpus 是 ruggsea 在 Hugging Face 发布的数据集仓库,当前卡片主要关联文本生成与推理。本站固定记录上游版本 5b78199b86a8,同步到 48980 个文件,文件元数据合计 3.25 TB;访问状态为“公开”,许可证字段为“cc-by-4.0”。
上游模型卡 / 数据集卡
【README 卡片中文译介】
以下内容依据上游仓库 ruggsea/infini-news-corpus 的固定版本 README、卡片字段和文件元数据进行中文结构化整理。它保留便于选型的关键信息,完整技术细节、代码示例和许可文本请同时查看上游原文。
【资源概览】
ruggsea/infini-news-corpus 是 ruggsea 在 Hugging Face 发布的数据集仓库,当前卡片主要关联文本生成与推理。本站固定记录上游版本 5b78199b86a8,同步到 48980 个文件,文件元数据合计 3.25 TB;访问状态为“公开”,许可证字段为“cc-by-4.0”。
【适用方向】
适合在明确数据字段、拆分和许可证后,用于文本生成与推理相关的训练、评测或研究。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。
【版本与规格】
固定版本:5b78199b86a8。 任务标签:文本生成与推理。 语言字段:eng, spa, rus, deu, ita, fra, tur, arb, por, hin, jpn, ell, ron, zho, pol, nld, kor, ukr, vie, swe, hun, bul, ces, ind, fas, tam, arz, nor, urd, ben, fin, slk, hrv, msa, est, srp, mal, tel, lit, bos, dan, cat, slv, mar, sqi, azj, tha, heb, hbs, lav, kan, multilingual。 数据集卡名称:INFINI-NEWS Corpus。 规模分类:1B<n<10B。 上游页面记录的最近更新时间:2026-07-01。
【文件信息】
上游 API 返回 48980 个文件,文件元数据合计 3.25 TB。 已保存文件清单中的主要扩展名:.parquet 99 个、无扩展名 1 个。 当前较大的文件包括:data/year=2016/month=09/part-b9c0c41864890f45.parquet(91.13 MB);data/year=2016/month=09/part-2069d506236528a9.parquet(75.51 MB);data/year=2016/month=08/part-9858bd959d85db9f.parquet(64.19 MB)。 仓库文件较多,本站仅保存前 100 条文件元数据;完整清单请查看上游仓库。
【运行或处理环境】
仓库文件元数据合计 3.25 TB。仅按下载、解压和临时文件估算,建议至少预留约 3.90 TB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。
【使用边界】
许可证显示为“cc-by-4.0”,具体用途限制、附加政策和归属要求仍以上游原文为准。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。
INFINI-NEWS Corpus **🔎 Search this corpus online:** query it with sub-second full-text search and n-gram counts — in the browser or via a public, keyless REST API, no download required — at **infini-news.uni-graz.at** (API reference). A multilingual news corpus extracted from Common Crawl CC-News WARC files. One row per article, with body text extracted via trafilatura, WARC provenance, and derived metadata (publish date, language, topic, byte hashes) in a single flat schema. Covers Aug 2016 – Apr 2026. At a glance | | | |---|---| | Articles | **1 357 027 742** | | Distinct hostnames | **133 565** | | Text size (uncompressed) | **3.4 TB** | | Estimated tokens | **~1.19 trillion** (cl100k_base) | | Languages — GlotLID (ISO 639-3) | **1 172** | | Languages — CommonLingua (334-class) | **331** | | Files | 48 978 parquet shards, partitioned `year=YYYY/month=MM` | | On-disk size | ~1.7 TB (zstd parquet) | | License | CC-BY-4.0 | Articles per year | year | articles | months | |---|---:|---| | 2016 | 7.4 M | Aug–Dec | | 2017 | 71.6 M | full | | 2018 | 92.0 M | full | | 2019 | 129.8 M | full | | 2020 | 185.2 M | full | | 2021 | 196.7 M | full | | 2022 | 201.9 M (peak) | full | | 2023 | 182.1 M | full | | 2024 | 143.1 M | full | | 2025 | 120.3 M | full | | 2026 | 26.8 M | Jan–Apr | Top languages Detected with two independent identifiers — GlotLID (Kargaran et al. 2023) and CommonLingua (Pleias / GSMA 2026); counts below are from CommonLingua (334-class, byte-level). | ISO 639-3 | articles | share | |---|---:|---:| | eng | 521.3 M | 38.4 % | | spa | 135.2 M | 9.96 % | | rus | 88.8 M | 6.55 % | | deu | 86.7 M | 6.39 % | | ita | 70.8 M | 5.21 % | | fra | 55.3 M | 4.07 % | | tur | 43.9 M | 3.24 % | | arb | 28.9 M | 2.13 % | | por | 27.2 M | 2.00 % | | hin | 21.5 M | 1.59 % | | _other 321 langs (CommonLingua)_ | 277.6 M | 20.5 % | Schema | column | type | description | |---|---|---| | `warc_record_id` | string | WARC URN; primary key, unique per article | | `url` | string | full
适用场景
适合在明确数据字段、拆分和许可证后,用于文本生成与推理相关的训练、评测或研究。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。
规模与格式
固定版本:5b78199b86a8。 任务标签:文本生成与推理。 语言字段:eng, spa, rus, deu, ita, fra, tur, arb, por, hin, jpn, ell, ron, zho, pol, nld, kor, ukr, vie, swe, hun, bul, ces, ind, fas, tam, arz, nor, urd, ben, fin, slk, hrv, msa, est, srp, mal, tel, lit, bos, dan, cat, slv, mar, sqi, azj, tha, heb, hbs, lav, kan, multilingual。 数据集卡名称:INFINI-NEWS Corpus。 规模分类:1B<n<10B。 上游页面记录的最近更新时间:2026-07-01。
文件说明
上游 API 返回 48980 个文件,文件元数据合计 3.25 TB。 已保存文件清单中的主要扩展名:.parquet 99 个、无扩展名 1 个。 当前较大的文件包括:data/year=2016/month=09/part-b9c0c41864890f45.parquet(91.13 MB);data/year=2016/month=09/part-2069d506236528a9.parquet(75.51 MB);data/year=2016/month=08/part-9858bd959d85db9f.parquet(64.19 MB)。 仓库文件较多,本站仅保存前 100 条文件元数据;完整清单请查看上游仓库。
上游文件元数据
.gitattributes2.40 KBdata/year=2016/month=08/part-226884625dc26108.parquet42.67 MBdata/year=2016/month=08/part-5c3cfdc76cf5e03a.parquet42.32 MBdata/year=2016/month=08/part-70909cd76e3a70a8.parquet43.18 MBdata/year=2016/month=08/part-9858bd959d85db9f.parquet64.19 MBdata/year=2016/month=08/part-b979ba701f18bd7c.parquet35.70 MBdata/year=2016/month=08/part-d0b83b0e38afb38e.parquet26.55 MBdata/year=2016/month=08/part-ed5a9dbac932e5be.parquet40.36 MBdata/year=2016/month=08/part-f48ce515d0992bd9.parquet2.68 MBdata/year=2016/month=09/part-02e3ade9f232f9d8.parquet23.80 MBdata/year=2016/month=09/part-15aecce1c07202c1.parquet23.50 MBdata/year=2016/month=09/part-17a67e0aca45e468.parquet45.30 MB
硬件建议
仓库文件元数据合计 3.25 TB。仅按下载、解压和临时文件估算,建议至少预留约 3.90 TB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。
注意事项
许可证显示为“cc-by-4.0”,具体用途限制、附加政策和归属要求仍以上游原文为准。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。
获取、校验与交付
咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。
本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。