数据集

wikipedia

wikimedia/wikipedia

查看上游原文 ↗
上游访问:公开 本站服务:可咨询 许可证:cc-by-sa-3.0, gfdl 上游版本:b04c8d1ceb2f

中文简介

这是由 Wikimedia Wikipedia 转储构建的多语言百科文章数据集,每种语言对应一个子集,样本包含清理后的完整文章文本。许可标记包括 CC BY-SA 3.0 和 GFDL,使用时需要遵守署名、相同方式共享等要求,并注意版本、语言覆盖和原始转储日期。

UPSTREAM README

上游模型卡 / 数据集卡

在 Hugging Face 查看原文 ↗

这是由 Wikimedia Wikipedia 转储构建的多语言百科文章数据集,每种语言对应一个子集,样本包含清理后的完整文章文本。许可标记包括 CC BY-SA 3.0 和 GFDL,使用时需要遵守署名、相同方式共享等要求,并注意版本、语言覆盖和原始转储日期。

已有简体中文译文 · 本站中文整理 · 2026-07-23 14:50

Dataset Card for Wikimedia Wikipedia Table of Contents Table of Contents Dataset Description Dataset Summary Supported Tasks and Leaderboards Languages Dataset Structure Data Instances Data Fields Data Splits Dataset Creation Curation Rationale Source Data Annotations Personal and Sensitive Information Considerations for Using the Data Social Impact of Dataset Discussion of Biases Other Known Limitations Additional Information Dataset Curators Licensing Information Citation Information Contributions Dataset Description **Homepage:** https://dumps.wikimedia.org **Repository:** **Paper:** **Point of Contact:** Dataset Summary Wikipedia dataset containing cleaned articles of all languages. The dataset is built from the Wikipedia dumps (https://dumps.wikimedia.org/) with one subset per language, each containing a single train split. Each example contains the content of one full Wikipedia article with cleaning to strip markdown and unwanted sections (references, etc.). All language subsets have already been processed for recent dump, and you can load them per date and language this way: Data Visualization Click the Nomic Atlas map below to visualize the 6.4 million samples in the `20231101.en` split. Supported Tasks and Leaderboards The dataset is generally used for Language Modeling. Languages You can find the list of languages here: https://meta.wikimedia.org/wiki/List_of_Wikipedias Dataset Structure Data Instances An example looks as follows: Data Fields The data fields are the same among all configurations: `id` (`str`): ID of the article. `url` (`str`): URL of the article. `title` (`str`): Title of the article. `text` (`str`): Text content of the article. Data Splits All configurations contain a single `train` split. Dataset Creation Curation Rationale [More Information Needed] Source Data Initial Data Collection and Normalization The dataset is built from the Wikipedia dumps: https://dumps.wikimedia.org You can find the full list of languages and dates here: https:

公开页仅展示原文摘录;完整模型卡或数据集卡请前往上游仓库查看。

上游文件元数据

  • .gitattributes2.25 KB
  • 20231101.ab/train-00000-of-00001.parquet1.18 MB
  • 20231101.ace/train-00000-of-00001.parquet1.50 MB
  • 20231101.ady/train-00000-of-00001.parquet339.31 KB
  • 20231101.af/train-00000-of-00001.parquet118.72 MB
  • 20231101.als/train-00000-of-00001.parquet47.16 MB
  • 20231101.alt/train-00000-of-00001.parquet2.78 MB
  • 20231101.am/train-00000-of-00001.parquet10.22 MB
  • 20231101.ami/train-00000-of-00001.parquet2.16 MB
  • 20231101.an/train-00000-of-00001.parquet28.20 MB
  • 20231101.ang/train-00000-of-00001.parquet1.71 MB
  • 20231101.anp/train-00000-of-00001.parquet3.20 MB
第三方资源声明

本页面为橙子AI科技的中文整理与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。