数据集

VoxPopuli

facebook/voxpopuli

查看上游原文 ↗
上游访问:公开 本站服务:可咨询 内容检查:AI 辅助整理并检查 许可证:CC0 1.0(原始音频另见欧洲议会法律声明) 上游版本:42f01879c780

中文简介

VoxPopuli 是 Meta/Facebook 发布方整理的欧洲议会多语言语音数据集,固定数据集卡实现包含 18 种语言的转写语音,并另有带口音英语测试数据。它适合语音识别和多语言研究,但语言、说话人和性别分布并不均衡。

UPSTREAM README

上游模型卡 / 数据集卡

在 Hugging Face 查看原文 ↗

数据定位:VoxPopuli 是欧洲议会多语言语音数据,固定实现包含 18 种语言的转写语音,并提供带口音英语测试集。它适合 ASR 与口音研究,不是中文语音资源。

选择建议:先选目标语言和 split,再确认时长、说话人分布与解码流程。API 仓库存储约 827.73 GB,全量获取前应核算缓存和特征空间。

许可与偏差:数据卡为 CC0,但原始音频还要参阅欧洲议会法律声明。卡片记录性别分布不均,部分文档字段仍待补充;使用方应保留这些限制,不能宣传为完全无偏或无隐私风险。

已有简体中文译文 · Codex 基于固定版本上游 README 编写;待人工复核 · 2026-08-07 23:24

Dataset Card for Voxpopuli Table of Contents Table of Contents Dataset Description Dataset Summary Supported Tasks and Leaderboards Languages Dataset Structure Data Instances Data Fields Data Splits Dataset Creation Curation Rationale Source Data Annotations Personal and Sensitive Information Considerations for Using the Data Social Impact of Dataset Discussion of Biases Other Known Limitations Additional Information Dataset Curators Licensing Information Citation Information Contributions Dataset Description **Homepage:** https://github.com/facebookresearch/voxpopuli **Repository:** https://github.com/facebookresearch/voxpopuli **Paper:** https://arxiv.org/abs/2101.00390 **Point of Contact:** changhan@fb.com, mriviere@fb.com, annl@fb.com Dataset Summary VoxPopuli is a large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation. The raw data is collected from 2009-2020 European Parliament event recordings. We acknowledge the European Parliament for creating and sharing these materials. This implementation contains transcribed speech data for 18 languages. It also contains 29 hours of transcribed speech data of non-native English intended for research in ASR for accented speech (15 L2 accents) Example usage VoxPopuli contains labelled data for 18 languages. To load a specific language pass its name as a config name: To load all the languages in a single dataset use "multilang" config name: To load a specific set of languages, use "multilang" config name and pass a list of required languages to `languages` parameter: To load accented English data, use "en_accented" config name: Note that L2 English subset contains only `test` split.** Supported Tasks and Leaderboards automatic-speech-recognition: The dataset can be used to train a model for Automatic Speech Recognition (ASR). The model is presented with an audio file and asked to transcribe the audio file to written text. The most common evaluation metric is the word

公开页仅展示原文摘录;完整模型卡或数据集卡请前往上游仓库查看。

适用场景

适合自动语音识别、跨语言声学建模、口音鲁棒性和字幕研究。应先按目标语言加载配置并检查 train、validation、test 拆分,而不是全量下载;中文语音项目不应因它是多语言数据就把它当中文训练集。

规模与格式

固定版本:42f01879c780b4a2e90ec0b4f616c2ece526e4f1。任务:automatic-speech-recognition;固定数据集卡实现提供 18 种转写语言与 15 种 L2 口音、约 29 小时带口音英语测试数据,主要格式为 Parquet 音频数据。

文件说明

Hugging Face API 记录 245 个文件,used_storage 约 827.73 GB,本站文件清单已截断。数据按语言和拆分组织,实际需求应明确语言配置与 split;交付时需校验 Parquet 分片、音频解码可用性和数据集脚本版本。

上游文件元数据

  • .gitattributes1.59 KB
  • cs/test-00000-of-00001.parquet566.87 MB
  • cs/train-00000-of-00004.parquet2.43 GB
  • cs/train-00001-of-00004.parquet2.40 GB
  • cs/train-00002-of-00004.parquet2.41 GB
  • cs/train-00003-of-00004.parquet2.42 GB
  • cs/validation-00000-of-00001.parquet554.39 MB
  • de/test-00000-of-00001.parquet892.69 MB
  • de/train-00000-of-00016.parquet2.96 GB
  • de/train-00001-of-00016.parquet2.98 GB
  • de/train-00002-of-00016.parquet3.03 GB
  • de/train-00003-of-00016.parquet2.97 GB

硬件建议

ASR 训练通常需要高吞吐音频解码、缓存和特征提取,磁盘空间应覆盖原始分片、解码缓存和中间特征。只做单语言实验可按配置分批获取;全量多语言处理应使用并行数据管线并记录失败样本。

注意事项

数据卡许可证字段为 CC0,但原始欧洲议会音频仍需参阅其法律声明。公开会议语音也可能涉及说话人、政治观点和偏差分析,模型使用应考虑地域、口音和性别不均衡。数据卡中仍有部分信息标为待补充,不能虚构完整隐私结论。

获取、校验与交付

咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。

第三方资源声明

本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。