中文简介
1111xxx/zoengjyutgaai 是 1111xxx 在 Hugging Face 发布的数据集仓库,当前卡片主要关联语音识别、语音合成、文本生成与推理、向量表示与检索。本站固定记录上游版本 a204ebda8ebe,同步到 99475 个文件,文件元数据合计 20.99 GB;访问状态为“公开”,许可证字段为“cc0-1.0”。
上游模型卡 / 数据集卡
【README 卡片中文译介】
以下内容依据上游仓库 1111xxx/zoengjyutgaai 的固定版本 README、卡片字段和文件元数据进行中文结构化整理。它保留便于选型的关键信息,完整技术细节、代码示例和许可文本请同时查看上游原文。
【资源概览】
1111xxx/zoengjyutgaai 是 1111xxx 在 Hugging Face 发布的数据集仓库,当前卡片主要关联语音识别、语音合成、文本生成与推理、向量表示与检索。本站固定记录上游版本 a204ebda8ebe,同步到 99475 个文件,文件元数据合计 20.99 GB;访问状态为“公开”,许可证字段为“cc0-1.0”。
【适用方向】
适合评估语音转写、字幕生成和语音内容结构化任务。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。
【版本与规格】
固定版本:a204ebda8ebe。 任务标签:语音识别、语音合成、文本生成与推理、向量表示与检索。 语言字段:yue。 数据集卡名称:c。 规模分类:10K<n<100K。 上游页面记录的最近更新时间:2026-05-19。
【文件信息】
上游 API 返回 99475 个文件,文件元数据合计 20.99 GB。 已保存文件清单中的主要扩展名:.opus 77 个、.parquet 16 个、.py 3 个、.sh 2 个、无扩展名 2 个。 当前较大的文件包括:data/saamgwokjinji-00004-of-00005.parquet(529.11 MB);data/saamgwokjinji-00003-of-00005.parquet(512.91 MB);data/saamgwokjinji-00002-of-00005.parquet(482.88 MB)。 仓库文件较多,本站仅保存前 100 条文件元数据;完整清单请查看上游仓库。
【运行或处理环境】
仓库文件元数据合计 20.99 GB。仅按下载、解压和临时文件估算,建议至少预留约 25.18 GB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。
【使用边界】
许可证显示为“cc0-1.0”,具体用途限制、附加政策和归属要求仍以上游原文为准。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。
張悦楷講古語音數據集 English Dataset Description **Homepage:** 張悦楷講古語音數據集 The Zoeng Jyut Gaai Story-telling Speech Dataset **License:** CC0 1.0 Universal **Language:** Cantonese **Total Duration:** 188.25 hours **Average Clip Duration:** 5.826 seconds **Median Clip Duration:** 5.385 seconds **Total number of characters:** 2903094 **Average characters per clip:** 24.90 **Median characters per clip:** 23 **Average speech speed:** 4.27 characters per second **Voice Actor:** 張悦楷 呢個係張悦楷講《三國演義》、《水滸傳》、《走進毛澤東的最後歲月》、《鹿鼎記》語音數據集。張悦楷係廣州最出名嘅講古佬 / 粵語説書藝人。佢從上世紀七十年代開始就喺廣東各個收音電台度講古,佢把聲係好多廣州人嘅共同回憶。本數據集收集嘅係佢最知名嘅四部作品。 數據集用途: TTS(語音合成)訓練集 ASR(語音識別)訓練集或測試集 各種語言學、文學研究 直接聽嚟欣賞藝術! TTS 效果演示:https://huggingface.co/spaces/laubonghaudoi/zoengjyutgaai_tts 説明 所有文本都根據 https://jyutping.org/blog/typo/ 同 https://jyutping.org/blog/particles/ 規範用字。 所有文本都使用全角標點,冇半角標點。 所有文本都用漢字轉寫,無阿拉伯數字無英文字母 所有音頻源都存放喺`/source`,為方便直接用作訓練數據,切分後嘅音頻都放喺 `opus/` 所有 opus 音頻皆為 48000 Hz 採樣率。 所有源字幕 SRT 文件都存放喺 `srt/` 路經下,搭配 `source/` 下嘅音源可以直接作為帶字幕嘅錄音直接欣賞。 `cut.py` 係切分腳本,將對應嘅音源根據 srt 切分成短句並生成一個文本轉寫 csv。 `stats.py` 係統計腳本,運行佢就會顯示成個數據集嘅各項統計數據。 引用本數據集 本數據集屬公共領域,遵循 CC0 許可聲明。即係話你可以無需授權免費任用本數據集,亦都唔需要註明出處。不過如果你用咗本數據集,我哋都希望你可以引用本頁面,作為對楷叔嘅懷念同致敬: 下載使用 要下載使用呢個數據集,可以喺 Python 入面直接跑: 如果想單純將 `opus/` 入面所有嘢下載落嚟,可以跑下面嘅 Python 代碼,注意要安裝 `pip install --upgrade huggingface_hub` 先: 如果唔想用 python,你亦都可以用命令行叫 git 針對克隆個`opus/`或者其他路經,避免將成個 repo 都克隆落嚟浪費空間同下載時間: 數據集構建流程 本數據集嘅收集、構建過程係: 1. 從 YouTube 或者國內評書網站度下載錄音源文件,一般都係每集半個鐘長嘅 `.webm` 或者 `.mp3`。 1. 用加字幕工具幫呢啲錄音加字幕,得到對應嘅 `.srt` 文件。 1. 將啲源錄音用下面嘅命令儘可能無壓縮噉轉換成 `.opus` 格式。 1. 運行`cut.py`,將每一集 `.opus` 按照 `.srt` 入面嘅時間點切分成一句一個 `.opus`,然後對應嘅文本寫入本數據集嘅 `xxx.csv`。 1. 然後打開一個 IPython,逐句跑下面嘅命令,將啲數據推上 HuggingFace。 音頻格式轉換 首先要安裝 ffmpeg,然後運行: 如果想將所有 opus 文件全部轉換成 wav,可以直接運行`to_wav.sh`: 跟住就會生成一個 `wav/` 路經,入面都係 `opus/` 對應嘅音頻。注意 wav 格式非常掗埞,成個 `opus/` 轉晒後會佔用至少 500GB 儲存空間,所以轉換之前記得確保有足夠空間。如果你想對音頻重採樣,亦都可以修改 `to_wav.sh` 入面嘅命令順便做重採樣。 The Zoeng Jyut Gaai Story-telling Speech Dataset This is a speech dataset of Zoeng Jyut Gaai story-telling _Romance of the Th
适用场景
适合评估语音转写、字幕生成和语音内容结构化任务。 正式使用前应先抽样检查字段、语言、重复项、敏感信息和训练/测试划分,避免只依据仓库名称判断数据质量。
规模与格式
固定版本:a204ebda8ebe。 任务标签:语音识别、语音合成、文本生成与推理、向量表示与检索。 语言字段:yue。 数据集卡名称:c。 规模分类:10K<n<100K。 上游页面记录的最近更新时间:2026-05-19。
文件说明
上游 API 返回 99475 个文件,文件元数据合计 20.99 GB。 已保存文件清单中的主要扩展名:.opus 77 个、.parquet 16 个、.py 3 个、.sh 2 个、无扩展名 2 个。 当前较大的文件包括:data/saamgwokjinji-00004-of-00005.parquet(529.11 MB);data/saamgwokjinji-00003-of-00005.parquet(512.91 MB);data/saamgwokjinji-00002-of-00005.parquet(482.88 MB)。 仓库文件较多,本站仅保存前 100 条文件元数据;完整清单请查看上游仓库。
上游文件元数据
.gitattributes2.38 KB.gitignore39 Badd_jyutping_column.py2.75 KBalign.py3.53 KBconvert_metadata.sh1.80 KBconvert_to_opus.sh1.63 KBcut.py3.56 KBdata/lukdinggei-00000-of-00006.parquet390.72 MBdata/lukdinggei-00001-of-00006.parquet371.38 MBdata/lukdinggei-00002-of-00006.parquet376.10 MBdata/lukdinggei-00003-of-00006.parquet368.53 MBdata/lukdinggei-00004-of-00006.parquet376.13 MB
硬件建议
仓库文件元数据合计 20.99 GB。仅按下载、解压和临时文件估算,建议至少预留约 25.18 GB 可用磁盘;实际需求还取决于压缩率、缓存、数据转换和训练副本,正式处理前应以完整文件清单重新测算。
注意事项
许可证显示为“cc0-1.0”,具体用途限制、附加政策和归属要求仍以上游原文为准。 数据集还需核对样本来源、隐私与个人信息、标签质量、地域偏差及下游模型的合规要求。
获取、校验与交付
咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。
本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。