数据集

TinyStories

roneneldan/TinyStories

查看上游原文 ↗
上游访问:公开 本站服务:可咨询 内容检查:已人工审核 许可证:Community Data License Agreement – Sharing 1.0 上游版本:f54c09fd2331

中文简介

TinyStories 是使用 GPT-3.5 和 GPT-4 生成的英文短故事数据集,采用较小词汇范围,常用于研究小型语言模型能否学习连贯文本。它适合教学与低成本实验,但不应被当作真实儿童内容或完整世界知识来源。

UPSTREAM README

上游模型卡 / 数据集卡

在 Hugging Face 查看原文 ↗

TinyStories 是英文合成短故事数据集。上游数据集卡说明其故事由 GPT-3.5 和 GPT-4 生成,并使用较小词汇范围,用于研究小型语言模型学习连贯文本的能力。

它适合教学、训练管线验证和小模型实验,但合成内容不等同于事实可靠、教育适龄或经过专业编辑的儿童材料。

使用前应检查内容偏见、重复、质量和目标人群适配,并遵守 CDLA-Sharing 1.0 与固定版本数据集卡的要求。

译文已人工复核 · 本站基于上游 README 整理并人工复核 · 2026-07-23 23:47

Dataset containing synthetically generated (by GPT-3.5 and GPT-4) short stories that only use a small vocabulary. Described in the following paper: https://arxiv.org/abs/2305.07759. The models referred to in the paper were trained on TinyStories-train.txt (the file tinystories-valid.txt can be used for validation loss). These models can be found on Huggingface, at roneneldan/TinyStories-1M/3M/8M/28M/33M/1Layer-21M. Additional resources: tinystories_all_data.tar.gz - contains a superset of the stories together with metadata and the prompt that was used to create each story. TinyStoriesV2-GPT4-train.txt - Is a new version of the dataset that is based on generations by GPT-4 only (the original dataset also has generations by GPT-3.5 which are of lesser quality). It contains all the examples in TinyStories.txt which were GPT-4 generated as a subset (but is significantly larger). Evaluation_prompts.yaml: List of prompts used to evaluate our models (see paper)

公开页仅展示原文摘录;完整模型卡或数据集卡请前往上游仓库查看。

适用场景

适合小模型训练实验、语言建模教学、生成质量评测和受控词汇研究。可用于验证训练管线,但不宜直接替代真实领域数据或面向儿童的专业内容审核。

规模与格式

英文合成短故事集合,上游说明由 GPT-3.5 和 GPT-4 生成,并控制词汇难度以支持小型语言模型研究。具体文件、拆分和生成说明以上游数据集卡为准。

文件说明

本次固定版本由 Hugging Face 官方 API 返回 14 个文件条目,总存储量约 16.11 GB。选择训练或验证拆分时应记录文件范围和版本校验信息。

上游文件元数据

  • .gitattributes2.69 KB
  • data/train-00000-of-00004-2d5a1467fff1081b.parquet237.21 MB
  • data/train-00001-of-00004-5852b56a2bd28fd9.parquet236.68 MB
  • data/train-00002-of-00004-a26307300439e943.parquet234.50 MB
  • data/train-00003-of-00004-d243063613e5a057.parquet236.50 MB
  • data/validation-00000-of-00001-869c898b519ad725.parquet9.53 MB
  • Evaluation prompts.yaml11.48 KB
  • MLP_input_output.npy781.25 MB
  • README.md1.04 KB
  • TinyStories-train.txt1.79 GB
  • TinyStories-valid.txt18.55 MB
  • TinyStories_all_data.tar.gz1.50 GB

硬件建议

相较超大网页语料更适合单机教学和训练管线验证,但实际资源仍取决于选择的文件、序列长度、模型规模、批量大小和训练框架。

注意事项

合成故事可能继承生成模型的偏见、错误和重复模式,也未必符合教育、年龄分级或事实标准。对外应用前应进行内容安全、质量与目标人群适配审查。

获取、校验与交付

咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。

第三方资源声明

本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。