中文简介
TinyStories 是使用 GPT-3.5 和 GPT-4 生成的英文短故事数据集,采用较小词汇范围,常用于研究小型语言模型能否学习连贯文本。它适合教学与低成本实验,但不应被当作真实儿童内容或完整世界知识来源。
上游模型卡 / 数据集卡
TinyStories 是英文合成短故事数据集。上游数据集卡说明其故事由 GPT-3.5 和 GPT-4 生成,并使用较小词汇范围,用于研究小型语言模型学习连贯文本的能力。
它适合教学、训练管线验证和小模型实验,但合成内容不等同于事实可靠、教育适龄或经过专业编辑的儿童材料。
使用前应检查内容偏见、重复、质量和目标人群适配,并遵守 CDLA-Sharing 1.0 与固定版本数据集卡的要求。
Dataset containing synthetically generated (by GPT-3.5 and GPT-4) short stories that only use a small vocabulary. Described in the following paper: https://arxiv.org/abs/2305.07759. The models referred to in the paper were trained on TinyStories-train.txt (the file tinystories-valid.txt can be used for validation loss). These models can be found on Huggingface, at roneneldan/TinyStories-1M/3M/8M/28M/33M/1Layer-21M. Additional resources: tinystories_all_data.tar.gz - contains a superset of the stories together with metadata and the prompt that was used to create each story. TinyStoriesV2-GPT4-train.txt - Is a new version of the dataset that is based on generations by GPT-4 only (the original dataset also has generations by GPT-3.5 which are of lesser quality). It contains all the examples in TinyStories.txt which were GPT-4 generated as a subset (but is significantly larger). Evaluation_prompts.yaml: List of prompts used to evaluate our models (see paper)
适用场景
适合小模型训练实验、语言建模教学、生成质量评测和受控词汇研究。可用于验证训练管线,但不宜直接替代真实领域数据或面向儿童的专业内容审核。
规模与格式
英文合成短故事集合,上游说明由 GPT-3.5 和 GPT-4 生成,并控制词汇难度以支持小型语言模型研究。具体文件、拆分和生成说明以上游数据集卡为准。
文件说明
本次固定版本由 Hugging Face 官方 API 返回 14 个文件条目,总存储量约 16.11 GB。选择训练或验证拆分时应记录文件范围和版本校验信息。
上游文件元数据
.gitattributes2.69 KBdata/train-00000-of-00004-2d5a1467fff1081b.parquet237.21 MBdata/train-00001-of-00004-5852b56a2bd28fd9.parquet236.68 MBdata/train-00002-of-00004-a26307300439e943.parquet234.50 MBdata/train-00003-of-00004-d243063613e5a057.parquet236.50 MBdata/validation-00000-of-00001-869c898b519ad725.parquet9.53 MBEvaluation prompts.yaml11.48 KBMLP_input_output.npy781.25 MBREADME.md1.04 KBTinyStories-train.txt1.79 GBTinyStories-valid.txt18.55 MBTinyStories_all_data.tar.gz1.50 GB
硬件建议
相较超大网页语料更适合单机教学和训练管线验证,但实际资源仍取决于选择的文件、序列长度、模型规模、批量大小和训练框架。
注意事项
合成故事可能继承生成模型的偏见、错误和重复模式,也未必符合教育、年龄分级或事实标准。对外应用前应进行内容安全、质量与目标人群适配审查。
获取、校验与交付
咨询此资源时只需发送本页链接或资源准确全称。橙子AI科技会继续核对版本、文件与类型、README资料卡、许可证和访问条件,并在合法访问权限、许可证及平台规则允许的前提下,协助海内外下载、完整性校验及网盘或硬盘交付;本官网本身不托管或下载资源文件。
本页面为橙子AI科技基于固定版本上游卡片整理的中文信息与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。