资源目录

AI数据集目录

仅展示已发布且完成人工审核的数据集信息;具体可用性和用途条件请以详情页及上游原文为准。

数据集可咨询

Aether-7B-5Attn-checkpoints

该仓库保存 Aether-7B-5Attn 预训练过程中的多个中间检查点,用于复现训练和研究模型能力随训练进度的变化。每个目录包含权重、配置和分词器,模型采用自定义架构;加载时需要基础仓库提供的专用代码,并应核对每...

来源
FINAL-Bench
访问
公开
许可
apache-2.0
上游文件
17 个 · 36.83 GB
查看详情 →
数据集可咨询

ClothTransformer-dataset

这是 ClothTransformer 可扩展布料仿真研究的官方数据集,包含 2056 条无穿透仿真轨迹,每条 240 帧,总计约 49.3 万帧和约 33GB。场景覆盖物体碰撞、人体服装和机器人布料操作,数据以独...

来源
YuCrazing1
访问
公开
许可
cc-by-4.0
上游文件
4119 个 · 31.23 GB
查看详情 →
数据集可咨询

Complete-FABLE.5-traces-2M

这是对多个 FABLE.5 / Claude 轨迹来源进行汇总、内容核验与去重后的数据集。上游说明包含约 5.67 万行可查看数据,并强调来源清理;名称中的规模、实际行数、重复率和来源授权应以数据文件及完整数据卡为准。

来源
Crownelius
访问
公开
许可
mit
上游文件
3 个 · 12.23 GB
查看详情 →
数据集可咨询

Fable-5-traces

该数据集收集 Fable 5 的智能体运行轨迹,属于机器生成的工具调用和任务过程数据。数据卡包含训练格式、规模和来源说明,许可证标记为 AGPL-3.0;用于模型训练前应核对轨迹是否包含敏感信息、第三方内容、重复数...

来源
Glint-Research
访问
公开
许可
agpl-3.0
上游文件
4798 个 · 80.13 MB
查看详情 →
数据集可咨询

GLM-5.2-Conversation

该数据集包含从 GLM-5.2 高推理设置生成的约 5 万条对话轨迹,上游标注总 token 约 1.2 亿。数据面向文本生成和问答训练;关于生成来源、提示分布、质量过滤、模型服务条款与可再分发性,应在训练前进一步核对。

来源
ianncity
访问
公开
许可
apache-2.0
上游文件
4 个 · 915.57 MB
查看详情 →
数据集可咨询

GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset

这是一个由多个来源汇总的超大规模蒸馏数据集合,上游宣称包含 1800 万以上样本、数十个来源及多个类别。仓库名称和数据卡含有大量第三方模型品牌与规模声明,本站未验证其真实来源、授权链和数据质量;使用前应逐项审查来源...

来源
Manusagents
访问
公开
许可
mit
上游文件
9842 个 · 81.48 GB
查看详情 →
数据集可咨询

MotionDecode

MotionDecode 仓库发布面向 Unitree G1 人形机器人的重定向动作数据,并介绍约 1000 小时、120Hz 的高精度光学动作捕捉语料。数据覆盖人体骨骼、手指、物体 6D 位姿、视频和标签;仓库许...

来源
CMRobot
访问
公开
许可
上游未声明
上游文件
98790 个 · 152.55 GB
查看详情 →
数据集可咨询

Open-SWE-Traces

Open-SWE-Traces 是面向软件工程智能体的指令微调数据集,包含 20 万以上由 SWE-agent 和 OpenHands 框架收集或合成的轨迹。数据针对类似 SWE-Bench 的问题,并保存工具与修...

来源
nvidia
访问
公开
许可
cc-by-4.0
上游文件
88 个 · 171.17 GB
查看详情 →
数据集可咨询

SenseNova-Vision-Corpus-50M

SenseNova-Vision-Corpus-50M 是面向统一多模态生成的图文语料集合,上游同时提供英文与简体中文数据卡入口。许可证标记为 CC BY-NC 4.0,意味着默认限制商业使用;数据规模、图像来源、...

来源
sensenova
访问
公开
许可
cc-by-nc-4.0
上游文件
496 个 · 7.98 TB
查看详情 →
数据集可咨询

SynthComp

SynthComp 是用于评估完整证据检索能力的合成多跳基准,提供俄语和英语两个版本,每个版本约 395 道组合型短答案问题。问题由模型基于受控网页子图生成,并经过程序化与模型过滤;其目标是要求检索全部必要证据,而...

来源
t-tech
访问
公开
许可
odc-by
上游文件
18 个 · 832.81 MB
查看详情 →
数据集可咨询

TRuST

TRuST 是一个俄语网页检索基准,包含 324 道需要组合多条证据的短答案问题,用于评估语言模型和搜索智能体的检索能力。上游明确说明来源来自抓取时公开的网页且不主张原始材料所有权,因此用户需自行审查来源、网站条款...

来源
t-tech
访问
公开
许可
odc-by
上游文件
17 个 · 42.82 GB
查看详情 →
数据集可咨询

TinyStories

TinyStories 是由 GPT-3.5 和 GPT-4 合成的英文短故事数据集,故事使用较小词汇表,常用于研究小型语言模型的生成与语言学习能力。仓库包含训练、验证及扩展版本资料;合成偏差、内容质量和 CDLA...

来源
roneneldan
访问
公开
许可
cdla-sharing-1.0
上游文件
14 个 · 16.11 GB
查看详情 →
数据集可咨询

Turkce-Atlas-Instruct

Türkçe Atlas 是面向土耳其语指令跟随和聊天模型训练的监督微调数据集,上游说明包含约 33.6 万条 system、user、assistant 三轮格式样本。任务覆盖改写、摘要、问答、结构化输出、语法、...

来源
AlicanKiraz0
访问
公开
许可
mit
上游文件
3 个 · 945.65 MB
查看详情 →
数据集可咨询

UltraX-Preview

UltraX-Preview 是 OpenBMB 发布的大规模预训练数据处理项目预览数据,主题是使用自适应程序化编辑提升预训练语料质量。上游提供论文、代码、模型和 UltraData 集合链接;数据规模、编辑规则、...

来源
openbmb
访问
公开
许可
apache-2.0
上游文件
483 个 · 453.48 GB
查看详情 →
数据集可咨询

Vera-Layered-Video-Dataset

该数据集用于 Vera 分层扩散视频编辑研究,目标是在编辑时保持内容结构,并提供论文、项目页面和标注资料。资源面向分层视频生成与编辑训练,许可证标记为 Apache-2.0;仍需核对视频来源、人物与素材授权、数据划...

来源
netflix
访问
公开
许可
apache-2.0
上游文件
90105 个 · 205.48 GB
查看详情 →
数据集可咨询

VideoChat3-Academic2M

VideoChat3-Academic2M 是 VideoChat3 使用的学术视频指令标注数据,覆盖视频描述、视频问答和细粒度动作理解。仓库提供重新标注后的 JSONL,不重复托管原始视频;用户需要从原始数据集路...

来源
MCG-NJU
访问
公开
许可
apache-2.0
上游文件
57 个 · 161.18 GB
查看详情 →
数据集可咨询

antidoom-mix-v1.0

Antidoom Mix v1.0 是一个仅包含提示词的训练混合数据集,面向 antidoom 风格生成和偏好数据流水线。上游有意移除了标准答案、推理过程、隐藏测试和验证目标,并过滤明显答案线索;使用时仍需核对各来...

来源
LiquidAI
访问
公开
许可
apache-2.0
上游文件
3 个 · 0 B
查看详情 →
数据集可咨询

arc-agi-3-schema-traces

该数据集包含 50 条 ARC-AGI-3 游戏轨迹,分别来自两组模型运行,并附带不依赖第三方包的评分工具。每条轨迹保存事件日志、会话数据、快照及生成文件;它适合分析游戏式推理过程,但许可证信息当前不完整,训练或再...

来源
schema-harness
访问
公开
许可
上游未声明
上游文件
1058 个 · 397.56 MB
查看详情 →
数据集可咨询

arxiv-latex

该数据集将 arXiv 的 LaTeX 源文件与官方元数据整理为便于查询的 Parquet 语料,面向大规模科学文献处理。数据卡强调完整历史语料和持续同步,但单篇论文的版权与许可可能不同;使用前需依据 arXiv ...

来源
scholarweave
访问
公开
许可
other
上游文件
49 个 · 452.19 GB
查看详情 →
数据集可咨询

claude-fable-5-claude-code

该仓库保存 Claude Fable 5 相关的匿名化原始智能体轨迹,并说明其与 Glint-Research/Fable-5-traces 存在相同数据来源,二者不应重复混用。上游建议使用专用工具转换和过滤会话;...

来源
armand0e
访问
公开
许可
上游未声明
上游文件
65 个 · 97.78 MB
查看详情 →
数据集可咨询

fable-5-coding-and-debugging-traces

该数据集包含 Claude Fable 5 的编程、调试、工具调用和智能体轨迹,上游列出约 2443 条轨迹和 13357 条训练行。数据保留会话中的探索、工具参数、结果与纠错过程;使用前应检查数据授权、隐私清理、...

来源
greghavens
访问
公开
许可
cc-by-4.0
上游文件
249 个 · 249.10 GB
查看详情 →
数据集可咨询

fineweb

FineWeb 是 Hugging Face 发布的大规模英文网页预训练语料,上游称总量约 15 万亿 token,并提供按 Common Crawl 批次拆分的数据及清洗、去重和评测说明。数据规模极大,使用时需关...

来源
HuggingFaceFW
访问
公开
许可
odc-by
上游文件
28147 个 · 106.77 TB
查看详情 →
数据集可咨询

fineweb-edu

FineWeb-Edu 是从 FineWeb 中筛选出的英文教育网页语料,上游介绍的主要版本约有 1.3 万亿 token。筛选器使用模型生成的教育质量标注训练,用于保留更具教育价值的页面;使用时仍需关注网页来源权...

来源
HuggingFaceFW
访问
公开
许可
odc-by
上游文件
3038 个 · 5.63 TB
查看详情 →
数据集可咨询

gaming-500-hours

这是约 494.7 小时的原生 PC 与主机游戏录屏数据,包含 776 个游戏会话和约 168 款游戏。上游说明视频已按游戏组织并剔除登录器、桌面等非游戏部分,同时保留菜单、过场和加载画面;当前许可证信息为空,使用...

来源
markov-ai
访问
公开
许可
上游未声明
上游文件
3108 个 · 1.45 TB
查看详情 →
数据集可咨询

github-code

GitHub Code 数据集包含来自 GitHub 的约 1.15 亿个代码文件,覆盖多种编程语言,总规模约 1TB。样本记录代码、仓库、路径、语言、文件许可和大小;由于不同文件许可可能不同,不能只依据数据集总标...

来源
codeparrot
访问
公开
许可
other
上游文件
1132 个 · 623.89 GB
查看详情 →
数据集可咨询

kimi-k3-coding-and-debugging-traces

该数据集保存 Kimi K3 的编程、工具使用与指令跟随轨迹,上游列出约 320 条会话轨迹和 2300 条训练行。每行是实际智能体会话的累积前缀,保留探索、工具参数、结果和纠错过程;用于训练前应评估来源授权、敏感...

来源
greghavens
访问
公开
许可
cc-by-4.0
上游文件
36 个 · 235.73 MB
查看详情 →
数据集可咨询

reasoning-corpus-4K-5M-v1

该数据集汇集多种模型生成的推理链,并筛选为约 5K token 以内的训练样本,面向小型语言模型的推理、代码和智能体训练。上游说明数据来自多个公开仓库并提供来源占比;使用前需要核对每个来源的数据许可、去重情况、推理...

来源
SupraLabs
访问
公开
许可
apache-2.0
上游文件
3 个 · 66.24 GB
查看详情 →
数据集可咨询

wikipedia

这是由 Wikimedia Wikipedia 转储构建的多语言百科文章数据集,每种语言对应一个子集,样本包含清理后的完整文章文本。许可标记包括 CC BY-SA 3.0 和 GFDL,使用时需要遵守署名、相同方式...

来源
wikimedia
访问
公开
许可
cc-by-sa-3.0, gfdl
上游文件
557 个 · 1.30 TB
查看详情 →