Aether-7B-5Attn-checkpoints
该仓库保存 Aether-7B-5Attn 预训练过程中的多个中间检查点,用于复现训练和研究模型能力随训练进度的变化。每个目录包含权重、配置和分词器,模型采用自定义架构;加载时需要基础仓库提供的专用代码,并应核对每...
- 来源
- FINAL-Bench
- 访问
- 公开
- 许可
- apache-2.0
- 上游文件
- 17 个 · 36.83 GB
仅展示已发布且完成人工审核的数据集信息;具体可用性和用途条件请以详情页及上游原文为准。
该仓库保存 Aether-7B-5Attn 预训练过程中的多个中间检查点,用于复现训练和研究模型能力随训练进度的变化。每个目录包含权重、配置和分词器,模型采用自定义架构;加载时需要基础仓库提供的专用代码,并应核对每...
这是 ClothTransformer 可扩展布料仿真研究的官方数据集,包含 2056 条无穿透仿真轨迹,每条 240 帧,总计约 49.3 万帧和约 33GB。场景覆盖物体碰撞、人体服装和机器人布料操作,数据以独...
这是对多个 FABLE.5 / Claude 轨迹来源进行汇总、内容核验与去重后的数据集。上游说明包含约 5.67 万行可查看数据,并强调来源清理;名称中的规模、实际行数、重复率和来源授权应以数据文件及完整数据卡为准。
该数据集收集 Fable 5 的智能体运行轨迹,属于机器生成的工具调用和任务过程数据。数据卡包含训练格式、规模和来源说明,许可证标记为 AGPL-3.0;用于模型训练前应核对轨迹是否包含敏感信息、第三方内容、重复数...
该数据集包含从 GLM-5.2 高推理设置生成的约 5 万条对话轨迹,上游标注总 token 约 1.2 亿。数据面向文本生成和问答训练;关于生成来源、提示分布、质量过滤、模型服务条款与可再分发性,应在训练前进一步核对。
这是一个由多个来源汇总的超大规模蒸馏数据集合,上游宣称包含 1800 万以上样本、数十个来源及多个类别。仓库名称和数据卡含有大量第三方模型品牌与规模声明,本站未验证其真实来源、授权链和数据质量;使用前应逐项审查来源...
MotionDecode 仓库发布面向 Unitree G1 人形机器人的重定向动作数据,并介绍约 1000 小时、120Hz 的高精度光学动作捕捉语料。数据覆盖人体骨骼、手指、物体 6D 位姿、视频和标签;仓库许...
Open-SWE-Traces 是面向软件工程智能体的指令微调数据集,包含 20 万以上由 SWE-agent 和 OpenHands 框架收集或合成的轨迹。数据针对类似 SWE-Bench 的问题,并保存工具与修...
SenseNova-Vision-Corpus-50M 是面向统一多模态生成的图文语料集合,上游同时提供英文与简体中文数据卡入口。许可证标记为 CC BY-NC 4.0,意味着默认限制商业使用;数据规模、图像来源、...
SynthComp 是用于评估完整证据检索能力的合成多跳基准,提供俄语和英语两个版本,每个版本约 395 道组合型短答案问题。问题由模型基于受控网页子图生成,并经过程序化与模型过滤;其目标是要求检索全部必要证据,而...
TRuST 是一个俄语网页检索基准,包含 324 道需要组合多条证据的短答案问题,用于评估语言模型和搜索智能体的检索能力。上游明确说明来源来自抓取时公开的网页且不主张原始材料所有权,因此用户需自行审查来源、网站条款...
TinyStories 是由 GPT-3.5 和 GPT-4 合成的英文短故事数据集,故事使用较小词汇表,常用于研究小型语言模型的生成与语言学习能力。仓库包含训练、验证及扩展版本资料;合成偏差、内容质量和 CDLA...
Türkçe Atlas 是面向土耳其语指令跟随和聊天模型训练的监督微调数据集,上游说明包含约 33.6 万条 system、user、assistant 三轮格式样本。任务覆盖改写、摘要、问答、结构化输出、语法、...
UltraX-Preview 是 OpenBMB 发布的大规模预训练数据处理项目预览数据,主题是使用自适应程序化编辑提升预训练语料质量。上游提供论文、代码、模型和 UltraData 集合链接;数据规模、编辑规则、...
该数据集用于 Vera 分层扩散视频编辑研究,目标是在编辑时保持内容结构,并提供论文、项目页面和标注资料。资源面向分层视频生成与编辑训练,许可证标记为 Apache-2.0;仍需核对视频来源、人物与素材授权、数据划...
VideoChat3-Academic2M 是 VideoChat3 使用的学术视频指令标注数据,覆盖视频描述、视频问答和细粒度动作理解。仓库提供重新标注后的 JSONL,不重复托管原始视频;用户需要从原始数据集路...
Antidoom Mix v1.0 是一个仅包含提示词的训练混合数据集,面向 antidoom 风格生成和偏好数据流水线。上游有意移除了标准答案、推理过程、隐藏测试和验证目标,并过滤明显答案线索;使用时仍需核对各来...
该数据集包含 50 条 ARC-AGI-3 游戏轨迹,分别来自两组模型运行,并附带不依赖第三方包的评分工具。每条轨迹保存事件日志、会话数据、快照及生成文件;它适合分析游戏式推理过程,但许可证信息当前不完整,训练或再...
该数据集将 arXiv 的 LaTeX 源文件与官方元数据整理为便于查询的 Parquet 语料,面向大规模科学文献处理。数据卡强调完整历史语料和持续同步,但单篇论文的版权与许可可能不同;使用前需依据 arXiv ...
该仓库保存 Claude Fable 5 相关的匿名化原始智能体轨迹,并说明其与 Glint-Research/Fable-5-traces 存在相同数据来源,二者不应重复混用。上游建议使用专用工具转换和过滤会话;...
该数据集包含 Claude Fable 5 的编程、调试、工具调用和智能体轨迹,上游列出约 2443 条轨迹和 13357 条训练行。数据保留会话中的探索、工具参数、结果与纠错过程;使用前应检查数据授权、隐私清理、...
FineWeb 是 Hugging Face 发布的大规模英文网页预训练语料,上游称总量约 15 万亿 token,并提供按 Common Crawl 批次拆分的数据及清洗、去重和评测说明。数据规模极大,使用时需关...
FineWeb-Edu 是从 FineWeb 中筛选出的英文教育网页语料,上游介绍的主要版本约有 1.3 万亿 token。筛选器使用模型生成的教育质量标注训练,用于保留更具教育价值的页面;使用时仍需关注网页来源权...
这是约 494.7 小时的原生 PC 与主机游戏录屏数据,包含 776 个游戏会话和约 168 款游戏。上游说明视频已按游戏组织并剔除登录器、桌面等非游戏部分,同时保留菜单、过场和加载画面;当前许可证信息为空,使用...
GitHub Code 数据集包含来自 GitHub 的约 1.15 亿个代码文件,覆盖多种编程语言,总规模约 1TB。样本记录代码、仓库、路径、语言、文件许可和大小;由于不同文件许可可能不同,不能只依据数据集总标...
该数据集保存 Kimi K3 的编程、工具使用与指令跟随轨迹,上游列出约 320 条会话轨迹和 2300 条训练行。每行是实际智能体会话的累积前缀,保留探索、工具参数、结果和纠错过程;用于训练前应评估来源授权、敏感...
该数据集汇集多种模型生成的推理链,并筛选为约 5K token 以内的训练样本,面向小型语言模型的推理、代码和智能体训练。上游说明数据来自多个公开仓库并提供来源占比;使用前需要核对每个来源的数据许可、去重情况、推理...
这是由 Wikimedia Wikipedia 转储构建的多语言百科文章数据集,每种语言对应一个子集,样本包含清理后的完整文章文本。许可标记包括 CC BY-SA 3.0 和 GFDL,使用时需要遵守署名、相同方式...