中文简介
UltraX-Preview 是 OpenBMB 发布的大规模预训练数据处理项目预览数据,主题是使用自适应程序化编辑提升预训练语料质量。上游提供论文、代码、模型和 UltraData 集合链接;数据规模、编辑规则、去重与质量评估方法应结合论文和数据卡完整说明理解。
上游模型卡 / 数据集卡
UltraX-Preview 是 OpenBMB 发布的大规模预训练数据处理项目预览数据,主题是使用自适应程序化编辑提升预训练语料质量。上游提供论文、代码、模型和 UltraData 集合链接;数据规模、编辑规则、去重与质量评估方法应结合论文和数据卡完整说明理解。
UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing 📜 Paper | 💻 Code | 🤖 Models | 📦 UltraData Collection English | 中文 📚 Introduction UltraX** is a function-calling refinement framework for large-scale pre-training data that adaptively generates and executes editing functions for efficient instance-wise refinement. Unlike rule-based or end-to-end LLM rewriting methods, UltraX trains a lightweight refinement model to predict structured editing operations — including insertion, deletion, and modification — which are then deterministically executed on the original text. This dataset collection contains **five English pre-training corpora refined by UltraX**, each with ~20B tokens: | Dataset | Source Corpus | Description | |---------|--------------|-------------| | UltraX-FineWeb | FineWeb | Large-scale Common Crawl web corpus | | UltraX-RedPajama-V2 | RedPajama-v2 | Multi-source web corpus | | UltraX-AICC | AICC | HTML-parsed high-fidelity web corpus | | UltraX-Ultra-FineWeb | Ultra-FineWeb | Quality-filtered FineWeb corpus | | UltraX-FineWeb-ProX-Doc | FineWeb-ProX-Doc | ProX document-level refined corpus | 📢 News **[2026.07.17]** **UltraX** tops the Hugging Face Datasets Trending list, reaching the #1 spot! ⭐️⭐️⭐️ **[2026.07.13]** **UltraX** codebase, refinement model, and refined datasets are now available on GitHub and Hugging Face. 🚀🚀🚀 **[2026.07.10]** **UltraX** technical report is available on arXiv. 🔥🔥🔥 💡 Highlights **Function-Calling Refinement:** Instead of end-to-end text rewriting, UltraX predicts structured editing operations (`keep_all`, `remove_all`, `remove_lines`, `replace_str`, `add_line`), enabling fine-grained instance-level editing with deterministic execution. **LAM + DCR Pipeline:** Line Alignment and Mapping (LAM) aligns original and refined text at line level, while Dynamic Context Replacement (DCR) converts character-level edits into reliable `replace_str` operations with unique context anchoring. **Robust Large-Scale
上游文件元数据
.gitattributes2.45 KBdata/UltraX-AICC/UltraX-AICC-en-part-0001-of-0061.parquet1.05 GBdata/UltraX-AICC/UltraX-AICC-en-part-0002-of-0061.parquet1.05 GBdata/UltraX-AICC/UltraX-AICC-en-part-0003-of-0061.parquet1.05 GBdata/UltraX-AICC/UltraX-AICC-en-part-0004-of-0061.parquet1.07 GBdata/UltraX-AICC/UltraX-AICC-en-part-0005-of-0061.parquet1.06 GBdata/UltraX-AICC/UltraX-AICC-en-part-0006-of-0061.parquet1.07 GBdata/UltraX-AICC/UltraX-AICC-en-part-0007-of-0061.parquet1.05 GBdata/UltraX-AICC/UltraX-AICC-en-part-0008-of-0061.parquet1.05 GBdata/UltraX-AICC/UltraX-AICC-en-part-0009-of-0061.parquet1.05 GBdata/UltraX-AICC/UltraX-AICC-en-part-0010-of-0061.parquet1.07 GBdata/UltraX-AICC/UltraX-AICC-en-part-0011-of-0061.parquet1.06 GB
本页面为橙子AI科技的中文整理与服务说明,不代表资源作者或平台官方页面。实际许可、访问和使用条件以上游原文为准。