📜 论文 | 💻 代码 | 🤖 模型 | 📦 UltraData 合集
English | 中文
UltraX 是一个面向大规模预训练数据的函数调用式精炼框架,可为每条样本自适应生成并执行编辑函数,实现高效的逐例精炼。与基于规则或端到端 LLM 改写方法不同,UltraX 训练一个轻量精炼模型来预测结构化编辑操作——包括插入、删除和修改——然后在原始文本上确定性执行。
本数据集合集包含 五个经 UltraX 精炼的英文预训练语料,每个约 20B tokens:
| 数据集 | 源语料 | 说明 |
|---|---|---|
| UltraX-FineWeb | FineWeb | 大规模 Common Crawl 网页语料 |
| UltraX-RedPajama-V2 | RedPajama-v2 | 多源网页语料 |
| UltraX-AICC | AICC | HTML 解析的高保真网页语料 |
| UltraX-Ultra-FineWeb | Ultra-FineWeb | 质量过滤的 FineWeb 语料 |
| UltraX-FineWeb-ProX-Doc | FineWeb-ProX-Doc | ProX 文档级精炼语料 |
keep_all、remove_all、remove_lines、replace_str、add_line),实现细粒度实例级编辑与确定性执行。replace_str 操作。
我们使用 1B 参数的 MiniCPM 模型在每个语料的 20B tokens 上从零预训练,并使用 LightEval 在 10 个基准上进行零样本评估(ARC-C、ARC-E、CSQA、HellaSwag、MMLU、OBQA、PIQA、SIQA、WinoGrande、SciQ)。
主要结论:
FineWeb 在不同训练 token 预算下的平均下游性能。
每个 parquet 文件包含 5 列:
| 列名 | 类型 | 说明 |
|---|---|---|
uid | string | 唯一标识符(raw_content 的 MD5 哈希) |
raw_content | string | 精炼前的原始文本 |
cleaned_content | string | 经 UltraX 精炼后的文本 |
processed_functions | string | 应用的编辑操作 |
source | string | 源语料名称 |
你可以直接从 Hugging Face 加载数据集:
from datasets import load_dataset
# 加载 UltraX-FineWeb
ds = load_dataset("openbmb/UltraX", "UltraX-FineWeb", split="train")
# 加载 UltraX-RedPajama-V2
ds = load_dataset("openbmb/UltraX", "UltraX-RedPajama-V2", split="train")
# 加载 UltraX-AICC
ds = load_dataset("openbmb/UltraX", "UltraX-AICC", split="train")
# 加载 UltraX-Ultra-FineWeb
ds = load_dataset("openbmb/UltraX", "UltraX-Ultra-FineWeb", split="train")
# 加载 UltraX-FineWeb-ProX-Doc
ds = load_dataset("openbmb/UltraX", "UltraX-FineWeb-ProX-Doc", split="train")UltraX 精炼模型预测以下函数空间中的操作:
| 函数 | 说明 |
|---|---|
keep_all() | 文档无需修改 |
remove_all() | 整篇文档无价值(如错误页面、登录墙) |
remove_lines(start, end) | 删除从 start 到 end 的连续行(含首尾) |
replace_str(line, old, new) | 在指定行内替换子字符串 |
add_line(base, sub_idx, content) | 在指定位置附近插入新行 |
感谢以上优秀的开源工作!🙌
如果我们的工作对您有帮助,请考虑引用:
@misc{ultrax2026,
title={UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing},
author={Xinlong Zhao and Dongsheng Liu and Hengyu Zhao and Zixuan Fu and Zheng Wang and Jie Cai and Jie Zhou and Qiang Ma and Xuanhe Zhou and Xu Han and Yudong Wang and Zhiyuan Liu},
year={2026},
eprint={2607.08646},
archivePrefix={arXiv},
primaryClass={cs.CL},
}本项目基于 Apache 2.0 协议发布。由于 UltraX 数据集基于多个源语料构建,用户应自行检查各源数据集的许可证以确保合规使用。
禁止不加处理的二次发布: 未经原作者(或本机构)书面明确授权,任何其他机构、组织或第三方平台不得以任何形式对本项目成果进行直接转载、复制、托管、镜像克隆或商业化包装再发布。