OpenBMB 开源社区/UltraData-RL-2609
数据集
数据集查看器
文件和版本
Pull Requests
讨论

UltraData-RL-2609

📦 UltraData 合集 | 🌐 UltraData | 🤗 MiniCPM5 系列

English | 中文

📚 简介

UltraData-RL-2609 是 UltraData L0-L4 分级数据管理框架 面向强化学习的 L3 合成与增强数据。面向 MiniCPM5-2B 后训练 RL 阶段构建,作为 UltraData-SFT-2605 在可验证奖励任务上的补充。它也是 JustRL II(Scaling Small LLMs to 128K Reasoning with a Critic)使用的训练语料;该方法在极简 JustRL 配方之上引入 critic,并将推理 RL 扩展到 128K 规模。

发布超过 8.5 万条高质量训练样本,覆盖数学推理、科学 / 知识问答、长文本理解与代码生成。数据以可验证任务为基本单元,统一整理为适用于 RL 训练的 JSONL,并围绕结果可判定、奖励可信、难度适配三个目标构建,为策略提供稳定、可追溯的训练信号。

📢 最新动态

  • [2026.09.07] UltraData-RL-2609 数据集正式发布!面向 MiniCPM5-2B 后训练的可验证奖励 RL 数据,约 8.6 万条,覆盖 Math、Knowledge(STEM)、Long-Context 和 Code。🚀🚀🚀
  • [2026.09.07] MiniCPM5-2B 正式发布! 作为 MiniCPM5 系列在 MiniCPM5-1B 之后的第二款模型,这是一款沿用同一套训练配方放大的 2B 稠密 Transformer,面向端侧、本地部署与资源受限场景,达到 2B 级开源 SOTA,整体可与 4B 级模型竞争,并在代码、数学、长上下文、工具调用与 Agent 任务上相对同规模模型更具优势。UltraData-RL-2609 是 MiniCPM5-2B 的核心 RL 数据。🚀🚀🚀
  • [2026.02.08] UltraData 平台正式上线,并发布 L0-L4 分级数据管理框架。🔍🔍🔍

🎯 数据规模与能力覆盖

发布版本共 85,995 条样本,覆盖四个 RL 方向。其中 Knowledge 对应构建说明中的 STEM / 科学推理切片。

方向样本数占比任务结果如何验证
Math32,41237.7%竞赛 / 教材类数学题,答案唯一可抽取与 ground_truth 做答案匹配
Code23,66527.5%按自然语言描述生成程序用 ground_truth 中的测试用例执行提交代码
Long-Context18,04621.0%长文档多跳问答(上下文包含在 query 中)与 ground_truth 做答案匹配,上下文保证支撑答案
Knowledge11,87213.8%科学 / 知识推理简答题与 ground_truth 做答案匹配
合计85,995100%

🌟 数据集特点

  • 领域覆盖完整。 覆盖 Math、Knowledge(STEM)、Long-Context 和 Code,分别面向数学推理、科学推理、长文本理解和代码生成,形成互补的 RL 能力训练分布。
  • 任务结果可验证。 各领域均保留明确的参考目标和结果判定方式:Math 和 Knowledge 使用可抽取、可校验的答案,Long-Context 保证上下文与答案相互对应,Code 通过程序执行结果和 testcase 判断输出是否正确。选择题、判断题、证明题、多问题以及依赖图片的题目已在构建流程中移除。
  • 奖励信号可靠。 参考答案、标准标签和执行判定经过一致性检查(LLM Judge、多模型共识、testcase 交叉校验),减少答案错误、标签错误和验证器误判对 RL 训练造成的噪声;无法确认标签的样本直接丢弃,不做猜测。
  • 难度适配 RL 训练。 数据难度围绕 RL 初始化模型的实际能力进行控制:通过率为 1(已掌握、无梯度)的样本移除;处于可学习区间的保留;通过率为 0 但标签已确认合法的保留,并交由在线动态采样调控。难度筛选不会修改任何标签。

🧪 使用样例:JustRL II

JustRL II 以 UltraData-RL-2609 作为可验证奖励训练集,将小模型推理 RL 扩展到 128K,并引入 critic。在极简 JustRL 配方之上,进一步采用长度自适应 advantage 估计与 critic,以提升长程 RL 的稳定性。

在基于本数据集的 JustRL II 实验设置中,AIME 2025 在约 300 步 RL 内由 61 提升到 81;最终使用 UltraData-RL-2609 完成后训练的 MiniCPM5-2B checkpoint 在 AIME 2025 上达到 86。完整消融与更多评测结果见 JustRL II 技术博客。

🏗️ 数据构建流程

阶段 1–2 完成数据准备,阶段 3–5 分别对应上述三个目标(可判定 → 可信 → 难度适配),阶段 6 整理发布。四个领域走同一套六阶段流程,使用各自的验证器与筛选规则。

  1. 数据准备与来源整合。 Math:DAPO、DeepScaler、DeepMath 的并集。Knowledge / STEM:OpenScienceReasoning-2。Long-Context:HotpotQA、Qasper、MuSiQue 扩写至更长上下文,加内部合成数据。Code:OpenCodeReasoning、OpenCodeReasoning-2、HardTests,并合成测试用例。
  2. 任务形式标准化与改写。 按训练器和验证器要求统一任务格式、答案字段和元数据。Math / Knowledge 改写为简答题;Long-Context 扩展上下文并保持问题与参考答案的对应关系;Code 统一 query、输入输出约定和提交格式。
  3. 可验证性过滤。 仅保留答案唯一、可自动校验且抽取格式统一的样本。Long-Context 样本须有明确的上下文—问题—答案关联;Code 样本须能在沙箱中对测试用例执行。
  4. 奖励可信性校验。 LLM Judge 审核题目与答案的一致性。Math / Knowledge 由多个独立模型重新求解、按共识修正标签(无共识则丢弃)。Long-Context 结合参考答案比对与多模型质量评估。Code 交叉验证测试用例、参考实现与预期输出,移除无效或无法执行的用例。
  5. 难度匹配。 在 RL 初始化 checkpoint 上多次 rollout,估算每条样本的经验通过率。通过率为 1 的样本移除;处于可学习区间的保留;通过率为 0 但标签已确认合法的保留并交由在线动态采样调控频率。本阶段只改变难度与采样权重,不改变参考标签。
  6. 格式整理与质量复核。 导出为统一 JSONL;检查可解析性、必需字段、唯一 ID、抽取规则与验证器配置;清理重复、近重复以及与公开评测集重叠的样本;复核 Math / Knowledge 唯一答案、Long-Context 上下文关联、Code 测试用例可执行性;记录来源、筛选版本与验证器版本。

各领域在阶段 2–4 使用的具体做法如下:

领域阶段 2 · 标准化阶段 3 · 可验证性阶段 4 · 奖励校验
Math / Knowledge改写为简答题答案抽取与匹配多模型共识
Long-Context扩展上下文,保持问答对应要求明确的上下文—答案关联参考答案比对 + 模型评估
Code统一 query 与输入输出约定沙箱执行测试用例测试用例 / 参考实现 / 输出交叉验证

📦 数据格式

数据以 JSONL 形式存储,每行对应一条完整的 RL 训练样本。发布版本采用统一的五字段结构:uuid、query、ground_truth、source 和 domain。

{
  "uuid": "{Domain}_00001",
  "query": "……待模型回答的完整题面……",
  "ground_truth": "……参考答案……",
  "source": "{Original Source} | UltraData-RL-2609",
  "domain": "{Domain}"
}
字段类型说明
uuidstring样本的全局唯一标识,由领域前缀和样本序号组成。
querystring待模型回答或完成的任务内容;长文本任务的完整上下文和问题均放在该字段中。
ground_truthstring | object参考答案或可用于验证的目标:Math / Knowledge / Long-Context 为参考答案字符串,Code 为测试用例对象(见下)。
sourcestring原始来源与 UltraData-RL-2609,以 `
domainstring取值为 Math、Knowledge、Long_Context、Code。

Code 题目均为标准输入输出型(call_type = std,fn_name = null),其 ground_truth 由等长数组 inputs 与 outputs 构成:第 i 项分别为第 i 组测例的完整标准输入与期望标准输出。验证完全基于执行:将 inputs[i] 送入候选程序的标准输入,收集标准输出,尾部空白归一化后与 outputs[i] 比对,全部通过视为正确。例如,一个含两组测例的 ground_truth:

{"inputs": ["3\n1 2 3\n", "1\n5\n"], "outputs": ["6\n", "5\n"]}

🚀 快速开始

from datasets import load_dataset

ds = load_dataset("openbmb/UltraData-RL-2609", "Math", split="train")
ds = load_dataset("openbmb/UltraData-RL-2609", "Knowledge", split="train")
ds = load_dataset("openbmb/UltraData-RL-2609", "Long-Context", split="train")
ds = load_dataset("openbmb/UltraData-RL-2609", "Code", split="train")

print(ds[0]["query"][:300])
print(ds[0]["ground_truth"])

可用 config:Math、Knowledge、Long-Context、Code。

💡 使用场景

  • 面向端侧模型的 RL / RLVR 后训练。
  • 按切片使用:数学推理(Math)、科学 / 知识推理(Knowledge)、长上下文多跳问答(Long-Context)、带可执行测例的程序生成(Code)。
  • 与 UltraData-SFT-2605 等 SFT 数据做配比研究。

⚠️ 注意事项与局限性

  • Code 需要自行准备验证器。 发布内容包含测试用例,不包含沙箱;使用者须自行运行提交代码以计算奖励。
  • 静态标签。 构建时使用的难度过滤与在线采样权重不作为字段发布,仅保留最终入选样本。
  • 去污范围。 仅覆盖构建时已知评测集,引入新基准前应另行检测。

📂 数据来源

  • Math:DAPO-Math-17k、DeepScaleR-Preview-Dataset、DeepMath-103K:公开的可验证数学 RL 数据集,取三者并集。
  • Knowledge / STEM:OpenScienceReasoning-2:科学推理题,整理为简答题形式。
  • Long-Context:HotpotQA、Qasper、MuSiQue:多跳与文档问答数据,扩写至更长上下文;另含内部合成数据。
  • Code:OpenCodeReasoning、OpenCodeReasoning-2、HardTests:竞赛编程题,配合合成的测试用例。

📜 许可与数据来源

本项目按 Apache 2.0 许可证发布。上游数据集分别采用 MIT、CC BY 4.0、CC BY-SA 4.0 许可,对由其派生的内容继续适用。Apache 2.0 不会覆盖或取代这些条款。

禁止未经授权的原样转载: 未经原作者(或本组织)事先书面许可,任何机构、组织或第三方平台严禁以任何形式直接转载、镜像、重新托管,或对项目产物进行商业化重新包装后再发布。

📖 引用

如果 UltraData-RL-2609 对您的研究有帮助,请考虑引用:

@misc{ultradata_rl_2609,
  title        = {UltraData-RL-2609},
  author       = {MiniCPM Team},
  year         = {2026},
  publisher    = {Hugging Face},
  howpublished = {\url{https://huggingface.co/datasets/openbmb/UltraData-RL-2609}}
}