📦 UltraData 合集 | 🌐 UltraData | 🤗 MiniCPM5 系列
English | 中文
UltraData-RL-2609 是 UltraData L0-L4 分级数据管理框架 面向强化学习的 L3 合成与增强数据。面向 MiniCPM5-2B 后训练 RL 阶段构建,作为 UltraData-SFT-2605 在可验证奖励任务上的补充。它也是 JustRL II(Scaling Small LLMs to 128K Reasoning with a Critic)使用的训练语料;该方法在极简 JustRL 配方之上引入 critic,并将推理 RL 扩展到 128K 规模。
发布超过 8.5 万条高质量训练样本,覆盖数学推理、科学 / 知识问答、长文本理解与代码生成。数据以可验证任务为基本单元,统一整理为适用于 RL 训练的 JSONL,并围绕结果可判定、奖励可信、难度适配三个目标构建,为策略提供稳定、可追溯的训练信号。
发布版本共 85,995 条样本,覆盖四个 RL 方向。其中 Knowledge 对应构建说明中的 STEM / 科学推理切片。
| 方向 | 样本数 | 占比 | 任务 | 结果如何验证 |
|---|---|---|---|---|
| Math | 32,412 | 37.7% | 竞赛 / 教材类数学题,答案唯一可抽取 | 与 ground_truth 做答案匹配 |
| Code | 23,665 | 27.5% | 按自然语言描述生成程序 | 用 ground_truth 中的测试用例执行提交代码 |
| Long-Context | 18,046 | 21.0% | 长文档多跳问答(上下文包含在 query 中) | 与 ground_truth 做答案匹配,上下文保证支撑答案 |
| Knowledge | 11,872 | 13.8% | 科学 / 知识推理简答题 | 与 ground_truth 做答案匹配 |
| 合计 | 85,995 | 100% |
JustRL II 以 UltraData-RL-2609 作为可验证奖励训练集,将小模型推理 RL 扩展到 128K,并引入 critic。在极简 JustRL 配方之上,进一步采用长度自适应 advantage 估计与 critic,以提升长程 RL 的稳定性。
在基于本数据集的 JustRL II 实验设置中,AIME 2025 在约 300 步 RL 内由 61 提升到 81;最终使用 UltraData-RL-2609 完成后训练的 MiniCPM5-2B checkpoint 在 AIME 2025 上达到 86。完整消融与更多评测结果见 JustRL II 技术博客。
阶段 1–2 完成数据准备,阶段 3–5 分别对应上述三个目标(可判定 → 可信 → 难度适配),阶段 6 整理发布。四个领域走同一套六阶段流程,使用各自的验证器与筛选规则。
各领域在阶段 2–4 使用的具体做法如下:
| 领域 | 阶段 2 · 标准化 | 阶段 3 · 可验证性 | 阶段 4 · 奖励校验 |
|---|---|---|---|
| Math / Knowledge | 改写为简答题 | 答案抽取与匹配 | 多模型共识 |
| Long-Context | 扩展上下文,保持问答对应 | 要求明确的上下文—答案关联 | 参考答案比对 + 模型评估 |
| Code | 统一 query 与输入输出约定 | 沙箱执行测试用例 | 测试用例 / 参考实现 / 输出交叉验证 |
数据以 JSONL 形式存储,每行对应一条完整的 RL 训练样本。发布版本采用统一的五字段结构:uuid、query、ground_truth、source 和 domain。
{
"uuid": "{Domain}_00001",
"query": "……待模型回答的完整题面……",
"ground_truth": "……参考答案……",
"source": "{Original Source} | UltraData-RL-2609",
"domain": "{Domain}"
}| 字段 | 类型 | 说明 |
|---|---|---|
| uuid | string | 样本的全局唯一标识,由领域前缀和样本序号组成。 |
| query | string | 待模型回答或完成的任务内容;长文本任务的完整上下文和问题均放在该字段中。 |
| ground_truth | string | object | 参考答案或可用于验证的目标:Math / Knowledge / Long-Context 为参考答案字符串,Code 为测试用例对象(见下)。 |
| source | string | 原始来源与 UltraData-RL-2609,以 ` |
| domain | string | 取值为 Math、Knowledge、Long_Context、Code。 |
Code 题目均为标准输入输出型(call_type = std,fn_name = null),其 ground_truth 由等长数组 inputs 与 outputs 构成:第 i 项分别为第 i 组测例的完整标准输入与期望标准输出。验证完全基于执行:将 inputs[i] 送入候选程序的标准输入,收集标准输出,尾部空白归一化后与 outputs[i] 比对,全部通过视为正确。例如,一个含两组测例的 ground_truth:
{"inputs": ["3\n1 2 3\n", "1\n5\n"], "outputs": ["6\n", "5\n"]}from datasets import load_dataset
ds = load_dataset("openbmb/UltraData-RL-2609", "Math", split="train")
ds = load_dataset("openbmb/UltraData-RL-2609", "Knowledge", split="train")
ds = load_dataset("openbmb/UltraData-RL-2609", "Long-Context", split="train")
ds = load_dataset("openbmb/UltraData-RL-2609", "Code", split="train")
print(ds[0]["query"][:300])
print(ds[0]["ground_truth"])可用 config:Math、Knowledge、Long-Context、Code。
Math)、科学 / 知识推理(Knowledge)、长上下文多跳问答(Long-Context)、带可执行测例的程序生成(Code)。本项目按 Apache 2.0 许可证发布。上游数据集分别采用 MIT、CC BY 4.0、CC BY-SA 4.0 许可,对由其派生的内容继续适用。Apache 2.0 不会覆盖或取代这些条款。
禁止未经授权的原样转载: 未经原作者(或本组织)事先书面许可,任何机构、组织或第三方平台严禁以任何形式直接转载、镜像、重新托管,或对项目产物进行商业化重新包装后再发布。
如果 UltraData-RL-2609 对您的研究有帮助,请考虑引用:
@misc{ultradata_rl_2609,
title = {UltraData-RL-2609},
author = {MiniCPM Team},
year = {2026},
publisher = {Hugging Face},
howpublished = {\url{https://huggingface.co/datasets/openbmb/UltraData-RL-2609}}
}