Nemotron-Science-v1 是一个合成的科学推理数据集,包含两个子集:一个 MCQA 集,该子集在 Nemotron-Post-Training-v1 的 STEM 部分基础上进行了改进,使用 GPT-OSS-120B 生成 GPQA 风格的问题和推理轨迹;以及一个 RQA 集,包含合成的化学问题。
本数据集可用于商业用途。
Nemotron-Science-v1 数据集包含以下子集:
该子集是对 Nemotron-Post-Training-Dataset-v1 中 STEM 子集的改进,使用 GPT-OSS-120B 生成了推理轨迹。该数据集由模拟 GPQA 风格主题和子主题的合成科学问题组成,旨在增强大型语言模型在科学领域的推理能力。
该数据集由合成的化学问题组成,旨在增强大型语言模型在科学领域的推理能力。
NVIDIA Corporation
创建时间:2025 年 12 月 3 日
最后修改时间:2025 年 12 月 3 日
本数据集受 知识共享署名 4.0 国际许可协议 (CC BY 4.0) 管辖。
本数据集面向 LLM 工程师和研究团队,用于开发和训练大型语言模型,重点是提高科学推理和问题解决能力。它适用于基于科学的模型开发流程中的监督训练和数据增强。
数据收集方法
合成 - 由 LLM 生成的科学问题与解答对
标注方法
合成 - 模型生成的解答和注释
模态:文本
格式:JSONL
结构:文本 + 元数据
| 子集 | 样本数 |
|---|---|
| MCQA | 174,155 |
| RQA | 52,179 |
| 总计 | 226,334 |
总磁盘大小:约 2.5 GB
NVIDIA 认为可信 AI 是一项共同责任,我们已制定相关政策和实践,以支持各类 AI 应用的开发。当按照我们的服务条款下载或使用本数据集时,开发者应与其内部开发团队合作,确保该数据集满足相关行业和用例的要求,并应对意外的产品误用情况。
如发现质量、风险、安全漏洞或与 NVIDIA AI 相关的问题,请通过 此处 报告。