HuggingFace镜像/Nemotron-Science-v1
数据集数据集查看器文件和版本
下载使用量0

数据集描述:

Nemotron-Science-v1 是一个合成的科学推理数据集,包含两个子集:一个 MCQA 集,该子集在 Nemotron-Post-Training-v1 的 STEM 部分基础上进行了改进,使用 GPT-OSS-120B 生成 GPQA 风格的问题和推理轨迹;以及一个 RQA 集,包含合成的化学问题。

本数据集可用于商业用途。

Nemotron-Science-v1 数据集包含以下子集:

MCQA

该子集是对 Nemotron-Post-Training-Dataset-v1 中 STEM 子集的改进,使用 GPT-OSS-120B 生成了推理轨迹。该数据集由模拟 GPQA 风格主题和子主题的合成科学问题组成,旨在增强大型语言模型在科学领域的推理能力。

RQA

该数据集由合成的化学问题组成,旨在增强大型语言模型在科学领域的推理能力。

数据集所有者:

NVIDIA Corporation

数据集创建日期:

创建时间:2025 年 12 月 3 日
最后修改时间:2025 年 12 月 3 日

许可协议/使用条款:

本数据集受 知识共享署名 4.0 国际许可协议 (CC BY 4.0) 管辖。

预期用途:

本数据集面向 LLM 工程师和研究团队,用于开发和训练大型语言模型,重点是提高科学推理和问题解决能力。它适用于基于科学的模型开发流程中的监督训练和数据增强。

数据集特征

数据收集方法
合成 - 由 LLM 生成的科学问题与解答对

标注方法
合成 - 模型生成的解答和注释

数据集格式

模态:文本
格式:JSONL
结构:文本 + 元数据

数据集量化

子集样本数
MCQA174,155
RQA52,179
总计226,334

总磁盘大小:约 2.5 GB

伦理考量:

NVIDIA 认为可信 AI 是一项共同责任,我们已制定相关政策和实践,以支持各类 AI 应用的开发。当按照我们的服务条款下载或使用本数据集时,开发者应与其内部开发团队合作,确保该数据集满足相关行业和用例的要求,并应对意外的产品误用情况。
如发现质量、风险、安全漏洞或与 NVIDIA AI 相关的问题,请通过 此处 报告。