JEPA-DNA-HyenaDNA 是 JEPA-DNA 系列中的 HyenaDNA 骨干模型。JEPA-DNA 是一个模型无关的持续预训练框架,通过结合标准 token 级 DNA 语言建模与 Joint-Embedding Predictive Architecture (JEPA),为基因组基础模型奠定基础。与传统基因组模型完全依赖 token 级生成目标(掩码语言建模或下一 token 预测)并优先进行局部 token 重建不同,JEPA-DNA 还在潜在空间中监督模型的全局序列嵌入,迫使其预测被掩码基因组片段的功能表示,而不是它们的字面 token。这使学习信号从 token 恢复转向语义对齐,在保留底层骨干模型生成精度的同时,产生更具线性可分性和生物学相关性的特征。该检查点与 JEPA-DNA 论文 中所述原始研究工作的参数完全一致,使用它的代码可在 官方 JEPA-DNA Github 仓库 中找到。
JEPA-DNA-HyenaDNA 是 JEPA-DNA 的 HyenaDNA 变体。JEPA-DNA 是一个基因组基础模型训练框架,它在标准 DNA 语言模型预训练中加入 Joint-Embedding Predictive Architecture (JEPA) 目标。它在 HyenaDNA 骨干模型之上执行一个持续预训练阶段——该骨干模型是一种亚二次方长卷积/状态空间模型风格的算子模型,并以单核苷酸分辨率通过 next-token prediction (NTP) 目标进行训练——将 token 级学习与潜在空间预测相结合,以提升功能基因组表示。
该模型已可用于非商业用途。
适用条款:使用本模型受 NVIDIA 非商业许可证 约束,以完成 NVIDIA 适用的内部法务和开源发布审查流程为前提。
全球
JEPA-DNA 检查点适用于基因组学研究、表征学习和下游序列建模工作流。典型用途包括特征提取、线性探测、持续预训练研究,以及基于零样本嵌入的序列扰动评分。该模型不适用于诊断工具、临床决策系统或经验证的医疗产品。
Github 05/18/2026,见 https://github.com/NVIDIA-Digital-Bio/JEPA-DNA
Hugging Face 07/16/2026,见 https://huggingface.co/nvidia/NV-JEPA-DNA-HyenaDNA-16k
JEPA-DNA-HyenaDNA 采用 HyenaDNA 16k,这是一种亚二次复杂度的 长卷积 / 状态空间模型风格 算子模型,在单核苷酸分辨率下以 下一词元预测(NTP) 目标进行训练,并基于最后一个词元嵌入进行序列聚合。JEPA-DNA 在该骨干网络基础上扩展了一个目标编码器(骨干网络的指数移动平均副本)以及一个轻量级 4 层 Transformer 预测器,用于在降维嵌入空间中重建目标的潜在表示。训练采用基于跨度的掩码与重新掩码,以防止被掩码目标被平凡恢复,并分两个阶段进行:首先冻结骨干网络并优化预测器,然后在由原生 NTP 损失、JEPA 余弦相似度潜在预测损失以及 VICReg 风格的方差与协方差正则化组成的复合目标下,联合优化预测器与骨干网络:
| 模型名称 | 参数量 |
|---|---|
| JEPA-DNA-HyenaDNA-16k | 6 × 10⁵ |
输入类型: 文本(基因组 DNA 序列,已分词)
输入格式: DNA 字符串
输入参数: 1D
与输入相关的其他属性: 输入 DNA 序列的上下文长度最高可达 8,192 bp,采用单核苷酸分词和预处理,并基于最后一个 token 的嵌入进行序列聚合。
输出类型: 嵌入 / 潜在序列表示
输出格式: 嵌入(2D,序列长度 × 隐藏维度)和序列表示(1D,隐藏维度)
输出参数: 2D(嵌入),1D(序列表示)
与输出相关的其他属性: 输出为序列级嵌入和隐藏状态,可用于线性探针、基于嵌入的序列扰动评分以及检索类任务;它们不直接产生标签,而是供下游模型或评估器使用。
我们的 AI 模型针对 NVIDIA GPU 加速系统进行设计和/或优化。通过利用 NVIDIA 的硬件(例如 GPU 核心)和软件框架(例如 CUDA 库),与仅使用 CPU 的方案相比,该模型可实现更快的训练和推理速度。
运行时引擎:
支持的硬件微架构兼容性:
首选/支持的操作系统:
将基础模型与微调模型集成到 AI 系统中时,需要使用特定用例数据开展额外测试,以确保安全且有效地部署。遵循 V 模型方法,在单元级和系统级进行迭代测试与验证至关重要,以减轻风险,满足技术和功能需求,并确保在部署前符合安全与伦理标准。
属性: 持续预训练使用 hg38 人类参考基因组,约 600K 个窗口。内容为基因组 DNA 序列,编码为单核苷酸 token 的类文本序列。通过与原始基线保持数据一致性,持续训练阶段隔离了 JEPA-DNA 目标的影响。
数据模态
训练数据规模: 约 600K 个序列窗口。
按数据集划分的数据采集方法:
按数据集划分的标注方法:
评估在由 GFMBench-API 提供的 17 项基因组基准任务上进行,覆盖监督线性探测(9 项任务)和零样本(8 项任务)协议。
基准得分: 对于 HyenaDNA 骨干网络,JEPA-DNA 在所有评估任务上的平均 AUROC 提升约为 3.28%,单个任务的 AUROC 提升最高可达 +11.2%。报告的指标包括 AUROC、AUPRC 和马修斯相关系数(MCC)。
按数据集划分的数据收集方法:
按数据集划分的标注方法:
加速引擎: PyTorch - 2.6.0
测试硬件: NVIDIA Blackwell(B300 SXM6 GPU)
NVIDIA 认为可信 AI 是一项共同责任,我们已制定相应的政策和实践,以支持各类 AI 应用的开发。在下载或按照我们的服务条款使用时,开发者应与其内部模型团队协作,确保该模型满足相关行业和使用场景的要求,并防范可能出现的意外产品滥用。
用户有责任确保模型生成的分子的相关物理性质得到适当评估,并确保其符合适用的安全法规和伦理标准。
如需了解更多有关该模型伦理考量的详细信息,请参见 Model Card++ 的偏差、可解释性、安全与保障以及隐私子卡片。
请在此处报告模型质量、风险、安全漏洞或 NVIDIA AI 关注事项。