HuggingFace镜像/deepmel
模型介绍
文件和版本
分析

DeepMEL

用于直接从 DNA 序列预测黑色素瘤特异性可及染色质区域和染色质主题的卷积和循环神经网络。

免责声明

这是 Liesbeth Minnoye、Ibrahim Ihsan Taskiran 等人在《Cross-species analysis of enhancer logic using deep learning》(https://doi.org/10.1101/gr.260844.120)中提出方法的非官方实现。

DeepMEL 的官方代码库位于 aertslab/DeepMEL。

[!TIP] MultiMolecule 团队已确认,所提供的模型和检查点产生的中间表示与原始实现相同。

DeepMEL 的发布团队并未为此模型撰写此模型卡片,因此本模型卡片由 MultiMolecule 团队编写。

模型详情

DeepMEL 是一种混合卷积/循环神经网络,训练用于直接从 500 bp DNA 序列预测 24 个黑色素瘤染色质主题(一个 4-MEL 黑素细胞主题、一个 7-MES 间充质样主题以及其他可及性程序)。每个输入序列由共享编码器处理,该编码器包括一维卷积、最大池化、时间分布式密集投影和双向 LSTM,随后是全连接层。相同的编码器独立应用于正向 DNA 链及其反向互补链;最终的 24 路解码器在每个分支中为每个主题生成一个 sigmoid 概率,并将两个分支的概率平均后作为模型的预测结果。有关训练过程的更多信息,请参考训练详情部分。

模型规格

卷积滤波器数量卷积核大小双向 LSTM 隐藏层大小全连接隐藏层大小主题数量参数数量(百万)浮点运算次数(百万)乘加运算次数(百万)最大标记数
12820128256243.4440.7620.19500

链接

  • 代码:multimolecule.deepmel
  • 数据:黑色素瘤细胞系单细胞ATAC-seq主题模型
  • 论文:Cross-species analysis of enhancer logic using deep learning
  • 开发者:Liesbeth Minnoye、Ibrahim Ihsan Taskiran、David Mauduit、Maurizio Fazio、Linde Van Aerschot、Gert Hulselmans、Valerie Christiaens、Samira Makhzami、Monika Seltenhammer、Panagiotis Karras、Aline Primot、Edouard Cadieu、Ellen van Rooijen、Jean-Christophe Marine、Giorgia Egidy、Ghanem-Elias Ghanem、Leonard Zon、Jasper Wouters、Stein Aerts
  • 模型类型:在500 bp DNA序列上构建的一维卷积神经网络(1D CNN)与双向长短期记忆网络(BiLSTM),结合反向互补平均法用于多任务染色质主题预测
  • 原始仓库:aertslab/DeepMEL

使用方法

模型文件依赖于multimolecule库。您可以使用pip安装该库:

pip install multimolecule

直接使用

染色质主题预测

您可以直接使用该模型预测500 bp DNA序列的24种黑色素瘤染色质主题活性:

>>> import torch
>>> from multimolecule import DnaTokenizer, DeepMelForSequencePrediction

>>> tokenizer = DnaTokenizer.from_pretrained("multimolecule/deepmel")
>>> model = DeepMelForSequencePrediction.from_pretrained("multimolecule/deepmel")
>>> sequence = "ACGT" * 125
>>> output = model(**tokenizer(sequence, return_tensors="pt"))

>>> output.logits.shape
torch.Size([1, 24])

接口

  • 输入长度:固定为500 bp DNA窗口
  • 字符集:ACGT(采用独热编码);反向互补序列在内部计算
  • 输出:24个染色质主题的对数几率(多标签二值型);postprocess返回每个主题经分支平均后的sigmoid概率

训练详情

DeepMEL的训练目标是预测源自黑色素瘤细胞系单细胞ATAC-seq的细胞类型特异性可及染色质主题。

训练数据

DeepMEL的训练数据基于黑色素瘤单细胞ATAC-seq实验得到的可及基因组区间,并将其建模为24个染色质主题(包括4-MEL黑素细胞样程序和7-MES间充质样程序)。每个训练样本是一个500 bp的基因组区间,标记有一个指示哪些主题处于活跃状态的二值向量。2号染色体被留出用于验证和测试。

训练流程

预训练

模型训练旨在最小化分支平均sigmoid概率与观察到的主题活性标签之间的多标签二值交叉熵损失。

  • 优化器:Adam
  • 损失函数:多标签二值交叉熵
  • 正则化:Dropout(池化后为0.2,LSTM输入和循环Dropout为0.1,双向LSTM后为0.2,预测头前为0.4)

引用

@article{minnoye2020deepmel,
  author    = {Minnoye, Liesbeth and Taskiran, Ibrahim Ihsan and Mauduit, David and Fazio, Maurizio and Van Aerschot, Linde and Hulselmans, Gert and Christiaens, Valerie and Makhzami, Samira and Seltenhammer, Monika and Karras, Panagiotis and Primot, Aline and Cadieu, Edouard and van Rooijen, Ellen and Marine, Jean-Christophe and Egidy, Giorgia and Ghanem, Ghanem-Elias and Zon, Leonard and Wouters, Jasper and Aerts, Stein},
  title     = {Cross-species analysis of enhancer logic using deep learning},
  journal   = {Genome Research},
  volume    = 30,
  number    = 12,
  pages     = {1815--1834},
  year      = 2020,
  publisher = {Cold Spring Harbor Laboratory Press},
  doi       = {10.1101/gr.260844.120}
}

[!NOTE] 本仓库中分发的制品是 MultiMolecule 项目的一部分。 如果 MultiMolecule 对您的研究有所帮助,请按以下方式引用 MultiMolecule 项目:

@software{chen_2024_12638419,
  author    = {Chen, Zhiyuan and Zhu, Sophia Y.},
  title     = {MultiMolecule},
  doi       = {10.5281/zenodo.12638419},
  publisher = {Zenodo},
  url       = {https://doi.org/10.5281/zenodo.12638419},
  year      = 2024,
  month     = may,
  day       = 4
}

联系方式

有关模型卡片的任何问题或意见,请使用 MultiMolecule 的 GitHub issues。

有关论文/模型的问题或意见,请联系 DeepMEL 论文 的作者。

许可证

本模型实现采用 GNU Affero General Public License 许可。

如需其他条款和说明,请参阅我们的 许可证常见问题。

SPDX-License-Identifier: AGPL-3.0-or-later