HuggingFace镜像/sptransformer
模型介绍
文件和版本
分析

SpTransformer

用于从pre-mRNA序列预测组织特异性剪接的Transformer网络。

免责声明

本项目是Ningyuan You等人发表的论文SpliceTransformer predicts tissue-specific splicing linked to human diseases的非官方实现。

SpliceTransformer(SpTransformer)的官方代码库位于ShenLab-Genomics/SpliceTransformer。

[!TIP] MultiMolecule团队已确认,所提供的模型和检查点能够生成与原始实现相同的中间表示。

SpTransformer的发布团队未为本模型编写此模型卡片,本模型卡片由MultiMolecule团队编写。

模型详情

SpTransformer(SpliceTransformer)是一种深度神经网络,可从pre-mRNA原始序列预测组织特异性剪接。 它将两个预训练的SpliceAI风格的扩张残差卷积特征提取器与一个可训练的输入投影路径相结合;拼接后的特征通过带有轴向位置嵌入的Sinkhorn transformer注意力块进行处理。 对于每个位置,该网络预测一个3通道的剪接位点分数(无剪接/受体/供体)以及15种人类组织中每个位置的剪接位点使用分数。 该模型在每个预测位置的两侧使用固定的4000个核苷酸侧翼上下文。 SpTransformer通常用于通过对参考序列和替代序列进行评分并计算差异来评估遗传变异对组织特异性剪接的影响。 有关训练过程的更多信息,请参考训练详情部分。

模型规格

层数隐藏层大小头数中间层大小最大序列长度参数数量 (M)浮点运算次数 (G)乘加运算次数 (G)上下文
825681024819217.07290.72144.654000

链接

  • 代码:multimolecule.sptransformer
  • 数据:GTEx 人类 15 种组织的 RNA-seq 数据,包含来自 GENCODE 的基因注释以及多物种序列数据
  • 论文:SpliceTransformer predicts tissue-specific splicing linked to human diseases
  • 开发者:Ningyuan You、Chang Liu、Yuxin Gu、Rong Wang、Hanying Jia、Tianyun Zhang、Song Jiang、Jinsong Shi、Ming Chen、Min-Xin Guan、Siqi Sun、Shanshan Pei、Zhihong Liu、Ning Shen
  • 模型类型:带有窗口局部注意力和 Sinkhorn 排序桶注意力的 Transformer 编码器,用于组织特异性剪接预测
  • 原始仓库:ShenLab-Genomics/SpliceTransformer

使用方法

模型文件依赖于 multimolecule 库。您可以使用 pip 进行安装:

pip install multimolecule

直接使用

RNA 剪接位点预测

您可以直接使用此模型来预测前体 mRNA 序列中每个核苷酸的组织特异性剪接:

>>> from multimolecule import RnaTokenizer, SpTransformerModel

>>> tokenizer = RnaTokenizer.from_pretrained("multimolecule/sptransformer")
>>> model = SpTransformerModel.from_pretrained("multimolecule/sptransformer")
>>> output = model(tokenizer("AGCAGUCAUUAUGGCGAA", return_tensors="pt")["input_ids"])

>>> output.keys()
odict_keys(['last_hidden_state', 'logits'])

logits张量重现了原始SpTransformer的输出:每个位置的3通道剪接位点得分(无剪接/受体/供体)以及每个组织(15种组织)的剪接位点使用得分。

下游用途

令牌预测

您可以使用[SpTransformerForTokenPrediction][multimolecule.models.SpTransformerForTokenPrediction]对SpTransformer进行微调,以实现每个核苷酸的组织特异性剪接回归,该模型在骨干网络之上添加了一个共享的令牌预测头。

接口

  • 输入长度:可变的前体mRNA序列
  • 侧翼上下文:每个预测位置两侧固定4000个核苷酸
  • 填充:末端用N填充
  • 输出:每个位置的3通道剪接位点得分(no-splice/acceptor/donor)+ 每个组织(15种组织)的剪接位点使用得分

训练详情

SpTransformer的训练目标是根据初级前体mRNA序列预测组织特异性剪接。

训练数据

SpTransformer的训练数据来源于15种人类组织的RNA-seq数据得到的剪接测量结果,并使用了来自GENCODE的基因注释以及多物种序列数据。 两个卷积特征提取器预先训练为SpliceAI风格的剪接位点预测器,并在下游微调中作为可训练子模块保留。 对于每个预测核苷酸,使用以该核苷酸为中心的序列窗口,当靠近转录本末端时,侧翼上下文用N(未知核苷酸)填充。

训练过程

预训练

该模型通过最小化剪接位点分类的交叉熵损失和每个组织剪接位点使用的回归损失的组合进行训练,将预测结果与来自RNA-seq的测量结果进行比较。

引用

@article{You2024,
  author    = {You, Ningyuan and Liu, Chang and Gu, Yuxin and Wang, Rong and Jia, Hanying and Zhang, Tianyun and Jiang, Song and Shi, Jinsong and Chen, Ming and Guan, Min-Xin and Sun, Siqi and Pei, Shanshan and Liu, Zhihong and Shen, Ning},
  title     = {{SpliceTransformer predicts tissue-specific splicing linked to human diseases}},
  journal   = {Nature Communications},
  year      = {2024},
  volume    = {15},
  number    = {1},
  pages     = {9129},
  month     = {oct},
  doi       = {10.1038/s41467-024-53088-6},
  issn      = {2041-1723},
  url       = {https://doi.org/10.1038/s41467-024-53088-6}
}

[!NOTE] 本仓库中分发的制品是 MultiMolecule 项目的一部分。 若 MultiMolecule 对您的研究有所帮助,请按以下方式引用 MultiMolecule 项目:

@software{chen_2024_12638419,
  author    = {Chen, Zhiyuan and Zhu, Sophia Y.},
  title     = {MultiMolecule},
  doi       = {10.5281/zenodo.12638419},
  publisher = {Zenodo},
  url       = {https://doi.org/10.5281/zenodo.12638419},
  year      = 2024,
  month     = may,
  day       = 4
}

联系方式

关于模型卡片的任何问题或意见,请使用 MultiMolecule 的 GitHub 议题。

关于论文/模型的问题或意见,请联系 SpliceTransformer 论文 的作者。

许可证

本模型实现基于 GNU Affero General Public License 许可。

如需其他条款和说明,请参考我们的 许可证常见问题。

SPDX-License-Identifier: AGPL-3.0-or-later