HuggingFace镜像/aparent
模型介绍
文件和版本
分析

APARENT

用于从序列预测人类3'UTR选择性多聚腺苷酸化(APA)的卷积神经网络。

免责声明

这是 Nicholas Bogard、Johannes Linder 等人所著《A Deep Neural Network for Predicting and Engineering Alternative Polyadenylation》(https://doi.org/10.1016/j.cell.2019.04.046)的非官方实现。

APARENT 的官方代码库位于 johli/aparent。

[!TIP] MultiMolecule 团队已确认,所提供的模型和检查点产生的中间表示与原始实现相同。

APARENT 的发布团队未为此模型撰写此模型卡片,因此本模型卡片由 MultiMolecule 团队编写。

模型详情

APARENT(APA REgression NeT)是一种卷积神经网络,其训练数据来源于超过 350 万个在 HEK293 细胞中通过迷你基因报告基因表达的随机化 3'UTR 多聚腺苷酸信号。给定一个固定长度为 205 nt 的 3'UTR/多聚腺苷酸序列,APARENT 可预测选择性多聚腺苷酸化同工型比例(一个标量)和位置切割分布。该模型主要用于评估遗传变异对 APA 调控的影响,并设计新的多聚腺苷酸化信号。有关训练过程的更多信息,请参阅训练详情部分。

原始作者推荐使用基础的、未归一化的 APARENT 模型进行同工型和变异效应预测。

模型规格

层数隐藏层大小参数数量(百万)浮点运算次数(十亿)乘加运算次数(十亿)最大标记数
42566.430.030.01205

链接

  • 代码:multimolecule.aparent
  • 数据:大规模平行多聚腺苷酸化 MPRA,GEO GSE113849
  • 论文:A Deep Neural Network for Predicting and Engineering Alternative Polyadenylation
  • 开发者:Nicholas Bogard、Johannes Linder、Alexander B. Rosenberg、Georg Seelig
  • 模型类型:用于从 3'UTR 序列预测选择性多聚腺苷酸化同工型和切割的 1D CNN
  • 原始代码库:johli/aparent

使用方法

模型文件依赖于multimolecule库。您可以使用pip安装它:

pip install multimolecule

直接使用

APA 异构体预测

您可以直接使用该模型来预测 3'UTR/多聚腺苷酸(polyA)序列的 APA 异构体比例:

>>> from multimolecule import RnaTokenizer, AparentForSequencePrediction

>>> tokenizer = RnaTokenizer.from_pretrained("multimolecule/aparent")
>>> model = AparentForSequencePrediction.from_pretrained("multimolecule/aparent")
>>> output = model(**tokenizer("ACGUACGUACGU", return_tensors="pt"))

>>> output.keys()
odict_keys(['logits'])

完整的 APARENT 同工型和切割输出可在主链上获取:

>>> from multimolecule import RnaTokenizer, AparentModel

>>> tokenizer = RnaTokenizer.from_pretrained("multimolecule/aparent")
>>> model = AparentModel.from_pretrained("multimolecule/aparent")
>>> output = model(**tokenizer("ACGUACGUACGU", return_tensors="pt"))

>>> output.keys()
odict_keys(['pooler_output', 'isoform_logits', 'cleavage_logits'])

接口

  • 输入长度:固定为 205 nt 的 3'UTR / polyA 序列
  • 输出(AparentModel):isoform_logits(标量 APA 比例)+ cleavage_logits(206 维位置切割分布)
  • 输出(AparentForSequencePrediction):仅 APA 同工型标量(logits)

训练详情

APARENT 经过训练,可联合预测随机化 3'UTR 多聚腺苷酸信号的 APA 同工型比例和位置切割分布。

训练数据

APARENT 的训练数据来自 350 多万条随机化 3'UTR 多聚腺苷酸信号序列,这些序列在 HEK293 细胞的微型基因报告基因上表达(一项大规模平行报告基因分析,MPRA)。3'UTR MPRA 文库的原始测序数据可在 GEO 登录号 GSE113849 获取。

本 APARENT 模型使用所有 MPRA 文库进行训练(未保留任何文库),以生成最佳的通用 APA 预测器;它与论文中评估的按文库保留模型不同。

训练过程

预训练

模型的训练目标是最小化一个组合目标函数:同工型比例的 sigmoid KL 散度和位置切割分布的 KL 散度,两者权重相等。

引用

@article{bogard2019adeep,
  author    = {Bogard, Nicholas and Linder, Johannes and Rosenberg, Alexander B. and Seelig, Georg},
  title     = {A Deep Neural Network for Predicting and Engineering Alternative Polyadenylation},
  journal   = {Cell},
  volume    = {178},
  number    = {1},
  pages     = {91--106.e23},
  year      = {2019},
  publisher = {Elsevier BV},
  doi       = {10.1016/j.cell.2019.04.046}
}

[!NOTE] 本仓库中分发的制品是 MultiMolecule 项目的一部分。 如果 MultiMolecule 对您的研究有帮助,请按以下方式引用 MultiMolecule 项目:

@software{chen_2024_12638419,
  author    = {Chen, Zhiyuan and Zhu, Sophia Y.},
  title     = {MultiMolecule},
  doi       = {10.5281/zenodo.12638419},
  publisher = {Zenodo},
  url       = {https://doi.org/10.5281/zenodo.12638419},
  year      = 2024,
  month     = may,
  day       = 4
}

联系方式

有关模型卡片的任何问题或意见,请使用 MultiMolecule 的 GitHub 议题。

有关论文/模型的问题或意见,请联系 APARENT 论文 的作者。

许可证

本模型实现采用 GNU Affero General Public License 许可证。

如需其他条款和说明,请参阅我们的 许可证常见问题。

SPDX-License-Identifier: AGPL-3.0-or-later