HuggingFace镜像/optmrl
模型介绍
文件和版本
分析

OptMRL

用于从编码序列上游50个核苷酸预测mRNA平均核糖体负载(MRL)的卷积神经网络。

免责声明

这是 Frederick Korbel 等人发表的《Interpreting Deep Neural Networks for the Prediction of Translation Rates》(https://doi.org/10.1101/2023.06.02.543405)一文的非官方实现。

OptMRL 的官方代码库位于 ohlerlab/mlcis。

[!TIP] MultiMolecule 团队已确认,所提供的模型和检查点能够生成与原始实现相同的中间表示。

OptMRL 的发布团队并未为此模型撰写此模型卡片,本模型卡片由 MultiMolecule 团队编写。

模型详情

OptMRL 是一个小型一维卷积神经网络,其训练目的是根据紧邻编码序列上游的5'非翻译区(5'UTR)的50个核苷酸序列,预测平均核糖体负载(MRL)——一种源自多核糖体图谱分析的翻译效率代理指标。该模型首先在约260,000个随机5'UTR报告基因上进行预训练,然后在约20,000个人源内源性5'UTR上进行微调。有关训练过程的更多信息,请参阅训练详情部分。

该网络架构由三个 Conv1D 层堆叠而成(120个过滤器,核大小为8,same 填充,ReLU激活函数),随后是一个 Flatten 层、一个具有ReLU激活函数和dropout的40单元 Dense 瓶颈层,以及一个最终的标量 Dense 回归头。

模型规格

层数隐藏层大小参数数量(百万)浮点运算次数(百万)乘加运算次数(百万)最大标记数
5400.47624.0412.0050

链接

  • 代码:multimolecule.optmrl
  • 数据:260,000个随机5'UTR报告基因(预训练)+ 20,000个人源5'UTR报告基因(微调)
  • 论文:Interpreting Deep Neural Networks for the Prediction of Translation Rates
  • 开发人员:Frederick Korbel、Ekaterina Eroshok、Uwe Ohler
  • 模型类型:用于从5'UTR序列回归平均核糖体负载的一维CNN
  • 原始代码库:ohlerlab/mlcis

使用方法

模型文件依赖于multimolecule库。您可以使用pip安装该库:

pip install multimolecule

直接使用

平均核糖体负载预测

您可以直接使用此模型来预测50核苷酸5'UTR窗口的平均核糖体负载:

>>> from multimolecule import RnaTokenizer, OptMrlForSequencePrediction

>>> tokenizer = RnaTokenizer.from_pretrained("multimolecule/optmrl")
>>> model = OptMrlForSequencePrediction.from_pretrained("multimolecule/optmrl")
>>> sequence = "ACGU" * 12 + "AC"  # 50 nt
>>> input = tokenizer(sequence, add_special_tokens=False, return_tensors="pt")
>>> output = model(**input)

>>> output.logits.shape
torch.Size([1, 1])

接口

  • 输入长度:从编码序列上游紧邻区域截取的固定50 nt的5'UTR窗口
  • 填充方式:较短序列右侧用零填充至50 nt;较长序列截断为前50 nt
  • 字符集:仅包含ACGU;未知字符/N标记的独热信号为零
  • 特殊标记:不添加(add_special_tokens=False)
  • 输出:每个窗口对应一个标量平均核糖体负载(MRL)分数

训练详情

OptMRL首先在大型随机5'UTR报告基因库上进行预训练,然后在较小的内源性人类5'UTR库上进行微调。

训练数据

  • 预训练:约260,000个随机5'UTR报告基因,均配有多聚核糖体分析MRL测量值。
  • 微调:约20,000个人类内源性5'UTR报告基因,均配有多聚核糖体分析MRL测量值。

每个报告基因包含编码序列上游紧邻区域的50核苷酸5'UTR窗口,以及一个标量MRL标签。

注意[RnaTokenizer][multimolecule.RnaTokenizer]会自动将"T"转换为"U",若需禁用此功能,可传入replace_T_with_U=False。

训练流程

预训练

模型首先以回归任务形式预训练,用于预测每个随机5'UTR报告基因的实测MRL值,随后使用相同的回归目标在人类5'UTR报告基因上进行端到端微调。发布的模型为微调后的模型。

引用

@article{korbel2023interpreting,
  author    = {Korbel, Frederick and Eroshok, Ekaterina and Ohler, Uwe},
  title     = {Interpreting Deep Neural Networks for the Prediction of Translation Rates},
  journal   = {bioRxiv},
  publisher = {Cold Spring Harbor Laboratory},
  year      = {2023},
  doi       = {10.1101/2023.06.02.543405}
}

[!NOTE] 本仓库中分发的工件是 MultiMolecule 项目的一部分。 如果 MultiMolecule 对您的研究有所帮助,请按以下方式引用 MultiMolecule 项目:

@software{chen_2024_12638419,
  author    = {Chen, Zhiyuan and Zhu, Sophia Y.},
  title     = {MultiMolecule},
  doi       = {10.5281/zenodo.12638419},
  publisher = {Zenodo},
  url       = {https://doi.org/10.5281/zenodo.12638419},
  year      = 2024,
  month     = may,
  day       = 4
}

联系方式

关于模型卡片的任何问题或意见,请使用 MultiMolecule 的 GitHub issues。

关于论文/模型的问题或意见,请联系 OptMRL 论文 的作者。

许可证

本模型实现采用 GNU Affero General Public License 许可。

如需其他条款和说明,请参考我们的 许可证常见问题。

SPDX-License-Identifier: AGPL-3.0-or-later