HuggingFace镜像/maxentscan-score5
模型介绍
文件和版本
分析

MaxEntScan

用于对 RNA 剪接位点短序列基序进行评分的最大熵模型。

免责声明

这是 Gene Yeo 等人发表的《Maximum entropy modeling of short sequence motifs with applications to RNA splicing signals》(https://doi.org/10.1089/1066527041410418)的非官方实现。

MaxEntScan 的官方发布版本位于 Burge 实验室 MaxEntScan 页面。

[!TIP] MultiMolecule 团队已确认,所提供的模型和检查点产生的中间表示与原始实现相同。

MaxEntScan 的发布团队并未为此模型撰写此模型卡片,因此本模型卡片由 MultiMolecule 团队编写。

模型详情

MaxEntScan 是一种用于剪接供体(5')和剪接受体(3')序列基序的最大熵模型。它不是神经网络,并且没有可训练权重。模型参数是 Yeo 和 Burge(2004 年)根据人类剪接位点序列估计的固定最大熵概率表。

模型规格

MaxEntScan 是一种无参数的最大熵模型。它执行固定的表查找,不包含分析器可归因于某个模块的可学习权重或浮点运算。作为模型固定参数的捆绑评分表包括:

  • score5:一个包含 16,384 个条目的 me2x5 概率表(4⁷ 个浮点数),通过 9 聚体中 7 个非保守位置的 4 进制哈希进行索引。
  • score3:九个重叠的最大熵分解表(me2x3acc1..9),大小分别为 4⁷、4⁷、4⁷、4⁷、4⁷、4³、4⁴、4³、4⁴(总计 5 × 16384 + 2 × 64 + 2 × 256 = 82560 个浮点数)。
模式窗口大小参数数量 (M)浮点运算数 (G)乘加运算数 (G)
score590.000.000.00
score3230.000.000.00

链接

  • 代码:multimolecule.maxentscan
  • 数据:由 Yeo 和 Burge 整理的人类 RefSeq 剪接位点序列
  • 论文:Maximum entropy modeling of short sequence motifs with applications to RNA splicing signals
  • 开发者:Gene Yeo、Christopher B. Burge
  • 模型类型:具有 5' 和 3' 剪接位点固定概率表的最大熵剪接位点评分
  • 原始仓库:Burge Lab MaxEntScan

使用方法

模型文件依赖于 multimolecule 库。您可以使用 pip 安装该库:

pip install multimolecule

直接使用

5' 剪接位点评分

>>> import torch
>>> from multimolecule import RnaTokenizer, MaxEntScanModel, MaxEntScanConfig

>>> config = MaxEntScanConfig()
>>> model = MaxEntScanModel(config)
>>> tokenizer = RnaTokenizer.from_pretrained("multimolecule/maxentscan-score5")
>>> # MaxEntScan scores a raw fixed-length window; do not add special tokens.
>>> input = tokenizer("CAGGUAAGU", add_special_tokens=False, return_tensors="pt")["input_ids"]
>>> output = model(input)
>>> output.logits.shape
torch.Size([1, 1])

3' 剪接位点评分

>>> config = MaxEntScanConfig(mode="score3")
>>> model = MaxEntScanModel(config)
>>> output = model(torch.randint(4, (1, config.window)))
>>> output.logits.shape
torch.Size([1, 1])

接口

  • 输入长度:score5为固定9个核苷酸窗口;score3为固定23个核苷酸窗口
  • 字母表:仅支持ACGU;未知或N标记在查表前均替换为A
  • 特殊标记:不添加(add_special_tokens=False)
  • inputs_embeds:不支持;模型仅对离散标记窗口进行评分
  • 输出:每个窗口对应一个标量剪接位点对数几率评分

训练详情

MaxEntScan 未经过训练。其最大熵概率表由 Yeo 与 Burge(2004 年)通过迭代最大熵过程,从一组人类组成型剪接位点序列中一次性估计得出。已发表的概率表被直接复用。

评分模式

  • score5:对 5'(供体)剪接位点在 9 个核苷酸窗口(3 个外显子核苷酸 + 6 个内含子核苷酸)内进行评分。评分通过已发表的me2x5最大熵概率表结合共有背景比率得出。
  • score3:对 3'(受体)剪接位点在 23 个核苷酸窗口内进行评分。该 23 聚体按照已发表的最大熵分解方法,分解为 9 个重叠的最大熵子模型;评分是分子和分母子模型乘积的对数比率。

训练数据

  • 来源:如 Yeo 与 Burge(2004 年)所述的人类 RefSeq 剪接位点序列。
  • 最大熵约束:剪接位点窗口内的成对及更高阶位置依赖性。

模型参数为固定的最大熵概率表,这些表以纯文本文件形式随原始 Yeo 与 Burge(2004 年)MaxEntScan 工具一同发布:me2x5用于 5' 评分器,9 个最大熵分解矩阵me2x3acc1..9用于 3' 评分器。共有和背景比率是来自原始score5.pl和score3.pl程序的固定常数。

训练过程

预训练

MaxEntScan 不使用神经网络预训练。其最大熵概率表复用自原始 MaxEntScan 发布版本。

引用

@article{yeo2004maximum,
  author    = {Yeo, Gene and Burge, Christopher B.},
  title     = {Maximum entropy modeling of short sequence motifs with applications to RNA splicing signals},
  journal   = {Journal of Computational Biology},
  volume    = {11},
  number    = {2-3},
  pages     = {377--394},
  year      = {2004},
  publisher = {Mary Ann Liebert, Inc.},
  doi       = {10.1089/1066527041410418}
}

[!NOTE] 本仓库中分发的制品是 MultiMolecule 项目的一部分。 如果 MultiMolecule 对您的研究有所帮助,请按以下方式引用 MultiMolecule 项目:

@software{chen_2024_12638419,
  author    = {Chen, Zhiyuan and Zhu, Sophia Y.},
  title     = {MultiMolecule},
  doi       = {10.5281/zenodo.12638419},
  publisher = {Zenodo},
  url       = {https://doi.org/10.5281/zenodo.12638419},
  year      = 2024,
  month     = may,
  day       = 4
}

联系方式

有关模型卡片的任何问题或意见,请使用 MultiMolecule 的 GitHub issues。

有关论文/模型的问题或意见,请联系 MaxEntScan 论文 的作者。

许可证

本模型实现采用 GNU Affero General Public License 许可证。

如需其他条款和说明,请参阅我们的 许可证常见问题。

SPDX-License-Identifier: AGPL-3.0-or-later