用于对 RNA 剪接位点短序列基序进行评分的最大熵模型。
这是 Gene Yeo 等人发表的《Maximum entropy modeling of short sequence motifs with applications to RNA splicing signals》(https://doi.org/10.1089/1066527041410418)的非官方实现。
MaxEntScan 的官方发布版本位于 Burge 实验室 MaxEntScan 页面。
[!TIP] MultiMolecule 团队已确认,所提供的模型和检查点产生的中间表示与原始实现相同。
MaxEntScan 的发布团队并未为此模型撰写此模型卡片,因此本模型卡片由 MultiMolecule 团队编写。
MaxEntScan 是一种用于剪接供体(5')和剪接受体(3')序列基序的最大熵模型。它不是神经网络,并且没有可训练权重。模型参数是 Yeo 和 Burge(2004 年)根据人类剪接位点序列估计的固定最大熵概率表。
MaxEntScan 是一种无参数的最大熵模型。它执行固定的表查找,不包含分析器可归因于某个模块的可学习权重或浮点运算。作为模型固定参数的捆绑评分表包括:
score5:一个包含 16,384 个条目的 me2x5 概率表(4⁷ 个浮点数),通过 9 聚体中 7 个非保守位置的 4 进制哈希进行索引。score3:九个重叠的最大熵分解表(me2x3acc1..9),大小分别为 4⁷、4⁷、4⁷、4⁷、4⁷、4³、4⁴、4³、4⁴(总计 5 × 16384 + 2 × 64 + 2 × 256 = 82560 个浮点数)。| 模式 | 窗口大小 | 参数数量 (M) | 浮点运算数 (G) | 乘加运算数 (G) |
|---|---|---|---|---|
| score5 | 9 | 0.00 | 0.00 | 0.00 |
| score3 | 23 | 0.00 | 0.00 | 0.00 |
模型文件依赖于 multimolecule 库。您可以使用 pip 安装该库:
pip install multimolecule>>> import torch
>>> from multimolecule import RnaTokenizer, MaxEntScanModel, MaxEntScanConfig
>>> config = MaxEntScanConfig()
>>> model = MaxEntScanModel(config)
>>> tokenizer = RnaTokenizer.from_pretrained("multimolecule/maxentscan-score5")
>>> # MaxEntScan scores a raw fixed-length window; do not add special tokens.
>>> input = tokenizer("CAGGUAAGU", add_special_tokens=False, return_tensors="pt")["input_ids"]
>>> output = model(input)
>>> output.logits.shape
torch.Size([1, 1])>>> config = MaxEntScanConfig(mode="score3")
>>> model = MaxEntScanModel(config)
>>> output = model(torch.randint(4, (1, config.window)))
>>> output.logits.shape
torch.Size([1, 1])score5为固定9个核苷酸窗口;score3为固定23个核苷酸窗口ACGU;未知或N标记在查表前均替换为Aadd_special_tokens=False)inputs_embeds:不支持;模型仅对离散标记窗口进行评分MaxEntScan 未经过训练。其最大熵概率表由 Yeo 与 Burge(2004 年)通过迭代最大熵过程,从一组人类组成型剪接位点序列中一次性估计得出。已发表的概率表被直接复用。
score5:对 5'(供体)剪接位点在 9 个核苷酸窗口(3 个外显子核苷酸 + 6 个内含子核苷酸)内进行评分。评分通过已发表的me2x5最大熵概率表结合共有背景比率得出。score3:对 3'(受体)剪接位点在 23 个核苷酸窗口内进行评分。该 23 聚体按照已发表的最大熵分解方法,分解为 9 个重叠的最大熵子模型;评分是分子和分母子模型乘积的对数比率。模型参数为固定的最大熵概率表,这些表以纯文本文件形式随原始 Yeo 与 Burge(2004 年)MaxEntScan 工具一同发布:me2x5用于 5' 评分器,9 个最大熵分解矩阵me2x3acc1..9用于 3' 评分器。共有和背景比率是来自原始score5.pl和score3.pl程序的固定常数。
MaxEntScan 不使用神经网络预训练。其最大熵概率表复用自原始 MaxEntScan 发布版本。
@article{yeo2004maximum,
author = {Yeo, Gene and Burge, Christopher B.},
title = {Maximum entropy modeling of short sequence motifs with applications to RNA splicing signals},
journal = {Journal of Computational Biology},
volume = {11},
number = {2-3},
pages = {377--394},
year = {2004},
publisher = {Mary Ann Liebert, Inc.},
doi = {10.1089/1066527041410418}
}[!NOTE] 本仓库中分发的制品是 MultiMolecule 项目的一部分。 如果 MultiMolecule 对您的研究有所帮助,请按以下方式引用 MultiMolecule 项目:
@software{chen_2024_12638419,
author = {Chen, Zhiyuan and Zhu, Sophia Y.},
title = {MultiMolecule},
doi = {10.5281/zenodo.12638419},
publisher = {Zenodo},
url = {https://doi.org/10.5281/zenodo.12638419},
year = 2024,
month = may,
day = 4
}有关模型卡片的任何问题或意见,请使用 MultiMolecule 的 GitHub issues。
有关论文/模型的问题或意见,请联系 MaxEntScan 论文 的作者。
本模型实现采用 GNU Affero General Public License 许可证。
如需其他条款和说明,请参阅我们的 许可证常见问题。
SPDX-License-Identifier: AGPL-3.0-or-later