源仓库:
dkarthikeyan1/tcrt5_pre_tcrdb(HuggingFace) 任务:T 细胞受体(TCR / CDR3β)序列条件生成(pMHC → TCR,seq2seq)
TCRT5 是基于 T5 架构、针对 T 细胞受体(TCR)序列条件生成的预训练模型。 给定目标肽-MHC(pMHC)输入,可条件生成对应的 TCR(CDR3β)序列; 预训练于约 1400 万 CDR3β 序列(TCRdb)与约 78 万 pMHC 对(IEDB)的掩码片段重建任务。
T5ForConditionalGeneration(config.json):
| 组件 | 版本 |
|---|---|
| 昇腾 NPU | Ascend 910 |
| CANN | 8.5.1 |
| Python | 3.11 |
| PyTorch | 2.9.0 |
| torch_npu | 2.9.0.post1 |
| transformers | ≥ 4.50 |
pip install -r requirements.txt# 默认用例(pMHC → TCR 生成,自动选择 NPU)
python3 inference.py --device npu:0
# 指定输入
python3 inference.py --input-text "[PMHC]KLGGALQAK[SEP]YFAMYQENVAQTDVDTLYIIYRDYTWAELAYTWY[EOS]" --device npu:0inference.py 加载本仓 weights/ 的 T5ForConditionalGeneration 权重,执行 pMHC→TCR 条件生成,验证输出形状与数值。
npu:0(Ascend 910,CANN 8.5.1,PyTorch 2.9.0 / torch_npu 2.9.0.post1)[PMHC]KLGGALQAK[SEP]YFAMYQENVAQTDVDTLYIIYRDYTWAELAYTWY[EOS](编码后 46 tokens)NPU_INFERENCE_PASS=Trueinference.py 推理脚本(必选交付)
readme.md 部署说明文档(必选交付)
requirements.txt 环境依赖清单
weights/ 模型权重(model.safetensors 168MB + tokenizer + config)cc-by-nc-sa-4.0(非商用,署名-相同方式共享)