InternLM/Intern-MemDec-4B
模型介绍
文件和版本
Pull Requests
讨论
分析

Intern-MemDec-4B

Intern-S2

💻 GitHub 仓库 • 🤗 模型集合 • 📖 MemSFT 论文

简介

我们推出 Intern-MemDec-4B,这是一款记忆解码器,旨在为 Intern-S2 基础模型扩展专业领域知识与能力。它是一个辅助模型组件,而非独立的语言模型:在推理过程中,Intern-S2 基础模型与记忆解码器并行处理相同的上下文,同时由轻量级的 token 级路由器动态融合二者的预测结果。

科学知识具有长尾分布特性且不断演进。经过固定后训练的基础模型无法完全覆盖所有专业子领域、任务协议或新兴发现。为每个领域更新整个基础模型还可能破坏其通用推理、指令遵循、多模态及智能体能力。Intern-MemDec-4B 则提供了一种模块化的领域扩展机制。Intern-S2 基础模型保持不变并作为主要推理引擎,而附加的记忆模块会在需要时提供额外的生物学知识和重复出现的任务模式。

Intern-MemDec-4B 通过将领域数据中基于检索的证据压缩为可复用的参数化模块进行训练。在推理时,它无需访问原始的检索数据存储。

重要提示:Intern-MemDec-4B 并非设计为独立加载或使用的对话模型。它必须与兼容的 Intern-S2 基础模型以及相应的融合配置或路由器一同部署。

特性

  • 模块化领域扩展:Intern-MemDec-4B 在不更新 Intern-S2 基础模型参数的情况下,增添专业领域知识与任务能力。通过将领域适配转变为记忆模块附加而非基础模型重写,它提供了一种实用方法,在保持原始基础模型不变的前提下,为通用科学基础模型扩展 DNA、RNA、蛋白质及生物分子相互作用等专业知识。
  • 自适应融合并保留通用能力:Intern-S2 基础模型与生物记忆模块并行处理相同的解码上下文,轻量级的 token 级路由器动态决定二者对每个下一个 token 预测的贡献。记忆分支可增强生物学相关输入的专业预测,而基础模型在通用推理、指令遵循、事实知识、多模态理解及智能体任务上仍保持主导地位,减少对模型原有能力的干扰。
  • 可复用且可扩展的参数化记忆:领域证据被压缩为可复用的参数化模块,因此在线推理无需原始检索数据存储。训练完成后,记忆模块可通过匹配的路由器或融合配置附加到兼容的 Intern-S2 基础模型上。该方法同样适用于其他目标领域的最新数据,使独立训练的记忆模块能够随着科学领域的发展不断引入新知识与能力。

工作原理

在每个解码步骤中,Intern-S2 主干模型与 Intern-MemDec-4B 接收相同的输入上下文,并独立生成下一个 token 的预测结果。一个轻量级路由模块会分析来自两个分支的信号,进而决定各自对最终预测结果的贡献权重。

面对生物学相关输入时,路由模块可提高记忆分支的贡献比例,以增强专业领域的预测能力;而处理通用或无关领域输入时,它能保持主干模型的主导地位,从而保留其原有的推理能力、指令遵循能力、事实性知识、多模态交互及智能体行为。因此,新的领域能力可通过独立训练、即插即用的记忆模块来添加,无需对整个模型进行反复的全量微调。

记忆解码器架构

性能表现

我们在 Biology-Instructions 的全部 21 项任务上,对 Intern-MemDec-4B 与 Intern-S2-Preview-397B 组合模型进行了评估。附加的生物记忆模块将平均得分从 56.92 提升至 60.32(提高 3.40 分)。技术报告中的评估还显示,该模型在通用和多模态基准测试中表现出与基础模型广泛可比的能力,这支持了记忆解码器作为领域扩展接口的设计初衷,即能够在扩展特定领域能力的同时,保留基础模型的通用性能。

Biology-Instructions 与跨领域能力雷达图

(a)Biology-Instructions 各任务类别性能(b)跨领域能力分布

Biology-Instructions 任务结果

所有分数均以 0–100 分制呈现。

Biology-Instructions 任务Intern-S2-Preview-397B+ Intern-MemDec-4B
DNA-cpd63.1172.57
DNA-emp19.9527.25
DNA-enhancer activity53.6860.71
DNA-pd84.4089.12
DNA-tf-h56.5755.99
DNA-tf-m56.9667.09
Multi-sequence antibody-antigen40.2436.44
Multi-sequence promoter-enhancer interaction22.4638.47
Multi-sequence RNA-protein interaction84.7487.34
Multi-sequence siRNA efficiency63.0560.63
Protein-Fluorescence70.4872.23
Protein-FunctionEC61.8860.10
Protein-Solubility68.6068.00
Protein-Stability69.6767.80
Protein-Thermostability58.4453.97
RNA-CRISPROnTarget6.6117.18
RNA-Isoform82.6584.81
RNA-MeanRibosomeLoading56.2059.71
RNA-Modification59.6460.48
RNA-NoncodingRNAFamily78.8085.70
RNA-ProgrammableRNASwitches37.1341.23
平均得分56.9260.32

领域覆盖范围

本版本仅覆盖生物学领域。其训练和评估重点在于生物序列理解以及涉及DNA、RNA、蛋白质和生物分子相互作用的预测任务。代表性任务类别包括:

  • DNA属性、增强子活性和转录因子预测;
  • RNA修饰、异构体、调控和相互作用预测;
  • 蛋白质功能、溶解度、稳定性、荧光性和热稳定性预测;
  • 抗体-抗原及其他多序列生物分子相互作用任务。

Intern-MemDec-4B不应被视为涵盖所有科学学科的通用存储器。要将Intern-S2扩展到其他领域,可以在目标领域的最新高质量数据上训练单独的记忆解码器。由此产生的存储器能够将新的领域知识和专业能力注入骨干模型,而无需重写骨干参数。这使得记忆接口适用于随着科学数据和任务需求的发展而进行持续的领域扩展。

快速开始

我们建议使用LMDeploy(>= 0.15.0)来部署模型套件——internlm/Intern-S2-Preview-397B-FP8大语言模型和internlm/Intern-MemDec-4B记忆模型。

pip install "lmdeploy>=0.15.0"

在 4× H200 GPU 上,通过以下命令启动服务:

lmdeploy serve api_server internlm/Intern-S2-Preview-397B-FP8 \
  --backend pytorch \
  --tp 4 \
  --trust-remote-code \
  --hf-overrides '{"memory_model_path": "internlm/Intern-MemDec-4B"}'

该服务默认在 http://0.0.0.0:23333 暴露与 OpenAI 兼容的 API。可通过以下方式进行查询:

curl http://localhost:23333/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "internlm/Intern-S2-Preview-397B-FP8",
    "messages": [{"role": "user", "content": "<PROTEIN> GSSGSSGPSKFIEGLRNEEATEGDTATLWCELSKAAPVEWRKGHETLRDGDRHSLRQDGSRCELQIRGLAVVDAGEYSCVCGQERTSATLTVRALPARFIESGPSSG </PROTEIN> What is the EC number associated with the enzymatic function of this protein? Please put the final enzyme within \\boxed{} using an EC number such as ECx.x.x.x, and separate multiple entries with commas."}]
  }'

在本示例中,模型返回预测的酶类别:

\boxed{EC2.7.11.-,EC2.7.11.1}

兼容性

  • Intern-MemDec-4B 必须通过支持 Memory Decoder 的推理运行时与受支持的 Intern-S2 主干模型配合使用。目前,Intern-S2-Preview-397B 是唯一受支持的主干模型。
  • 尽管内存检查点设计为可在兼容的主干模型规模间复用,但自适应路由器依赖于所选的主干模型-内存对。仅使用为该对明确发布的路由器或融合配置。

引用

@misc{wang2026memsftmitigatingalignmenttax,
      title={MemSFT: Mitigating Alignment Tax with an External Parametric Memory}, 
      author={Jiarui Wang and Xiang Shi and Jiaqi Cao and Rubin Wei and Xiquan Wang and Hao Sun and Jingzhi Wang and Zhiqi Yang and Qipeng Guo and Bowen Zhou and Zhouhan Lin},
      year={2026},
      eprint={2607.25614},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2607.25614}, 
}
@article{cao2026memory,
  title={Memory decoder: A pretrained, plug-and-play memory for large language models},
  author={Cao, Jiaqi and Wang, Jiarui and Wei, Rubin and Guo, Qipeng and Chen, Kai and Zhou, Bowen and Lin, Zhouhan},
  journal={Advances in Neural Information Processing Systems},
  volume={38},
  pages={115487--115510},
  year={2026}
}