OpenMOSS/SmolLM-1.7B-base-mla-topk4-rank1024
模型介绍
文件和版本
Pull Requests
讨论
分析

SmolLM-1.7B-base-mla-topk4-rank1024

本仓库包含 HuggingFaceTB/SmolLM-1.7B 的 MLAfication 转换所产生的仅注意力增量权重。它并非可独立使用的完整模型检查点。

变体

字段值
基础模型HuggingFaceTB/SmolLM-1.7B
基础版本d7449ff7241c863f3e8accc475155f0f97afa011
MLA 潜在秩1024
每 KV 头的 RoPE 维度4
训练检查点步数 2400
训练变体stage1+2-distill-QKV
增量张量168
增量大小0.67 GiB
SHA-2560adeacc1259906d2300c2ccf57156be0efb13e99872adf17797910359da89ac9

训练过程中,注意力以外的所有参数均被冻结,各注意力的输出投影也被冻结。因此,上传的增量恰好包含满足 "attn" in name and "o_proj" not in name 的参数;嵌入层、MLP、注意力之外的归一化层、输出投影以及 LM head 均已省略。历史源检查点本身已准确包含这些可训练的注意力张量。

加载

请使用 MHA2MLA-V2 实现,从固定的基础模型实例化 MLAfication 架构,然后使用 strict=False 加载 model.safetensors:

from safetensors.torch import load_file

delta = load_file("model.safetensors")
load_result = mla_model.load_state_dict(delta, strict=False)

在加载增量权重之前,必须先对模型架构进行修补。不支持直接使用原生 AutoModelForCausalLM.from_pretrained(...) 加载此仓库。config.json 中包含逐层 RoPE 索引以及已清理的 MLAfication 元数据。

文件

  • model.safetensors:仅注意力层的增量权重
  • config.json:基础架构、RoPE 索引以及 MLAfication 元数据
  • manifest.json:来源、字节大小、张量数量与校验和

许可

权重遵循 SmolLM 基础模型的 Apache 2.0 许可协议。