本仓库包含 HuggingFaceTB/SmolLM-1.7B 的 MLAfication 转换所产生的仅注意力增量权重。它并非可独立使用的完整模型检查点。
| 字段 | 值 |
|---|---|
| 基础模型 | HuggingFaceTB/SmolLM-1.7B |
| 基础版本 | d7449ff7241c863f3e8accc475155f0f97afa011 |
| MLA 潜在秩 | 1024 |
| 每 KV 头的 RoPE 维度 | 4 |
| 训练检查点 | 步数 2400 |
| 训练变体 | stage1+2-distill-QKV |
| 增量张量 | 168 |
| 增量大小 | 0.67 GiB |
| SHA-256 | 0adeacc1259906d2300c2ccf57156be0efb13e99872adf17797910359da89ac9 |
训练过程中,注意力以外的所有参数均被冻结,各注意力的输出投影也被冻结。因此,上传的增量恰好包含满足 "attn" in name and "o_proj" not in name 的参数;嵌入层、MLP、注意力之外的归一化层、输出投影以及 LM head 均已省略。历史源检查点本身已准确包含这些可训练的注意力张量。
请使用 MHA2MLA-V2 实现,从固定的基础模型实例化 MLAfication 架构,然后使用 strict=False 加载 model.safetensors:
from safetensors.torch import load_file
delta = load_file("model.safetensors")
load_result = mla_model.load_state_dict(delta, strict=False)在加载增量权重之前,必须先对模型架构进行修补。不支持直接使用原生 AutoModelForCausalLM.from_pretrained(...) 加载此仓库。config.json 中包含逐层 RoPE 索引以及已清理的 MLAfication 元数据。
model.safetensors:仅注意力层的增量权重config.json:基础架构、RoPE 索引以及 MLAfication 元数据manifest.json:来源、字节大小、张量数量与校验和权重遵循 SmolLM 基础模型的 Apache 2.0 许可协议。