本仓库包含用于对 HuggingFaceTB/SmolLM-1.7B 进行 MLAfication 转换的 仅注意力增量权重。它并非独立完整模型检查点。
| 字段 | 值 |
|---|---|
| 基础模型 | HuggingFaceTB/SmolLM-1.7B |
| 基础修订版本 | d7449ff7241c863f3e8accc475155f0f97afa011 |
| MLA 潜在秩 | 384 |
| 每个 KV 头的 RoPE 维度 | 2 |
| 训练检查点 | 步数 8000 |
| 训练变体 | stage1+2-distill-QKV |
| Delta 张量数 | 168 |
| Delta 大小 | 0.49 GiB |
| SHA-256 | 2a2e1812d02e35cfddbcd915b515dffe8226e1ec9454d3a59f507c8c16e77f09 |
本次训练冻结了注意力之外的所有参数,并冻结了每个注意力输出投影。因此,上传的 Delta 权重恰好包含满足 "attn" in name and "o_proj" not in name 的参数;嵌入、MLP、注意力之外的归一化、输出投影以及 LM head 均被省略。来自历史完整检查点的冻结张量,在将基础张量转换为检查点 dtype 后,已与固定的基础权重精确核验一致。
使用 MHA2MLA-V2 实现,从固定的基础模型实例化 MLAfication 架构,然后使用 strict=False 加载 model.safetensors:
from safetensors.torch import load_file
delta = load_file("model.safetensors")
load_result = mla_model.load_state_dict(delta, strict=False)加载增量权重之前,必须先修补架构。不支持直接使用原版 AutoModelForCausalLM.from_pretrained(...) 加载该仓库。config.json 包含逐层 RoPE 索引,以及已清理的 MLA 化元数据。
model.safetensors:仅注意力层的增量权重config.json:基础架构、RoPE 索引以及 MLA 化元数据manifest.json:来源、字节大小、张量数量和校验和该权重遵循 SmolLM 基础模型的 Apache 2.0 许可证。