OpenMOSS/SmolLM-1.7B-base-mla-topk2-rank640
模型介绍
文件和版本
Pull Requests
讨论
分析

SmolLM-1.7B-base-mla-topk2-rank640

该仓库包含用于 HuggingFaceTB/SmolLM-1.7B 的 MLAfication 转换的 仅注意力层的增量权重。它并非独立的完整模型检查点。

变体

字段取值
基础模型HuggingFaceTB/SmolLM-1.7B
基础版本d7449ff7241c863f3e8accc475155f0f97afa011
MLA 潜在秩640
每个 KV head 的 RoPE 维度2
训练检查点第 5600 步
训练变体stage1+2-distill-QKV
增量张量168
增量大小0.56 GiB
SHA-256aba8fbaf9ef079a5ca7695c305346c7f1c764dc79435153b6f10352c6594780d

本次训练冻结了注意力之外的所有参数,并冻结了每个注意力的输出投影。因此,上传的增量权重恰好只包含名称满足 "attn" in name and "o_proj" not in name 的参数;嵌入、MLP、注意力之外的归一化、输出投影以及 LM head 均被省略。历史完整检查点中的冻结张量在将基础张量转换为检查点 dtype 后,已与固定版本的基础权重进行了精确校验。

加载

使用 MHA2MLA-V2 实现,从固定版本的基础模型实例化 MLAfication 架构,然后以 strict=False 加载 model.safetensors:

from safetensors.torch import load_file

delta = load_file("model.safetensors")
load_result = mla_model.load_state_dict(delta, strict=False)

在加载 delta 前,必须先修补架构。直接使用未经修改的 AutoModelForCausalLM.from_pretrained(...) 加载该仓库不受支持。config.json 包含逐层 RoPE 索引以及经过清洗的 MLAfication 元数据。

文件

  • model.safetensors:仅 attention 的 delta 权重
  • config.json:基础架构、RoPE 索引和 MLAfication 元数据
  • manifest.json:溯源、字节大小、张量数量和校验和

许可证

这些权重遵循 SmolLM 基座模型的 Apache 2.0 许可证。