本仓库包含对 Qwen/Qwen2.5-7B 进行 MLA 化转换的 仅注意力的增量权重。它不是一个独立的完整模型检查点。
| 字段 | 值 |
|---|---|
| 基础模型 | Qwen/Qwen2.5-7B |
| 基础版本 | d149729398750b98c0af14eb82c78cfe92750796 |
| MLA 潜在秩 | 512 |
| 每个 KV 头的 RoPE 维度 | 8 |
| 训练检查点 | step 180 |
| 训练变体 | stage1+2-distill-QKV |
| 增量张量 | 336 |
| 增量大小 | 1.47 GiB |
| SHA-256 | 09e3c288e055711f3413457e32f0f3397ead889d472b15ddabb625c6f96dc684 |
本次训练冻结了注意力层以外的所有参数,并冻结了每个注意力输出投影。因此,上传的增量恰好包含满足 "attn" in name and "o_proj" not in name 的参数;嵌入层、MLP、注意力层以外的归一化层、输出投影以及 LM head 均已省略。来自历史完整检查点的冻结张量在将基础张量转换为检查点 dtype 后,已与固定基础权重进行了精确校验。
请使用 MHA2MLA-V2 实现,从固定基础模型实例化 MLA 化架构,然后使用 strict=False 加载 model.safetensors:
from safetensors.torch import load_file
delta = load_file("model.safetensors")
load_result = mla_model.load_state_dict(delta, strict=False)在加载增量权重之前,必须先修补模型架构。直接使用原生 AutoModelForCausalLM.from_pretrained(...) 加载此仓库不受支持。config.json 中包含逐层 RoPE 索引以及已清理的 MLAfication 元数据。
model.safetensors:仅注意力部分的增量权重config.json:基础架构、RoPE 索引和 MLAfication 元数据manifest.json:溯源信息、字节大小、张量数量和校验和该权重遵循 Qwen2.5 基础模型的 Apache 2.0 许可证。