OpenMOSS/Qwen2.5-7B-base-mla-topk8-rank128
模型介绍
文件和版本
Pull Requests
讨论
分析

Qwen2.5-7B-base-mla-topk8-rank128

本仓库包含针对 Qwen/Qwen2.5-7B 的 MLAfication 转换所生成的 仅注意力增量权重。它不是一个可独立使用的完整模型检查点。

变体

字段值
基座模型Qwen/Qwen2.5-7B
基座版本d149729398750b98c0af14eb82c78cfe92750796
MLA 潜在秩128
每个 KV 头的 RoPE 维度8
训练检查点step 4800
训练变体stage1+2-distill-QKV
Delta 张量336
Delta 大小1.38 GiB
SHA-2560142dc97c7c30ce48ae9235b29fb44cbbf7a9fef9fda7374d11732646be5968c

本次训练冻结了所有非注意力参数,并冻结了每个注意力的输出投影。因此,上传的 Delta 恰好包含匹配 "attn" in name and "o_proj" not in name 的参数;嵌入、MLP、注意力之外的归一化、输出投影以及 LM head 均已省略。历史完整检查点中的冻结张量,在将基座张量转换为检查点 dtype 后,已针对固定的基座权重进行了严格校验。

加载

使用 MHA2MLA-V2 实现,从固定的基座模型实例化 MLAfication 架构,然后以 strict=False 加载 model.safetensors:

from safetensors.torch import load_file

delta = load_file("model.safetensors")
load_result = mla_model.load_state_dict(delta, strict=False)

加载增量权重前,必须先对模型架构进行补丁处理。直接通过原生的 AutoModelForCausalLM.from_pretrained(...) 加载本仓库不受支持。config.json 包含逐层 RoPE 索引以及已清洗的 MLA 化元数据。

文件

  • model.safetensors:仅注意力的增量权重
  • config.json:基础架构、RoPE 索引以及 MLA 化元数据
  • manifest.json:来源信息、字节大小、张量数量和校验和

许可证

权重遵循 Qwen2.5 基础模型的 Apache 2.0 许可证。