OpenMOSS/Qwen3-8B-base-mla-topk8-rank256
模型介绍
文件和版本
Pull Requests
讨论
分析

Qwen3-8B-base-mla-topk8-rank256

本仓库包含针对 Qwen/Qwen3-8B-Base 进行 MLA 化转换的 仅注意力的增量权重。它不是一个独立的完整模型检查点。

变体

字段值
基础模型Qwen/Qwen3-8B-Base
基础修订49e3418fbbbca6ecbdf9608b4d22e5a407081db4
MLA 潜在秩256
每个 KV 头的 RoPE 维度8
训练检查点步数 4800
增量张量216
增量大小1.26 GiB
SHA-2565a0024eb0c4dbee9af7bed7b0082a0843956a722fbced658f42375d1ae479c91

该增量仅包含 q_proj、k_r_proj、低秩 kv_proj 以及 QK-Norm 参数。嵌入、MLP/MoE、输出投影、LM head 以及其他基础模型参数均被有意省略。

加载

请使用 MHA2MLA-V2 实现,从基础模型实例化 MLA 化架构,然后以 strict=False 加载 model.safetensors:

from safetensors.torch import load_file

delta = load_file("model.safetensors")
load_result = mla_model.load_state_dict(delta, strict=False)

加载增量前必须先对架构进行补丁处理。直接使用原生 AutoModelForCausalLM.from_pretrained(...) 加载本仓库不受支持。config.json 包含项目集成所需的逐层 RoPE 索引,以及经过净化的 MLAfication 元数据。

Files

  • model.safetensors:仅注意力模块的增量权重
  • config.json:基础架构、RoPE 索引和 MLAfication 元数据
  • manifest.json:来源信息、字节大小、张量数量和校验和

License

权重沿用基础 Qwen3 模型的 Apache 2.0 许可证。