本仓库包含 Qwen/Qwen3-8B-Base 的 MLAfication 转换所需的 仅注意力相关增量权重。它不是一个独立的完整模型检查点。
| 字段 | 值 |
|---|---|
| 基础模型 | Qwen/Qwen3-8B-Base |
| 基础修订版本 | 49e3418fbbbca6ecbdf9608b4d22e5a407081db4 |
| MLA 潜在秩 | 1024 |
| 每个 KV 头的 RoPE 维度 | 8 |
| 训练检查点 | step 1200 |
| 增量张量 | 216 |
| 增量大小 | 1.57 GiB |
| SHA-256 | 4fb00adef74293384b0a20e25dc7d70cc0f9c2903410fb875bdb18ee7e412ddb |
该增量仅包含 q_proj、k_r_proj、低秩 kv_proj 以及 QK-Norm 参数。Embeddings、MLP/MoE、output projection、LM head 以及其他基础模型参数均被有意省略。
使用 MHA2MLA-V2 实现从基础模型实例化 MLAfication 架构,然后以 strict=False 加载 model.safetensors:
from safetensors.torch import load_file
delta = load_file("model.safetensors")
load_result = mla_model.load_state_dict(delta, strict=False)在加载 delta 之前,必须先对架构进行修补。直接使用原生的 AutoModelForCausalLM.from_pretrained(...) 加载本仓库不受支持。config.json 包含项目集成所需的逐层 RoPE 索引,以及经过清理的 MLAfication metadata。
model.safetensors:仅包含 attention 的 delta 权重config.json:基础架构、RoPE 索引和 MLAfication metadatamanifest.json:来源、字节大小、tensor 数量和校验和权重遵循基础 Qwen3 模型的 Apache 2.0 许可证。