OpenMOSS/Qwen3-30B-A3B-base-mla-topk8-rank256
模型介绍
文件和版本
Pull Requests
讨论
分析

Qwen3-30B-A3B-base-mla-topk8-rank256

本仓库包含用于 Qwen/Qwen3-30B-A3B-Base 的 MLA 化转换的 仅注意力增量权重。它不是一个独立的完整模型检查点。

变体

字段值
基础模型Qwen/Qwen3-30B-A3B-Base
基础修订版本1b75feb79f60b8dc6c5bc769a898c206a1c6a4f9
MLA 潜在秩256
每个 KV head 的 RoPE 维度8
训练检查点第 4800 步
增量张量288
增量大小0.83 GiB
SHA-256244d4d3e37a91123544d602cd366de0f37c63834cbba0ed79fc159a6d2b9eb86

该增量仅包含 q_proj、k_r_proj、低秩 kv_proj 以及 QK-Norm 参数。嵌入、MLP/MoE、输出投影、LM head 以及其他基础模型参数已被有意省略。

加载

使用 MHA2MLA-V2 实现,基于基础模型实例化 MLA 化架构,然后以 strict=False 加载 model.safetensors:

from safetensors.torch import load_file

delta = load_file("model.safetensors")
load_result = mla_model.load_state_dict(delta, strict=False)

在加载 delta 之前,必须先为架构打上补丁。不支持直接使用原生 AutoModelForCausalLM.from_pretrained(...) 加载此仓库。config.json 包含项目集成所需的逐层 RoPE indices 和已清理的 MLAfication metadata。

Files

  • model.safetensors: 仅 attention 的 delta 权重
  • config.json: 基础架构、RoPE indices 和 MLAfication metadata
  • manifest.json: 来源、字节大小、tensor 数量和校验和

License

权重遵循基础 Qwen3 模型的 Apache 2.0 许可证。