colibrì 的预转换权重——这是一个纯 C 引擎,通过从磁盘流式传输路由专家,可在具有约 25 GB RAM 的消费级机器上运行 GLM-5.2(7440 亿参数 MoE)。
这是 colibrì 的 coli convert 输出(convert_fp8_to_int4.py --ebits 4 --io-bits 8,包含用于原生投机解码的 MTP 头),上传此文件是为了让您无需下载 756 GB 的 FP8 检查点并花费一天时间进行转换。
⚠️ 这不是 GGUF / AWQ / GPTQ / MLX 模型。 它是 colibrì 自己的容器:对于每个量化权重,包含 name(U8,打包的 int4 半字节)和 name.qs(每行 F32 缩放因子),其量化数学与引擎的 C 内核完全一致。它仅适用于 colibrì 引擎。
# get the engine
git clone https://github.com/JustVugg/colibri && cd colibri/c && ./setup.sh
# download this repo to a FAST local disk (NVMe, ext4 — never a network/9p mount)
hf download jlnsrk/GLM-5.2-colibri-int4 --local-dir /nvme/glm52_i4
# chat (RAM budget, expert cache and MTP auto-detected)
COLI_MODEL=/nvme/glm52_i4 ./coli chat要求:Linux(或WSL2)、gcc + OpenMP、AVX2、≥16 GB内存、约400 GB可用NVMe空间。
| 文件 | 内容 |
|---|---|
out-*.safetensors | 密集权重(注意力/MLA、共享专家、嵌入)+ 21,504个路由专家,每行int4缩放;路由层/归一化层保持F32精度 |
| MTP分片 | GLM-5.2的多 token 预测头(第78层)——支持无损推测解码(约2个token/前向) |
config.json、tokenizer*.json、generation_config.json | 从基础仓库复制 |
转换过程:FP8(e4m3,128×128块缩放)→ f32 → 使用 np.rint 转换为int4,以匹配引擎的 lrintf —— 与本地转换的token结果完全一致。
基于 zai-org/GLM-5.2-FP8(MIT许可)转换而来。本衍生版本同样采用MIT许可。转换使用colibrì官方转换器,未作修改。