HuggingFace镜像/GLM-5.2-colibri-int4
模型介绍
文件和版本
分析

GLM-5.2 — colibrì int4 容器(约 370 GB)

colibrì 的预转换权重——这是一个纯 C 引擎,通过从磁盘流式传输路由专家,可在具有约 25 GB RAM 的消费级机器上运行 GLM-5.2(7440 亿参数 MoE)。

这是 colibrì 的 coli convert 输出(convert_fp8_to_int4.py --ebits 4 --io-bits 8,包含用于原生投机解码的 MTP 头),上传此文件是为了让您无需下载 756 GB 的 FP8 检查点并花费一天时间进行转换。

⚠️ 这不是 GGUF / AWQ / GPTQ / MLX 模型。 它是 colibrì 自己的容器:对于每个量化权重,包含 name(U8,打包的 int4 半字节)和 name.qs(每行 F32 缩放因子),其量化数学与引擎的 C 内核完全一致。它仅适用于 colibrì 引擎。

用法

# get the engine
git clone https://github.com/JustVugg/colibri && cd colibri/c && ./setup.sh

# download this repo to a FAST local disk (NVMe, ext4 — never a network/9p mount)
hf download jlnsrk/GLM-5.2-colibri-int4 --local-dir /nvme/glm52_i4

# chat (RAM budget, expert cache and MTP auto-detected)
COLI_MODEL=/nvme/glm52_i4 ./coli chat

要求:Linux(或WSL2)、gcc + OpenMP、AVX2、≥16 GB内存、约400 GB可用NVMe空间。

内含文件说明

文件内容
out-*.safetensors密集权重(注意力/MLA、共享专家、嵌入)+ 21,504个路由专家,每行int4缩放;路由层/归一化层保持F32精度
MTP分片GLM-5.2的多 token 预测头(第78层)——支持无损推测解码(约2个token/前向)
config.json、tokenizer*.json、generation_config.json从基础仓库复制

转换过程:FP8(e4m3,128×128块缩放)→ f32 → 使用 np.rint 转换为int4,以匹配引擎的 lrintf —— 与本地转换的token结果完全一致。

来源与许可

基于 zai-org/GLM-5.2-FP8(MIT许可)转换而来。本衍生版本同样采用MIT许可。转换使用colibrì官方转换器,未作修改。