HuggingFace镜像/Mellum2-12B-A2.5B-Thinking-6bit
模型介绍
文件和版本
分析
pip install -U mlx-lm

mlx_lm.chat \
  --model mlx-community/Mellum2-12B-A2.5B-Thinking-6bit \
  --max-tokens 8192 \
  --temp 0.6 \
  --top-p 0.95

基准测试

使用 oMLX 0.5.7 和 MLX-LM 0.31.3,在配备 128 GB 统一内存的 Apple M5 Max MacBook Pro 上进行基准测试,采用内置的 Python-code 工作负载,并生成 128 个 token。结果会随硬件、运行时版本、上下文长度和生成设置不同而变化。

提示词 Token 数TTFTPrefill生成端到端峰值内存
4,096717.8 ms5,706.1 tok/s145.9 tok/s1.6 s9.90 GB
16,3843,436.8 ms4,767.2 tok/s132.8 tok/s4.4 s10.2 GB
32,7689,389.4 ms3,489.9 tok/s114.7 tok/s10.5 s10.5 GB
65,53623,584.3 ms2,778.8 tok/s87.4 tok/s25.1 s11.2 GB
131,07269,353.6 ms1,889.9 tok/s54.9 tok/s71.7 s12.7 GB

在 4,096 个 token 的提示词下,批量生成在 2、4 和 8 个并发请求下分别实现了 196.4、187.8 和 194.2 的聚合生成 tok/s,而单请求为 145.9 tok/s。

模型溯源

关于原始模型卡片、训练细节、基准测试结果以及使用指南,请参阅 上游 JetBrains 检查点.