pip install -U mlx-lm
mlx_lm.chat \
--model mlx-community/Mellum2-12B-A2.5B-Thinking-6bit \
--max-tokens 8192 \
--temp 0.6 \
--top-p 0.95使用 oMLX 0.5.7 和 MLX-LM 0.31.3,在配备 128 GB 统一内存的 Apple M5 Max MacBook Pro 上进行基准测试,采用内置的 Python-code 工作负载,并生成 128 个 token。结果会随硬件、运行时版本、上下文长度和生成设置不同而变化。
| 提示词 Token 数 | TTFT | Prefill | 生成 | 端到端 | 峰值内存 |
|---|---|---|---|---|---|
| 4,096 | 717.8 ms | 5,706.1 tok/s | 145.9 tok/s | 1.6 s | 9.90 GB |
| 16,384 | 3,436.8 ms | 4,767.2 tok/s | 132.8 tok/s | 4.4 s | 10.2 GB |
| 32,768 | 9,389.4 ms | 3,489.9 tok/s | 114.7 tok/s | 10.5 s | 10.5 GB |
| 65,536 | 23,584.3 ms | 2,778.8 tok/s | 87.4 tok/s | 25.1 s | 11.2 GB |
| 131,072 | 69,353.6 ms | 1,889.9 tok/s | 54.9 tok/s | 71.7 s | 12.7 GB |
在 4,096 个 token 的提示词下,批量生成在 2、4 和 8 个并发请求下分别实现了 196.4、187.8 和 194.2 的聚合生成 tok/s,而单请求为 145.9 tok/s。
关于原始模型卡片、训练细节、基准测试结果以及使用指南,请参阅 上游 JetBrains 检查点.