RadixArk Qwen3.8-27B-NVFP4-BF16-LMHead 模型是 RadixArk/Qwen3.8-27B-NVFP4 的一个变体,后者是 RadixArk 使用 NVIDIA Model Optimizer 基于混合 NVFP4 W4A4 方案对 Qwen/Qwen3.8-27B 进行量化生成的版本。它与源检查点的唯一区别在于 lm_head 没有被量化:该检查点使用 Qwen/Qwen3.8-27B 中原始的 BF16 lm_head 权重,而非 NVFP4 W4A4 量化后的权重。其他所有张量均与源检查点完全一致。
在 SGLang 上运行:启动命令和各平台配置方案,请参阅 Qwen3.8-27B 使用指南。
该模型并非由 RadixArk 所有或开发。它是 Qwen 模型的量化衍生版本;有关源模型的能力、训练信息、局限性以及许可证,请参阅上游 Qwen3.8-27B 模型卡。
全球
面向希望在 AI Agent 系统、聊天机器人、RAG 系统以及其他 AI 应用中部署开箱即用、预量化模型的开发者。
于 08/14/2026 通过 https://huggingface.co/RadixArk/Qwen3.8-27B-NVFP4 在 Hugging Face 发布
架构类型: Transformers(稠密多模态)
网络架构: Qwen3.8-27B
模型参数量: 27B
输入类型: 文本、图像和视频
输入格式: 字符串和视觉媒体
与输入相关的其他属性: 原生上下文长度最高为 262,144 个 token。
输出类型: 文本
输出格式: 字符串
支持的运行时引擎:
硬件微架构兼容性:
推荐操作系统:
使用 NVIDIA Model Optimizer 完成量化,commit 87c9f8cf83021957d1a1a575c90c9a4eaaf7ef0c。
校准使用了来自 abisee/cnn_dailymail 训练集的 1,024 个样本,序列长度为 512。
RadixArk 未对该检查点进行训练或微调。训练信息继承自上游 Qwen3.8-27B 模型卡片。
该模型在 GSM8K 和 Terminal-Bench 2.1 上完成了评估。
MLP 的 gate_proj、up_proj 和 down_proj 层采用组大小为 16 的动态 NVFP4 W4A4 量化。注意力权重使用 FP8,而 lm_head、MTP 和视觉张量保留原始 BF16 精度。
以下 SGLang 配置使用四块 NVIDIA Blackwell GPU:
sglang serve \
--trust-remote-code \
--model-path RadixArk/Qwen3.8-27B-NVFP4-BF16-LMHead \
--tp-size 4 \
--mem-fraction-static 0.75 \
--speculative-algorithm NEXTN \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--reasoning-parser qwen3 \
--tool-call-parser qwen3_coder \
--host 0.0.0.0 \
--port 30000For other deployment topologies and hardware-specific configurations, see the SGLang Qwen3.8-27B 手册.
以下结果在本检查点(并非继承自源 NVFP4 检查点)上测得,使用 4 块 NVIDIA GB300 GPU 和 TP4 SGLang 部署(SGLang main @ d287880a、NEXTN 3/1/4、seed 0)。
| 评测基准 | 评测协议 | 得分 |
|---|---|---|
| GSM8K | 完整 1,319 样本划分,思考模式,模型默认采样,sgl-eval | 96.13% (1,268/1,319) |
| Terminal-Bench 2.1 | Claude Code 2.1.228,DFlash2 草稿模型,pass@1 | 69.4% (247/356, rep 4) / 68.18% (60/88, rep 1) |
GSM8K 停止率为 100%,无截断、无错误。供参考,源 NVFP4 检查点(量化后的 lm_head)在同一协议下得分为 96.36% (1,271/1,319);该差异处于 temperature 1.0 下单次运行的采样噪声范围内。所报告的评测均为纯文本。
基础模型可能生成不准确、不完整、不相关、存在偏见或其他不符合预期的响应。开发者应针对预期用途评估该模型,并应用适当的安全防护措施。
RadixArk 认为可信 AI 是共同责任。开发者应确保该模型的使用符合上游许可证,并满足其应用的安全、隐私和可靠性要求。