HuggingFace镜像/Qwen3.8-27B-NVFP4-BF16-LMHead
模型介绍
文件和版本
分析

模型概览

描述:

RadixArk Qwen3.8-27B-NVFP4-BF16-LMHead 模型是 RadixArk/Qwen3.8-27B-NVFP4 的一个变体,后者是 RadixArk 使用 NVIDIA Model Optimizer 基于混合 NVFP4 W4A4 方案对 Qwen/Qwen3.8-27B 进行量化生成的版本。它与源检查点的唯一区别在于 lm_head 没有被量化:该检查点使用 Qwen/Qwen3.8-27B 中原始的 BF16 lm_head 权重,而非 NVFP4 W4A4 量化后的权重。其他所有张量均与源检查点完全一致。

在 SGLang 上运行:启动命令和各平台配置方案,请参阅 Qwen3.8-27B 使用指南。

第三方社区注意事项

该模型并非由 RadixArk 所有或开发。它是 Qwen 模型的量化衍生版本;有关源模型的能力、训练信息、局限性以及许可证,请参阅上游 Qwen3.8-27B 模型卡。

许可证/使用条款:

Apache License 2.0

部署地域:

全球

使用场景:

面向希望在 AI Agent 系统、聊天机器人、RAG 系统以及其他 AI 应用中部署开箱即用、预量化模型的开发者。

发布日期:

于 08/14/2026 通过 https://huggingface.co/RadixArk/Qwen3.8-27B-NVFP4 在 Hugging Face 发布

模型架构:

架构类型: Transformers(稠密多模态)
网络架构: Qwen3.8-27B
模型参数量: 27B

输入:

输入类型: 文本、图像和视频
输入格式: 字符串和视觉媒体
与输入相关的其他属性: 原生上下文长度最高为 262,144 个 token。

输出:

输出类型: 文本
输出格式: 字符串

软件集成:

支持的运行时引擎:

  • SGLang

硬件微架构兼容性:

  • NVIDIA Blackwell(该检查点已在 GB300 上生成并验证)

推荐操作系统:

  • Linux

模型版本:

使用 NVIDIA Model Optimizer 完成量化,commit 87c9f8cf83021957d1a1a575c90c9a4eaaf7ef0c。

训练、测试与评估数据集:

校准数据:

校准使用了来自 abisee/cnn_dailymail 训练集的 1,024 个样本,序列长度为 512。

训练数据集:

RadixArk 未对该检查点进行训练或微调。训练信息继承自上游 Qwen3.8-27B 模型卡片。

评估数据集:

该模型在 GSM8K 和 Terminal-Bench 2.1 上完成了评估。

训练后量化

MLP 的 gate_proj、up_proj 和 down_proj 层采用组大小为 16 的动态 NVFP4 W4A4 量化。注意力权重使用 FP8,而 lm_head、MTP 和视觉张量保留原始 BF16 精度。

使用

以下 SGLang 配置使用四块 NVIDIA Blackwell GPU:

sglang serve \
  --trust-remote-code \
  --model-path RadixArk/Qwen3.8-27B-NVFP4-BF16-LMHead \
  --tp-size 4 \
  --mem-fraction-static 0.75 \
  --speculative-algorithm NEXTN \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --reasoning-parser qwen3 \
  --tool-call-parser qwen3_coder \
  --host 0.0.0.0 \
  --port 30000

For other deployment topologies and hardware-specific configurations, see the SGLang Qwen3.8-27B 手册.

评测

以下结果在本检查点(并非继承自源 NVFP4 检查点)上测得,使用 4 块 NVIDIA GB300 GPU 和 TP4 SGLang 部署(SGLang main @ d287880a、NEXTN 3/1/4、seed 0)。

评测基准评测协议得分
GSM8K完整 1,319 样本划分,思考模式,模型默认采样,sgl-eval96.13% (1,268/1,319)
Terminal-Bench 2.1Claude Code 2.1.228,DFlash2 草稿模型,pass@169.4% (247/356, rep 4) / 68.18% (60/88, rep 1)

GSM8K 停止率为 100%,无截断、无错误。供参考,源 NVFP4 检查点(量化后的 lm_head)在同一协议下得分为 96.36% (1,271/1,319);该差异处于 temperature 1.0 下单次运行的采样噪声范围内。所报告的评测均为纯文本。

模型局限性:

基础模型可能生成不准确、不完整、不相关、存在偏见或其他不符合预期的响应。开发者应针对预期用途评估该模型,并应用适当的安全防护措施。

伦理考量

RadixArk 认为可信 AI 是共同责任。开发者应确保该模型的使用符合上游许可证,并满足其应用的安全、隐私和可靠性要求。