NVIDIA GLM-5.2 NVFP4 模型是 ZAI 公司 GLM-5.2 模型的量化版本,后者是一款采用优化 Transformer 架构的自回归语言模型。GLM-5.2 是一款面向推理与编码任务的混合专家(MoE)模型,它借助稀疏注意力机制(搭配 IndexShare 索引器)来支持长上下文。欲了解更多信息,请查阅此处。NVIDIA GLM-5.2 NVFP4 模型通过 Model Optimizer 进行量化。
本模型可随时用于商业或非商业用途。
管辖条款: 模型的使用受 MIT 许可协议 约束,与基础模型相同。
全球
面向希望采用现成预量化模型,部署于 AI 智能体系统、聊天机器人、RAG 系统及其他 AI 驱动应用的开发者。
2026 年 6 月 25 日通过 Hugging Face 发布,地址:https://huggingface.co/nvidia/GLM-5.2-NVFP4
Nvidia Model Optimizer:https://github.com/NVIDIA/Model-Optimizer
架构类型: Transformers
网络架构: GLM-5.2(GlmMoeDsaForCausalLM)
模型参数数量: 总计 7530 亿,激活参数 400 亿
输入类型: 文本
输入格式: 字符串
输入参数: 一维(1D)
其他输入相关属性: 上下文长度可达 100 万
输出类型: 文本
输出格式: 字符串
输出参数: 一维(1D):序列
其他输出相关属性: 无
我们的 AI 模型设计和/或优化旨在运行于 NVIDIA GPU 加速系统。通过利用 NVIDIA 的硬件(例如 GPU 核心)和软件框架(例如 CUDA 库),与仅使用 CPU 的解决方案相比,该模型实现了更快的训练和推理速度。
支持的运行时引擎:
支持的硬件微架构兼容性:
推荐操作系统:
将基础模型和微调模型集成到 AI 系统中,需要使用特定用例数据进行额外测试,以确保安全有效的部署。遵循 V 模型方法,在单元和系统层面进行迭代测试与验证至关重要,这有助于在部署前降低风险、满足技术和功能要求,并确保符合安全与道德标准。
模型版本为 NVFP4 1.0 版本,使用 nvidia-modelopt v0.46.0 进行量化
我们使用下述数据集对模型进行校准,并使用评估数据集下的基准进行评估。
我们未对本模型优化器版本进行训练或测试。以下训练和测试数据集下注明的方法代表第三方用于训练和测试基础模型的数据收集和标注方法。
数据模态: 未公开
数据集的数据收集方法: 未公开
数据集的标注方法: 未公开
属性: 未公开
数据集的数据收集方法: 未公开
数据集的标注方法: 未公开
属性: 未公开
数据集: GPQA Diamond、SciCode、IFBench、AA-LCR、τ²-Bench Telecom
数据集的数据收集方法: 混合:自动化、人工
数据集的标注方法: 混合:人工、自动化
属性: 我们在基于文本的推理、编码、长上下文回忆和智能体工具使用基准上对模型进行了评估:GPQA Diamond 包含 448 道由生物学、物理学和化学领域专家编写的研究生级多选题;SciCode 评估科学编码能力;IFBench 是一个用于评估在多样化和结构化任务约束下指令遵循能力的基准;AA-LCR(Artificial Analysis Long Context Recall,人工分析长上下文回忆)评估模型从长输入上下文中准确检索和回忆信息的能力;τ²-Bench Telecom 评估在双控电信客户服务场景中的智能体工具使用和策略遵循能力,在该场景中,模型与模拟用户和外部工具交互以解决账户问题。
加速引擎: SGLang、vLLM
测试硬件: NVIDIA B200
NVIDIA B300
本模型通过将GLM-5.2的权重和激活量化为NVFP4数据类型得到,可使用SGLang和vLLM进行推理。仅对MoE专家中Transformer块内线性算子的权重和激活进行量化,共享专家不参与量化。
此检查点使用最新的SGLang镜像(lmsysorg/sglang:latest)部署。GLM-5.2的glm_moe_dsa架构需要transformers>=5.3.0,我们在启动服务器前已在容器中完成安装。您也可以使用lmsysorg/sglang:dev-glm52-nvfp4
pip install -U "transformers>=5.3.0" && \
python3 -m sglang.launch_server \
--model nvidia/GLM-5.2-NVFP4 \
--tensor-parallel-size 8 \
--quantization modelopt_fp4 \
--tool-call-parser glm47 \
--reasoning-parser glm45 \
--trust-remote-code \
--chunked-prefill-size 16384 \
--mem-fraction-static 0.80要使用 vLLM 部署此 checkpoint,请使用 vllm/vllm-openai:v0.23.0 镜像并运行:
vllm serve nvidia/GLM-5.2-NVFP4 \
--tensor-parallel-size 8 \
--enable-expert-parallel \
--trust-remote-code \
--reasoning-parser glm45 \
--tool-call-parser glm47 \
--enable-auto-tool-choice \
--kv-cache-dtype fp8_e4m3 \
--host 0.0.0.0 --port 8000准确性基准测试结果如下表所示。AA-LCR 通过 SGLang 进行测量;所有其他基准测试均通过 vLLM 进行测量。
| 精度 | GPQA Diamond | SciCode | IFBench | AA-LCR | τ²-Bench Telecom |
|---|---|---|---|---|---|
| baseline (FP8) | 89.52 | 49.85 | 74.95 | 69.38 | 97.9 |
| NVFP4 | 89.39 | 49.04 | 75.81 | 70.13 | 98.25 |
基准模型:GLM-5.2-FP8。 基准测试参数:temperature=1.0,top_p=0.95。GPQA Diamond 使用 max_new_tokens=100000;所有其他基准测试使用 max_new_tokens=64000。
基础模型的训练数据包含从互联网上抓取的有毒语言和社会偏见。因此,该模型可能会放大这些偏见,并在收到有毒提示时返回有毒响应。即使提示本身不包含任何明确冒犯性内容,模型生成的答案也可能不准确、遗漏关键信息,或包含无关、冗余的文本,从而产生社会不可接受或不受欢迎的内容。
NVIDIA 认为可信 AI 是一项共同责任,我们已制定相关政策和实践,以支持广泛 AI 应用的开发。开发人员应与内部模型团队合作,确保该模型满足相关行业和用例的要求,并应对未预见的产品滥用情况。
请确保您对所有输入图像和视频内容拥有适当的权利和许可;如果图像或视频中包含人物、个人健康信息或知识产权,生成的图像或视频不会模糊或保持所包含图像主体的比例。
有关此模型伦理考量的更多详细信息,请参见 Model Card++ Bias, Explainability, Safety & Security, and Privacy Subcards。
请在此处报告模型质量、风险、安全漏洞或 NVIDIA AI 相关问题 here。
SUBCARDS:
| 领域: | 响应: |
|---|---|
| 预期任务/领域: | 文本生成、推理、摘要和问答。 |
| 模型类型: | 文本和图像到文本转换器 |
| 目标用户: | 此模型面向开发人员、研究人员以及构建/使用大型语言模型(LLMs)的客户,旨在平衡准确性和效率。 |
| 输出: | 文本字符串 |
| 描述模型工作原理: | 通过使用多个自注意力层,基于输入序列中提供的上下文预测下一个单词或标记来生成文本 |
| 经测试,该模型对哪些可能受到不利影响的群体能提供可比结果,无论其: | 不适用 |
| 技术局限性与缓解措施: | 该模型是在包含有毒语言和社会偏见的数据上训练的,这些数据最初是从互联网上爬取的。因此,该模型可能会放大这些偏见,并在收到有毒提示时返回有毒响应。因此,在部署该模型的任何应用程序之前,开发人员应针对其特定的模型应用场景进行安全测试和调优。 |
| 是否已验证符合规定的质量标准? | 是 |
| 性能指标: | 准确性、吞吐量和用户端吞吐量 |
| 潜在已知风险 | 模型生成的答案可能不准确,遗漏关键信息,或包含无关或冗余文本,从而产生社会不可接受或不受欢迎的文本,即使提示本身不包含任何明确冒犯性的内容。 |
| 许可: | 您的使用受以下管辖条款约束:模型的使用受MIT许可证管辖,与基础模型相同。 |
| 领域: | 响应: |
|---|---|
| 在模型设计和测试中,对可能受到不利影响的群体(受保护类别)的参与考量: | 无 |
| 为减轻不必要偏见所采取的措施: | 无 |
| 领域: | 响应: |
|---|---|
| 模型应用场景: | 聊天、指令遵循、聊天机器人开发、代码生成、推理 |
| 描述生命关键型应用(如适用): | 不适用 |
| 使用场景限制: | 遵守管理条款:模型的使用受 MIT 许可证 管辖,与基础模型相同。 |
| 模型和数据集限制: | 应用最小权限原则(PoLP)以限制数据集生成的访问权限。限制措施确保训练期间的数据集访问,并遵守数据集许可约束。模型检查点在 Hugging Face 上提供,并可能在云提供商的模型目录中提供。 |
| 领域: | 响应: |
|---|---|
| 可生成或可逆向工程的个人数据? | 否 |
| 用于创建此模型的个人数据? | 否 |
| 是否获得了所使用的任何个人数据的同意? | 不适用 |
| 数据集审查频率? | 发布前 |
| 是否使用了用户与 AI 模型交互的数据(例如用户输入和提示)来训练模型? | 否 |
| 训练中使用的所有数据集是否都有来源? | 是 |
| 数据标注(注释、元数据)是否符合隐私法律? | 是 |
| 如果收到数据主体关于数据更正或删除的请求,数据是否符合该请求? | 不适用 |
| 适用的 NVIDIA 隐私政策 | https://www.nvidia.com/en-us/about-nvidia/privacy-policy/ |