NVIDIA Kimi-K2.7-Code DFlash 模型是 Moonshot AI 旗下 Kimi-K2.7-Code 模型的 DFlash 草稿头,该模型是一个面向编码的智能体语言模型,采用优化的 Transformer 架构。更多信息,请查看此处。NVIDIA Kimi-K2.7-Code DFlash 模型通过 Model Optimizer 集成了 DFlash 投机解码。
本模型可直接用于商业或非商业用途。
适用条款:本模型的使用受 NVIDIA Open Model License 约束。
附加信息:Modified MIT License。 Kimi-K2.7-Code。
全球
设计智能体系统、编码助手、软件工程 Copilot 以及其他需要长程代码生成与推理的 AI 应用的开发者。也适用于需要通过投机解码实现低延迟推理的典型指令跟随任务。
Hugging Face 2026年07月09日,通过 https://huggingface.co/nvidia/Kimi-K2.7-Code-DFlash
架构类型: Transformers
网络架构: DeepSeek V3
模型参数量: 总参数 1T,激活参数 32B
输入类型: 文本、图像、视频
输入格式: 字符串、二进制(Base64 编码)、二进制(Base64 编码)
输入参数: 一维(1D)、二维(2D)、三维(3D)
与输入相关的其他属性: 上下文长度:256K
输出类型: 文本
输出格式: 字符串
输出参数: 一维(1D):序列
与输出相关的其他属性: 根据服务配置和应用层工具,输出可能包括自然语言响应、代码、结构化 JSON、工具调用请求、智能体协调指令以及生成产物。
本 AI 模型已针对在 NVIDIA GPU 加速系统上运行进行设计和/或优化。借助 NVIDIA 硬件(如 GPU 核心)和软件框架(如 CUDA 库),与纯 CPU 方案相比,该模型可实现更快的训练与推理速度。
受支持的运行时引擎:
受支持的硬件微架构兼容性:
推荐操作系统:
将基础模型与微调模型集成到 AI 系统中时,需要使用针对特定用例的数据进行额外测试,以确保安全且有效地部署。遵循 V 模型方法论,在单元测试和系统测试两个层面进行迭代测试与验证,对于降低风险、满足技术和功能要求,并确保部署前符合安全与伦理标准至关重要。
该模型为 DFlash 版本,并使用 nvidia-modelopt v0.45.0 进行训练
链接:Nemotron-Post-Training-Dataset-v2,仅使用数据集中的提示词进行数据合成,(未使用 GPT 的原始响应),随后用于训练 DFlash 模块。
数据模态: 文本、图像、视频
图像训练数据规模: 无
文本训练数据规模: [10 亿至 10 万亿词元]
视频训练数据规模: 无
各数据集的数据收集方法:混合:自动化、合成
各数据集的标注方法:混合:自动化、合成
属性: 112K 多语言文本样本,提示词涵盖数学、代码、STEM 和对话主题。每个样本包含一条由目标模型生成的合成响应。
链接:MTBench,更多详情,请参见此处;SPEED-Bench
各数据集的数据收集方法:混合:人工收集、合成
各数据集的标注方法:混合:人工标注、合成
属性: MT-Bench 包含 3,300 段多轮对话序列,每条均标注有专家偏好投票。SPEED-Bench 是一个统一且多样化的推测解码基准测试,覆盖编码、人文学科、数学、多语言、QA、RAG、推理、角色扮演、STEM、摘要和写作领域。
加速引擎: vLLM
测试硬件: NVIDIA Blackwell B200
合成数据来自 Moonshot AI 的 Kimi-K2.7-Code 模型,并用于微调 DFlash 模块。该模型已可在 DFlash 推测解码模式下通过 vLLM 进行推理。DFlash 模块用于预测下一个 token 之后的候选 token。在生成步骤中,每个前向 DFlash 模块都会生成比前一个模块更靠后的 token 分布。选择最长的已接受候选序列,使得每个生成步骤返回的 token 数量大于 1。每个步骤生成的 token 数量称为接受率。
使用 vLLM 部署 checkpoint:
vllm serve <Kimi-K2.7-Code-NVFP4 checkpoint> \
--tensor-parallel-size 4 \
--trust-remote-code \
--speculative-config '{
"method": "dflash",
"model": "<draft-model>",
"num_speculative_tokens":8
}'或者,使用 Python LLM API:
from vllm import LLM, SamplingParams
llm = LLM(
model="<Kimi-K2.7-Code-NVFP4 checkpoint>",
tensor_parallel_size=4,
trust_remote_code=True,
speculative_config={
"method": "dflash",
"model": "<draft-model>",
"num_speculative_tokens":8
},
)在 SPEED-Bench(定性子集)上、draft block size 为 8 时的接受率:
| 类别 | SPEED-Bench 接受率 |
|---|---|
| coding | 3.41 |
| humanities | 2.76 |
| math | 3.24 |
| multilingual | 3.89 |
| qa | 2.82 |
| rag | 3.68 |
| reasoning | 3.26 |
| roleplay | 2.36 |
| stem | 2.84 |
| summarization | 3.48 |
| writing | 2.66 |
| 总体平均 | 3.13 |
在 SPEED-Bench(throughput-32k 子集,长上下文)上、draft block size 为 8 时的接受率:
| 类别 | SPEED-Bench 接受率 |
|---|---|
| low_entropy | 3.69 |
| mixed | 3.09 |
| high_entropy | 2.34 |
| 总体平均 | 3.04 |
在 MT-bench上、draft block size 为 8 时的接受率:
| 类别 | MT-bench 接受率 |
|---|---|
| writing | 2.90 |
| roleplay | 2.49 |
| reasoning | 3.02 |
| math | 4.26 |
| coding | 3.36 |
| extraction | 3.91 |
| stem | 2.80 |
| humanities | 2.37 |
| 总体平均 | 3.14 |
NVIDIA 认为 Trustworthy AI 是一项共同责任,我们已建立政策与实践,以支持广泛 AI 应用场景的开发。开发者应与内部模型团队合作,确保该模型满足相关行业和使用场景的要求,并防范不可预见的产品滥用。
请确保您对所有输入图像和视频内容拥有相应的权利和权限;如果图像或视频中包含人员、个人健康信息或知识产权,生成的图像或视频不会对其中的图像主体进行模糊处理,也不会保留其比例。
如需了解该模型更详细的伦理考量,请参阅 Model Card++ 中的偏见、可解释性、安全与安保和隐私子卡片。
请通过此处报告模型质量、风险、安全漏洞或 NVIDIA AI Concerns。
子卡片:
| 字段: | 响应: |
|---|---|
| 预期任务/领域: | 文本生成、代码生成、推理以及长程软件工程任务。 |
| 模型类型: | 文本与图像到文本 Transformer |
| 预期用户: | 本模型面向构建/使用 LLM 以进行编码和智能体任务的开发者、研究人员和客户,同时兼顾准确性与效率。 |
| 输出: | 文本字符串 |
| 描述模型如何工作: | 使用多层自注意力层,根据输入序列提供的上下文预测下一个单词或 token,从而生成文本 |
| 已测试可确保无论何种差异均提供可比结果的受不利影响群体名称: | 不适用 |
| 技术限制与缓解措施: | 该模型在最初从互联网爬取、含有有害语言和社会偏见的数据上训练。因此,模型可能放大这些偏见并返回有害回复,尤其是在接收到有害提示时。因此,在部署该模型的任何应用之前,开发者应针对其模型的具体应用场景进行定制化的安全测试与调优。 |
| 是否已验证满足规定质量标准? | 是 |
| 性能指标: | 准确率、吞吐量以及用户端吞吐量 |
| 潜在已知风险 | 该模型可能生成不准确的答案,遗漏关键信息,或包含无关或冗余文本,从而产生社会不可接受或不良文本,即使提示本身不包含任何明确冒犯性内容。 |
| 许可: | 您的使用受以下适用条款约束:使用本模型受 NVIDIA Open Model License 约束。 |
附加信息:Modified MIT License。Kimi-K2.7-Code。
| 字段: | 回复: |
|---|---|
| 模型设计与测试中,受不利影响的群体(受保护类别)的参与考量: | 无 |
| 为缓解非预期偏见所采取的措施: | 无 |
| 偏见指标: | 无 |
| 字段: | 回复: |
|---|---|
| 模型应用: | 聊天、指令遵循、聊天机器人开发、代码生成、推理 |
| 描述生命安全关键应用(如适用): | 不适用 |
| 使用场景限制: | 遵守约束条款:本模型的使用受 NVIDIA Open Model License 约束。 |
| 模型与数据集限制: | 应用最小权限原则(PoLP),以限制数据集生成过程中的访问权限。训练过程中强制执行数据集访问限制,并遵守数据集许可约束。模型检查点已在 Hugging Face 上提供,后续可能上线云服务商的模型目录。 |
其他信息:Modified MIT License。 Kimi-K2.7-Code。
| 字段: | 响应: |
|---|---|
| 是否存在可生成或可逆向工程化的个人数据? | 否 |
| 创建该模型时是否使用了个人数据? | 否 |
| 对于所使用的任何个人数据,是否已取得同意? | 不适用 |
| 数据集审查频率如何? | 发布前 |
| 用户与 AI 模型交互的数据(例如用户输入和提示词)是否用于训练模型? | 否 |
| 用于训练的所有数据集是否都有来源信息? | 是 |
| 数据标注(注释、元数据)是否符合隐私法律法规? | 是 |
| 数据是否符合数据主体提出的数据更正或删除请求(如有此类请求)? | 不适用 |
| 适用的 NVIDIA 隐私政策 | https://www.nvidia.com/en-us/about-nvidia/privacy-policy/ |