HuggingFace镜像/Kimi-K2.7-Code-DFlash
模型介绍
文件和版本
分析

模型概述

描述:

NVIDIA Kimi-K2.7-Code DFlash 模型是 Moonshot AI 旗下 Kimi-K2.7-Code 模型的 DFlash 草稿头,该模型是一个面向编码的智能体语言模型,采用优化的 Transformer 架构。更多信息,请查看此处。NVIDIA Kimi-K2.7-Code DFlash 模型通过 Model Optimizer 集成了 DFlash 投机解码。

本模型可直接用于商业或非商业用途。

许可证/使用条款:

适用条款:本模型的使用受 NVIDIA Open Model License 约束。

附加信息:Modified MIT License。 Kimi-K2.7-Code。

部署地区:

全球

使用场景:

设计智能体系统、编码助手、软件工程 Copilot 以及其他需要长程代码生成与推理的 AI 应用的开发者。也适用于需要通过投机解码实现低延迟推理的典型指令跟随任务。

发布日期:

Hugging Face 2026年07月09日,通过 https://huggingface.co/nvidia/Kimi-K2.7-Code-DFlash

参考资料:

  • Kimi-K2.7-Code 发布说明

模型架构:

架构类型: Transformers

网络架构: DeepSeek V3

模型参数量: 总参数 1T,激活参数 32B

输入:

输入类型: 文本、图像、视频

输入格式: 字符串、二进制(Base64 编码)、二进制(Base64 编码)

输入参数: 一维(1D)、二维(2D)、三维(3D)

与输入相关的其他属性: 上下文长度:256K

输出:

输出类型: 文本

输出格式: 字符串

输出参数: 一维(1D):序列

与输出相关的其他属性: 根据服务配置和应用层工具,输出可能包括自然语言响应、代码、结构化 JSON、工具调用请求、智能体协调指令以及生成产物。

本 AI 模型已针对在 NVIDIA GPU 加速系统上运行进行设计和/或优化。借助 NVIDIA 硬件(如 GPU 核心)和软件框架(如 CUDA 库),与纯 CPU 方案相比,该模型可实现更快的训练与推理速度。

软件集成:

受支持的运行时引擎:

  • vLLM

受支持的硬件微架构兼容性:

  • NVIDIA Blackwell B200

推荐操作系统:

  • Linux

将基础模型与微调模型集成到 AI 系统中时,需要使用针对特定用例的数据进行额外测试,以确保安全且有效地部署。遵循 V 模型方法论,在单元测试和系统测试两个层面进行迭代测试与验证,对于降低风险、满足技术和功能要求,并确保部署前符合安全与伦理标准至关重要。

模型版本:

该模型为 DFlash 版本,并使用 nvidia-modelopt v0.45.0 进行训练

训练与评估数据集:

训练数据集:

链接:Nemotron-Post-Training-Dataset-v2,仅使用数据集中的提示词进行数据合成,(未使用 GPT 的原始响应),随后用于训练 DFlash 模块。

数据模态: 文本、图像、视频

图像训练数据规模: 无

文本训练数据规模: [10 亿至 10 万亿词元]

视频训练数据规模: 无

各数据集的数据收集方法:混合:自动化、合成

各数据集的标注方法:混合:自动化、合成

属性: 112K 多语言文本样本,提示词涵盖数学、代码、STEM 和对话主题。每个样本包含一条由目标模型生成的合成响应。

评估数据集:

链接:MTBench,更多详情,请参见此处;SPEED-Bench

各数据集的数据收集方法:混合:人工收集、合成

各数据集的标注方法:混合:人工标注、合成

属性: MT-Bench 包含 3,300 段多轮对话序列,每条均标注有专家偏好投票。SPEED-Bench 是一个统一且多样化的推测解码基准测试,覆盖编码、人文学科、数学、多语言、QA、RAG、推理、角色扮演、STEM、摘要和写作领域。

推理:

加速引擎: vLLM

测试硬件: NVIDIA Blackwell B200

DFlash 推测解码

合成数据来自 Moonshot AI 的 Kimi-K2.7-Code 模型,并用于微调 DFlash 模块。该模型已可在 DFlash 推测解码模式下通过 vLLM 进行推理。DFlash 模块用于预测下一个 token 之后的候选 token。在生成步骤中,每个前向 DFlash 模块都会生成比前一个模块更靠后的 token 分布。选择最长的已接受候选序列,使得每个生成步骤返回的 token 数量大于 1。每个步骤生成的 token 数量称为接受率。

用法

使用 vLLM 部署 checkpoint:

vllm serve <Kimi-K2.7-Code-NVFP4 checkpoint> \
  --tensor-parallel-size 4 \
  --trust-remote-code \
  --speculative-config '{
    "method": "dflash",
    "model": "<draft-model>",
    "num_speculative_tokens":8
  }'

或者,使用 Python LLM API:

from vllm import LLM, SamplingParams

llm = LLM(
    model="<Kimi-K2.7-Code-NVFP4 checkpoint>",
    tensor_parallel_size=4,
    trust_remote_code=True,
    speculative_config={
        "method": "dflash",
        "model": "<draft-model>",
        "num_speculative_tokens":8
    },
)

评估

在 SPEED-Bench(定性子集)上、draft block size 为 8 时的接受率:

类别SPEED-Bench 接受率
coding3.41
humanities2.76
math3.24
multilingual3.89
qa2.82
rag3.68
reasoning3.26
roleplay2.36
stem2.84
summarization3.48
writing2.66
总体平均3.13

在 SPEED-Bench(throughput-32k 子集,长上下文)上、draft block size 为 8 时的接受率:

类别SPEED-Bench 接受率
low_entropy3.69
mixed3.09
high_entropy2.34
总体平均3.04

在 MT-bench上、draft block size 为 8 时的接受率:

类别MT-bench 接受率
writing2.90
roleplay2.49
reasoning3.02
math4.26
coding3.36
extraction3.91
stem2.80
humanities2.37
总体平均3.14

伦理考量

NVIDIA 认为 Trustworthy AI 是一项共同责任,我们已建立政策与实践,以支持广泛 AI 应用场景的开发。开发者应与内部模型团队合作,确保该模型满足相关行业和使用场景的要求,并防范不可预见的产品滥用。

请确保您对所有输入图像和视频内容拥有相应的权利和权限;如果图像或视频中包含人员、个人健康信息或知识产权,生成的图像或视频不会对其中的图像主体进行模糊处理,也不会保留其比例。

如需了解该模型更详细的伦理考量,请参阅 Model Card++ 中的偏见、可解释性、安全与安保和隐私子卡片。

请通过此处报告模型质量、风险、安全漏洞或 NVIDIA AI Concerns。

子卡片:

可解释性

字段:响应:
预期任务/领域:文本生成、代码生成、推理以及长程软件工程任务。
模型类型:文本与图像到文本 Transformer
预期用户:本模型面向构建/使用 LLM 以进行编码和智能体任务的开发者、研究人员和客户,同时兼顾准确性与效率。
输出:文本字符串
描述模型如何工作:使用多层自注意力层,根据输入序列提供的上下文预测下一个单词或 token,从而生成文本
已测试可确保无论何种差异均提供可比结果的受不利影响群体名称:不适用
技术限制与缓解措施:该模型在最初从互联网爬取、含有有害语言和社会偏见的数据上训练。因此,模型可能放大这些偏见并返回有害回复,尤其是在接收到有害提示时。因此,在部署该模型的任何应用之前,开发者应针对其模型的具体应用场景进行定制化的安全测试与调优。
是否已验证满足规定质量标准?是
性能指标:准确率、吞吐量以及用户端吞吐量
潜在已知风险该模型可能生成不准确的答案,遗漏关键信息,或包含无关或冗余文本,从而产生社会不可接受或不良文本,即使提示本身不包含任何明确冒犯性内容。
许可:您的使用受以下适用条款约束:使用本模型受 NVIDIA Open Model License 约束。

附加信息:Modified MIT License。Kimi-K2.7-Code。

偏见

字段:回复:
模型设计与测试中,受不利影响的群体(受保护类别)的参与考量:无
为缓解非预期偏见所采取的措施:无
偏见指标:无

安全与安保

字段:回复:
模型应用:聊天、指令遵循、聊天机器人开发、代码生成、推理
描述生命安全关键应用(如适用):不适用
使用场景限制:遵守约束条款:本模型的使用受 NVIDIA Open Model License 约束。
模型与数据集限制:应用最小权限原则(PoLP),以限制数据集生成过程中的访问权限。训练过程中强制执行数据集访问限制,并遵守数据集许可约束。模型检查点已在 Hugging Face 上提供,后续可能上线云服务商的模型目录。

其他信息:Modified MIT License。 Kimi-K2.7-Code。

隐私

字段:响应:
是否存在可生成或可逆向工程化的个人数据?否
创建该模型时是否使用了个人数据?否
对于所使用的任何个人数据,是否已取得同意?不适用
数据集审查频率如何?发布前
用户与 AI 模型交互的数据(例如用户输入和提示词)是否用于训练模型?否
用于训练的所有数据集是否都有来源信息?是
数据标注(注释、元数据)是否符合隐私法律法规?是
数据是否符合数据主体提出的数据更正或删除请求(如有此类请求)?不适用
适用的 NVIDIA 隐私政策https://www.nvidia.com/en-us/about-nvidia/privacy-policy/