HuggingFace镜像/Inkling
模型介绍文件和版本分析

Inkling

BF16 | NVFP4 | 演示平台 | Tinker 使用指南 | 可接受使用政策

1. 基本信息

Inkling 是一款通用多模态模型,可接受文本、图像和音频输入并生成文本输出。它适用于英语及其他多种语言,同时支持多种编程语言。该模型面向开发人员设计,旨在助力构建人工智能驱动的应用,包括智能体与工具使用系统、编码助手、聊天机器人以及检索增强生成系统等。它也适用于通用对话、指令遵循以及其他自然语言和多模态任务。Inkling 以开源权重形式发布,支持研究人员进行研究、微调,并供下游开发人员集成到第三方产品中。

支持语言: 英语,并具备跨其他语言的通用多语言处理能力。

2. 快速开始

您可以在 Tinker 演示平台 上试用 Inkling,或通过 Tinker 使用指南 中的 API 进行访问。

Inkling 支持使用以下开源库进行本地部署:

  • SGLang(部署指南)
  • vLLM(部署指南)
  • TokenSpeed(部署指南)
  • Unsloth(部署指南)
  • Huggingface(部署指南)

此外,也可通过第三方推理服务提供商获取 API 访问权限。

3. 模型属性

模型类型

多模态自回归Transformer

架构类型

66层纯解码器Transformer,配备稀疏混合专家(MoE)前馈骨干网络:每个token被路由至256个专家中的6个,外加2个对每个token均激活的共享专家。注意力机制采用局部层与全局层混合架构。该模型原生支持多模态——图像和视频通过分层补丁编码器进行编码,音频通过离散token编码——所有模态均被投影到共享隐藏空间,并由解码器联合处理。

参数规模

总计9750亿,活跃参数410亿

数值支持

BF16和NVFP4

输入模态

Inkling接受UTF-8编码的文本输入、任何基于像素格式的图像输入(各维度理想范围为40px至4096px以获得最佳性能),以及16kHz采样率的WAV格式音频输入(理想长度在20分钟以内以获得最佳性能)。

输出模态

Inkling生成UTF-8编码的文本输出。

4. 训练

训练数据涵盖多种内容类型,包括文本、图像、音频和视频。模型训练数据来源于公开可用资源、第三方获取内容,或合成生成及增强内容。公开可用数据包括来自公共互联网和公开可访问存储库的内容。

训练数据整理流程包括数据集的清洗、处理和修改。这些处理步骤因数据类型而异,可能包括去重和过滤以移除垃圾数据或其他低质量数据,或用于提升安全性及实现其他目标。

5. 评估

Inkling的评估结果以effort=0.99报告。对比分数生成于2026年7月14日。Nemotron 3 Ultra、Kimi K2.5、Kimi K2.6、GLM 5.2和DeepSeek V4 Pro为开源权重模型;Gemini 3.1 Pro、Claude Fable 5和GPT 5.6 Sol为闭源权重模型。

InklingNemotron 3 UltraKimi K2.5Kimi K2.6GLM 5.2DeepSeek V4 ProGemini 3.1 Pro (high)Claude Fable 5 (max)GPT 5.6 Sol (xhigh)
推理能力
HLE(纯文本)29.7%26.6%29.4%35.9%40.1%35.9%44.7%53.3%47.2%
HLE(带工具)46.0%37.4%50.2%54.0%54.7%48.2%51.4%64.5%55.0%
AIME 202697.1%94.2%95.8%96.4%99.2%96.7%98.3%–99.9%
GPQA Diamond87.2%86.7%87.9%91.1%89.5%88.8%94.1%92.6%94.1%
智能体能力(编码)
SWEBench Verified77.6%70.7%76.8%80.2%–80.6%80.6%95.0%–
SWEBench Pro(公开版)54.3%46.4%50.7%58.6%62.1%55.4%54.2%80.0%64.6%
Terminal Bench 2.1(最佳测试框架)63.856.451.371.382.76473.884.689.5
GDPVal-AA v212331164100911901514130796217601748
智能体能力(通用)
MCP Atlas74.1%44.7%64.0%68.1%77.8%73.2%78.2%83.3%81.8%
Tau 3 Banking23.7%13.8%13.2%20.6%26.8%25.8%16.5%26.8%33.0%
事实准确性
BrowseComp(带上下文)77.1%–74.9%83.2%–83.4%85.9%88.0%89.4%
SimpleQA Verified43.9%32.4%36.9%38.7%38.1%57.0%77.3%68.3%71.6%
AA Omniscience1.0%-1.0%-8.0%6.0%4.0%-10.0%33.0%40.0%22.0%
对话能力
IFBench79.8%81.4%70.2%76.0%73.3%76.5%77.1%63.5%72.7%
Global-MMLU-Lite88.7%85.6%84.0%88.4%89.2%89.3%92.7%93.3%91.8%
视觉能力
MMMU Pro(Standard 10)73.5%–75.0%79.0%––82.0%84.2%83.0%
Charxiv RQ78.1%–77.5%80.4%––80.2%86.5%84.7%
Charxiv RQ(带python)82.0%–78.7%86.7%––89.9%89.4%87.8%
音频能力
Audio MC56.6%–––––66.8%––
MMAU77.2%–––––82.5%––
VoiceBench91.4%–––––94.3%––
安全性
FORTRESS(对抗性)78.0%77.6%54.1%65.6%71.3%36.0%65.2%96.0%82.4%
FORTRESS(良性)95.9%90.5%98.3%97.2%90.0%98.5%98.0%55.1%98.1%
StrongREJECT98.6%98.7%99.5%99.8%98.5%98.6%98.0%98.7%98.5%

6. 安全性

我们在发布前进行了安全性评估,涵盖日常人机交互和危险能力测试。由于Inkling是多模态的,我们关注其安全行为在文本、音频和图像输入中是否保持一致。我们在发布前采取了缓解措施以降低风险。

在日常交互方面,我们评估了谄媚行为、有害操纵以及心理伤害模式(如类社会关系依赖和对妄想推理的验证),包括通过多轮、开放式的外部红队测试,旨在发现仅在较长对话中才会出现的问题。我们还评估了模型是否会拒绝真正有害的请求,同时不会过度拒绝良性请求。在化学、生物、放射和核(CBRN)以及网络安全方面,我们通过内部评估、外部测试以及旨在评估移除安全防护后潜在能力的拒绝抑制变体,对知识和程序提升进行了评估。在失控风险方面,我们评估了智能体能力、策略性欺骗和破坏潜力,并与公开的前沿模型进行了基准对比,发现该模型的能力明显低于前沿水平。

综合所有领域,我们得出结论:Inkling并未带来超出开放权重生态系统现有水平的实质性能力提升风险。

我们的评估中发现的残余风险——具体而言,Inkling偶尔会倾向于遵从涉及有害主题的角色扮演和间接框架提示——与任何开放权重模型的表现一致,最好通过纵深防御来解决,而不是仅仅依赖模型的拒绝机制。常见的下游 moderation 工具(如 Llama Guard)与Inkling兼容,可以作为模型的外层防护,以捕获越狱尝试、过滤不安全输出并执行特定用例的策略。我们建议将此类输入/输出分类作为部署堆栈的一部分,尤其是在面向消费者或高流量的应用中,这些场景更可能遭遇对抗性提示。

7. 偏差、风险与局限性

Inkling 可能会表现出基础模型常见的一般性局限,包括幻觉(生成看似合理但与事实不符或缺乏支持的内容)、偶尔无法精确遵循指令,以及在长多轮对话中性能下降。与其他基于网络衍生数据和合成数据训练的大规模模型一样,Inkling 可能会反映其训练数据中存在的偏差,包括人口统计、文化或语言偏差,并且在训练期间代表性不足的语言、方言或主题领域上的表现可能不均衡。

Inkling 的知识仅限于其训练截止日期前可获取的信息,可能无法反映此后发生的事件、发展或变化。

我们建议下游开发者和部署者在高风险或安全关键场景中对输出内容进行适当的人工监督和审查,而非未经核实就依赖 Inkling 的输出。

  • 在部署前,针对其特定用例、语言和目标人群,自行评估 Inkling 的性能、安全性和公平性,尤其是涉及弱势群体的应用。
  • 在应用层实施额外的安全措施,例如内容过滤、速率限制和监控,特别是在开放式部署环境中,Inkling 的内置缓解措施可能不足以单独应对。
  • 避免在医疗、法律或安全关键决策等领域部署 Inkling,除非进行额外的微调、领域特定验证和人工监督。