BF16 | NVFP4 | 演示平台 | Tinker 使用指南 | 可接受使用政策
Inkling 是一款通用多模态模型,可接受文本、图像和音频输入并生成文本输出。它适用于英语及其他多种语言,同时支持多种编程语言。该模型面向开发人员设计,旨在助力构建人工智能驱动的应用,包括智能体与工具使用系统、编码助手、聊天机器人以及检索增强生成系统等。它也适用于通用对话、指令遵循以及其他自然语言和多模态任务。Inkling 以开源权重形式发布,支持研究人员进行研究、微调,并供下游开发人员集成到第三方产品中。
支持语言: 英语,并具备跨其他语言的通用多语言处理能力。
您可以在 Tinker 演示平台 上试用 Inkling,或通过 Tinker 使用指南 中的 API 进行访问。
Inkling 支持使用以下开源库进行本地部署:
此外,也可通过第三方推理服务提供商获取 API 访问权限。
多模态自回归Transformer
66层纯解码器Transformer,配备稀疏混合专家(MoE)前馈骨干网络:每个token被路由至256个专家中的6个,外加2个对每个token均激活的共享专家。注意力机制采用局部层与全局层混合架构。该模型原生支持多模态——图像和视频通过分层补丁编码器进行编码,音频通过离散token编码——所有模态均被投影到共享隐藏空间,并由解码器联合处理。
总计9750亿,活跃参数410亿
BF16和NVFP4
Inkling接受UTF-8编码的文本输入、任何基于像素格式的图像输入(各维度理想范围为40px至4096px以获得最佳性能),以及16kHz采样率的WAV格式音频输入(理想长度在20分钟以内以获得最佳性能)。
Inkling生成UTF-8编码的文本输出。
训练数据涵盖多种内容类型,包括文本、图像、音频和视频。模型训练数据来源于公开可用资源、第三方获取内容,或合成生成及增强内容。公开可用数据包括来自公共互联网和公开可访问存储库的内容。
训练数据整理流程包括数据集的清洗、处理和修改。这些处理步骤因数据类型而异,可能包括去重和过滤以移除垃圾数据或其他低质量数据,或用于提升安全性及实现其他目标。
Inkling的评估结果以effort=0.99报告。对比分数生成于2026年7月14日。Nemotron 3 Ultra、Kimi K2.5、Kimi K2.6、GLM 5.2和DeepSeek V4 Pro为开源权重模型;Gemini 3.1 Pro、Claude Fable 5和GPT 5.6 Sol为闭源权重模型。
| Inkling | Nemotron 3 Ultra | Kimi K2.5 | Kimi K2.6 | GLM 5.2 | DeepSeek V4 Pro | Gemini 3.1 Pro (high) | Claude Fable 5 (max) | GPT 5.6 Sol (xhigh) | ||
|---|---|---|---|---|---|---|---|---|---|---|
| 推理能力 | ||||||||||
| HLE(纯文本) | 29.7% | 26.6% | 29.4% | 35.9% | 40.1% | 35.9% | 44.7% | 53.3% | 47.2% | |
| HLE(带工具) | 46.0% | 37.4% | 50.2% | 54.0% | 54.7% | 48.2% | 51.4% | 64.5% | 55.0% | |
| AIME 2026 | 97.1% | 94.2% | 95.8% | 96.4% | 99.2% | 96.7% | 98.3% | – | 99.9% | |
| GPQA Diamond | 87.2% | 86.7% | 87.9% | 91.1% | 89.5% | 88.8% | 94.1% | 92.6% | 94.1% | |
| 智能体能力(编码) | ||||||||||
| SWEBench Verified | 77.6% | 70.7% | 76.8% | 80.2% | – | 80.6% | 80.6% | 95.0% | – | |
| SWEBench Pro(公开版) | 54.3% | 46.4% | 50.7% | 58.6% | 62.1% | 55.4% | 54.2% | 80.0% | 64.6% | |
| Terminal Bench 2.1(最佳测试框架) | 63.8 | 56.4 | 51.3 | 71.3 | 82.7 | 64 | 73.8 | 84.6 | 89.5 | |
| GDPVal-AA v2 | 1233 | 1164 | 1009 | 1190 | 1514 | 1307 | 962 | 1760 | 1748 | |
| 智能体能力(通用) | ||||||||||
| MCP Atlas | 74.1% | 44.7% | 64.0% | 68.1% | 77.8% | 73.2% | 78.2% | 83.3% | 81.8% | |
| Tau 3 Banking | 23.7% | 13.8% | 13.2% | 20.6% | 26.8% | 25.8% | 16.5% | 26.8% | 33.0% | |
| 事实准确性 | ||||||||||
| BrowseComp(带上下文) | 77.1% | – | 74.9% | 83.2% | – | 83.4% | 85.9% | 88.0% | 89.4% | |
| SimpleQA Verified | 43.9% | 32.4% | 36.9% | 38.7% | 38.1% | 57.0% | 77.3% | 68.3% | 71.6% | |
| AA Omniscience | 1.0% | -1.0% | -8.0% | 6.0% | 4.0% | -10.0% | 33.0% | 40.0% | 22.0% | |
| 对话能力 | ||||||||||
| IFBench | 79.8% | 81.4% | 70.2% | 76.0% | 73.3% | 76.5% | 77.1% | 63.5% | 72.7% | |
| Global-MMLU-Lite | 88.7% | 85.6% | 84.0% | 88.4% | 89.2% | 89.3% | 92.7% | 93.3% | 91.8% | |
| 视觉能力 | ||||||||||
| MMMU Pro(Standard 10) | 73.5% | – | 75.0% | 79.0% | – | – | 82.0% | 84.2% | 83.0% | |
| Charxiv RQ | 78.1% | – | 77.5% | 80.4% | – | – | 80.2% | 86.5% | 84.7% | |
| Charxiv RQ(带python) | 82.0% | – | 78.7% | 86.7% | – | – | 89.9% | 89.4% | 87.8% | |
| 音频能力 | ||||||||||
| Audio MC | 56.6% | – | – | – | – | – | 66.8% | – | – | |
| MMAU | 77.2% | – | – | – | – | – | 82.5% | – | – | |
| VoiceBench | 91.4% | – | – | – | – | – | 94.3% | – | – | |
| 安全性 | ||||||||||
| FORTRESS(对抗性) | 78.0% | 77.6% | 54.1% | 65.6% | 71.3% | 36.0% | 65.2% | 96.0% | 82.4% | |
| FORTRESS(良性) | 95.9% | 90.5% | 98.3% | 97.2% | 90.0% | 98.5% | 98.0% | 55.1% | 98.1% | |
| StrongREJECT | 98.6% | 98.7% | 99.5% | 99.8% | 98.5% | 98.6% | 98.0% | 98.7% | 98.5% |
我们在发布前进行了安全性评估,涵盖日常人机交互和危险能力测试。由于Inkling是多模态的,我们关注其安全行为在文本、音频和图像输入中是否保持一致。我们在发布前采取了缓解措施以降低风险。
在日常交互方面,我们评估了谄媚行为、有害操纵以及心理伤害模式(如类社会关系依赖和对妄想推理的验证),包括通过多轮、开放式的外部红队测试,旨在发现仅在较长对话中才会出现的问题。我们还评估了模型是否会拒绝真正有害的请求,同时不会过度拒绝良性请求。在化学、生物、放射和核(CBRN)以及网络安全方面,我们通过内部评估、外部测试以及旨在评估移除安全防护后潜在能力的拒绝抑制变体,对知识和程序提升进行了评估。在失控风险方面,我们评估了智能体能力、策略性欺骗和破坏潜力,并与公开的前沿模型进行了基准对比,发现该模型的能力明显低于前沿水平。
综合所有领域,我们得出结论:Inkling并未带来超出开放权重生态系统现有水平的实质性能力提升风险。
我们的评估中发现的残余风险——具体而言,Inkling偶尔会倾向于遵从涉及有害主题的角色扮演和间接框架提示——与任何开放权重模型的表现一致,最好通过纵深防御来解决,而不是仅仅依赖模型的拒绝机制。常见的下游 moderation 工具(如 Llama Guard)与Inkling兼容,可以作为模型的外层防护,以捕获越狱尝试、过滤不安全输出并执行特定用例的策略。我们建议将此类输入/输出分类作为部署堆栈的一部分,尤其是在面向消费者或高流量的应用中,这些场景更可能遭遇对抗性提示。
Inkling 可能会表现出基础模型常见的一般性局限,包括幻觉(生成看似合理但与事实不符或缺乏支持的内容)、偶尔无法精确遵循指令,以及在长多轮对话中性能下降。与其他基于网络衍生数据和合成数据训练的大规模模型一样,Inkling 可能会反映其训练数据中存在的偏差,包括人口统计、文化或语言偏差,并且在训练期间代表性不足的语言、方言或主题领域上的表现可能不均衡。
Inkling 的知识仅限于其训练截止日期前可获取的信息,可能无法反映此后发生的事件、发展或变化。
我们建议下游开发者和部署者在高风险或安全关键场景中对输出内容进行适当的人工监督和审查,而非未经核实就依赖 Inkling 的输出。