HuggingFace镜像/Inkling-Small
模型介绍
文件和版本
分析

Inkling

BF16 | NVFP4 | Playground | Tinker Cookbook | Acceptable Use

1. 基本信息

Inkling-Small 是一款通用多模态模型,可接受文本、图像和音频输入并生成文本输出。它适用于英语及其他多种语言,同时支持多种编程语言。该模型专为开发人员构建 AI 驱动的应用程序而设计,包括智能体系统、工具使用系统、编码助手、聊天机器人和检索增强生成系统,也适用于通用对话、指令遵循以及其他自然语言和多模态任务。模型以开放权重形式发布,旨在支持研究、微调以及下游开发人员将其集成到第三方产品中。

语言支持: 英语,并具备跨其他语言的通用多语言处理能力。

2. 快速开始

可在 Tinker Playground 上试用 Inkling-Small,或通过 Tinker Cookbook 调用 API 进行访问。

Inkling-Small 支持通过以下开源库进行本地部署:

  • SGLang(使用指南)
  • vLLM(使用指南)
  • TokenSpeed(使用指南)
  • Unsloth(使用指南)
  • Huggingface(使用指南)

此外,还可通过第三方推理服务提供商获取 API 访问权限。

3. 模型特性

模型类型

多模态自回归Transformer

架构类型

42层仅解码器Transformer,采用稀疏混合专家(MoE)前馈骨干网络:每个token被路由至256个专家中的6个,外加2个对所有token均激活的共享专家。注意力机制采用局部与全局层混合架构。该模型原生支持多模态——图像通过分层补丁编码器进行编码,音频通过离散token编码——所有模态均被投影至共享隐藏空间,并由解码器联合处理。

参数规模

总计2760亿,激活120亿

数值支持

BF16和NVFP4

输入模态

Inkling-Small支持文本、图像和音频输入:

  • 文本:UTF-8编码文本
  • 图像:任何基于像素的图像输入。为获得最佳性能,每个图像维度应在40px至4096px之间。
  • 音频:WAV格式,采样率16kHz。为获得最佳性能,音频长度理想情况下应在2分钟以内。

输出模态

Inkling-Small生成的输出为UTF-8编码文本。

4. 训练

训练数据包含多种内容类型,包括文本、图像、音频、视频。

模型的训练数据来源于公开可用资源、第三方获取,或通过合成生成及增强处理。公开可用数据包括来自公共互联网和可公开访问的存储库的内容。

训练数据的整理过程包括数据集的清洗、处理和修改。这些处理步骤因数据类型而异,可能包括去重、过滤以移除垃圾数据或其他低质量数据,或为提升安全性及其他目标而进行的处理。

5. 评估

开源权重 闭源权重
Inkling-Small Qwen3.5 397B-A17B MiMo V2.5 Minimax M2.7 DeepSeek V4 Flash Nemotron 3 Ultra Inkling Claude 4.5 Haiku Gemini 3.5 Flash-Lite GPT 5.6 Luna
模型信息
AA指数 (v4.1) 40.0%34.0%37.0%38.0%40.0%38.0%41.0%30.0%36.0%49.0%
参数规模(B) (激活/总计) 12 / 27617 / 39715 / 31010 / 23013 / 28455 / 55041 / 975–––
智能体(代码)
SWEBench Verified 80.2%76.4%71.0%79.9%79.0%70.7%77.6%73.3%75.0%93.0%
SWEBench Pro (公开版) 55.9%50.9%56.1%56.2%52.6%46.4%54.3%39.5%54.2%62.7%
Terminal Bench 2.1 (最佳测试框架) 64.7%51.3%63.7%55.4%61.8%56.4%63.8%44.2%54.0%82.5%
SciCode 48.7%42.0%43.1%47.0%44.9%39.9%46.1%43.3%40.9%50.0%
智能体(通用)
GDPval-AA v2 12699621145115911891164123891111391530
MCP Atlas (公开版/完整版) 79.6/79.2%74.2%/––49.4%/–69.0%/–47.4/44.7%78.8/76.0%41.2/40.2%79.8/76.8%77.0/75.0%
Tau 3 Banking 15.5%13.4%6.6%8.9%22.9%13.8%23.7%9.1%16.5%24.3%
BrowseComp (含上下文管理) 77.4%78.6%–76.3%73.2%63.0%77.1%––84.0%
Toolathlon Verified 54.4%40.7%49.1%47.5%50.9%34.3%45.5%26.9%57.1%67.9%
AA-Briefcase 917–––833870839612––
推理(通用)
GPQA Diamond 89.5%89.3%84.9%87.4%89.4%86.7%87.2%67.2%83.8%89.5%
HLE (仅文本) 31.6%27.3%25.2%28.1%32.1%26.6%29.7%9.7%17.5%35.6%
HLE (含工具) 47.8%48.3%40.0%40.3%45.1%37.4%46.0%17.8%42.5%48.9%
AIME 2026 95.5%93.3%93.6%87.7%95.8%94.2%97.1%85.1%82.2%97.6%
HMMT Feb 2026 9 93.9%78.8%86.3%66.7%63.6%98.5%
CritPt 8.3%1.7%3.7%0.6%7.1%3.1%5.4%0.0%0.0%20.6%
推理(抽象)
ARC-AGI-1 84.0%–––––79.5%47.7%–87.7%
ARC-AGI-2 40.1%–––––36.5%4.0%–47.6%
事实性
SimpleQA Verified 20.6%26.0%16.1%13.5%34.1%32.4%43.9%5.9%44.1%41.7%
AA Omniscience (指数) -9.0-29.8-9.30.7-22.9-1.02.1-4.26.9-11.6
对话
IFBench 82.2%78.8%67.1%75.7%79.2%81.4%79.8%54.3%78.6%67.3%
Global-MMLU-Lite 86.7%90.0%83.5%83.9%88.4%85.6%88.7%83.4%89.4%88.7%
安全性
StrongREJECT 98.4%99.4%99.3%99.4%97.4%98.7%98.6%98.6%97.6%98.7%
FORTRESS (对抗性) 71.6%77.3%64.8%86.3%32.0%77.6%78.0%91.3%70.7%83.8%
FORTRESS (良性) 96.9%95.4%94.6%90.1%99.2%90.6%95.9%94.1%95.5%97.8%
视觉
MMMU Pro (Standard 10) 74.0%77.3%75.4%–––73.5%58.6%79.0%78.6%
Charxiv RQ (原始 / 带python) 77.4/81.3%80.8%/–81.0%/––––78.1/82.0%57.4%/–70.0%/–81.4%/–
音频
Audio MC 54.9%–30.4%–––56.6%–33.6%–
MMAU 77.0%–73.6%–––77.2%–75.2%–
VoiceBench 90.1%–86.4%–––91.4%–85.9%–
- Inkling-Small在整套评估套件中与开源和闭源模型的对比。激活参数和总参数用于说明规模;短横线表示撰写本文时分数尚未公布。 - SWEBench Verified:Inkling和Inkling-Small的数据使用纯bash测试工具报告。外部模型数据采用其自我报告数值。 - Terminal Bench 2.1:Inkling和Inkling-Small的数据使用内部编码测试工具报告。发现少量解决方案因网络搜索存在数据污染,故记为0分。外部模型优先使用其自我报告数据,若无则采用我们的内部测试工具评估结果。 - Audio MC:其他模型因未登上官方排行榜,故均采用内部评估数据。 - VoiceBench:该基准测试采用基于规则的硬编码字符串匹配进行评分,因此评估结果对输出格式差异较为敏感。为此,我们添加了系统提示,指导模型遵循预期的答案格式。 - 带工具的HLE:我们使用内部测试工具对Minimax M2.7、Claude 4.5 Haiku、Gemini 3.5 Flash-Lite和GPT 5.6 Luna进行了基准测试。

6. 安全性

我们在发布前进行了安全性评估,涵盖日常人机交互和危险能力测试。由于Inkling-Small是多模态模型,我们特别关注其安全行为在文本、音频和图像输入中是否保持一致。在发布前,我们已采取缓解措施以降低风险。

在日常交互方面,我们评估了模型的谄媚行为、受有害操纵的可能性以及心理伤害模式(如类社会关系依赖和对妄想推理的认同),包括通过多轮、开放式的外部红队测试,旨在发现那些仅在较长对话中才会显现的问题。我们还评估了模型是否会拒绝真正有害的请求,同时不会过度拒绝良性请求。在化学、生物、放射和核(CBRN)以及网络安全领域,我们通过内部评估、外部测试以及移除安全防护的拒绝抑制变体,来评估知识和程序提升能力,以估计其潜在能力。在失控风险方面,我们评估了模型的代理能力、策略性欺骗和破坏潜力,并与公开的前沿模型进行基准对比,发现该模型的能力明显低于前沿水平。

综合所有领域的评估,我们得出结论:Inkling-Small不会带来超出开源模型生态系统现有水平的实质性能力提升风险。

我们的评估中发现的残余风险——具体而言,Inkling-Small偶尔会倾向于遵从涉及有害主题的角色扮演和间接框架提示——与任何开源模型的表现一致,且最好通过纵深防御来解决,而非仅依赖模型自身的拒绝机制。常见的下游 moderation 工具(如Llama Guard)与Inkling-Small兼容,可以作为模型的外层防护,用于捕捉越狱尝试、过滤不安全输出并执行特定用例的策略。我们建议将此类输入/输出分类作为部署堆栈的一部分,尤其是在面向消费者或高流量的应用中,这些场景更可能遭遇对抗性提示。

7. 偏差、风险与局限性

Inkling-Small 可能存在基础模型常见的一般性局限,包括幻觉(生成看似合理但与事实不符或缺乏支持的内容)、偶尔无法精确遵循指令,以及在长对话轮次中性能下降。与其他基于网络数据和合成数据训练的大规模模型一样,Inkling-Small 可能会反映其训练数据中存在的偏差,包括人口统计、文化或语言偏差,并且在训练期间代表性不足的语言、方言或主题领域上的表现可能不均衡。

Inkling-Small 的知识仅限于其训练截止日期前可获取的信息,可能无法反映此后发生的事件、发展或变化。

我们建议下游开发者和部署者在高风险或安全关键场景中对输出内容进行适当的人工监督和审查,而非未经核实就依赖 Inkling-Small 的输出。

  • 在部署前,针对其特定用例、语言和目标人群,自行评估 Inkling-Small 的性能、安全性和公平性,尤其是涉及弱势群体的应用。
  • 在应用层实施额外的安全措施,例如内容过滤、速率限制和监控,特别是在开放式部署环境中,Inkling-Small 内置的缓解措施可能不足以独立应对风险。
  • 避免在医疗、法律或安全关键决策等领域部署 Inkling-Small,除非经过额外的微调、特定领域的验证和人工监督。

8. 法律信息

训练数据文档