HuggingFace镜像/Ling-3.0-tiny-base
模型介绍
文件和版本
分析

🤗 Hugging Face   |   🤖 ModelScope    |   🐙 OpenRouter   

简介

我们已开源 Ling-3.0 系列,这是我们迄今最高效的语言基础模型家族。为支持科研与社区驱动的创新,我们将发布训练过程中的一组检查点,如下所示:

模型预训练中期训练 合并(即 WSM)
Ling-3.0-tiny Ling-3.0-tiny-base-30T Ling-3.0-tiny-base-midtrain Ling-3.0-tiny-base
Ling-3.0-flash Ling-3.0-flash-base-30T Ling-3.0-flash-base-midtrain Ling-3.0-flash-base

这些检查点对应训练流程的不同阶段:

  • 预训练检查点已完成大规模预训练,但尚未进行中期训练、WSM 合并(或学习率衰减)或后训练。
  • 中期训练检查点已完成中期训练,但尚未进行 WSM 合并(或学习率衰减)或后训练。
  • 合并检查点基于中期训练检查点完成了 WSM 合并(或学习率衰减),但尚未进行后训练。

这些检查点旨在支持持续预训练、微调以及进一步研究。如需查看后训练模型,请参考 Ling-3.0-tiny 和 Ling-3.0-flash。

模型概览

核心特性

  • 高度稀疏(1/64)MoE 架构:共 512 个路由专家,每个 token 仅激活 8 个路由专家和 1 个共享专家。该架构在保持广泛模型能力的同时,每个 token 仅激活 5.1B(Non-emb)参数;
  • 原生混合线性注意力:Ling-3.0 系列从预训练初始阶段便采用原生混合线性注意力架构,通过结合 KDA 与 Gated MLA,以实现对长上下文输入的高效处理。
  • Warmup-Stable and Merge:我们以加权检查点合并替代常规学习率衰减。通过消除衰减阶段,我们的 Base 模型更适合持续预训练和动态数据扩展,同时支持离线探索不同的衰减调度,而无需为每种策略重新运行高成本实验。
  • 无缝扩展:Ling-3.0-tiny-base 和 Ling-3.0-flash-base 共享同一套训练方案,便于社区先在 Ling-3.0-tiny-base 上开展实验,再将经过验证的训练策略扩展至规模更大的 Ling-3.0-flash-base。
模型属性Base(WSM 合并的最终检查点)
架构混合线性 MoE
参数规模总计 7.9B,激活 1.3B
Transformer 层数18 KDA + 6 Gated MLA (3:1)
稠密层数量1
路由专家数量128
共享专家数量1
激活专家数量8
注意力头数16
隐藏层维度1536
专家中间层维度512
稠密中间层维度4608
词表大小157,184

基座模型评测

为系统评估基座模型的各项能力,我们采用自建的综合性基准测试套件,覆盖知识、编码、数学、推理、多语言理解与长上下文理解等多个关键领域。预训练基座检查点(即 Ling-3.0-tiny-base)的评测结果对比如下:

领域基准测试样例数配置Ling-3.0-tiny-baseLing-2.5-mini-baseQwen3.5-9B-baseQwen3.5-4B-base
7.9B A1.3B16B A1.4B9B4B
知识CCPM(EM)0-shot84.0180.7788.3181.88
ARC-C(EM)0-shot92.2091.1994.5892.20
AGIEval(Acc)0-shot64.4963.3866.1761.45
SimpleQA-Verified(Acc)5-shot7.207.1010.406.40
MMLU-Pro(EM)5-shot51.8349.8957.7652.06
CEval(EM)5-shot80.5980.1681.5276.67
代码HumanEval-Plus(Pass@1)0-shot79.2776.2252.4449.39
CruxEval(Pass@1)1-shot67.4463.1968.1264.31
MultiPL-E(Pass@1)1-shot64.3864.3452.8945.47
LiveCodeBench1(Pass@1)1-shot24.2322.9118.0613.88
BigCodeBench(Pass@1)0-shot42.8942.5429.3924.39
FullStackBench(Pass@1)3-shot39.4838.5937.2333.14
LCBench2(Pass@1)3-shot41.5946.1633.4719.46
数学MATH500(Acc)4-shot65.6068.4055.2049.60
OlympiadBench(Acc)3-shot25.9024.1021.8417.02
TheoremQA(Acc)5-shot51.6450.6852.8847.40
OmniMath(Acc)3-shot29.7029.0222.9920.89
推理CommonSenseQA(EM)5-shot83.4681.1683.6280.18
BBH(EM)3-shot80.6477.3784.5280.11
长上下文LongBench(Acc)0-shot43.8529.9351.8739.96
LEval(Acc)0-shot68.3762.7277.2463.09
注:
1 LiveCodeBench (2408-2505)
2 LCBench (2301-2502)

预期用途

推荐用例:

  • 继续预训练
  • 中期训练
  • 面向领域适配的监督微调
  • 偏好优化、RL 后训练与蒸馏研究
  • 长上下文与 MoE 系统研究

不建议直接用于:

  • 直接面向终端用户的聊天部署
  • 未进行额外对齐与评估的安全关键应用
  • 未进行后训练与任务特定验证的生产使用

使用

有关微调示例,请参阅我们的 ling-cookbook。

常见问题

如有任何问题,欢迎随时发起讨论。

许可证

该模型基于 MIT License 发布。