🤗 Hugging Face | 🤖 ModelScope | 🐙 OpenRouter
我们已开源 Ling-3.0 系列,这是我们迄今最高效的语言基础模型家族。为支持科研与社区驱动的创新,我们将发布训练过程中的一组检查点,如下所示:
| 模型 | 预训练 | 中期训练 | 合并(即 WSM) |
|---|---|---|---|
| Ling-3.0-tiny | Ling-3.0-tiny-base-30T | Ling-3.0-tiny-base-midtrain | Ling-3.0-tiny-base |
| Ling-3.0-flash | Ling-3.0-flash-base-30T | Ling-3.0-flash-base-midtrain | Ling-3.0-flash-base |
这些检查点对应训练流程的不同阶段:
这些检查点旨在支持持续预训练、微调以及进一步研究。如需查看后训练模型,请参考 Ling-3.0-tiny 和 Ling-3.0-flash。
| 模型属性 | Base(WSM 合并的最终检查点) |
|---|---|
| 架构 | 混合线性 MoE |
| 参数规模 | 总计 7.9B,激活 1.3B |
| Transformer 层数 | 18 KDA + 6 Gated MLA (3:1) |
| 稠密层数量 | 1 |
| 路由专家数量 | 128 |
| 共享专家数量 | 1 |
| 激活专家数量 | 8 |
| 注意力头数 | 16 |
| 隐藏层维度 | 1536 |
| 专家中间层维度 | 512 |
| 稠密中间层维度 | 4608 |
| 词表大小 | 157,184 |
为系统评估基座模型的各项能力,我们采用自建的综合性基准测试套件,覆盖知识、编码、数学、推理、多语言理解与长上下文理解等多个关键领域。预训练基座检查点(即 Ling-3.0-tiny-base)的评测结果对比如下:
| 领域 | 基准测试 | 样例数配置 | Ling-3.0-tiny-base | Ling-2.5-mini-base | Qwen3.5-9B-base | Qwen3.5-4B-base |
|---|---|---|---|---|---|---|
| 7.9B A1.3B | 16B A1.4B | 9B | 4B | |||
| 知识 | CCPM(EM) | 0-shot | 84.01 | 80.77 | 88.31 | 81.88 |
| ARC-C(EM) | 0-shot | 92.20 | 91.19 | 94.58 | 92.20 | |
| AGIEval(Acc) | 0-shot | 64.49 | 63.38 | 66.17 | 61.45 | |
| SimpleQA-Verified(Acc) | 5-shot | 7.20 | 7.10 | 10.40 | 6.40 | |
| MMLU-Pro(EM) | 5-shot | 51.83 | 49.89 | 57.76 | 52.06 | |
| CEval(EM) | 5-shot | 80.59 | 80.16 | 81.52 | 76.67 | |
| 代码 | HumanEval-Plus(Pass@1) | 0-shot | 79.27 | 76.22 | 52.44 | 49.39 |
| CruxEval(Pass@1) | 1-shot | 67.44 | 63.19 | 68.12 | 64.31 | |
| MultiPL-E(Pass@1) | 1-shot | 64.38 | 64.34 | 52.89 | 45.47 | |
| LiveCodeBench1(Pass@1) | 1-shot | 24.23 | 22.91 | 18.06 | 13.88 | |
| BigCodeBench(Pass@1) | 0-shot | 42.89 | 42.54 | 29.39 | 24.39 | |
| FullStackBench(Pass@1) | 3-shot | 39.48 | 38.59 | 37.23 | 33.14 | |
| LCBench2(Pass@1) | 3-shot | 41.59 | 46.16 | 33.47 | 19.46 | |
| 数学 | MATH500(Acc) | 4-shot | 65.60 | 68.40 | 55.20 | 49.60 |
| OlympiadBench(Acc) | 3-shot | 25.90 | 24.10 | 21.84 | 17.02 | |
| TheoremQA(Acc) | 5-shot | 51.64 | 50.68 | 52.88 | 47.40 | |
| OmniMath(Acc) | 3-shot | 29.70 | 29.02 | 22.99 | 20.89 | |
| 推理 | CommonSenseQA(EM) | 5-shot | 83.46 | 81.16 | 83.62 | 80.18 |
| BBH(EM) | 3-shot | 80.64 | 77.37 | 84.52 | 80.11 | |
| 长上下文 | LongBench(Acc) | 0-shot | 43.85 | 29.93 | 51.87 | 39.96 |
| LEval(Acc) | 0-shot | 68.37 | 62.72 | 77.24 | 63.09 | |
|
注: 1 LiveCodeBench (2408-2505) 2 LCBench (2301-2502) | ||||||
推荐用例:
不建议直接用于:
有关微调示例,请参阅我们的 ling-cookbook。
如有任何问题,欢迎随时发起讨论。
该模型基于 MIT License 发布。