HuggingFace镜像/LFM2.5-2.6B
模型介绍
文件和版本
分析
Liquid AI
试用 LFM • 文档 • LEAP • Discord

LFM2.5-2.6B

LFM2.5-2.6B 是 LFM2.5 系列的一部分,该系列是专为设备端部署设计的混合模型。它基于 LFM2 架构构建,拥有 128K 上下文窗口和智能体化后训练。

  • 同类最佳智能体:在工具使用、指令遵循和多步骤智能体任务方面,可与 4 倍规模的模型相媲美。
  • 智能体强化学习:在最流行的智能体框架中进行训练,以提高兼容性。
  • 高效推理:在 Apple M5 Max 上可达 220 tok/s,在 AMD Ryzen CPU 上可达 113 tok/s,内存占用不到 2.5 GB。

有关 LFM2.5-2.6B 的更多信息,请参见我们的 博客文章。

[!NOTE] 💻 演示:无需任何设置,即可在 Hugging Face 空间中体验 LFM2.5-2.6B 的智能体能力: 浏览器中的研究智能体:帮助您研究特定问题并生成摘要

🗒️ 模型详情

模型参数规模描述
LFM2.5-2.6B-Base2.6B用于微调的预训练基础模型
LFM2.5-2.6B2.6B针对智能体工作负载进行后训练

LFM2.5-2.6B 是一个通用纯文本模型,具有以下特点:

  • 总参数:2.69B
  • 层数:30(22 个双门控短卷积块 + 8 个 GQA)
  • 训练数据量:34 万亿 tokens
  • 词汇表大小:128,000
  • 上下文长度:131,072 tokens
  • 支持语言:英语、阿拉伯语、中文、法语、德语、意大利语、日语、韩语、葡萄牙语、西班牙语、越南语、泰语、印尼语、印地语、俄语、波兰语
  • 生成参数:
    • temperature: 0.1
    • top_k: 50
    • repetition_penalty: 1.1
模型描述
LFM2.5-2.6B原生格式的原始模型 checkpoint。最适合使用 Transformers、vLLM 和 SGLang 进行微调或推理。
LFM2.5-2.6B-GGUF适用于 llama.cpp 及兼容工具的量化格式。针对 CPU 推理和本地部署进行优化,降低了内存占用。
LFM2.5-2.6B-ONNX用于跨平台部署的 ONNX Runtime 格式。支持在各种环境(云、边缘、移动设备)中进行硬件加速推理。
LFM2.5-2.6B-MLX适用于 Apple Silicon 的 MLX 格式。利用 MLX 框架在 Mac 设备上实现快速推理优化。

我们建议将其用于智能体工作负载、工具使用、数据提取、RAG 和长上下文工作流。不建议将其用于智能体编码和知识密集型任务。

聊天模板

LFM2.5采用类ChatML格式。详情请参见聊天模板文档。示例:

<|startoftext|><|im_start|>system
You are a helpful assistant trained by Liquid AI.<|im_end|>
<|im_start|>user
What is C. elegans?<|im_end|>
<|im_start|>assistant

你可以使用 tokenizer.apply_chat_template() 自动格式化消息。

[!TIP] 💡 注意:LFM2.5-2.6B 是一个纯推理模型,在回答前始终会进行思考。在开始助手回答时,它会在 聊天模板 中直接添加 </think> 标签。

工具使用

LFM2.5 支持通过四个步骤进行函数调用:

  1. 函数定义:在系统提示中以 JSON 对象形式提供工具列表,或使用带有 tools=... 参数的 tokenizer.apply_chat_template()。
  2. 函数调用:默认情况下,LFM2.5 会编写类 Python 风格的函数调用(在 <|tool_call_start|> 和 <|tool_call_end|> 特殊标记之间的 Python 列表)作为助手回答。你可以在系统提示中要求模型输出 JSON 格式的函数调用来覆盖此行为。
  3. 函数执行:执行调用并以 tool 角色返回结果。
  4. 最终回答:LFM2.5 解释工具输出并返回针对原始提示的纯文本回答。

完整指南请参见 工具使用文档。示例:

<|startoftext|><|im_start|>system
List of tools: [{"name": "get_candidate_status", "description": "Retrieves the current status of a candidate in the recruitment process", "parameters": {"type": "object", "properties": {"candidate_id": {"type": "string", "description": "Unique identifier for the candidate"}}, "required": ["candidate_id"]}}]<|im_end|>
<|im_start|>user
What is the current status of candidate ID 12345?<|im_end|>
<|im_start|>assistant
<|tool_call_start|>[get_candidate_status(candidate_id="12345")]<|tool_call_end|>Checking the current status of candidate ID 12345.<|im_end|>
<|im_start|>tool
[{"candidate_id": "12345", "status": "Interview Scheduled", "position": "Clinical Research Associate", "date": "2023-11-20"}]<|im_end|>
<|im_start|>assistant
The candidate with ID 12345 is currently in the "Interview Scheduled" stage for the position of Clinical Research Associate, with an interview date set for 2023-11-20.<|im_end|>

训练

LFM2.5-2.6B 在约34T tokens上进行预训练,其中包含一个将上下文窗口扩展至128K的中期训练阶段。随后的训练通过四个阶段将基础模型转变为智能体:监督微调(两轮)、特定领域教师模型专业化、多领域在线策略蒸馏以及智能体强化学习。

特别是智能体强化学习,使我们能够在主流的智能体框架内直接训练模型。这让模型接触到这些框架的工具、系统提示和交互模式,有助于其在各类智能体环境中实现可靠运行。

🏃 推理

LFM2.5 支持多种推理框架。完整列表请参见推理文档。

名称描述文档笔记本
Transformers可直接访问模型内部结构的简单推理。链接Colab 链接
vLLM基于GPU的高吞吐量生产部署。链接Colab 链接
llama.cpp支持CPU卸载的跨平台推理。链接Colab 链接
MLXApple 的机器学习框架,针对 Apple Silicon 优化。链接—
LM Studio用于本地运行 LLM 的桌面应用程序。链接—
SGLang基于GPU的高吞吐量生产部署。链接-

使用 Transformers 快速开始(兼容 transformers>=5.0.0):

from transformers import AutoModelForCausalLM, AutoTokenizer, TextStreamer

model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    device_map="auto",
    dtype="bfloat16",
#   attn_implementation="flash_attention_2" <- uncomment on compatible GPU
)
tokenizer = AutoTokenizer.from_pretrained(model_id)
streamer = TextStreamer(tokenizer, skip_prompt=True, skip_special_tokens=True)

prompt = "What is C. elegans?"

input_ids = tokenizer.apply_chat_template(
    [{"role": "user", "content": prompt}],
    add_generation_prompt=True,
    return_tensors="pt",
    tokenize=True,
)["input_ids"].to(model.device)

output = model.generate(
    input_ids,
    do_sample=True,
    temperature=0.1,
    top_k=50,
    repetition_penalty=1.1,
    max_new_tokens=512,
    streamer=streamer,
)

🔧 微调

为获得最佳效果,我们建议针对您的特定使用场景对 LFM2.5 进行微调。

名称描述文档笔记本
CPT(Unsloth)使用 Unsloth 进行文本补全的持续预训练。链接Colab 链接
CPT(Unsloth)使用 Unsloth 进行翻译的持续预训练。链接Colab 链接
SFT(Unsloth)使用 Unsloth 进行带 LoRA 的监督微调。链接Colab 链接
SFT(TRL)使用 TRL 进行带 LoRA 的监督微调。链接Colab 链接
DPO(TRL)使用 TRL 进行带 LoRA 的直接偏好优化。链接Colab 链接
GRPO(TRL)使用 TRL 进行带 LoRA 的 GRPO。链接Colab 链接

📊 性能表现

基准测试

我们在一系列多样化的基准测试中,将LFM2.5-2.6B与相关的100亿参数以下模型进行了对比。

基准测试LFM2.5-2.6B (2.6B)gemma-4-E2B-it (5.1B)gemma-4-E4B-it (8B)Qwen3.5-4B (4.7B)Qwen3.5-9B (9.7B)
AA-Omni-Public Index-29.50-74.47-49.03-54.30-50.43
AA-Omni-Public Acc8.136.378.3317.6321.30
AA-Omni-Public Non-hallu59.0413.6737.4212.668.84
AIME2551.8726.3334.2749.3356.07
LiveCodeBenchv659.4154.9263.7760.8569.86
IFBench59.1734.0839.2448.4056.47
Multi-IF80.0769.4477.3555.6762.55
IFStruct85.4964.8576.6536.2578.50
BFCLv456.8836.9846.3950.5660.13
ToolSandbox77.8352.4065.0075.5576.44
τ³-Bench Banking5.673.354.125.455.15
Claw-Eval average (EN)62.8553.1458.0262.2866.53
PinchBench68.2244.2455.0971.2671.45
BrowseComp+ (OpenClaw)26.898.3115.9024.4627.23

CPU推理

得益于其高效的LFM2架构,LFM2.5-2.6B是我们测试过的速度最快的模型,在M5 Max上的解码速度为220 tokens/s,在Ryzen AI Max+ 395上为113 tokens/s。即使在手机上,以30 tokens/s的速度运行,也能支持功能完备的智能体。

GPU推理

LFM2.5-2.6B是同尺寸模型中速度最快的,在高并发情况下,输出 tokens 速度接近15K/秒,在单张H100上每天大约可处理13亿 tokens。

📬 联系方式

  • 有疑问或想交流?加入我们的Discord社区
  • 如对边缘部署的定制解决方案感兴趣,请联系我们的销售团队。

引用格式

@article{liquidAI202626B,
  author  = {Liquid AI},
  title   = {LFM2.5-2.6B: Agents Everywhere},
  journal = {Liquid AI Blog},
  year    = {2026},
  note    = {www.liquid.ai/blog/lfm2-5-2-6b},
}
@article{liquidai2025lfm2,
  title   = {LFM2 Technical Report},
  author  = {Liquid AI},
  journal = {arXiv preprint arXiv:2511.23404},
  year    = {2025}
}