HuggingFace镜像/Mistral-Large-3-675B-Instruct-2512-Eagle
模型介绍
文件和版本
分析

Mistral Large 3 675B Instruct 2512 Eagle

本模型是 Mistral Large 3 Instruct 的 Eagle 推测器。

根据任务不同,生成过程可预期获得明显提速。

Mistral Large 3 675B Instruct 2512

在我们的大模型家族中,Mistral Large 3 是一款先进的通用型多模态细粒度混合专家(Mixture-of-Experts)模型,具备41B 激活参数与675B 总参数,并基于 3000 张 H200 从头训练

本模型是 FP8 指令后训练版本,针对指令任务进行了微调,非常适合聊天、智能体以及指令驱动的使用场景。
它面向可靠性与长上下文理解而设计,专为生产级助手、检索增强系统、科学计算任务以及复杂企业工作流打造。

Mistral Large 3 支持以下本地部署格式:

  • FP8 可在单节点 B200 或 H200 上部署。
  • NVFP4 可在单节点 H100 或 A100 上部署。

如有需要,我们还提供 BF16 版本。

核心特性

Mistral Large 3 由两个主要架构组件构成:

  • 一个 673B 参数、39B 激活参数的细粒度 MoE 语言模型
  • 一个 2.5B 视觉编码器

Mistral Large 3 Instruct 模型提供以下能力:

  • 视觉:使模型能够分析图像,并基于视觉内容提供洞察,而不局限于文本。
  • 多语言:支持数十种语言,包括英语、法语、西班牙语、德语、意大利语、葡萄牙语、荷兰语、中文、日语、韩语和阿拉伯语。
  • System Prompt:对系统提示词保持强遵循与稳定支持。
  • 智能体:提供业内领先的智能体能力,支持原生函数调用和 JSON 输出。
  • Frontier:提供业内领先的性能。
  • Apache 2.0 License:一项允许商业和非商业用途下使用与修改的开源许可证。
  • 大上下文窗口:支持 256k 上下文窗口。

推荐设置

我们建议以客户端-服务器方式部署 Large 3,并遵循以下最佳实践:

  • 系统提示:明确定义使用环境与用例,并说明如何在智能体系统中有效调用工具。
  • 采样参数:在日常使用和生产环境中,temperature 应低于 0.1;对于创意类用例,可探索更高的 temperature。建议开发者自行尝试其他设置。
  • 工具:保持工具集定义清晰,并将工具数量限制为完成用例所需的最小数量,避免向模型加载过多工具。
  • 视觉:在启用视觉能力部署时,建议将图片宽高比保持在接近 1:1(宽:高)。避免使用过于细长或过宽的图像——必要时进行裁剪,以确保最佳性能。

使用

该模型可配合以下框架使用:

  • vllm:参见此处

vLLM

我们建议搭配 vLLM 使用该模型。

安装

请确保安装 vllm >= 1.12.0:

pip install vllm --upgrade

执行上述操作后,应会自动安装 mistral_common >= 1.8.6。

检查方法:

python -c "import mistral_common; print(mistral_common.__version__)"

你也可以使用即开即用的 Docker 镜像 或 Docker Hub 上的镜像。

服务部署

我们建议在服务端/客户端模式下使用 Mistral Large 3。

  1. 启动一个服务:
vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512 \
  --tensor-parallel-size 8 \
  --load-format mistral \
  --tokenizer-mode mistral \
  --config-format mistral \
  --enable-auto-tool-choice \
  --tool-call-parser mistral \
  --limit-mm-per-prompt '{"image": 10}' \
  --speculative_config '{
    "model": "mistralai/Mistral-Large-3-675B-Instruct-2512-Eagle",
    "num_speculative_tokens": 3,
    "method": "eagle",
    "max_model_len": "16384"
  }'

注意: 在 GPU 上运行 mistralai/Mistral-Large-3-675B-Instruct-2512 需要 B200 或 H200 节点。

  1. 要 ping 客户端,可以使用一段简单的 Python 代码片段。示例如下。
from datetime import datetime, timedelta

from openai import OpenAI
from huggingface_hub import hf_hub_download

# Modify OpenAI's API key and API base to use vLLM's API server.
openai_api_key = "EMPTY"
openai_api_base = "http://localhost:8000/v1"

TEMP = 0.15
MAX_TOK = 262144

client = OpenAI(
    api_key=openai_api_key,
    base_url=openai_api_base,
)

models = client.models.list()
model = models.data[0].id


def load_system_prompt(repo_id: str, filename: str) -> str:
    file_path = hf_hub_download(repo_id=repo_id, filename=filename)
    with open(file_path, "r") as file:
        system_prompt = file.read()
    today = datetime.today().strftime("%Y-%m-%d")
    yesterday = (datetime.today() - timedelta(days=1)).strftime("%Y-%m-%d")
    model_name = repo_id.split("/")[-1]
    return system_prompt.format(name=model_name, today=today, yesterday=yesterday)


SYSTEM_PROMPT = load_system_prompt(model, "SYSTEM_PROMPT.txt")
image_url = "https://static.wikia.nocookie.net/essentialsdocs/images/7/70/Battle.png/revision/latest?cb=20220523172438"

messages = [
    {"role": "system", "content": SYSTEM_PROMPT},
    {
        "role": "user",
        "content": [
            {
                "type": "text",
                "text": "What action do you think I should take in this situation? List all the possible actions and explain why you think they are good or bad.",
            },
            {"type": "image_url", "image_url": {"url": image_url}},
        ],
    },
]


response = client.chat.completions.create(
    model=model,
    messages=messages,
    temperature=TEMP,
    max_tokens=MAX_TOK,
)

print(response.choices[0].message.content)

许可证

本模型依据 Apache 2.0 License 授权。

您不得以任何方式使用本模型,从而侵犯、不当利用或以其他方式违反任何第三方权利,包括知识产权。