本模型是 Mistral Large 3 Instruct 的 Eagle 推测器。
根据任务不同,生成过程可预期获得明显提速。
在我们的大模型家族中,Mistral Large 3 是一款先进的通用型多模态细粒度混合专家(Mixture-of-Experts)模型,具备41B 激活参数与675B 总参数,并基于 3000 张 H200 从头训练
本模型是 FP8 指令后训练版本,针对指令任务进行了微调,非常适合聊天、智能体以及指令驱动的使用场景。
它面向可靠性与长上下文理解而设计,专为生产级助手、检索增强系统、科学计算任务以及复杂企业工作流打造。
Mistral Large 3 支持以下本地部署格式:
如有需要,我们还提供 BF16 版本。
Mistral Large 3 由两个主要架构组件构成:
Mistral Large 3 Instruct 模型提供以下能力:
我们建议以客户端-服务器方式部署 Large 3,并遵循以下最佳实践:
该模型可配合以下框架使用:
我们建议搭配 vLLM 使用该模型。
请确保安装 vllm >= 1.12.0:
pip install vllm --upgrade执行上述操作后,应会自动安装 mistral_common >= 1.8.6。
检查方法:
python -c "import mistral_common; print(mistral_common.__version__)"你也可以使用即开即用的 Docker 镜像 或 Docker Hub 上的镜像。
我们建议在服务端/客户端模式下使用 Mistral Large 3。
vllm serve mistralai/Mistral-Large-3-675B-Instruct-2512 \
--tensor-parallel-size 8 \
--load-format mistral \
--tokenizer-mode mistral \
--config-format mistral \
--enable-auto-tool-choice \
--tool-call-parser mistral \
--limit-mm-per-prompt '{"image": 10}' \
--speculative_config '{
"model": "mistralai/Mistral-Large-3-675B-Instruct-2512-Eagle",
"num_speculative_tokens": 3,
"method": "eagle",
"max_model_len": "16384"
}'注意: 在 GPU 上运行 mistralai/Mistral-Large-3-675B-Instruct-2512 需要 B200 或 H200 节点。
from datetime import datetime, timedelta
from openai import OpenAI
from huggingface_hub import hf_hub_download
# Modify OpenAI's API key and API base to use vLLM's API server.
openai_api_key = "EMPTY"
openai_api_base = "http://localhost:8000/v1"
TEMP = 0.15
MAX_TOK = 262144
client = OpenAI(
api_key=openai_api_key,
base_url=openai_api_base,
)
models = client.models.list()
model = models.data[0].id
def load_system_prompt(repo_id: str, filename: str) -> str:
file_path = hf_hub_download(repo_id=repo_id, filename=filename)
with open(file_path, "r") as file:
system_prompt = file.read()
today = datetime.today().strftime("%Y-%m-%d")
yesterday = (datetime.today() - timedelta(days=1)).strftime("%Y-%m-%d")
model_name = repo_id.split("/")[-1]
return system_prompt.format(name=model_name, today=today, yesterday=yesterday)
SYSTEM_PROMPT = load_system_prompt(model, "SYSTEM_PROMPT.txt")
image_url = "https://static.wikia.nocookie.net/essentialsdocs/images/7/70/Battle.png/revision/latest?cb=20220523172438"
messages = [
{"role": "system", "content": SYSTEM_PROMPT},
{
"role": "user",
"content": [
{
"type": "text",
"text": "What action do you think I should take in this situation? List all the possible actions and explain why you think they are good or bad.",
},
{"type": "image_url", "image_url": {"url": image_url}},
],
},
]
response = client.chat.completions.create(
model=model,
messages=messages,
temperature=TEMP,
max_tokens=MAX_TOK,
)
print(response.choices[0].message.content)本模型依据 Apache 2.0 License 授权。
您不得以任何方式使用本模型,从而侵犯、不当利用或以其他方式违反任何第三方权利,包括知识产权。