模型的完整 BF16 版本。我们推荐此变体用于推理和进一步微调。
LightOnOCR-1B 是一款紧凑的端到端视觉-语言模型,适用于光学字符识别(OCR)和文档理解。它在其权重级别内实现了最先进的准确率,同时比更大的通用视觉语言模型快数倍且成本更低。
亮点
LightOnOCR 将视觉Transformer编码器(基于Pixtral)与轻量级文本解码器(基于Qwen3,从高质量开源视觉语言模型蒸馏而来)相结合。 它针对文档解析任务进行了优化,能够从高分辨率页面中提取准确的、具有布局感知的文本。
| 模型 | ArXiv | 旧扫描件 | 数学 | 表格 | 多列 | 小文本 | 基础 | 总体 |
|---|---|---|---|---|---|---|---|---|
| LightOnOCR-1B-1025 (151k 词汇) | 81.4 | 71.6 | 76.4 | 35.2 | 80.0 | 88.7 | 99.5 | 76.1 |
| LightOnOCR-1B-32k (32k 词汇) | 80.6 | 66.2 | 73.5 | 33.5 | 71.2 | 87.6 | 99.5 | 73.1 |
| LightOnOCR-1B-16k (16k 词汇) | 82.3 | 72.9 | 75.3 | 33.5 | 78.6 | 85.1 | 99.8 | 75.4 |
所有基准测试均使用 Olmo-Bench 上的 vLLM 进行评估。
uv venv --python 3.12 --seed
source .venv/bin/activate
export VLLM_COMMIT=e88bdd60d9a25d985168c9f4a60ab10095236d7c
uv pip install vllm \
'triton-kernels @ git+https://github.com/triton-lang/triton.git@v3.5.0#subdirectory=python/triton_kernels' \
--torch-backend=auto \
--extra-index-url https://wheels.vllm.ai/${VLLM_COMMIT} \
--prerelease=allow
uv pip install pypdfium2 pillow requestsvllm serve lightonai/LightOnOCR-1B-1025 \
--limit-mm-per-prompt '{"image": 1}' \
--async-schedulingimport base64
import requests
import pypdfium2 as pdfium
import io
ENDPOINT = "http://localhost:8000/v1/chat/completions"
MODEL = "lightonai/LightOnOCR-1B-1025"
# Download PDF from arXiv
pdf_url = "https://arxiv.org/pdf/2412.13663"
pdf_data = requests.get(pdf_url).content
# Open PDF and convert first page to image
pdf = pdfium.PdfDocument(pdf_data)
page = pdf[0]
# Render at 200 DPI (scale factor = 200/72 ≈ 2.77)
pil_image = page.render(scale=2.77).to_pil()
# Convert to base64
buffer = io.BytesIO()
pil_image.save(buffer, format="PNG")
image_base64 = base64.b64encode(buffer.getvalue()).decode('utf-8')
# Make request
payload = {
"model": MODEL,
"messages": [{
"role": "user",
"content": [{
"type": "image_url",
"image_url": {"url": f"data:image/png;base64,{image_base64}"}
}]
}],
"max_tokens": 4096,
"temperature": 0.2,
"top_p": 0.9,
}
response = requests.post(ENDPOINT, json=payload)
text = response.json()['choices'][0]['message']['content']
print(text)| 变体 | 描述 |
|---|---|
| LightOnOCR-1B-1025 | 完整多语言模型(默认) |
| LightOnOCR-1B-32k | 最快的剪枝词汇版本(32k tokens),针对欧洲语言优化 |
| LightOnOCR-1B-16k | 最紧凑的变体,具有最小的词汇量 |
训练和推理的Transformers集成即将推出。
LightOnOCR完全可微分,支持:
📓 微调笔记本
训练数据基于多样化的大规模PDF语料库,涵盖:
该数据集将以开放许可协议发布。
Apache License 2.0
@misc{lightonocr2025,
title = {LightOnOCR-1B: End-to-End and Efficient Domain-Specific Vision-Language Models for OCR},
author = {Said Taghadouini and Baptiste Aubertin and Adrien Cavaillès},
year = {2025},
howpublished = {\url{https://huggingface.co/blog/lightonai/lightonocr}}
}