J
gcw_9PElOpHK/chandra-ocr-2-NPU
模型介绍
文件和版本
Pull Requests
讨论
分析

Chandra OCR 2 昇腾 NPU 适配 (Ascend NPU)

datalab-to/chandra-ocr-2 是基于 Qwen3.5 混合架构 (Mamba linear-attention + full-attention + MTP) 的多模态 OCR 模型 (~5.3B, bf16)。 本仓库提供 昇腾 NPU (Ascend910) 上的完整推理适配:vllm-ascend 离线推理脚本、 镜像权重下载、验证结果与部署文档。

  • 推理引擎: vllm-ascend (vllm 0.18.0 + torch_npu 2.9.0.post1)
  • 输入: 文档/票据/手写表单图片 → 输出: HTML (含布局块)
  • 硬件: Ascend910 (9362) × 2, HBM 64GB, CANN 8.5.1

快速开始

# 1. 下载权重 (hf-mirror.com 镜像, ~10.6GB, 建议 /tmp 等大分区)
python3 download_model.py --out /tmp/chandra-ocr-2-work/model

# 2. NPU 推理 (默认使用仓库内置 handwritten_form.png 示例图)
CHANDRA_MODEL_DIR=/tmp/chandra-ocr-2-work/model \
CHANDRA_DEMO_IMAGE=/tmp/chandra-ocr-2-work/model/handwritten_form.png \
python3 inference.py --demo

# 3. 指定图片 / 布局块提示词
python3 inference.py --image /path/to/page.png --prompt-type ocr_layout

详细步骤见 readme.md,精度验证见 VALIDATION.md。