公司动态
不止漫画:manga-ocr-base-npu能做通用日语印刷体OCR吗?完整实测与局限
不止漫画manga-ocr-base-npu能做通用日语印刷体OCR吗完整实测与局限【免费下载链接】manga-ocr-base-npu用户可直接在昇腾910系列NPU上运行日语漫画OCR推理识别图片中横竖排、含振假名的多行文本也可作为通用日语印刷体OCR使用。项目基于manga-ocr-base模型提供完整NPU推理适配全程无CPU回退精度与CPU对齐性能稳定并支持命令行推理与JSON结果输出。项目地址: https://ai.gitcode.com/atlasleong/manga-ocr-base-npumanga-ocr-base-npu是面向昇腾 910 系列 NPU 的日语 OCR 推理项目基于 manga-ocr-base 模型在 NPU 上直接运行漫画 OCR 推理识别图片中横竖排、含振假名的多行文本也可作为通用日语印刷体 OCR 使用。本文基于真实证据给出完整实测结果精度、性能、输出标记并如实说明使用局限。项目速览manga-ocr-base-npu 是什么它把 manga-ocr-base一个面向日语漫画场景的图像到文本 OCR 模型完整适配到了昇腾 NPU 上核心架构为 Transformers 的VisionEncoderDecoderModelseq2seq组件说明编码器ViT 风格DeiT-base12 层输入 224×224 RGB 图像解码器2 层 BERT 日语字符自回归解码器词表 6144分词器BertJapaneseTokenizerMeCab unidic-lite 字符子词推理策略beam searchnum_beams4max_length300它的两大卖点全程无 CPU 回退CPU_FALLBACKfalse且NPU 精度与 CPU 对齐。模型参数见 model/config.json权重与词表见model/pytorch_model.bin、model/vocab.txt。下面这张图是 NPU 适配工作流的完整执行记录从环境校验、依赖审计到精度/性能回归的每一步都可追溯快速上手指南如何在昇腾 NPU 上三步跑通日语 OCR 推理第一步确认 NPU 环境就绪⚡source /usr/local/Ascend/ascend-toolkit/set_env.sh npu-smi info第二步安装依赖torch / torch_npu 由昇腾 Worker 镜像提供无需单独安装git clone https://gitcode.com/atlasleong/manga-ocr-base-npu export PIP_INDEX_URLhttps://repo.huaweicloud.com/repository/pypi/simple/ pip install -r requirements.txt第三步运行推理python inference.py # 默认使用内置确定性测试图 python inference.py /path/to/manga_page.png # 对真实图片做日语 OCR环境要求一览项目要求硬件Ascend 910 系列至少 1 卡系统openEuler / Ubuntu / KylinOSCANN≥ 8.0推荐 8.2Python3.8 – 3.11推荐 3.11实测验证环境为 CANN 8.5.1 8 卡 Ascend 910B4-1单卡 HBM 64 GiBnpu-smi设备快照如下实测结果怎么判读6 个关键输出标记推理入口 inference.py 会打印设备标记、语义输出标记与 JSON 结果典型输出如下INPUT_DEVICEnpu:0 MODEL_DEVICEnpu:0 OUTPUT_DEVICEnpu:0 CPU_FALLBACKfalse INPUT_IMAGEdeterministic_synthetic_rgb_224x224_seed1234 GENERATED_TEXT. . . い や 、 い い じ ゃ な い 。 い い っ て 、 EXIT_CODE0标记含义怎么判读INPUT/MODEL/OUTPUT_DEVICE输入、模型、输出所在设备均为npu:0才说明全程跑在 NPU 上CPU_FALLBACKfalse无 CPU 回退这是真 NPU 推理的关键证据INPUT_IMAGE本次实际输入默认合成图或真实图片路径GENERATED_TEXT真实推理识别出的文本由generated_ids解码而来非写死JSON 结果结构化输出便于程序化集成EXIT_CODE进程退出码0表示成功图片不存在时返回2一次真实运行的验收结果截图如下输入、输出、设备标记、退出码齐全注默认合成图是程序生成的色块测试图所以GENERATED_TEXT内容没有实际语义它的作用是证明推理链路完整可用。实测数据精度对齐 CPU单次推理中位数 177ms精度对比NPU vs CPU固定 seed1234✅指标主对比12 样本回归阈值decoder_logits最大绝对误差0.02120.0306≤ 0.05decoder_logits平均绝对误差0.00210.0018≤ 0.01离散输出识别文本一致12/12 一致—≥ 0.95结论CPU 与 NPU 上的generated_ids完全一致判定acceptedtrue——NPU 推理没有引入识别结果层面的偏差。性能NPU 同步计时warmup2repeat5⚡指标实测值中位数177.26 ms均值178.14 ms标准差3.73 ms波动极小性能稳定p90182.21 ms最小 / 最大172.14 / 182.83 ms端到端含模型加载与生成约24.06 秒模型从本地目录加载local_files_onlyTrue推理阶段不访问网络适合离线部署。它能当通用日语印刷体 OCR 吗能但有前提。项目文档明确说明该模型针对漫画场景优化一张图里多行文本、横排/竖排、含振假名、叠加在图片上的文字、多种字体除漫画外也可作为通用日语印刷体 OCR 使用。它的定位是端到端的整图文本抽取——给一张图直接吐出一串识别文本而不是文档级 OCR没有文本行/词框定位不输出 bounding box没有版面分析栏位、阅读顺序能力输出是一整段文本序列不做逐行结构化。因此对漫画页和背景干净的日语印刷体文档、截图、海报它都能直接出文本但对需要精确定位每个文字区域的场景它不满足。使用局限5 点必须知道 ⚠️仅支持日语词表 6144 为日语字符子词中文、英文文档不适用输入固定 224×224所有图片会被缩放后送入模型高分辨率、文字密集的整页扫描件细节可能丢失输出长度受限max_length300、beam 固定为 4超长文本会被截断强依赖 NPU 硬件需要昇腾 910 系列且全程无 CPU 回退普通 PC 跑不起来单图推理无批量、无多页流程工程化集成需自行封装循环调用。结论它适合什么场景 适合在 NPU 上批量识别日语漫画页面、抽取日语印刷体文本文档/截图/海报要求离线、稳定、可复现——实测精度与 CPU 完全对齐、单次推理约 177ms 且波动极小。不适合中英混排文档、文字密集的超高分辨率扫描、需要文字框定位的场景以及没有 NPU 的机器。一句话总结manga-ocr-base-npu 是一个漫画为主、印刷体通用为辅的日语 OCR 工具NPU 适配扎实、实测数据诚实选型前认清上面 5 条局限即可放心使用。【免费下载链接】manga-ocr-base-npu用户可直接在昇腾910系列NPU上运行日语漫画OCR推理识别图片中横竖排、含振假名的多行文本也可作为通用日语印刷体OCR使用。项目基于manga-ocr-base模型提供完整NPU推理适配全程无CPU回退精度与CPU对齐性能稳定并支持命令行推理与JSON结果输出。项目地址: https://ai.gitcode.com/atlasleong/manga-ocr-base-npu创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考