OCR 文字识别
面向 AI Agent:本页的 Markdown 版本位于 https://ankole.agentbull.com/zh-Hans-CN/docs/ocr/index.md,文档索引位于 https://ankole.agentbull.com/zh-Hans-CN/llms.txt。
把文件发给 Agent,再说清楚需要哪些文字即可。Ankole 已在 Agent Computer Worker 中内置 OCR,无需配置模型提供商、API Key 或独立 OCR 服务。
例如,你可以直接说:
读取这张截图中的全部文字,保持原来的阅读顺序。
提取这份扫描 PDF 的第 2 到第 5 页,无法确定的文字请明确标出。
读取这张收据,列出商家、日期、商品、税费和总金额。
普通 CPU 也能运行的先进识别能力
Ankole 使用当前 SOTA 级、支持 CPU 的 PaddleOCR PP-OCRv6 medium 检测与识别模型。Medium 是 PP-OCRv6 模型族中更注重精度的一档。根据 PaddleOCR 的评测,它相较 PP-OCRv5_server 将文字检测精度提高 4.6%,将文字识别精度提高 5.1%。
一个模型即可覆盖 50 种语言,包括简体中文、繁体中文、英文、日文和 46 种拉丁语系语言。它不只适合文档扫描件,也能处理截图、招牌、商品标签和数码显示屏等真实场景中的文字。
Ankole 通过 OpenVINO 优化 CPU 推理路径,让普通 Worker 不依赖 GPU 也能快速完成本地识别。模型已经随 Worker 镜像提供,文档不会为了 OCR 被发送给外部识别服务,也没有按页调用费用。
Ankole 会选择更准确的读取方式
OCR 是从像素中估算文字,普通提取则直接读取原始字符。只要文件中存在可读取的原文,Ankole 会优先选择更准确的方式:
- PDF 有文字层时,Agent 直接提取原文。
- PDF 全部是扫描页时,Agent 识别每一页。
- PDF 同时包含文字页和扫描页时,只对需要的页面使用 OCR,其余页面直接提取。
- DOCX、PPTX 和 XLSX 文件会按文档结构读取,而不是把每一页当成图片。
你不需要自己判断该走哪条路径。尽量发送原始文件,并说明希望得到的结果即可。
Agent 可以返回什么
Agent 可以返回原始文字、整理后的转写、摘要,或从识别结果中提取的结构化信息。OCR 还会提供每行文字的位置和置信度,Agent 因此可以保持阅读顺序,并在扫描质量不足时提醒你结果不够可靠。
为了获得更好的结果,请尽量使用清晰、摆正且分辨率足够的图片。文字很小时,发送原始文件,不要只发压缩后的截图。你也可以要求 Agent 明确标出不确定的行,避免它默默猜测。
能力边界
- 当前 50 种语言模型不覆盖韩文、阿拉伯文、西里尔字母、泰文等其他文字系统。
- 手写文字、公式、复杂表格、弯曲文字,以及模糊或明显倾斜的照片可能降低准确率。表格会返回带位置的文字行,但不保证还原为表格结构。
- OCR 可以读取内容,但不会给原 PDF 写入可搜索的文字层。
ocr Skill 默认启用。如果 Agent 提示 OCR 不可用,请确认它使用的是当前 Worker 镜像,并在 Agent 能力库中检查该 Skill 是否已启用。