---
title: "OCR 文字识别"
description: "让 Agent 从扫描 PDF、照片、截图和收据中读取文字，无需 GPU 或外部 OCR 服务。"
url: "https://ankole.agentbull.com/zh-Hans-CN/docs/ocr/"
lang: "zh-Hans-CN"
---

> 面向 AI Agent 的文档索引：https://ankole.agentbull.com/zh-Hans-CN/llms.txt

# OCR 文字识别

把文件发给 Agent，再说清楚需要哪些文字即可。Ankole 已在 Agent Computer Worker 中内置 OCR，无需配置模型提供商、API Key 或独立 OCR 服务。

例如，你可以直接说：

```text
读取这张截图中的全部文字，保持原来的阅读顺序。

提取这份扫描 PDF 的第 2 到第 5 页，无法确定的文字请明确标出。

读取这张收据，列出商家、日期、商品、税费和总金额。
```

## 普通 CPU 也能运行的先进识别能力

Ankole 使用当前 SOTA 级、支持 CPU 的 [PaddleOCR PP-OCRv6 medium](https://www.paddleocr.ai/latest/version3.x/algorithm/PP-OCRv6/PP-OCRv6.html) 检测与识别模型。Medium 是 PP-OCRv6 模型族中更注重精度的一档。根据 PaddleOCR 的评测，它相较 PP-OCRv5_server 将文字检测精度提高 4.6%，将文字识别精度提高 5.1%。

一个模型即可覆盖 50 种语言，包括简体中文、繁体中文、英文、日文和 46 种拉丁语系语言。它不只适合文档扫描件，也能处理截图、招牌、商品标签和数码显示屏等真实场景中的文字。

Ankole 通过 OpenVINO 优化 CPU 推理路径，让普通 Worker 不依赖 GPU 也能快速完成本地识别。模型已经随 Worker 镜像提供，文档不会为了 OCR 被发送给外部识别服务，也没有按页调用费用。

## Ankole 会选择更准确的读取方式

OCR 是从像素中估算文字，普通提取则直接读取原始字符。只要文件中存在可读取的原文，Ankole 会优先选择更准确的方式：

- PDF 有文字层时，Agent 直接提取原文。
- PDF 全部是扫描页时，Agent 识别每一页。
- PDF 同时包含文字页和扫描页时，只对需要的页面使用 OCR，其余页面直接提取。
- DOCX、PPTX 和 XLSX 文件会按文档结构读取，而不是把每一页当成图片。

你不需要自己判断该走哪条路径。尽量发送原始文件，并说明希望得到的结果即可。

## Agent 可以返回什么

Agent 可以返回原始文字、整理后的转写、摘要，或从识别结果中提取的结构化信息。OCR 还会提供每行文字的位置和置信度，Agent 因此可以保持阅读顺序，并在扫描质量不足时提醒你结果不够可靠。

为了获得更好的结果，请尽量使用清晰、摆正且分辨率足够的图片。文字很小时，发送原始文件，不要只发压缩后的截图。你也可以要求 Agent 明确标出不确定的行，避免它默默猜测。

## 能力边界

- 当前 50 种语言模型不覆盖韩文、阿拉伯文、西里尔字母、泰文等其他文字系统。
- 手写文字、公式、复杂表格、弯曲文字，以及模糊或明显倾斜的照片可能降低准确率。表格会返回带位置的文字行，但不保证还原为表格结构。
- OCR 可以读取内容，但不会给原 PDF 写入可搜索的文字层。

`ocr` Skill 默认启用。如果 Agent 提示 OCR 不可用，请确认它使用的是当前 Worker 镜像，并在 **Agent 能力库**中检查该 Skill 是否已启用。
