Cherry Studio
文档

文档解析与 OCR

知识库只能检索已经解析出的文字。扫描 PDF、双栏论文、复杂表格和图片型页面,先把正文解析正确,再调整模型和召回参数。

先判断资料类型

资料类型推荐起点必查内容
Markdown、TXT、HTML默认读取标题层级、编码、换行
可复制文字的 PDF、DOCX、PPTX先用默认处理段落顺序、页眉页脚、表格
扫描 PDF、截图、图片型页面本地或系统 OCR识别语言、金额、日期、编号
多栏、公式或复杂表格 PDF专用文档处理器阅读顺序、表格结构、脚注

解析在检索链路中的位置

资料经过解析与 OCR、切分、关键词和向量检索后进入回答的知识库检索架构图

解析错误会继续传到分块和召回;下游模型无法恢复从正文中已经丢失的内容。

配置并验收一份样本文档

1. 选择代表性样本

不要先导入整批资料。选一份最能暴露问题的文档,例如带表格的扫描 PDF 或双栏说明书。

2. 配置处理能力

打开【设置】→【文档处理】,按需要配置文档解析服务和 OCR。云端服务通常需要 API Key 或服务地址;本地能力可能需要先下载模型。

文档处理设置中的文件解析与 OCR 服务配置

先把要使用的服务配置到可用状态,再回到知识库选择处理器。

3. 导入并等待就绪

把样本文档添加到知识库。处理完成后打开正文,检查标题、段落、页码、表格和 OCR 文字。

4. 检查 Chunks

确认关键条件与结论没有被拆散;页眉、页脚和目录不要大量重复占用片段。

知识库高级设置中的智能分段、分隔符、分段大小和重叠大小

正文正确后再检查分块;解析错误不能靠增大 Chunk 修复。

5. 用真实问题复测

在【召回测试】中输入一个答案位于该文档中的问题。结果应包含正确来源、完整条件和关键数字。

6. 固定方案再批量导入

样本合格后,再把同类型资料分批导入。处理器、OCR 或分块设置改变后,对旧资料执行【重新索引】并重复测试。

处理器与 OCR 怎么选

选择适用情况优点注意事项
默认读取文本型常见格式配置少、速度快复杂排版和扫描页可能丢失内容
System OCR系统支持且图片清晰无需额外 API Key、速度快准确率取决于操作系统、语言和图像质量
本地 PaddleOCR需要离线识别文档不离开本机首次使用前需要下载本地模型
云端或自托管处理器双栏、复杂表格、公式较多版面分析能力通常更强云端方案会接收用于处理的文档内容

典型问题怎么定位

表现先检查处理方向
正文为空或很短文件是否为扫描件启用 OCR 或更换处理器
双栏文字交错正文阅读顺序使用擅长版面分析的处理器
表格变成零散文字表头、行列关系更换处理器,或把关键规则整理成 Markdown 笔记
页眉页脚反复出现Chunks 中的重复噪声清理源文件或换解析器,不要只提高 Top K
OCR 数字出错金额、日期、编号提高图像清晰度并人工核对高风险字段

配置说明

配置项推荐起点何时调整调整后动作
文件处理器先用默认处理正文错序、表格丢失、扫描页为空重新索引样本文档
OCR清晰扫描件优先本地或系统能力图片型页面没有文字或错字较多重新索引并核对关键字段
Chunk 大小与重叠先保留知识库默认设置条件与结论被切开每轮只改一项并重新索引
验收问题3~5 个真实问题更换处理器、OCR 或分块后使用同一问题集比较

用户案例

小林导入一份双栏差旅制度 PDF。状态已经就绪,但正文把左右两栏交错在一起,召回结果中的审批条件也不完整。他没有先调高 Top K,而是换用更适合版面分析的处理器,重新索引同一文件,再检查正文和 Chunks。

完成标准是:审批条件按原文顺序可读,金额和日期正确,固定问题能召回包含完整条件的片段。

常见问题

正文正确,还需要看 Chunks 吗?

需要。正文正确只说明解析合格;条件和结论仍可能在切分时被分开。

增加 Top K 能修复解析问题吗?

不能。Top K 只控制返回多少片段,不会恢复正文中已经丢失或错序的内容。

为什么更换处理器后结果没有变化?

旧资料仍在使用原来的索引。对相关条目执行【重新索引】,再用相同问题复测。

继续阅读

添加与整理资料
选择来源并检查处理状态。
检查资料与召回
用固定问题验收解析与分块。
数据、隐私与维护
确认本地与云端的数据边界。

本页内容