又折腾了大半天,总算修复了所有问题,简单记录一下:
1. 使用 Gemini 2.5 Pro
2. 提取 PDF 文件里的文本数据,首先直接把 PDF 转换成文本提取;
3. PDF 内嵌的图片上的文本提取失败,使用 tesseract 提取,可以部分提取成功;
4. 失败的数据尝试用 easyOCR 提取,解决问题,但是速度很慢;
5. 所以告诉模型,依次使用 2,3,4 来提取,兼顾准确性和效率
一开始只给了输入输出样本,模型只想到了上面的第二步。直到我看到了 log 之后,才发现识别不出的问题,所以才加上 OCR。
使用 tesseract 只解决了部分问题,直到看到更详细的 log,才知道 tesseract 识别有局限。调了部分参数也没用,要求模型换一种 OCR,这才用了 easyOCR。
识别准确性上去了,但是性能不行,于是要求模型依次执行 2,3,4。
下次再写的话,应该一开始输出详细的 log 文件,方便我分析问题,也方便模型根据 log 来定位问题。
Post #494
373
DPS Build 用 OpenAI 和 gemini 写代码,确实提升了不少效率,但还是需要一些基础。 从一个 PDF 提取文本信息,用 Gemini 迭代了十多次仍旧无法提取信息,改了各种 prompt 都没用。 再仔细看那些 PDF 文件,发现其中一部分内容是从文本生成的,另一部分是从图片直接压成的。两部分组合成一个 PDF 文件。要不是之前和这类数据打过交道,我都没有 OCR 的概念,也不可能在 prompt 调用 OCR。 最后调用 Tesseract 成功提取了这些图片里的文本数据 🤷