老实说:我以前认为 PDF 编辑器除了合并页面或添加数字签名外,干不了什么大事。但那是在我处理祖父的旧手稿之前——那是一份 1970 年代手写的家族史,经过多次复印,文本看起来就像有人把咖啡泼在了一个影子上。
你可能见过这样的 PDF。字迹褪色、光照不均、随意的污渍,OCR 工具把它们当成真正的字母。我试过的每个标准 PDF 阅读器要么输出乱码,要么直接说“无法读取文本”。我差点放弃,打算重新打字输入整份文档。
为什么普通 PDF 阅读器搞不定
大多数 PDF 工具是为干净的数字化文档设计的。扔一份扫描的旧手稿过去,它们就慌了。就连 Adobe 的导出功能也会把“1923”变成“1q23”,并在纸张折痕处插入随机符号。
我需要的是能处理现实损坏的工具:卷角、边角的 handwritten 注释、像标点符号的水渍。就在这时,Docly 让我惊讶了。
Docly 的解决方法:把它当作一张凌乱的照片,而不是 PDF
Docly 没有直接对文档进行 OCR,而是让你先扫描或导入文件,然后在提取文本前应用自己的增强功能。我上传了一张特别糟糕的页面——发黄,中间有一道贯穿段落的撕裂。AI 摘要按钮甚至没有犹豫,就给我了一份干净的提取结果,保留了所有主要的人名和日期。
但真正的考验是一页我祖父划掉句子并在上面写修改的页面。大多数工具会把删除线和新增文本混在一起。Docly 提取的文本将它们分开,我可以直接在内置编辑器中手动修改。这为我节省了几个小时的交叉核对时间。
实际工作原理(给好奇的人)
你不需要学习任何设置。在 Docly 中打开文件,使用“编辑”选项卡,AI 会自动检测文档结构。如果有什么看起来不对,你可以手动调整识别区域——就像告诉工具“聚焦这个矩形,忽略那个污渍”。它并不完美(我仍然需要修复几个墨迹太淡的日期),但第一次尝试就捕捉到了大约 85% 的文本,这比我从其他工具得到的 40% 要好得多。
谁应该使用 Docly 处理旧手稿?
这不是一个通用的解决方案。如果你的文档是整洁的打印 PDF,你可能不需要 AI 层——任何基本的 OCR 都能胜任。但如果你处理的是:
- 带有背景噪音(污渍、阴影)的手写扫描件
- 多次复印、失去对比度的页面
- 带有批注、删除线或边注的文档
- 字体大小不规则的旧报纸或信件
……那么 Docly 值得下载。代价是:每页 AI 处理需要几秒钟,所以如果你有 300 页的手稿,最好先从最糟糕的页面开始。对于小批量(少于 20 页),它确实很快。
给真正阅读古老文件的人最后总结
我没想到一个 AI PDF 工具能让我感动,但看到祖父的文字干净地呈现出来——没有多余的符号,没有丢失的段落——感觉像一个小奇迹。Docly 并没有声称能恢复每一滴墨水,但它做了更实际的事情:当其他工具都无能为力时,它能让你的文本变得可读、可编辑。
如果你有积灰(或数字积灰)的旧手稿,拿一页糟糕的页面试试 Docly。你可能会惊讶于有多少历史能被拯救。
评论
发表评论