扫描 PDF 转可编辑 Word
最日常的一种。别人发来一份扫描件或锁死的 PDF,而你现在得改它、填它、翻译它,或者把其中一半拿去复用。你要的不是文字——你要的是同一份文档,只不过能编辑。
- 分栏、表格、缩进和图片都留在原来的位置
- 没有一打字就散架的浮动文本框
- 字体与间距原样保留,不做替换
- 手机拍的书页照片也能处理,不限于干净的扫描件
我们把英语和波斯语的资料都翻了一遍,弄清这个世界究竟为什么需要 OCR,然后专门为那些「页面本身也是内容」的场景做了这款产品。下面是一张老实的地图——包括那些我们最终交给你的不是 Word 的场景。
最日常的一种。别人发来一份扫描件或锁死的 PDF,而你现在得改它、填它、翻译它,或者把其中一半拿去复用。你要的不是文字——你要的是同一份文档,只不过能编辑。
波斯语转换需求里有很大一部分根本不是扫描件,而是老一代排版工具生成的电子 PDF——文字一复制出来就断成一个个毫无意义的字母。有人为了拿回能读的文字,宁可把一页清清楚楚的书页重新拍成照片。
把积攒多年的历年真题变成可编辑、可重排的题目:公式、几何图形、选项排布、答案与评分标准一并保留,随时能重新组卷,也能按知识点打标签。
理工科讲义是最贵的重打对象:打字员每一条公式、每一张表格都要另外收费。人工成本几乎全堆在这里。
财务报表、成绩单、价目表、化验结果、普查表——表格就是全部重点,而通用 OCR 恰恰就把它压成一片。
官方译件必须与原页一一对应:一样的印章、一样的成绩表、一样的签署栏。眼下译员得先手工把版面重搭一遍,才能动笔翻译。
在这些领域,页码不是装饰,而是成立与否的前提:引用一律标注卷次与页码。一份丢了分页的文本,对需要引用它的研究者来说等于没有。
手写材料的转录成本是印刷品的十到二十倍,而针对波斯语、阿拉伯语写本字迹,市面上根本没有一款像样的商业工具。这是整个市场上最大的一处空白。
把同一文本的两份扫描件交给我们,差异会以校勘记的形式回来。现有对校工具都是为拉丁字母设计的,处理阿拉伯字母的切分一塌糊涂。
一本绝版书只剩下纸质本或一份平面扫描件。要再版,就得把页面设计以可编辑的形式拿回来——而这恰恰是排版外包商每页收好几美元在做的事。
这是唯一一件逐页还原反而是错误答案的活。视障读者需要的是干净、可重排、语言标记正确的文本——而在波斯语里,一个半空格放错位置,屏幕阅读器就会把这个词念错。
检索系统已经成为版面忠实识读的最大新买家:一个说不清答案出自哪一页的问答机器人,在受监管的场景里根本没法用。
越来越多法院要求电子递交的文件带有真正可检索的文字层;证据开示阶段漏掉一个词,就等于漏掉一份文件。另外,把对方发来的扫描版合同转成 Word 好逐条批注,本身就是每天都要干的活。
满屋子纸质材料的机构,要的是能检索、能调阅、能留痕,而不是把它们变成别的东西。
双栏版式、脚注、页眉和跨页结果表,正是普通文字提取悄悄崩掉的地方——也正是研究者至今还在手工抄数字的地方。
密集的多栏版面,一篇报道绕着另外三篇转。只有做到按篇分区,档案才算能检索,而不只是被扫了一遍。
文印公司不只是竞争对手——他们也是渠道。客户和交期他们都有,缺的是一样不用人盯着就能搞定表格和公式的东西。
机构里天天有人要把去年的招标文件、表格或作业规程改回可编辑状态——方框、分隔线和编号还得和原来一模一样。
户籍登记、捐赠地契、旧书信、家藏文书——大多是手写的,往往还是孤本,也正是有人终于把阁楼那箱东西扫描一遍的理由。
三百页的书上传一次,逐页处理,哪些页已经完成、哪些页需要再看一眼,实时一目了然。