不是提取文字,是原样复刻。
多数 OCR 只丢给你一堆文字和一份错乱的版面。FullOCR 在 Word 里把整份文档重新搭起来——第一页仍是第一页,公式点开就能改,插图重绘成矢量对象,每一条下划线、每一个方框都留在原来的位置。
市面上只有两个糟糕的选择
一端是给机器读的文字提取,吐出 Markdown 或 JSON,压根算不上文档;另一端是排版外包,每页几美元,还要来回三轮校样。中间没有人真正把文档本身重建出来。
廉价 OCR 交给你的
- 一整片文字,版面荡然无存
- 表格被压平或彻底错位
- 公式变成乱码,或退化成图片
- 从右向左的文字被整段颠倒
- 无从核对它到底错在哪里
FullOCR 交给你的
- 与原件逐页对应的 Word 文件
- 保留原有合并单元格的真实表格
- Word 原生公式,随时可以编辑
- 波斯语、阿拉伯语排版正确,数字沿用原样
- 一份还原度评分和差异图,摆事实
为复刻而生,不为概括
十个专职智能体逐页把关,任何一环不签字,文件就不出厂。
逐页对应原件
一本 150 页的书,交付的就是 150 页的 Word 文件。分页落在原来的位置,按页码引用照样成立。
编译通过的公式
每个公式先写成 LaTeX 并编译验证,确认无误后再转成 Word 原生公式,交到你手上就能改。
插图重绘为矢量
图表与几何图形变成可编辑的 Word 图形,坐标轴、箭头、虚线、标记一样不少,而不是一张平面截图。
右向左文字,处理到位
波斯语与阿拉伯语保留各自的字形、数字、变音符与标点,括号和小数点绝不反向。
回印测试
我们把自己的输出重新渲染成图像,与你的扫描件逐点比对,并公开还原度评分和标出每一处差异的图。
不增一处,不删一处
不自作主张加标题,不擅自重排,不悄悄改错。原页上有一个灰底数字框,交付件里就有一个灰底数字框。
人们真正拿 OCR 来做的事,都在这里
我们把英语和波斯语的资料都翻了一遍,弄清这个世界究竟为什么需要 OCR,然后专门为那些「页面本身也是内容」的场景做了这款产品。下面是一张老实的地图——包括那些我们最终交给你的不是 Word 的场景。
扫描 PDF 转可编辑 Word
最日常的一种。别人发来一份扫描件或锁死的 PDF,而你现在得改它、填它、翻译它,或者把其中一半拿去复用。你要的不是文字——你要的是同一份文档,只不过能编辑。
Word复制出来就是乱码的波斯语 PDF
波斯语转换需求里有很大一部分根本不是扫描件,而是老一代排版工具生成的电子 PDF——文字一复制出来就断成一个个毫无意义的字母。有人为了拿回能读的文字,宁可把一页清清楚楚的书页重新拍成照片。
Word · 纯文本试卷与题库
把积攒多年的历年真题变成可编辑、可重排的题目:公式、几何图形、选项排布、答案与评分标准一并保留,随时能重新组卷,也能按知识点打标签。
Word · LaTeX · JSON手写与印刷的理工科讲义
理工科讲义是最贵的重打对象:打字员每一条公式、每一张表格都要另外收费。人工成本几乎全堆在这里。
Word · LaTeX把 PDF 和照片里的表格搬进 Excel
财务报表、成绩单、价目表、化验结果、普查表——表格就是全部重点,而通用 OCR 恰恰就把它压成一片。
Excel · CSV公证翻译与移民材料
官方译件必须与原页一一对应:一样的印章、一样的成绩表、一样的签署栏。眼下译员得先手工把版面重搭一遍,才能动笔翻译。
Word伊斯兰典籍与波斯古典文献
在这些领域,页码不是装饰,而是成立与否的前提:引用一律标注卷次与页码。一份丢了分页的文本,对需要引用它的研究者来说等于没有。
Word · 纯文本 · TEI写本与历史文献
手写材料的转录成本是印刷品的十到二十倍,而针对波斯语、阿拉伯语写本字迹,市面上根本没有一款像样的商业工具。这是整个市场上最大的一处空白。
纯文本 · TEI · 图像你走四步,我们跑十个智能体
上传文件或粘贴链接
PDF、照片或扫描仪输出都行,手机电脑均可。Drive、OneDrive、Dropbox 的云端链接由我们代取。
两遍独立识读
每一页由两条独立通道分别转录,再逐字比对,凡有分歧一律回到原图裁定。
重建并校验
公式逐条编译,插图重绘后复核,版面逐页拟合,最后全文清查违规字符。
三种格式一并下载
Word 用来编辑,HTML 用来上线,纯文本用来跑流水线。全部留在历史记录里,随时回来再取。
拖动分隔条,其中一侧就是我们的输出
这是某全国奥林匹克竞赛小册子里的真实一页,从头到尾由 FullOCR 转换。左边是我们生成的 Word 文件,右边是原始扫描件。旁边的差异图用颜色标出两者不一致的每一个像素。

一次上传,交出这件活真正需要的每一种格式。
大家嘴里的 OCR,其实是八件不同的活,有八种不同的结局。法院要可检索 PDF,会计要电子表格,AI 团队要带坐标的 Markdown,视障读者要可重排文本。结局由你挑,喂给它们的是同一份经过校验的识读结果。
Word(.docx)
复刻件本体。逐页对应,真标题、真表格、可编辑的原生公式、矢量插图,页眉与页码与印刷版分毫不差。
可检索 PDF
你的原始扫描件原封不动,底下叠一层准确的隐藏文字。把它列为电子递交硬性要求的法院越来越多,它也是档案机构的标准交付物。
Excel(.xlsx)与 CSV
表格以真表格的形式取出——合并单元格、跨页续表、原样数字全都保留。适合财务报表、成绩单、价目表与结果表。
Markdown 与 JSON
为 AI 而备:结构干净,每个内容块都带页面锚点与边界框,检索系统能说清答案究竟出自哪一页。
HTML
结构一致的语义标记,可直接发布。数学以 MathML 输出,因此它仍然是真正的数学。
LaTeX
为论文与学位论文准备:公式输出为 LaTeX 源码,表格输出为 tabular,插图单独成文件并附上图注。
EPUB3 与 DAISY
可重排、对屏幕阅读器友好,语言标记规范,波斯语间距按发音处理。这与逐页还原正好相反——而有些读者要的恰恰就是这个。
纯文本
刻意舍弃版面,但保留并标注页边界。适合检索索引、语料库与语言处理流水线。
手机上开个头,电脑上收个尾
历史记录跟着你走。文件如果存在另一台设备上,FullOCR 会直接告诉你是哪台设备、放在哪里,不用再满世界翻找自己下载过的东西。
一份历史,所有设备通用
每次转换都记录日期、源文件、页数、输出格式和还原度评分。
下载记录带设备信息
在手机上打开过往任务,会一句话讲清楚:这份 Word 文件存在你的笔记本电脑上,在这个文件夹里,叫这个名字。
随时重新下载
输出文件一直留在你的账户里,不会悄无声息地过期。
按页付费,不按人头
我们自己的模型成本是每页 $0.082,下面每一档价格都从这个数字算起,而不是照着同行的广告定。我们没有省去校验的更便宜档位——一份你不敢信的文档,根本不值得转换。
每个账户每月都有 5 页免费额度——不用绑卡,不打水印,三种格式全都能下载。
按页付费
转多少页就付多少钱。没有订阅,也不按人头收费。
起订金额 $6
- Word、HTML 与纯文本三种输出
- 双通道独立识读并裁定分歧
- 公式经编译验证,交付即可编辑
- 插图重绘为矢量图形
- 回印测试还原度报告
- 标准队列,12 小时内交付
Studio
适合每周都有转换需求的研究者、出版机构与翻译公司。
含 250 页,超出部分每页 $0.21
- 包含“按页付费”的全部功能
- 每月 250 页额度
- 任务优先排队
- 整本书批量上传
- 每个任务出具一致性证明
- 开放 API 与 Word 加载项
认证级
当这份文档必须经得起别人审查的时候。
- 包含 Studio 的全部功能
- 每一处存疑区域都由人工裁定
- 全文每个字符都可追溯到原图像素
- 带签名的一致性证明
- 有保险背书的准确率保证
- 面向法院、档案馆与出版机构
另外两种购买方式
加急
交互式队列——几分钟出结果,不用等几小时。可叠加在任意按页价格之上。
FullOCR 桌面版
在你自己的 Mac 或 PC 上运行,全程不联网。它会生成一份可编辑的 Word 初稿,附上还原度评分和一张值得复核的区域分布图,只把这些页面升级到云端的完整协议。每个大版本一次付费,含 100 页云端升级额度。
物理隔离节点
把云端完整协议整套装进你自己的网络,面向文档一步都不能出楼的机构。按节点年度授权,含上手培训与协议调优。
价格以美元计。每月 5 页的免费额度无需绑定银行卡。每月用量超过 5,000 页可单独报价。
文档始终是你的
什么时候删,你说了算
可以设置转换完成后立即删除,也可以留在历史记录里。无论哪一种,都不会有第三个人看到。
绝不用你的文件做训练
你上传的内容永远不会被用于训练任何模型。
支持离线部署
对于文档一步都不能外传的档案馆和机构,整套流程可以完整装进你自己的网络里。