टेक्स्ट एक्सट्रैक्शन नहीं। हूबहू रीप्रिंट।
ज़्यादातर OCR आपको टेक्स्ट का ढेर और टूटा-फूटा लेआउट थमा देते हैं। FullOCR आपके डॉक्युमेंट को Word में दोबारा खड़ा करता है — पहला पेज वही पहला पेज रहता है, इक्वेशन असली और एडिट होने लायक़ होती हैं, फिगर वेक्टर ऑब्जेक्ट की तरह दोबारा बनते हैं, और हर अंडरलाइन और बॉक्स ठीक वहीं रहता है जहाँ मूल में था।
बाज़ार दो ही रास्ते देता है, और दोनों ख़राब हैं
एक सिरे पर वे टूल हैं जो मशीनों के लिए टेक्स्ट खींचते हैं और Markdown या JSON लौटा देते हैं — डॉक्युमेंट बनता ही नहीं। दूसरे सिरे पर आपकी किताब टाइपसेटिंग वेंडर के पास जाती है: कई डॉलर प्रति पेज और तीन दौर के प्रूफ़। बीच में कोई नहीं जो डॉक्युमेंट को दोबारा वैसा ही खड़ा कर दे।
सस्ता OCR क्या लौटाता है
- टेक्स्ट की लंबी दीवार, लेआउट ग़ायब
- टेबल चपटी या पूरी तरह उलझी हुई
- इक्वेशन बेतुके अक्षरों या तस्वीरों में बदली हुई
- दाएँ-से-बाएँ लिखा टेक्स्ट उलटा हुआ
- क्या ग़लत हुआ, यह जाँचने का कोई तरीक़ा नहीं
FullOCR क्या लौटाता है
- एक Word फ़ाइल जो मूल से पेज दर पेज मेल खाती है
- असली टेबल, वही मर्ज की हुई सेल के साथ
- इक्वेशन Word की नेटिव, एडिटेबल इक्वेशन के रूप में
- फ़ारसी और अरबी सही तरह से, मूल अंकों के साथ
- एक फ़िडेलिटी स्कोर और डाइवर्जेंस मैप, जो यह साबित करते हैं
सार निकालने के लिए नहीं — हूबहू दोहराने के लिए बना है
हर पेज पर दस अलग-अलग विशेषज्ञ एजेंट काम करते हैं। जब तक हर एक हरी झंडी न दे, फ़ाइल बाहर नहीं जाती।
पेज दर पेज मिलान
150 पेज की किताब 150 पेज की Word फ़ाइल बनती है। पेज ब्रेक वहीं आते हैं जहाँ मूल में थे, इसलिए पेज नंबर से दिए गए हवाले आज भी सही बैठते हैं।
इक्वेशन जो सचमुच कंपाइल होती हैं
हर फ़ॉर्मूला पहले LaTeX में लिखा जाता है, कंपाइल करके साबित किया जाता है कि वह सही है, फिर Word की नेटिव इक्वेशन में बदल दिया जाता है — जिसे आप एडिट कर सकते हैं।
फिगर वेक्टर में दोबारा बने हुए
चार्ट और ज्यामितीय आकृतियाँ Word के एडिटेबल शेप बन जाती हैं — ऐक्सिस, तीर, डॉटेड लाइन और मार्कर सब अलग-अलग — न कि सपाट स्क्रीनशॉट।
दाएँ-से-बाएँ लिपियाँ, पूरी तरह ठीक
फ़ारसी और अरबी अपने अक्षर-रूप, अंक, ज़ेर-ज़बर और विराम-चिह्न वैसे ही रखते हैं। कोष्ठक और दशमलव कभी उलटते नहीं।
रीप्रिंट टेस्ट
हम अपने ही आउटपुट को वापस इमेज में रेंडर करके आपके स्कैन से मिलाते हैं, और फिर फ़िडेलिटी स्कोर के साथ हर फ़र्क़ का नक्शा खुलकर सामने रखते हैं।
न कुछ जोड़ा, न कुछ हटाया
न मनगढ़ंत हेडिंग, न “सुधार” के नाम पर री-फ़ॉर्मैटिंग, न चुपचाप की गई कोई ठीक-ठाक। पेज पर स्लेटी रंग का नंबर बॉक्स है, तो आपको स्लेटी रंग का नंबर बॉक्स ही मिलेगा।
लोग OCR से असल में जो-जो काम कराते हैं
हमने खंगाला कि दुनिया OCR से सचमुच कौन-सा काम कराती है — अंग्रेज़ी और फ़ारसी, दोनों तरह के स्रोतों में — और उन्हीं कामों के लिए बनाया जहाँ सिर्फ़ शब्द नहीं, पेज ख़ुद मायने रखता है। यह रहा ईमानदार नक्शा, उन कामों समेत जहाँ हम आपको Word के बजाय कुछ और थमाते हैं।
स्कैन किया हुआ PDF, एडिट होने लायक़ Word में
रोज़मर्रा वाला काम। किसी ने स्कैन या लॉक किया हुआ PDF भेज दिया, और अब आपको उसे एडिट करना है, भरना है, अनुवाद करना है या आधा हिस्सा दोबारा इस्तेमाल करना है। आपको टेक्स्ट नहीं चाहिए — आपको वही डॉक्युमेंट चाहिए, बस एडिट होने लायक़।
Wordवे फ़ारसी PDF जिनका टेक्स्ट टूटा-फूटा निकलता है
फ़ारसी कन्वर्ज़न की बहुत बड़ी माँग स्कैन की होती ही नहीं। वह पुराने टूल से बने डिजिटल PDF की होती है, जिनका टेक्स्ट कॉपी करते ही टूटे हुए, बेमतलब अक्षरों में बदल जाता है। लोग बिलकुल ठीक-ठाक पेज की तस्वीर सिर्फ़ इसलिए खींचते हैं कि पढ़ने लायक़ टेक्स्ट वापस मिल जाए।
Word · टेक्स्टइम्तिहान के पेपर और क्वेश्चन बैंक
सालों के पुराने पेपर को एडिट और आगे-पीछे होने लायक़ सवालों में बदल दीजिए — इक्वेशन, ज्यामिति की आकृतियाँ, विकल्पों का लेआउट, आंसर की और मार्किंग स्कीम सब सलामत — ताकि उन्हें नए पेपर में दोबारा जमाया जा सके और टॉपिक के हिसाब से टैग किया जा सके।
Word · LaTeX · JSONहाथ से लिखे और छपे हुए टेक्निकल नोट्स
इंजीनियरिंग और साइंस के लेक्चर नोट्स दोबारा टाइप कराना सबसे महँगा सौदा है, क्योंकि टाइपिस्ट हर फ़ॉर्मूले और हर टेबल का पैसा अलग से लेते हैं। हाथ से होने वाला पूरा खर्च यहीं इकट्ठा होता है।
Word · LaTeXPDF और तस्वीरों की टेबल, सीधे Excel में
बैलेंस शीट, मार्कशीट, प्राइस लिस्ट, लैब रिपोर्ट, जनगणना की शीट — पूरी बात ही टेबल में होती है, और आम OCR सबसे पहले उसी को सपाट कर देता है।
Excel · CSVप्रमाणित अनुवाद और इमिग्रेशन के डॉक्युमेंट
सरकारी अनुवाद को मूल पेज की हूबहू नक़ल होना पड़ता है: वही मुहरें, वही नंबरों की टेबल, वही दस्तख़त वाले खाने। अनुवादक आज भी अनुवाद शुरू करने से पहले यह पूरा लेआउट हाथ से दोबारा बनाते हैं।
Wordइस्लामी और शास्त्रीय फ़ारसी ग्रंथ
इन विषयों में पेज नंबर सजावट नहीं, वैधता की शर्त है: हवाले जिल्द और पेज से दिए जाते हैं। जिस टेक्स्ट की पेज-सीमाएँ खो जाएँ, वह हवाला देने वाले शोधकर्ता के किसी काम का नहीं।
Word · टेक्स्ट · TEIपांडुलिपियाँ और ऐतिहासिक दस्तावेज़
हाथ की लिखावट उतारने में छपी हुई सामग्री से दस से बीस गुना खर्च आता है, और फ़ारसी या अरबी पांडुलिपियों की लिखावट के लिए कोई ढंग का व्यावसायिक टूल है ही नहीं। पूरे बाज़ार में सबसे बड़ी खाली जगह यही है।
टेक्स्ट · TEI · इमेजआपके लिए चार क़दम। हमारे लिए दस एजेंट।
अपलोड कीजिए या लिंक पेस्ट कीजिए
PDF, फ़ोटो या स्कैनर का आउटपुट — फ़ोन से भी, लैपटॉप से भी। Drive, OneDrive और Dropbox के लिंक हम खुद फ़ेच कर लेते हैं।
दो अलग-अलग रीडिंग
हर पेज दो स्वतंत्र पास में दो बार पढ़ा जाता है, फिर अक्षर-दर-अक्षर मिलाया जाता है। जहाँ भी फ़र्क़ निकलता है, फ़ैसला इमेज देखकर होता है।
दोबारा बनाइए, फिर जाँचिए
फ़ॉर्मूले कंपाइल होते हैं, फिगर दोबारा बनाकर ऑडिट होते हैं, लेआउट पेज दर पेज बैठाया जाता है, और पूरी फ़ाइल में मना किए गए कैरेक्टर छान लिए जाते हैं।
तीन फ़ॉर्मैट में डाउनलोड
एडिट करने के लिए Word, वेब के लिए HTML, पाइपलाइन के लिए प्लेन टेक्स्ट। सब कुछ आपकी हिस्ट्री में रहता है, जब चाहें लौट आइए।
हैंडल को खींचिए। एक तरफ़ जो दिख रहा है, वह हमारा आउटपुट है।
यह एक राष्ट्रीय ओलंपियाड की बुकलेट का असली पेज है, शुरू से आख़िर तक कन्वर्ट किया हुआ। बाईं तरफ़ वह Word फ़ाइल है जो हमने बनाई, दाईं तरफ़ मूल स्कैन। बगल में लगा डाइवर्जेंस मैप रंगों में हर उस पिक्सल पर निशान लगाता है जहाँ दोनों में फ़र्क़ है।

एक अपलोड। काम को जो-जो फ़ॉर्मैट सचमुच चाहिए, सब।
जिसे लोग OCR कहते हैं, वह असल में आठ अलग-अलग काम हैं, जिनके आठ अलग-अलग अंजाम होते हैं। अदालत को सर्चेबल PDF चाहिए, अकाउंटेंट को स्प्रेडशीट, AI टीम को निर्देशांक वाला Markdown, और दृष्टिबाधित पाठक को रीफ़्लो होने वाला टेक्स्ट। अंजाम आप चुनिए; एक ही जाँची-परखी रीडिंग इन सबको सींचती है।
Word (.docx)
हूबहू नक़ल। पेज दर पेज मिलान, असली हेडिंग और टेबल, नेटिव और एडिट होने लायक़ इक्वेशन, वेक्टर फिगर, और हेडर व पेज नंबर ठीक वैसे ही जैसे छपे थे।
सर्चेबल PDF
आपका मूल स्कैन, और उसके नीचे सटीक अदृश्य टेक्स्ट लेयर। ई-फ़ाइलिंग के लिए अदालतों की बढ़ती फ़ेहरिस्त इसे माँगती है, और आर्काइव के लिए तो यही मानक डिलिवरेबल है।
Excel (.xlsx) और CSV
टेबल असली टेबल बनकर बाहर आती हैं — मर्ज की हुई सेल, कई पेज तक चलने वाला सिलसिला, और अंक अपने मूल रूप में। बैलेंस शीट, मार्कशीट, प्राइस लिस्ट और नतीजों की टेबल के लिए।
Markdown और JSON
AI के लिए तैयार: साफ़ स्ट्रक्चर, हर ब्लॉक पर पेज ऐंकर और बाउंडिंग बॉक्स — ताकि रिट्रीवल सिस्टम ठीक-ठीक वही पेज बता सके जिससे उसने जवाब दिया।
HTML
वही स्ट्रक्चर, सिमैंटिक मार्कअप में — पब्लिश करने के लिए तैयार। मैथ MathML में जाता है, इसलिए वह असली मैथ ही बना रहता है।
LaTeX
शोध-पत्रों और थीसिस के लिए: इक्वेशन LaTeX सोर्स में, टेबल tabular में, और आकृतियाँ अलग फ़ाइलों में अपने कैप्शन के साथ।
EPUB3 और DAISY
रीफ़्लो होने वाला, स्क्रीन रीडर के लिहाज़ से सही — सही लैंग्वेज टैग और उच्चारण के लिहाज़ से सुरक्षित फ़ारसी स्पेसिंग के साथ। यह पेज फ़िडेलिटी का ठीक उल्टा है, और कुछ पाठकों को बिलकुल यही चाहिए।
प्लेन टेक्स्ट
लेआउट जानबूझकर हटा दिया जाता है, पेज की सीमाएँ बनी रहती हैं और निशान लगी होती हैं। सर्च इंडेक्स, कॉर्पस और लैंग्वेज पाइपलाइन के लिए।
शुरू फ़ोन पर कीजिए, ख़त्म लैपटॉप पर
आपकी हिस्ट्री आपके साथ चलती है। अगर कोई फ़ाइल किसी दूसरे डिवाइस पर सेव हुई थी, तो FullOCR बता देता है कि किस डिवाइस पर और कहाँ — ताकि कहीं और किया गया डाउनलोड आप ढूँढ़ते न रह जाएँ।
एक ही हिस्ट्री, हर डिवाइस पर
हर कन्वर्ज़न की तारीख़, सोर्स फ़ाइल, पेज की संख्या, फ़ॉर्मैट और फ़िडेलिटी स्कोर — सब एक ही लिस्ट में।
डिवाइस पहचानने वाले डाउनलोड
पुराना जॉब फ़ोन पर खोलिए और साफ़-साफ़ लिखा मिलेगा: यह Word फ़ाइल आपके लैपटॉप पर, इस फ़ोल्डर में, इस नाम से सेव हुई थी।
जब चाहें दोबारा डाउनलोड कीजिए
आउटपुट आपके अकाउंट में बने रहते हैं। कुछ भी चुपचाप एक्सपायर नहीं होता।
पेज के पैसे दें, सीट के नहीं
मॉडल चलाने में हमारा अपना खर्च $0.082 प्रति पेज है। नीचे दी गई हर कीमत इसी से तय होती है, किसी कॉम्पिटिटर के विज्ञापन से नहीं। जाँच छोड़ देने वाला कोई सस्ता प्लान हमारे पास है ही नहीं — क्योंकि जिस डॉक्युमेंट पर भरोसा न हो, उसे कन्वर्ट कराने का कोई मतलब नहीं।
हर अकाउंट को शुरू से ही हर महीने 5 पेज मुफ़्त मिलते हैं — न कार्ड, न वॉटरमार्क, और तीनों फ़ॉर्मैट पूरे।
Pages
जितने पेज कन्वर्ट करें, बस उतने के पैसे। न सब्सक्रिप्शन, न प्रति-यूज़र सीट।
कम से कम $6 का ऑर्डर
- Word, HTML और प्लेन टेक्स्ट
- दो स्वतंत्र रीडिंग, फिर हर फ़र्क पर फ़ैसला
- इक्वेशन कंपाइल होकर एडिट होने लायक
- फिगर वेक्टर शेप में दोबारा बने हुए
- रीप्रिंट-टेस्ट वाली फ़िडेलिटी रिपोर्ट
- सामान्य कतार, 12 घंटे के भीतर डिलीवरी
Studio
उन रिसर्चर, पब्लिशर और ट्रांसलेशन ऑफ़िस के लिए जिनका यह काम हर हफ़्ते चलता रहता है।
250 पेज शामिल, उसके बाद $0.21 प्रति पेज
- Pages वाला सब कुछ
- हर महीने 250 पेज
- प्राथमिकता वाली कतार
- पूरी किताब एक साथ बैच में अपलोड
- हर जॉब के लिए कन्फ़ॉर्मेंस सर्टिफ़िकेट
- API ऐक्सेस और Word ऐड-इन
Certified
जब डॉक्युमेंट को किसी और की जाँच में खरा उतरना हो।
- Studio वाला सब कुछ
- फ़्लैग हुए हर हिस्से पर इंसान का फ़ैसला
- पूरे डॉक्युमेंट में हर अक्षर का मूल पिक्सल तक ट्रेस
- हस्ताक्षरित कन्फ़ॉर्मेंस सर्टिफ़िकेट
- बीमा-समर्थित सटीकता की गारंटी
- अदालतों, आर्काइव और पब्लिशर के लिए
खरीदने के दो और तरीके
Rush
इंटरैक्टिव कतार — घंटों की जगह मिनटों में। किसी भी प्रति-पेज कीमत के ऊपर जोड़ी जा सकती है।
FullOCR Desktop
आपके अपने Mac या PC पर चलता है, बिना इंटरनेट के। यह एडिट होने लायक Word ड्राफ़्ट बनाता है — साथ में फ़िडेलिटी स्कोर और उन हिस्सों का नक्शा जिन्हें जाँच लेना ठीक रहेगा — और सिर्फ़ उन्हीं पेज को पूरे क्लाउड प्रोटोकॉल तक भेजता है। हर मेजर वर्ज़न के लिए एक बार भुगतान, 100 एस्केलेशन पेज शामिल।
एयर-गैप्ड नोड
पूरा क्लाउड प्रोटोकॉल, आपके अपने नेटवर्क के अंदर इंस्टॉल — उन संस्थानों के लिए जिनके डॉक्युमेंट इमारत से बाहर जा ही नहीं सकते। प्रति नोड सालाना लाइसेंस, साथ में ऑनबोर्डिंग और प्रोटोकॉल ट्यूनिंग।
कीमतें अमेरिकी डॉलर में। हर महीने 5 पेज मुफ़्त, उसके लिए कार्ड की ज़रूरत नहीं। महीने में 5,000 पेज से ज़्यादा के लिए कीमत अलग से तय होती है।
आपके डॉक्युमेंट सिर्फ़ आपके हैं
डिलीट तब, जब आप कहें
फ़ाइलें कन्वर्ज़न के तुरंत बाद हटवा दीजिए, या हिस्ट्री में रहने दीजिए। दोनों ही सूरतों में उन्हें कोई और नहीं देखता।
आपकी फ़ाइलों पर कोई ट्रेनिंग नहीं
आपके अपलोड किसी भी चीज़ की ट्रेनिंग में कभी इस्तेमाल नहीं होते।
ऑफ़लाइन इंस्टॉलेशन
जिन आर्काइव और संस्थानों के डॉक्युमेंट कहीं भेजे ही नहीं जा सकते, उनके लिए पूरी पाइपलाइन उनके अपने नेटवर्क के अंदर इंस्टॉल की जा सकती है।
अक्सर पूछे जाने वाले सवाल
यह आम OCR से अलग कैसे है?
यह कौन-कौन सी भाषाएँ पढ़ सकता है?
मैं कौन-कौन सी फ़ाइलें अपलोड कर सकता हूँ?
अपलोड करने के बजाय लिंक भेज सकता हूँ?
क्या इक्वेशन सचमुच एडिट हो सकती हैं?
फ़िडेलिटी स्कोर का मतलब क्या है?
क्या आप मेरी फ़ाइलें रखते हैं?
क्या इसे अपनी मशीन पर चला सकता हूँ?
अपना सबसे मुश्किल पेज भेजिए
वही पेज — जिसकी टेबल कभी सही-सलामत नहीं बचती, या जिसका फ़ॉर्मूला हर बार टूट जाता है, या जिसका फ़ारसी टेक्स्ट हमेशा उलट जाता है। हमने यह चीज़ उसी पेज के लिए बनाई है।