Estrai testo da PDF online
Estrai e riconosci con OCR il testo dai documenti PDF direttamente nel tuo browser. Funziona su PDF e scansioni normali, sono supportate 16 lingue. I file non lasciano mai il tuo dispositivo.
Trascina e rilascia il tuo file qui o fai clic per selezionarlo
I file non lasciano mai il tuo dispositivo: tutto viene eseguito localmente nel browser.
Che cosa sono l'estrazione del testo dai PDF e l'OCR?
Estrarre il testo da un PDF significa trasformare le pagine del documento in testo semplice modificabile, che puoi copiare, cercare e tradurre. Basta caricare il file e premere il pulsante: la lingua viene rilevata automaticamente, i PDF con livello di testo vengono elaborati in pochi secondi e le scansioni passano attraverso l'OCR nel browser (Tesseract WASM, 16 lingue). I file non lasciano mai il dispositivo.
Domande frequenti sull'estrazione del testo dai PDF
Funziona su PDF scansionati?
Sì. Se il PDF non contiene un livello di testo, eseguiamo automaticamente l'OCR (riconoscimento) direttamente nel browser. Sono supportate 16 lingue, tra cui inglese, russo, ucraino, tedesco e francese. Non servono Adobe Acrobat o ABBYY FineReader.
Dove va il mio PDF?
Da nessuna parte. Il file viene letto nel browser, il testo viene estratto localmente tramite PDF.js e l'OCR viene eseguito dal motore Tesseract in WebAssembly. Non vediamo né il PDF né il testo riconosciuto: è fondamentale per passaporti, contratti e cartelle cliniche scansionati.
Devo scegliere la lingua del documento?
No, viene rilevato automaticamente. I PDF con un livello di testo passano attraverso `franc` per l'identificazione della lingua; le scansioni utilizzano l'OSD Tesseract sulla prima pagina per leggere la scrittura dominante (cirillico, latino, arabo). Lingue supportate: inglese, russo, ucraino, tedesco, francese, spagnolo, italiano, polacco, ceco, portoghese, olandese, bulgaro, persiano, estone, islandese, norvegese. Il modello di riconoscimento per la lingua rilevata viene scaricato una volta (~10–15 MB) e memorizzato nella cache del browser.
Quanto è veloce?
Un PDF con un livello di testo richiede 1–3 secondi, indipendentemente dalle dimensioni. Per le scansioni servono circa 5–30 secondi per pagina, in base al dispositivo. Un computer moderno elabora una scansione di 20 pagine in 2–3 minuti; uno smartphone è più lento.
Quanto è accurato il riconoscimento?
Tesseract è un motore open source, lo stesso utilizzato in FineReader Express su Linux. Nelle scansioni pulite con linee rette, la precisione è del 95–99% per parola. Sulle foto del telefono con inclinazioni, ombre o caratteri piccoli, aspettati di correggere le bozze. La grafia non viene riconosciuta.
Qual è la dimensione massima PDF?
30 MB. Per file più grandi, dividi il PDF in blocchi con il nostro strumento "Dividi PDF": tutte le operazioni sono locali e i file non lasciano mai il tuo dispositivo.