Estrai e copia il testo contenuto in un PDF. Supporta PDF con testo selezionabile. Tutto nel browser, nessun upload.
Carica il file PDF e il tool estrae automaticamente il testo presente, pagina per pagina. Il risultato appare nell'area di testo — puoi copiarlo tutto o pagina per pagina. L'estrazione avviene nel browser con PDF.js: nessun file viene caricato su server. Funziona su PDF digitali che contengono testo selezionabile; per PDF scansionati (immagini) serve un processo OCR separato.
PDF.js analizza il PDF nel browser e recupera i blocchi di testo dal layer testuale del documento. Un PDF digitale memorizza il testo come elementi vettoriali con posizione, font e contenuto — PDF.js li legge direttamente. Il testo estratto rispetta l'ordine di lettura della pagina ma può perdere la formattazione: colonne affiancate vengono lette nell'ordine in cui appaiono internamente al PDF, non sempre nell'ordine visivo intuitivo.
Un PDF digitale (creato da Word, export da software, report generati programmaticamente) contiene il testo come elemento selezionabile — l'estrazione è immediata e accurata. Un PDF scansionato è un'immagine fotografata o scansionata: non contiene testo, solo pixel. Per estrarre testo da un PDF scansionato serve l'OCR (Optical Character Recognition). Puoi verificare: se riesci a selezionare il testo nel tuo visualizzatore PDF, è digitale; se non puoi selezionarlo, è scansionato.
Copiare da PDF protetti: alcuni PDF bloccano la selezione del testo — l'estrazione via PDF.js aggira questa restrizione (purché il documento non abbia cifratura). Contare le parole: estrai il testo e incollalo nel Contatore Parole per una stima precisa. Ricerca full-text: converti in testo per rendere il contenuto cercabile. Preparare prompt per AI: estrai il testo per passarlo a un modello di linguaggio. Elaborazione dati: estrai tabelle o dati strutturati per importarli in un foglio di calcolo.
Per PDF protetti da password di apertura, PDF.js richiede la password — inseriscila quando richiesto. Per PDF con restrizioni (no copia, no stampa) ma senza password di apertura, l'estrazione funziona ugualmente: le restrizioni sono suggerimenti per i visualizzatori, non cifratura del testo.
I PDF con layout a colonne multiple o elementi sovrapposti memorizzano i blocchi di testo nell'ordine in cui sono stati creati, non nell'ordine visivo di lettura. PDF.js li estrae nell'ordine interno. Per layout complessi (giornali, brochure con colonne) l'ordine del testo estratto può differire dall'ordine di lettura naturale.
Carica il PDF su Google Drive e aprilo con Google Docs — Google applica l'OCR automaticamente. In alternativa usa Adobe Acrobat (a pagamento) o servizi come Adobe Scan o Microsoft Lens per foto di documenti. Per OCR in batch su molti file usa AWS Textract o Google Cloud Vision API.
No. L'estrazione avviene interamente nel browser con PDF.js. Il file rimane sul tuo dispositivo — puoi usarlo con documenti riservati, contratti, dati personali senza rischi.
No — il tool estrae solo il layer testuale. Le immagini nel PDF vengono ignorate. Grafici, tabelle come immagini, firme e timbri non vengono estratti. Per estrarre immagini da PDF usa il tool PDF → JPG.