OCR voor pdf

Een gescande pdf kiezen

Alleen PDF · 20 MB · 40 pagina’s

of zet hier één pdf neer

Gebruik deze tool als een pdf uit afbeeldingen van gescande pagina’s bestaat in plaats van selecteerbare tekst. De pagina’s worden in je browser weergegeven en met optische tekenherkenning (OCR) gelezen. Daarna kun je de herkende platte tekst controleren, kopiëren of als .txt-bestand opslaan. De bron-pdf blijft op je apparaat. De tool maakt geen doorzoekbare pdf, behoudt de pagina-indeling niet en de OCR-uitvoer kan fouten bevatten.

Tekst uit een gescande pdf halen

  1. 1

    Kies de documenttaal

    Selecteer de hoofdtaal van de gedrukte tekst. Deze keuze bepaalt welk OCR-model de browser gebruikt.

  2. 2

    Open de pdf

    Kies een pdf van maximaal 20 MB en 40 pagina’s. Het bronbestand blijft in je browser en wordt niet naar onze server verzonden.

  3. 3

    Wacht op de herkenning

    De browser geeft elke pagina weer en leest die met het gekozen OCR-model. Mogelijk moeten de modelbestanden eerst worden gedownload.

  4. 4

    Controleer het resultaat

    Vergelijk namen, getallen en belangrijke passages met de oorspronkelijke pagina’s. OCR is een hulpmiddel, geen betrouwbare transcriptie voor kritisch gebruik.

  5. 5

    Kopieer of download de tekst

    Kopiëren en de TXT lokaal downloaden houden het resultaat in de browser. Alleen bij de optionele downloadpagina wordt het afgeleide tekstbestand naar een beveiligde link geüpload.

Wat deze tool oplevert

De uitvoer is platte tekst met vóór de herkende tekst van elke pagina een paginamarkering. De tool:

  • voegt geen verborgen tekstlaag aan de pdf toe
  • reconstrueert geen kolommen, tabellen, formulieren of oorspronkelijke typografie
  • behoudt de visuele pagina-indeling niet
  • vertaalt het document niet
  • controleert niet of de herkende tekst klopt

Wil je de gescande pagina’s behouden en daarachter doorzoekbare tekst toevoegen, gebruik dan een speciale toepassing voor doorzoekbare pdf’s of OCR-software voor de desktop.

Documenten die het beste werken

OCR is bedoeld voor gedrukte tekst. Een rechte, scherpe scan met duidelijk contrast wordt beter herkend dan een onscherpe foto, een verbleekte fax of een beschadigde pagina. Decoratieve letters, handschrift, wiskundige notatie, dicht op elkaar staande kolommen en ingewikkelde tabellen kunnen slechte of verkeerd geordende tekst opleveren.

De tool accepteert pdf’s tot 20 MB en 40 pagina’s. Herkenning gebeurt pagina voor pagina en kan veel geheugen gebruiken, vooral bij grote pagina’s of een hoge resolutie. Raakt het browsergeheugen vol, splits de pdf dan op in kleinere bestanden en verwerk die afzonderlijk.

Ondersteunde OCR-talen

Je kunt kiezen uit Engels, Spaans, Frans, Duits, Italiaans, Portugees, Nederlands, Russisch, Japans, vereenvoudigd Chinees, Koreaans en Arabisch.

Kies de hoofdtaal voordat je het bestand opent. Een pagina met meerdere talen of schriften kan afzonderlijke verwerkingen nodig hebben; tekens die op elkaar lijken kunnen alsnog worden verwisseld.

Controleer de herkende tekst

Vergelijk het resultaat altijd met de oorspronkelijke pdf voordat je het gebruikt. Let vooral op:

  • namen, adressen en identificatienummers
  • datums, bedragen, decimaaltekens en mintekens
  • juridische, medische, financiële of veiligheidsinstructies
  • pagina-einden en leesvolgorde in documenten met meerdere kolommen

Beschouw OCR-uitvoer niet als een gezaghebbende kopie van een belangrijk document.

Bestandsverwerking en downloads

De bron-pdf wordt lokaal in je browser gelezen. Het bestand komt niet in de funnel-URL en wordt niet naar onze server gestuurd. Je browser kan de bibliotheken voor pdf-weergave en OCR en het gekozen taalmodel downloaden bij de ingestelde bibliotheekleverancier.

Kopiëren houdt de herkende tekst in de browser en zet die op het klembord. TXT lokaal downloaden maakt het .txt-bestand en slaat het op zonder upload. Alleen als je Downloadpagina maken kiest, wordt de afgeleide TXT naar een beveiligde link geüpload en daar maximaal 7 dagen bewaard. De lokale download blijft beschikbaar als die optionele upload mislukt.

Veelgestelde vragen

Nee. De bron-pdf blijft in de browser terwijl de pagina’s worden weergegeven en herkend. De browser kan de benodigde bibliotheken en het gekozen taalmodel downloaden. Ook de lokale download uploadt geen tekst; alleen de optionele downloadpagina uploadt de afgeleide TXT.

Nee. Het resultaat is per pagina gegroepeerde platte tekst. De tool wijzigt de oorspronkelijke pdf niet, voegt geen verborgen tekstlaag toe en behoudt de indeling niet.

Vergelijk het met de oorspronkelijke pagina’s. OCR kan tekens verwisselen, tekst overslaan en de leesvolgorde veranderen. Controleer elk detail voordat je de uitvoer gebruikt voor juridisch, medisch, financieel, veiligheidskritisch of ander belangrijk werk.

De tool is ontworpen voor gedrukte tekst. Handschrift, vergelijkingen en decoratieve letters kunnen onbetrouwbaar zijn. Tekens in een tabel worden mogelijk herkend, maar de structuur van rijen en kolommen blijft niet behouden in de platte tekst.

Engels, Spaans, Frans, Duits, Italiaans, Portugees, Nederlands, Russisch, Japans, vereenvoudigd Chinees, Koreaans en Arabisch. Kies de hoofdtaal voordat je de pdf opent.

De pdf mag maximaal 20 MB groot zijn en 40 pagina’s bevatten. Grote of gedetailleerde pagina’s kunnen het beschikbare browsergeheugen toch overschrijden; splits het document dan in kleinere bestanden.

TXT lokaal downloaden maakt het .txt-bestand en slaat het zonder upload rechtstreeks op je apparaat op. Maak je een downloadpagina, dan wordt alleen die afgeleide TXT naar een beveiligde link geüpload en daar maximaal 7 dagen bewaard.

Gerelateerde tools

Tool beschikbaar in andere talen