Doorzoekbare PDF maken

Kies een gescande PDF

Alleen PDF · 10 MB

Alleen PDF, tot 10 MB en 10 pagina's

Een gescande PDF is eigenlijk gewoon een stapel afbeeldingen in een PDF-container, dus je kunt de tekst niet markeren, kopiëren of doorzoeken. Deze tool voert optische tekenherkenning (OCR) uit op elke pagina in je browser en sluit het resultaat in als een onzichtbare tekstlaag die op de originele pagina is uitgelijnd. Het uiterlijk van de pagina blijft behouden, terwijl Ctrl+F en tekstselectie de herkende woorden kunnen gebruiken. Herkenning kan fouten maken en de uitvoer is geen getagde toegankelijke PDF. Vergelijk belangrijke tekst daarom met de scan.

Zo pas je OCR toe op een gescande PDF

  1. 1

    Upload de scan

    Sleep een gescande PDF erin (contracten, facturen, gearchiveerde rapporten). Gedrukte tekst werkt het best; handschrift niet.

  2. 2

    Kies de taal

    Kies de taal van het document (Engels, Spaans, Frans, Duits, Italiaans, Portugees of Nederlands) zodat de OCR-engine het juiste tekenmodel laadt.

  3. 3

    Start de herkenning

    Elke pagina wordt in hoge resolutie in je browser gerenderd en aan de OCR-engine doorgegeven. Lange documenten kunnen enkele minuten duren.

  4. 4

    Tekstlaag ingesloten

    De herkende woorden worden als onzichtbare laag op de originele pagina uitgelijnd, zodat elke pagina er onveranderd uitziet.

  5. 5

    Download de nieuwe PDF

    Je krijgt een PDF die de originele scans behoudt en nu doorzoekbaar is in elke moderne lezer.

Wanneer OCR goed werkt (en wanneer niet)

De OCR-kwaliteit hangt af van de scan. Vergelijk belangrijke namen, cijfers en juridische formuleringen altijd met de originele pagina.

Invoer Wat je kunt verwachten
Schone scan van gedrukte tekst Vaak goede resultaten; lees belangrijke tekst na.
Foto van een gedrukte pagina Het resultaat hangt af van scherpstelling, licht en de hoek van de pagina.
Oud boek of vervaagde typemachinedruk Controleer de herkende tekst zorgvuldig.
Handschrift of cursief schrift Niet betrouwbaar ondersteund.
Bonnetjes of thermische printeruitvoer Controleer cijfers en vage tekens zorgvuldig.
Sterk doorschijnen van de achterkant De resultaten kunnen onvolledig of onnauwkeurig zijn.

Doorzoekbare PDF versus PDF met alleen afbeeldingen

  • PDF met alleen afbeeldingen: pure bitmaps, geen tekst. Wat je scanner standaard produceert.
  • Doorzoekbare PDF: bitmaps plus een onzichtbare tekstlaag (wat deze tool oplevert). Ziet er identiek uit, Ctrl+F werkt.
  • PDF/A: een archiefvariant van PDF die de eigen lettertypen insluit en externe bronnen verbiedt, vaak vereist door rechtbanken en archieven. Deze tool levert een gewone doorzoekbare PDF op, geen gecertificeerde PDF/A; converteer en valideer met een speciaal PDF/A-hulpmiddel als je werkstroom dat vereist.

Tips voor het beste resultaat

  • Begin met ongeveer 300 DPI. Dat is vaak een bruikbaar evenwicht tussen leesbare details en verwerkingstijd. Een hogere resolutie vraagt meer tijd en geheugen.
  • Zet recht vóór OCR. De meeste scanners bieden automatisch draaien; zelfs een lichte scheefstand kan de herkenningskwaliteit verlagen.
  • Eén taal per keer. De engine herkent één taal tegelijk, dus kies de overheersende taal. Draai een tweetalig document één keer per taal en houd het beste resultaat.
  • Bewaar altijd het origineel. OCR maakt kleine fouten; de onzichtbare laag is een gemak, geen bewijs.

Veelgestelde vragen

De oorspronkelijke inhoud van de pagina blijft behouden. De herkende tekst wordt als onzichtbare laag daarmee uitgelijnd toegevoegd, zodat het uiterlijk van de pagina gelijk zou moeten blijven. Controleer het resultaat als exacte visuele overeenstemming belangrijk is.

Zeven talen in Latijns schrift: Engels, Spaans, Frans, Duits, Italiaans, Portugees en Nederlands. Kies de taal die bij je document past. Schriften zoals Cyrillisch, Arabisch en CJK (Chinees, Japans, Koreaans) zijn niet beschikbaar in deze tool.

Niet betrouwbaar. Deze tool is bedoeld voor gedrukte tekst. Handschriftherkenning is een andere technologie; controleer of transcribeer handgeschreven materiaal daarom apart.

Nee. De uitvoer is een gewone doorzoekbare PDF: je originele pagina-afbeeldingen plus een onzichtbare OCR-tekstlaag. Het is geen gecertificeerd PDF/A-archiefbestand. Vereist je werkstroom PDF/A, converteer en valideer het resultaat dan met een speciaal PDF/A-hulpmiddel.

OCR draait volledig in je browser, dus je bron-PDF wordt niet naar een server gestuurd voor herkenning. Een gewone lokale download blijft op je apparaat. Alleen als je Een downloadpagina maken kiest, wordt de voltooide doorzoekbare PDF naar onze server geüpload. De bron-PDF blijft lokaal en het geüploade resultaat wordt maximaal 7 dagen bewaard.

Gerelateerde tools