PDF-tabel naar CSV
Kies een tekst-PDF
Zet eenvoudige teksttabellen uit een PDF om in CSV- of TSV-bestanden zonder de PDF naar een server te sturen. De browser groepeert tekstfragmenten op hun zichtbare positie en zoekt naar terugkerende kolommen. Controleer elke gevonden tabel: dit is een voorzichtige detectie op basis van waarschijnlijkheid, geen garantie dat een complexe opmaak perfecte rijen en kolommen oplevert.
Een PDF-tabel als CSV extraheren
-
1
Kies een tekst-PDF
Selecteer een PDF van maximaal 20 MiB en 150 pagina's. Een scan die alleen uit afbeeldingen bestaat, moet eerst met OCR worden verwerkt.
-
2
Laat de browser tabellen zoeken
De detector gebruikt zichtbare tekstcoördinaten, inclusief paginarotatie en CropBox, en zoekt herhaalde rij- en kolomposities.
-
3
Controleer en kies de uitvoer
Selecteer de gewenste tabellen en controleer de rijen. Kies komma, puntkomma of tab, plus de UTF-8-markering en formulebeveiliging.
-
4
Download de tabellen
Elke geselecteerde tabel wordt lokaal als een apart CSV- of TSV-bestand gedownload. Tabellen worden niet over pagina's heen samengevoegd.
Wat de detector kan afleiden
Een PDF bewaart een tabel meestal niet als een echt raster, maar als tekstfragmenten op coördinaten. Deze tool groepeert fragmenten op dezelfde zichtbare regel, voegt nabije fragmenten samen en behoudt kolomposities die in meerdere rijen terugkomen. Duidelijke teksttabellen werken het best; samengevoegde of afgebroken cellen en decoratieve lay-outs kunnen handmatige correcties vereisen.
Paginarotatie en een verschoven CropBox worden genormaliseerd. Bij overwegend rechts-naar-links geschreven rijen volgt de kolomvolgorde de richting van de PDF-tekstlaag. Meerdere regelmatige tabellen op één pagina kunnen apart worden gevonden. Een doorlopende tabel op meerdere pagina’s wordt niet samengevoegd.
| PDF-indeling | Verwacht resultaat | Controle |
|---|---|---|
| Schone export met vaste kolommen | Meestal het beste resultaat | Koppen, decimalen en lege cellen |
| Ontbrekende waarde in een vaste rij | Lege cel op de afgeleide positie | Of de juiste kolom leeg bleef |
| Samengevoegde of afgebroken cel | Tekst kan verschuiven of splitsen | Vergelijk de voorvertoning |
| Meerdere regelmatige tabellen op één pagina | Kunnen als afzonderlijke genummerde tabellen worden herkend | Eén bestand per geselecteerde tabel |
| Gescande afbeelding | Geen tabel gevonden | Voer eerst OCR uit |
Naast 20 MiB en 150 pagina’s gelden veiligheidslimieten voor het aantal tekstfragmenten en tekens. Een sterk gefragmenteerde PDF kan daarom eerder stoppen.
CSV, TSV en veiligheid
Kies komma of puntkomma voor CSV, of tab voor TSV. Records eindigen met CRLF. Een veld met het gekozen scheidingsteken, een dubbel aanhalingsteken, regelterugloop of regelafbreking wordt tussen dubbele aanhalingstekens gezet; interne dubbele aanhalingstekens worden verdubbeld. Dit volgt de gebruikelijke regels uit RFC 4180, aangepast aan het gekozen scheidingsteken.
Formulebeveiliging staat standaard aan. Begint een cel na witruimte met =, +, - of @, inclusief ondersteunde volbrede varianten, dan wordt een apostrof toegevoegd. De waarde verandert daardoor, maar een spreadsheet behandelt de inhoud eerder als tekst. Uitschakelen bewaart de ruwe tekst, maar formuleachtige inhoud uit een onbetrouwbare PDF kan gevaarlijk zijn. OWASP beschrijft CSV Injection en waarom geen enkele maatregel in alle spreadsheetprogramma’s universeel is.
Een optionele UTF-8-markering helpt sommige programma’s niet-Latijnse tekst herkennen. Controleer het resultaat altijd vóór boekhouding, rapportage of automatische import.
Privéstatus van de stappen
De PDF, gevonden tabellen en instellingen blijven in deze browser. Ze staan maximaal 30 minuten in begrensde lokale browseropslag, zodat de drie stappen navigatie kunnen overleven. Downloads worden lokaal gemaakt en deze tool uploadt niets. Opnieuw beginnen verwijdert de huidige taak; de browser kan lokale gegevens eerder wissen.
Veelgestelde vragen
Nee. Lezen, detecteren en CSV of TSV maken gebeurt in de browser. De taak blijft maximaal 30 minuten in begrensde lokale opslag en elke download is lokaal.
Niet zonder voorbereiding. Een afbeeldingsscan heeft geen tekstlaag met posities. Voer eerst OCR uit en gebruik daarna de tekst-PDF.
Kies komma, puntkomma of tab. Records gebruiken CRLF; velden met het scheidingsteken, een aanhalingsteken of een regeleinde worden geciteerd en interne aanhalingstekens verdubbeld. Tab maakt een .tsv-bestand.
Ze voegt een apostrof toe aan cellen die na witruimte met =, +, - of @ beginnen. Dit staat standaard aan en verandert die waarden. Schakel het alleen uit als ruwe tekst nodig is en u de PDF vertrouwt.
De detectie gebruikt tekstposities, geen echte tabelcellen. Afbrekingen, samengevoegde cellen, afwijkende spatiëring en gemengde schrijfrichtingen kunnen waarden verschuiven. Vergelijk de voorvertoning met de bron.
Meerdere regelmatige tabellen op één pagina kunnen apart worden gevonden en geselecteerd. Elke selectie krijgt een eigen bestand. Een tabel die op de volgende pagina doorgaat, wordt niet samengevoegd.
Gerelateerde tools
PDF naar Excel converter
Detecteer regelmatige tabellen in een tekst-PDF en download lokale XLSX-, CSV- of TSV-bestanden. Controleer elke tabel. Limiet: 20 MiB en 150 pagina's.
PDF naar Word converter
Zet PDF-bestanden om naar volledig bewerkbare Word-documenten. Koppen, lijsten, afbeeldingen en tabellen blijven behouden. Gescande PDF’s worden automatisch met OCR verwerkt.
Word naar PDF
Converteer Word-documenten in .doc en .docx naar PDF met behoud van pagina-indeling, afbeeldingen, tabellen en koppen. Veilige upload, automatische verwijdering na 2 uur.
PDF bewerken
Voeg tekst, markeringen, rechthoeken en witte vlakken toe aan een PDF in de browser. Exporteer een nieuw PDF-bestand zonder software te installeren.
PDF splitsen
Splits een PDF in één bestand per pagina of in aangepaste bereiken zoals 1-3, 4-6, 8. Verwerk in je browser en download een ZIP.
PDF vergelijken
Vergelijk uitleesbare tekst uit twee PDF’s per pagina. Markeer wijzigingen lokaal in de browser, zonder bestanden te uploaden.