CSV-duplicatieverwijderaar

Duplikaten dringen op storende manieren binnen in CSV-exporten: herhaalde leveringen via webhook, twee rapporten die handmatig zijn samengevoegd, of een join die onverwachte rijen heeft veroorzaakt. Deze duplicaatverwijdering berekent een hash voor elke gegevensrij en behoudt alleen de eerste voorkomst; het resultaat behoudt daarmee de oorspronkelijke rijvolgorde zonder kopieën te bewaren. De koptekstrij is optioneel: zet de schakelaar om als uw bestand direct met gegevens begint.

Hoe deduplicatie werkt

  1. 1

    Plak de CSV

    Neem de koptekstrij wel of niet op; gebruik het selectievakje om de tool te vertellen wat van toepassing is.

  2. 2

    Elke rij wordt gehasht

    De rijen worden omgezet in arrays, en de MD5-waarde van hun JSON-representatie wordt gebruikt als unieke sleutel.

  3. 3

    De eerste die wordt gezien, wint

    De eerste rij met een bepaalde hash wordt behouden; latere rijen met dezelfde inhoud worden stilzwijgend overgeslagen.

  4. 4

    Koptekst blijft behouden

    Als de koptekstmodus aanstaat, wordt rij 1 altijd ongewijzigd doorgegeven en niet tegen de gegevens gededupliceerd.

Wat wordt als een duplicaat beschouwd

De deduplicator gebruikt gelijkheid op hele rijen. Twee rijen worden als duplicaten beschouwd wanneer alle cellen na standaard CSV-verwerking positie voor positie overeenkomen.

Wat toch als verschillend telt

Rij A Rij B Behandeld als
Alice,30,Paris Alice, 30, Paris Verschillend (extra spaties)
Bob,25 Bob,25, Verschillend (lege cel aan het einde)
"Jane Smith",42 Jane Smith,42 Gelijk (aanhalingstekens worden op parserniveau verwerkt)
TRUE,1 true,1 Verschillend (gevoelig voor hoofd- en kleine letters)

Wanneer deduplicatie op kolomniveau geschikter is

Matchen op volledige rijen is streng, en dat is meestal precies wat u wilt, maar soms wilt u eigenlijk „één rij per e-mailadres, ongeacht de andere kolommen”. Gebruik in dat geval eerst de CSV-kolomextractor om het bestand tot alleen de sleutelkolom te beperken, verwijder daar de duplicaten en gebruik het resultaat als opzoektabel. Of grijp naar SQL: SELECT DISTINCT ON (email) * FROM users ORDER BY email, created_at DESC; in PostgreSQL, of een GROUP BY met MIN()-aggregaten elders.

Praktische tips

  • Normaliseer voordat u dedupliceert. Verwijder eerst spaties en maak het hoofdlettergebruik in de sleutelkolommen uniform; anders blijven zowel ALICE@EXAMPLE.COM als alice@example.com bestaan.
  • Sorteer eerst en dedupliceer daarna, voor controleerbare resultaten. Als u wilt weten welke kopie is behouden, sorteer het CSV-bestand dan op uw gewenste tiebreaker (meest recente tijdstempel, laagste ID) voordat u de deduplicator uitvoert.
  • Controleer het aantal rijen. Gebruik de CSV-rijenteller op zowel het originele als het uitvoerbestand om te bevestigen hoeveel duplicaten zijn verwijderd.

Veelgestelde vragen

Nee, hij hasht volledig geparseerde rijen. Voor uniekheid op één kolom moet u het CSV-bestand eerst met de CSV-kolomextractor tot die kolom beperken en daarna de deduplicator uitvoeren.

De eerste voorkomst in het bestand. Sorteer het CSV-bestand vooraf als u een specifieke kopie wilt behouden (de nieuwste record, het laagste ID, enzovoort).

Ja. De rijen worden verwerkt volgens standaard CSV-regels, waardoor "Jane, Smith" als één cel blijft en daarop gebaseerd wordt vergeleken.

Het CSV-bestand wordt naar onze server gestuurd om de deduplicatie te berekenen. Het wordt niet opgeslagen of gedeeld en wordt niet aan de paginalink toegevoegd.

Gerelateerde tools