Fuzzy lijstmatcher
Het afstemmen van een CRM-export op een spreadsheet met factuurklanten, of het matchen van leveranciersnamen uit twee verschillende ERP-systemen, loopt bijna altijd vast op kleine verschillen, bijvoorbeeld ‘Acme Corp.’, ‘ACME Corporation’ en ‘acme corp.’. Plak beide lijsten, stel een gelijkenisdrempel in en het hulpmiddel stelt voor elke vermelding in lijst A de beste kandidaat uit lijst B voor; vermeldingen die onder de drempel vallen, worden gemarkeerd voor handmatige controle.
Hoe je twee chaotische lijsten met elkaar kunt vergelijken
-
1
Plak lijst A
Eén vermelding per regel: klantnamen, productcodes en straatadressen.
-
2
Plak lijst B
De kandidatenpool. Verschillen in hoofdlettergebruik, spaties en typefouten zijn geen probleem.
-
3
Stel een drempel in
Het gelijkenispercentage waarboven een overeenkomst wordt geaccepteerd (70% is een verstandige standaardwaarde).
-
4
Lees het rapport
Elk A-item wordt gekoppeld aan de beste B-kandidaat en een vertrouwenscore. Items die onder de drempel liggen, worden gemarkeerd voor beoordeling.
Hoe gelijkenis wordt gemeten
Het hulpmiddel gebruikt PHP’s similar_text (een score voor de langste gemeenschappelijke deelreeks) en geeft het resultaat als percentage weer. Hoe hoger, hoe beter; een exacte overeenkomst is 100%.
| Drempel | Gedrag |
|---|---|
| ≥ 95% | Bijna identiek, alleen verschillen in hoofdlettergebruik of spaties |
| 80–94% | Typefouten, ontbrekende leestekens, afgekapte achtervoegsels |
| 60–79% | Wijzigingen in woordvolgorde, afkortingen versus volledige vormen |
| < 60% | Waarschijnlijk geen echte overeenkomst, controleer handmatig |
Tips
- Normaliseer eerst als je de gebruikelijke ruis kent: kleine letters, leestekens verwijderen, spaties samenvoegen. Je krijgt nauwkeurigere scores.
- Verwijder bedrijfsachtervoegsels (‘Inc’, ‘Ltd’, ‘GmbH’) als ze inconsistent in de ene lijst voorkomen maar niet in de andere.
- Splits lange adressen, ‘straat + plaats’ apart matchen werkt beter dan één samengevoegde regel matchen.
- Let op één-op-veel. Het hulpmiddel kiest de beste B-overeenkomst per A-vermelding; het voorkomt niet dat dezelfde B met meerdere A-rijen overeenkomt.
Wanneer je een strenger algoritme moet gebruiken
Bij omvangrijk ontdubbelingswerk presteren de Levenshtein-afstand of Jaro–Winkler beter dan similar_text, vooral bij namen waarbij de tekenpositie van belang is. Als vage matching de facturering of samenvoegingen aanstuurt, controleer dan 20 willekeurige paren steekproefsgewijs voordat je op grote schaal op de uitvoer vertrouwt.
Veelgestelde vragen
70% vangt de meeste legitieme overeenkomsten op en signaleert tegelijk echte missers. Verhoog naar 85% als lijst B schoon is en je je geen valse positieven kunt veroorloven; verlaag naar 55% als beide lijsten rommelig zijn en je van plan bent alles handmatig te controleren.
Ja, maar normaliseer eerst: verwijder spaties, streepjes en landcodevoorvoegsels, en zet e-mailadressen in kleine letters. Vage matching op ruwe waarden geeft lage scores voor structureel identieke vermeldingen.
Intern zet het hulpmiddel beide kanten in kleine letters voordat het vergelijkt, dus ‘Apple’ en ‘apple’ scoren allebei 100%.
Ja, de matching draait aan de serverkant, dus je twee lijsten worden naar het hulpmiddel gestuurd om vergeleken te worden. Ze worden voor dat ene verzoek in het geheugen verwerkt en worden daarna niet opgeslagen of gelogd.
Gerelateerde tools
ASCII-tabelreferentie
Volledige ASCII-tabel van 0 tot 127 met decimale, hexadecimale, octale en binaire waarden en HTML-numerieke referentienotatie, inclusief control codes zoals NUL, LF en DEL.
HTML-tekenreferentie
Een doorzoekbare lijst met HTML-entiteiten, hun benoemde en numerieke codes, plus kopiëren met één klik voor speciale tekens en symbolen.
Sneltoetsenoverzicht
Zoek gedocumenteerde standaardsneltoetsen voor VS Code, Chrome en Bash met GNU Readline op macOS, Windows en Linux.
E-mailvalidator
Valideer een e-mailadres: RFC 5322-syntaxcontrole, live MX-record-zoekopdracht, plus details over lokaal deel, domein en lengte. Er wordt geen e-mail verstuurd.
EditorConfig-generator
Genereer een .editorconfig-bestand met uw regels voor inspringstijl en -grootte, regeleinde, tekenset en witruimte voor consistente opmaak in alle IDE's en editors.
ASCII naar binair-converter
Converteer elke ASCII-string naar zijn binaire representatie. Elk teken wordt acht bits, gescheiden door spaties, klaar voor protocoltrace of huiswerk.
Tool beschikbaar in andere talen
- Correspondance de listes floues [FR]
- 퍼지 목록 매처 [KO]
- مطابق القوائم الضبابية [AR]
- Luddig listmatchare [SV]
- Fuzzy-Listenabgleich [DE]
- Comparador de Listas Difusas [ES]
- เครื่องจับคู่รายการแบบฟัซซี่ (Fuzzy List Matcher) [TH]
- Pembanding Daftar Fuzzy [ID]
- ファジーリストマッチャー [JA]
- Bộ so khớp danh sách mờ [VI]
- Rozmyte dopasowywanie list [PL]
- Correspondência de Lista Difusa [PT]
- Fuzzy List Matcher [EN]
- Corrispondente di Liste Fuzzy [IT]
- Метод сопоставления нечётких списков [RU]
- Bulanık Liste Eşleştirici [TR]
- 模糊列表匹配器 [ZH]