Tekstgelijkenis controleren
Twee supporttickets die identiek klinken, een blogpost die op die van een concurrent lijkt, of twee productbeschrijvingen die gekopieerd lijken: je gevoel zegt dat ze overlappen, maar je wilt een getal. Deze controle vergelijkt twee teksten en geeft twee scores: woordoverlap, het aandeel unieke woorden dat de twee teksten gemeen hebben, en tekengelijkenis, hoe goed de ruwe tekens op elkaar aansluiten. Samen laten ze zien of de teksten vocabulaire, formulering of allebei delen.
Hoe de gelijkenis wordt gemeten
-
1
Plak beide teksten
Van elke lengte, van een zin tot een heel artikel.
-
2
Woordoverlap
Elke tekst wordt in kleine letters gezet en in unieke woorden gesplitst. De Jaccard-score is het aantal gedeelde woorden gedeeld door het totale aantal verschillende woorden.
-
3
Tekengelijkenis
Het hulpmiddel vergelijkt ook de ruwe tekenreeksen en meldt het percentage tekens dat overeenkomt.
-
4
Lees beide scores
Hoge woordoverlap met lagere tekengelijkenis betekent dezelfde woorden in een andere volgorde. Hoge tekengelijkenis betekent bijna identieke teksten, letter voor letter.
Wat elke score zegt
| Score | Bereik | Meet | Blinde vlek |
|---|---|---|---|
| Woordoverlap (Jaccard) | 0-100% | Het aandeel unieke woorden dat beide teksten delen | Negeert woordvolgorde en hoe vaak een woord voorkomt |
| Tekengelijkenis | 0-100% | Hoe goed de ruwe tekenreeks overeenkomt | Gevoelig voor lengte en kleine wijzigingen |
- Woordoverlap bij 100% betekent dat de twee teksten bijna dezelfde set woorden gebruiken.
- Tekengelijkenis bij 100% betekent dat de teksten teken voor teken bijna identiek zijn.
- Een groot verschil (hoge woordoverlap, lagere tekengelijkenis) wijst op hetzelfde vocabulaire, anders gerangschikt.
Uitgewerkt voorbeeld
The quick brown fox vergeleken met The quick red fox:
- Woordoverlap: 60.00% (ze delen the, quick en fox van vijf verschillende woorden)
- Tekengelijkenis: 83.33% (alleen brown tegenover red verschilt)
De twee getallen samen vertellen het verhaal: bijna dezelfde woorden en op één woord na bijna dezelfde tekens.
Wat het niet doet
Dit is een oppervlakkige tekenreeksvergelijking, geen plagiaat- of betekeniscontrole:
- Het vergelijkt woorden en tekens, dus twee passages die hetzelfde zeggen met andere woorden scoren laag.
- Het heeft geen database van gepubliceerd werk en kan dus niet zeggen of tekst ergens anders vandaan is gekopieerd.
- Vergelijken op betekenis (semantisch) vereist een embeddingmodel, dat dit hulpmiddel niet gebruikt.
Gebruik de scores als een snel signaal voor bijna-duplicaten, niet als een oordeel.
Tips voor voorbewerking
- Verwijder standaardtekst (handtekeningen, kop- en voetteksten) voordat je vergelijkt; die blazen beide scores kunstmatig op.
- Normaliseer witruimte en losse leestekens zodat opmaakverschillen de echte inhoudsovereenkomsten niet overstemmen.
- Let op lengteverschillen: sterk verschillende lengtes verlagen de tekengelijkenis, zelfs als de kortere tekst in de langere zit, vergelijk dus vergelijkbare stukken.
Veelgestelde vragen
Alleen als grof signaal. Het meet de woordoverlap en tekengelijkenis tussen de twee teksten die je plakt; het heeft geen database van bestaand werk en kan geen kopie uit een onbekende bron detecteren. Een hoge score markeert bijna-duplicaten die een nadere blik verdienen, meer niet.
Niet echt. Houdt een herschrijving de meeste woorden aan, dan blijft de woordoverlap hoog. Maar vervangt die door synoniemen, dan dalen beide scores, want het hulpmiddel vergelijkt woorden en tekens, geen betekenis. Echte parafrase herkennen vereist een semantisch (embedding)model.
Beide scores kunnen lange teksten aan, maar de vergelijking van tekengelijkenis wordt trager naarmate de teksten groeien, dus houd elke tekst op enkele duizenden tekens voor een snel resultaat.
Je twee teksten worden naar onze server gestuurd om vergeleken te worden en worden niet opgeslagen. De vergelijking is een eenvoudige woord- en tekenmatch, zonder betrokken derden.
Gerelateerde tools
Naslagwerk voor correctietekens
Bekijk 14 traditionele Engelse proefleesconventies, gegroepeerd per functie en uitgelegd met eenvoudige tekstvoorbeelden.
Woordhusselaar
Hussel de letters van elk woord en laat de eerste en laatste letter staan. Handig voor puzzels, taalspelletjes en leesoefeningen.
Spelling Bee-generator
Genereer een geschudde Engelse spellingslijst per niveau, van groep 3 tot een moeilijke Bee-ronde. Gratis ingebouwde woordenlijsten om te oefenen.
Truth or Dare-generator
Trek willekeurige waarheidsvragen en opdrachten uit een verzorgde, gezinsvriendelijke set: 15 vragen en 15 opdrachten, in het Engels. Gemengd of apart, tot 20 per beurt.
Clichédetector
Plak het schrijven en de detector vergelijkt het met een lijst van veelvoorkomende Engelse clichés en meldt hoe vaak elke zin voorkomt.
Engels naar Pig Latin
Vertaal Engels naar Pig Latin en terug. Gebruikt de klassieke beweging van consonantengroepen in combinatie met de -ay-suffiksregel.
Tool beschikbaar in andere talen
- Verificador de similaridade de textos [PT]
- テキスト類似度チェッカー [JA]
- Kontroll av textlikhet [SV]
- Trình kiểm tra độ tương đồng văn bản [VI]
- مدقق تشابه النصوص [AR]
- Textähnlichkeit prüfen [DE]
- Comprobador de similitud de textos [ES]
- Vérificateur de similarité de textes [FR]
- เครื่องมือตรวจความคล้ายของข้อความ [TH]
- 텍스트 유사도 검사기 [KO]
- Pemeriksa kemiripan teks [ID]
- Sprawdzanie podobieństwa tekstów [PL]
- Text Similarity Checker [EN]
- Verifica similarità testi [IT]
- Проверка схожести текстов [RU]
- Metin benzerliği denetleyici [TR]
- 文本相似度检查器 [ZH]