Tekstgelijkenis controleren

Volgende

Twee supporttickets die identiek klinken, een blogpost die op die van een concurrent lijkt, of twee productbeschrijvingen die gekopieerd lijken: je gevoel zegt dat ze overlappen, maar je wilt een getal. Deze controle vergelijkt twee teksten en geeft twee scores: woordoverlap, het aandeel unieke woorden dat de twee teksten gemeen hebben, en tekengelijkenis, hoe goed de ruwe tekens op elkaar aansluiten. Samen laten ze zien of de teksten vocabulaire, formulering of allebei delen.

Hoe de gelijkenis wordt gemeten

  1. 1

    Plak beide teksten

    Van elke lengte, van een zin tot een heel artikel.

  2. 2

    Woordoverlap

    Elke tekst wordt in kleine letters gezet en in unieke woorden gesplitst. De Jaccard-score is het aantal gedeelde woorden gedeeld door het totale aantal verschillende woorden.

  3. 3

    Tekengelijkenis

    Het hulpmiddel vergelijkt ook de ruwe tekenreeksen en meldt het percentage tekens dat overeenkomt.

  4. 4

    Lees beide scores

    Hoge woordoverlap met lagere tekengelijkenis betekent dezelfde woorden in een andere volgorde. Hoge tekengelijkenis betekent bijna identieke teksten, letter voor letter.

Wat elke score zegt

Score Bereik Meet Blinde vlek
Woordoverlap (Jaccard) 0-100% Het aandeel unieke woorden dat beide teksten delen Negeert woordvolgorde en hoe vaak een woord voorkomt
Tekengelijkenis 0-100% Hoe goed de ruwe tekenreeks overeenkomt Gevoelig voor lengte en kleine wijzigingen
  • Woordoverlap bij 100% betekent dat de twee teksten bijna dezelfde set woorden gebruiken.
  • Tekengelijkenis bij 100% betekent dat de teksten teken voor teken bijna identiek zijn.
  • Een groot verschil (hoge woordoverlap, lagere tekengelijkenis) wijst op hetzelfde vocabulaire, anders gerangschikt.

Uitgewerkt voorbeeld

The quick brown fox vergeleken met The quick red fox:

  • Woordoverlap: 60.00% (ze delen the, quick en fox van vijf verschillende woorden)
  • Tekengelijkenis: 83.33% (alleen brown tegenover red verschilt)

De twee getallen samen vertellen het verhaal: bijna dezelfde woorden en op één woord na bijna dezelfde tekens.

Wat het niet doet

Dit is een oppervlakkige tekenreeksvergelijking, geen plagiaat- of betekeniscontrole:

  • Het vergelijkt woorden en tekens, dus twee passages die hetzelfde zeggen met andere woorden scoren laag.
  • Het heeft geen database van gepubliceerd werk en kan dus niet zeggen of tekst ergens anders vandaan is gekopieerd.
  • Vergelijken op betekenis (semantisch) vereist een embeddingmodel, dat dit hulpmiddel niet gebruikt.

Gebruik de scores als een snel signaal voor bijna-duplicaten, niet als een oordeel.

Tips voor voorbewerking

  • Verwijder standaardtekst (handtekeningen, kop- en voetteksten) voordat je vergelijkt; die blazen beide scores kunstmatig op.
  • Normaliseer witruimte en losse leestekens zodat opmaakverschillen de echte inhoudsovereenkomsten niet overstemmen.
  • Let op lengteverschillen: sterk verschillende lengtes verlagen de tekengelijkenis, zelfs als de kortere tekst in de langere zit, vergelijk dus vergelijkbare stukken.

Veelgestelde vragen

Alleen als grof signaal. Het meet de woordoverlap en tekengelijkenis tussen de twee teksten die je plakt; het heeft geen database van bestaand werk en kan geen kopie uit een onbekende bron detecteren. Een hoge score markeert bijna-duplicaten die een nadere blik verdienen, meer niet.

Niet echt. Houdt een herschrijving de meeste woorden aan, dan blijft de woordoverlap hoog. Maar vervangt die door synoniemen, dan dalen beide scores, want het hulpmiddel vergelijkt woorden en tekens, geen betekenis. Echte parafrase herkennen vereist een semantisch (embedding)model.

Beide scores kunnen lange teksten aan, maar de vergelijking van tekengelijkenis wordt trager naarmate de teksten groeien, dus houd elke tekst op enkele duizenden tekens voor een snel resultaat.

Je twee teksten worden naar onze server gestuurd om vergeleken te worden en worden niet opgeslagen. De vergelijking is een eenvoudige woord- en tekenmatch, zonder betrokken derden.

Gerelateerde tools

Tool beschikbaar in andere talen