Getallen extraheren uit tekst

Plak een willekeurige rommelige bron, een factuur, een gescrapete productpagina, een chatlog of een CSV met opmerkingen, en krijg een schone lijst met elk getal dat erin staat. Gehele getallen, decimalen, negatieve getallen en bedragachtige cijfers worden in één regex-doorloop herkend. De uitvoer is ontdubbeld, één getal per regel, klaar om in een spreadsheet, rekenmachine of statistiektool te plakken.

Hoe je cijfers uit tekst haalt

  1. 1

    Plak de bron

    Voeg het tekstfragment toe, ongeacht hoe onleesbaar het is; de omringende woorden en interpunctie worden genegeerd.

  2. 2

    Kies de precisie

    Zet "Decimalen meenemen" aan om `3.14` te vangen, of schakel het uit om alleen gehele getallen zoals `42` te extraheren.

  3. 3

    Voer de extractor uit

    Elke match wordt opgeslagen, unieke waarden worden bewaard en u krijgt het aantal verschillende cijfers dat is gevonden.

  4. 4

    Kopieer de lijst

    Een nummer per regel, klaar om in Excel, Numbers of elk ander kolomgebaseerd hulpmiddel te plakken.

Wat de patroonherkenning herkent

De gebruikte regex is /-?\d+(?:\.\d+)?/ wanneer decimale getallen zijn ingeschakeld, en /-?\d+/ anders. Dit omvat de meest voorkomende numerieke vormen zonder dat er onduidelijkheden ontstaan door lokale instellingen.

Voorbeelden van opgevangen waarden

Invoer Gevonden (decimalen AAN)
Totaal: 1299.99 na btw 1299.99
Temperatuur daalde tot -4.5C -4.5
Versie 2.1.3 vandaag uitgebracht 2.1, 3
ID's: 001, 042, 1007 001, 042, 1007
Score: 87% geslaagd 87

Wat het niet probeert te behandelen

  • Duizendtalscheidingstekens. 1,234.56 wordt uitgehaald als 1 en 234.56. Verwijder eerst de scheidingstekens als u het volledige getal nodig hebt.
  • Europese decimale komma. 3,14 wordt gelezen als 3 en 14. Vervang de komma’s door punten voordat u extraheert.
  • Wetenschappelijke notatie. 6.02e23 levert 6.02 en 23 op. Verwerk de ruwe bron zelf als u de exponentvorm nodig hebt.
  • Breuken. 1/2 wordt 1 en 2, niet 0.5.

Nuttige vervolgstappen

  • Plaats de lijst in een statistiektool om het gemiddelde, de mediaan en de standaardafwijking te berekenen.
  • Sorteer en ontdubbel met sort | uniq om de unieke waarden in een logbestand te vinden.
  • Vergelijk twee extracties naast elkaar om ontbrekende posten op een factuur te vinden.

Veelgestelde vragen

Het negeert deze tekens en retourneert alleen de numerieke delen. $1,299.99 wordt bijvoorbeeld 1 of 299.99, omdat de komma niet als scheider voor duizendengetallen wordt gebruikt. Verwijder de komma’s uit de broncode als u 1299.99 als één geheel wilt hebben.

De regex vastlegt de cijfersreeks letterlijk, waardoor 007 blijft 007. Dit is belangrijk wanneer de cijfers in feite identificatienummers, onderdeelcodes of postcodes zijn en geen aritmetische waarden.

Standaard worden duplicaten verwijderd, zodat u een schone en duidelijke lijst krijgt. Als u de bronstream in zijn oorspronkelijke volgorde wilt behouden, kunt u deze vervangen door te gebruiken met een pipeline in het stijl van grep.

De tekst wordt verwerkt tijdens de verzoekstransactie en wordt niet opgeslagen na het ontvangen van de reactie; uw invoer blijft niet opgeslagen.

Gerelateerde tools

Tool beschikbaar in andere talen