Zum Inhalt springen
Allin

Text

29 Ratgeber zu text

Text zählen, vergleichen, säubern und umwandeln. Ratgeber darüber, was ein Zeichen, ein Wort und ein Byte für eine Maschine bedeuten — und warum die drei Zählungen desselben Absatzes selten übereinstimmen.

Hier anfangen

Sortiert danach, wie viele Seiten dieser Website auf sie verweisen — nicht nach Zugriffen.

  1. 1Zeilen nummerieren, damit mehrere Leute denselben Text prüfen könnenDie Nummerierung beginnt bei 1 und lässt sich nicht auf 0 setzen, ausgerichtet wird mit Leerzeichen statt Nullen, und das Entfernen macht acht der elf Trennzeichen rückgängig, ohne die Einrückung anzutasten. Was es weiterhin nicht kann: deine Zahlen von seinen unterscheiden.
  2. 2Die Sprache eines Textes erkennen — und warum kurze Texte scheiternGemessen, nicht behauptet: 90 kurze echte Wendungen in sechs Sprachen, keine abgelehnt und 68 richtig — 76 %, unter sechzehn Buchstaben nur noch 64 %. Vier der falschen Antworten kamen mit 100 % Sicherheit zurück.
  3. 3Zeilen nach einem Muster filtern — ohne KommandozeileDas ist grep für Menschen, die grep nicht benutzen — mit einem wichtigen Unterschied: Gesucht wird eine reine Teilzeichenkette, ein echter regulärer Ausdruck liefert also ein leeres Feld und keine Fehlermeldung. Jede Aussage hier wurde durch Ausführen des Werkzeugs geprüft.

Unsere Tools für diesen Bereich

Alle unsere text- & sprach-tools

Neueste Ratgeber

14. August 2026
13. August 2026
12. August 2026
Ratgeber · Text

Einen Anwendungs-Geheimschlüssel richtig erzeugen

Wie man einen soliden Geheimschlüssel-Generator von einem zweifelhaften unterscheidet, mit diesem als durchgerechnetem Beispiel: welche Zufallsquelle er aufruft, wie man die Entropie selbst berechnet und was am Tag des Schlüsselwechsels wirklich kaputtgeht.

Daniel Okonkwo · 12 Min.

Anleitung · Text

Zeilen nummerieren, damit mehrere Leute denselben Text prüfen können

Die Nummerierung beginnt bei 1 und lässt sich nicht auf 0 setzen, ausgerichtet wird mit Leerzeichen statt Nullen, und das Entfernen macht acht der elf Trennzeichen rückgängig, ohne die Einrückung anzutasten. Was es weiterhin nicht kann: deine Zahlen von seinen unterscheiden.

Daniel Okonkwo · 14 Min.

10. August 2026
Erklärung · Text

Satz- und Titelschreibweise: Die Regeln unterscheiden sich je nach Sprache

Die englische Titelschreibweise hat je nach Stilhandbuch drei verschiedene Grenzen. Französisch, Spanisch, Portugiesisch und Italienisch haben gar keine. Deutsch schreibt jedes Substantiv groß. Das Werkzeug weiß von all dem nichts — hier steht genau, was es tut.

Daniel Okonkwo · 12 Min.

Erklärung · Text

Alle E-Mail-Adressen oder URLs aus einem Textblock ziehen

Eine URL am Satzende behält den Punkt; eine E-Mail-Adresse am Ende desselben Satzes nicht. Ein akzentuierter Vorname in einer Adresse kommt abgeschnitten zurück. Jeder Fall hier lief durch die Werkzeuge, und die exakte Ausgabe steht dabei.

Daniel Okonkwo · 12 Min.

7. August 2026
Anleitung · Text

Zeilen nach einem Muster filtern — ohne Kommandozeile

Das ist grep für Menschen, die grep nicht benutzen — mit einem wichtigen Unterschied: Gesucht wird eine reine Teilzeichenkette, ein echter regulärer Ausdruck liefert also ein leeres Feld und keine Fehlermeldung. Jede Aussage hier wurde durch Ausführen des Werkzeugs geprüft.

Daniel Okonkwo · 10 Min.

Erklärung · Text

Duplikate in einer Liste finden — ohne Tabellenkalkulation

Zwei Zeilen, die identisch aussehen, sind es oft nicht. Groß- und Kleinschreibung, ein Leerzeichen am Ende, ein geschütztes Leerzeichen und zwei verschiedene Kodierungen desselben Akzentbuchstabens liefen je durch den Duplikatfinder — in drei von vier Fällen meldete er keine Duplikate.

Daniel Okonkwo · 10 Min.

6. August 2026
Ratgeber · Text

Eine aus Tabelle oder PDF eingefügte Liste bereinigen

Ein Einfügen bringt unsichtbare Zeichen mit: geschützte Leerzeichen, weiche Trennstriche, Nullbreiten-Leerzeichen, Tabs und CRLF. Vier Bereinigungswerkzeuge liefen über jedes davon — und sie verwenden drei verschiedene Definitionen von Leerraum.

Daniel Okonkwo · 11 Min.

14. Juli 2026
Ratgeber · Text

HTML sauber entfernen: was ein Tag-Entferner kann und was nicht

Tags entfernen und HTML bereinigen sind zwei verschiedene Aufgaben. Ein echtes Fragment durch eine naive Regex und durch einen formatbewussten Entferner geschickt, mit Script- und Style-Inhalten, Blockumbrüchen, Kommentaren, CDATA und der Reihenfolge der Entitäten als sichtbare Ausgabe.

Daniel Okonkwo · 13 Min.

9. Juli 2026
Erklärung · Text

Akzente entfernen zerstört die Suche — bis du es auf beiden Seiten tust

Diakritika zu falten ist ein Normalisierungsschritt, und Normalisierung wirkt nur, wenn dieselbe Funktion über Index und Suchanfrage läuft. NFC gegen NFD mit offengelegten Codepunkten und die Buchstaben — ø, ł, ß, œ, ı —, die den Faltvorgang unverändert überstehen.

Daniel Okonkwo · 14 Min.

8. Juli 2026
Anleitung · Text

Unsauberen Text bereinigen: die Reihenfolge der Schritte, auf die es ankommt

Tags entfernen, bevor Entitäten dekodiert werden, trimmen vor dem Deduplizieren, Leerraum zuletzt zusammenfassen. Drei Reihenfolgen in Node ausgeführt, eine neunstufige Pipeline in der richtigen Abfolge und die unsichtbaren Zeichen — U+00A0, U+200B, U+FEFF — die jede naive Bereinigung überleben.

Daniel Okonkwo · 14 Min.

3. Juli 2026
Vergleich · Text

camelCase, snake_case, kebab-case: welche - und warum du selten die Wahl hast

Die Konventionen sind keine Geschmacksfrage. Der Bindestrich ist der Minus-Operator, deshalb kann kebab-case in den meisten Sprachen kein Bezeichner sein - und genau darum nutzen CSS und URLs ihn. Dazu der Akronym-Rundtrip, der Namen stillschweigend zerstört, und die Regel, die ihn heilt.

Daniel Okonkwo · 11 Min.

1. Juli 2026
Ratgeber · Text

Zeichenlimits, die wirklich wehtun: Code-Einheiten, Codepunkte und Graphemcluster

Ein Zeichen ist gleich drei Dinge. Ein Emoji mit Hautton ist 1 Graphemcluster, 2 Codepunkte und 4 UTF-16-Einheiten. Alle Zählungen in diesem Leitfaden wurden in Node gemessen - dazu, warum eine SMS von 160 auf 70 fällt und warum VARCHAR(255) keine 255 von irgendetwas Bestimmtem sind.

Daniel Okonkwo · 10 Min.

30. Juni 2026
14. Mai 2026
6. Oktober 2025
Erklärung · Text

Wörter zu zählen ist mehrdeutig, und jedes Werkzeug antwortet anders

Eine Wortzahl ist eine Definition, keine Messung. Wir haben denselben Absatz auf vier Arten gezählt und 25, 28, 33 und 38 erhalten — dann 50.000 Zeichen gewöhnlicher Prosa gezählt und Übereinstimmung auf 4,5 % genau. Der Abstand rührt ausschließlich von Komposita, Zahlen und URLs her.

Daniel Okonkwo · 11 Min.

3. Oktober 2025
Ratgeber · Text

Zahlen für sechs Sprachen formatieren: Trennzeichen, Währung und der Weg zurück

1.234,56 und 1,234.56 sind dieselbe Zahl, und sie zu verwechseln ändert den Wert, den eine Leserin herausliest. Wir haben Intl.NumberFormat für alle sechs Sprachen der Website laufen lassen und jedes Trennzeichen ausgegeben — auch das unsichtbare, das das Französische verwendet — und dann gemessen, warum parseFloat davon nichts rückgängig machen kann.

Daniel Okonkwo · 12 Min.

29. September 2025
Erklärung · Text

Emoji sind schwerer, als sie aussehen: warum es für „einfach die Emoji entfernen“ keine Einzeiler-Antwort gibt

Ein sichtbares Emoji kann ein Codepunkt sein oder vierzehn UTF-16-Einheiten. Wir haben drei verbreitete reguläre Ausdrücke auf einen echten Satz losgelassen, und jeder ist anders gescheitert — einer löschte die Ziffern. Hier steht, warum, welche Unicode-Eigenschaft welche Frage beantwortet, und welche Graphemcluster-Regel wirklich funktioniert.

Daniel Okonkwo · 11 Min.

26. September 2025
2. Juli 2025
Ratgeber · Text

Markdown-Aufgabenlisten und was tatsächlich wo dargestellt wird

Aufgabenlisten stehen nicht in CommonMark. Sie sind eine Erweiterung von GitHub Flavored Markdown, weshalb dieselbe Datei hier Kontrollkästchen und dort wörtliche Klammern zeigt. Die genaue Markerregel, was Verschachtelung bewirkt, und eine Tabelle darüber, was CommonMark ist, was GFM und was keines von beidem — gegen beide Spezifikationen und vier Renderer geprüft.

Daniel Okonkwo · 10 Min.

1. Juli 2025
Erklärung · Text

Wo eine Zeile brechen darf: der Unicode-Algorithmus hinter jedem umbrochenen Absatz

„An Leerzeichen umbrechen“ scheitert in den meisten Schriftsystemen der Welt. UAX #14 gibt jedem Zeichen eine Zeilenumbruchklasse; wir haben unsere in Unicode 17.0.0 nachgeschlagen und eine konforme Implementierung über geschützte Leerzeichen, weiche Trennstriche, Nullbreiten-Leerzeichen, URLs, Japanisch und Thai laufen lassen.

Daniel Okonkwo · 12 Min.

30. Juni 2025
Ratgeber · Text

Zwischen Listenformaten konvertieren, ohne Daten zu verlieren: die Anführungsregeln, die niemand liest

Aus einer Liste mit Zeilenumbrüchen eine Kommaliste zu machen ist trivial, bis ein Eintrag ein Komma enthält. Die Anführungsregeln von RFC 4180, warum ein CSV-Feld einen Zeilenumbruch enthalten darf, warum europäische Tabellenkalkulationen das Semikolon verwenden und was ein leerer Eintrag mit dem Hin- und Rückweg macht — jeder Fall ausgeführt und abgedruckt.

Daniel Okonkwo · 12 Min.

26. Juni 2025
3. Juni 2025
Ratgeber · Text

Markdown entfernen: was der Klartext verliert und was eine Regex falsch macht

Ein Link wird zu Text, dessen Ziel gelöscht ist, eine verschachtelte Liste verliert ihre Hierarchie, eine Tabelle wird zu einer Reihe von Wörtern. Dann die technische Hälfte: Markdown hat keine einzige Spezifikation, und ein Regex-Entferner verstümmelt einen Dateinamen, ein Malzeichen und das Innere eines Codeblocks - alles gegen einen echten Parser gehalten.

Daniel Okonkwo · 11 Min.

2. Juni 2025
Erklärung · Text

Was ein Palindrom-Prüfer entscheiden muss, bevor er antworten kann

Groß- und Kleinschreibung, Leerraum, Satzzeichen und diakritische Zeichen: vier Regeln, sechs echte Sätze, und mit jeder ändert sich die Antwort. Dann die schwerere Hälfte - eine Zeichenkette umzukehren ist selbst nicht definiert, und die Umkehrung nach Codeeinheiten zerstört Emoji und löst Akzente ab, in Node vorgeführt.

Daniel Okonkwo · 11 Min.

30. Mai 2025
Ratgeber · Text

Suchen und Ersetzen: die Regex-Fallen, eine nach der anderen vorgeführt

Gierig gegen genügsam an derselben Zeichenkette, der Punkt, der Zeilenumbrüche überspringt, $& und $$ in der Ersetzung, eine wiederverwendete /g-Regex, die stillschweigend eine Zeile auslässt, und warum /i vom türkischen i nichts weiß. Jeder Fehlschlag in Node ausgeführt, mit einer Zähl-dann-Ersetze-Routine, die sie einfängt.

Daniel Okonkwo · 13 Min.

29. Mai 2025