Levenshtein Algorithmus

Was ist der Levenshtein-Algorithmus?

Der Levenshtein-Algorithmus berechnet die minimale Anzahl einzelner Zeichenoperationen, die nötig ist, um eine Zeichenfolge in eine andere umzuwandeln. Er zählt Einfügungen, Löschungen und Ersetzungen. Eine Distanz von 0 bedeutet identische Texte, während höhere Werte eine größere Abweichung anzeigen.

Grundidee des Levenshtein-Algorithmus

Der Levenshtein-Algorithmus misst die Ähnlichkeit zweier Zeichenfolgen anhand ihrer Levenshtein-Distanz, auf Deutsch auch Editierdistanz genannt. Entscheidend ist der kürzeste Bearbeitungsweg zwischen den Zeichenfolgen. Der Algorithmus bewertet dabei jedes eingefügte, gelöschte oder ersetzte Zeichen üblicherweise mit den Kosten 1.

Ein Beispiel: Zwischen SEO und SEA beträgt die Distanz 1, weil nur das letzte Zeichen ersetzt werden muss. Zwischen SEO und SEO beträgt sie 0. Die Distanz ist eine absolute Zahl und hängt deshalb von der Länge der verglichenen Begriffe ab.

  • Einfügen: Aus SEO wird durch ein zusätzliches Zeichen SEOs.
  • Löschen: Aus SEOs wird durch Entfernen des letzten Zeichens SEO.
  • Ersetzen: Aus SEO wird durch Austausch des letzten Zeichens SEA.

So funktioniert die Berechnung

Der Levenshtein-Algorithmus verwendet eine Matrix mit einer Zeile pro Zeichen der ersten Zeichenfolge und einer Spalte pro Zeichen der zweiten Zeichenfolge. Die erste Zeile und die erste Spalte enthalten fortlaufende Werte. Sie bilden den Aufwand ab, eine leere Zeichenfolge allein durch Einfügungen oder Löschungen aufzubauen.

Für jedes weitere Matrixfeld werden drei mögliche Wege verglichen:

  • Der Wert des oberen Feldes plus 1 steht für eine Löschung.
  • Der Wert des linken Feldes plus 1 steht für eine Einfügung.
  • Der diagonal vorherige Wert erhält einen Zuschlag von 0 bei gleichen Zeichen oder 1 bei unterschiedlichen Zeichen.

Der kleinste dieser drei Werte wird in das aktuelle Feld übernommen. Der Wert rechts unten enthält am Ende die Levenshtein-Distanz. Für Zeichenfolgen mit den Längen m und n benötigt die klassische Berechnung m × n Vergleiche. Die Zeitkomplexität beträgt daher O(m × n).

Für die Wörter Haus und Maus lautet das Ergebnis 1. Die minimale Bearbeitung besteht aus einer einzigen Ersetzung: Das Zeichen H wird durch M ersetzt. Zusätzliche Operationen wären möglich, würden aber nicht dem kürzesten Bearbeitungsweg entsprechen.

Distanz richtig einordnen

Eine Levenshtein-Distanz von 3 hat ohne Bezug zur Wortlänge nur begrenzte Aussagekraft. Drei Änderungen sind bei zwei Zeichenfolgen mit jeweils vier Zeichen erheblich, bei Texten mit jeweils 100 Zeichen dagegen gering. Für Vergleiche unterschiedlich langer Begriffe wird die Distanz deshalb häufig normalisiert.

Eine mögliche Ähnlichkeitsformel lautet: 1 minus Distanz geteilt durch die Länge der längeren Zeichenfolge. Multipliziert mit 100 ergibt sich ein Prozentwert. Bei SEO und SEA beträgt die Distanz 1 und die maximale Länge 3. Die normalisierte Ähnlichkeit liegt damit bei rund 66,7 Prozent.

Messbar ist die Zeichenähnlichkeit also über Distanz und Normalisierung. Ein allgemeingültiger Grenzwert existiert jedoch nicht. Prüfe Schwellenwerte immer an echten Begriffspaaren aus deinem Datenbestand. Bei kurzen Markenbezeichnungen kann eine Änderung bereits relevant sein, während längere Produktnamen mehrere Abweichungen vertragen.

Levenshtein-Algorithmus im SEO

Im SEO kann der Levenshtein-Algorithmus Schreibvarianten, Tippfehler und nahezu identische Keywords erkennen. Das erleichtert die Bereinigung großer Keywordlisten und ergänzt eine strukturierte SEO-Keyword-Recherche. Der Algorithmus kann beispielsweise Onlineshop und Onlineshp als ähnliche Zeichenfolgen markieren.

Für das Keyword-Clustering reicht die Levenshtein-Distanz allein nicht aus. Zwei Begriffe können fast gleich geschrieben sein und trotzdem verschiedene Bedeutungen haben. Umgekehrt können Auto und Fahrzeug dasselbe Thema bezeichnen, obwohl ihre Zeichenfolgen kaum übereinstimmen. Kombiniere Zeichenähnlichkeit deshalb mit Suchintention, SERP-Überschneidungen und semantischer Analyse.

  • Keywordlisten lassen sich um doppelte oder fehlerhafte Schreibweisen bereinigen.
  • Interne Suchanfragen können passenden Produkten oder Kategorien zugeordnet werden.
  • URL-, Title- und Produktdaten lassen sich auf auffällig ähnliche Varianten prüfen.
  • Marken- und Produktnamen können trotz einzelner Tippfehler erkannt werden.

Für eine erste Recherche nach Suchvolumen, Konkurrenz und Klickpreisen kannst du den kostenlosen Keyword-Planer verwenden. Die fachliche Entscheidung, ob zwei Keywords dieselbe Seite benötigen, bleibt von der Suchintention abhängig.

Nutzen für SEA und GEO

Im SEA kann der Levenshtein-Algorithmus ähnliche Suchbegriffe aus Suchanfrageberichten gruppieren. Dadurch lassen sich Tippfehler, Singular- und Pluralvarianten oder leicht abweichende Produktbezeichnungen schneller prüfen. Vor einer Zusammenführung muss jedoch kontrolliert werden, ob Conversion-Rate, Kosten und Nutzerabsicht vergleichbar sind.

Bei GEO (Generative Engine Optimization) kann die Zeichenähnlichkeit helfen, unterschiedliche Schreibweisen einer Marke oder eines Produkts in analysierten Quellen zu vereinheitlichen. Der Levenshtein-Algorithmus erkennt jedoch weder Empfehlungen noch den Kontext einer KI-Antwort. Für die Bewertung von ChatGPT, Perplexity, Gemini und Grok werden deshalb zusätzliche semantische und entitätsbasierte Verfahren benötigt.

Abgrenzung zu ähnlichen Verfahren

Verfahren Was wird verglichen? Wesentlicher Unterschied
Levenshtein-Distanz Zeichenfolgen beliebiger Länge Zählt Einfügungen, Löschungen und Ersetzungen.
Damerau-Levenshtein-Distanz Zeichenfolgen beliebiger Länge Berücksichtigt zusätzlich das Vertauschen benachbarter Zeichen.
Hamming-Distanz Zeichenfolgen gleicher Länge Zählt ausschließlich abweichende Zeichenpositionen.
Semantische Ähnlichkeit Bedeutung von Wörtern oder Texten Erfasst inhaltliche Nähe auch bei unterschiedlicher Schreibweise.

Der Unterschied zwischen dem Levenshtein-Algorithmus und der Damerau-Levenshtein-Variante wird bei typischen Vertippern sichtbar. Die Umwandlung von SEO in SOE benötigt nach dem klassischen Verfahren zwei Ersetzungen. Die Damerau-Variante kann den Tausch der benachbarten Zeichen E und O als eine Operation werten.

Typische Fehler bei der Anwendung

Der häufigste Fehler ist die Gleichsetzung von ähnlicher Schreibweise und gleicher Bedeutung. Der Levenshtein-Algorithmus bewertet ausschließlich Zeichenpositionen. Er weiß nicht, ob zwei Begriffe synonym sind, dieselbe Suchintention bedienen oder für dieselbe Landingpage geeignet sind.

  • Groß- und Kleinschreibung sollten vor dem Vergleich vereinheitlicht werden.
  • Leerzeichen, Bindestriche und Sonderzeichen benötigen festgelegte Regeln.
  • Umlaute dürfen nur normalisiert werden, wenn der Anwendungsfall dies erlaubt.
  • Schwellenwerte sollten nach Wortlänge und Datentyp getrennt getestet werden.

Eine saubere Vorverarbeitung entscheidet darüber, ob die Ergebnisse verwendbar sind. Bei Produktdaten kann das Entfernen von Artikelnummern sinnvoll sein. Bei Markenmonitoring können genau diese Zeichen relevant sein. Prüfe deshalb zuerst, welche Bestandteile eine Identität kennzeichnen, bevor du Texte normalisierst oder kürzt.

Häufige Fragen zum Levenshtein-Algorithmus

Kann der Levenshtein-Algorithmus ganze Texte vergleichen?

Ja, technisch lassen sich auch ganze Texte vergleichen. Mit zunehmender Textlänge steigen jedoch Rechenaufwand und Risiko irreführender Ergebnisse. Für längere Dokumente sind abschnittsweise oder semantische Vergleiche meist aussagekräftiger.

Beachtet der Algorithmus Groß- und Kleinschreibung?

Der Levenshtein-Algorithmus behandelt Groß- und Kleinbuchstaben als unterschiedliche Zeichen, sofern die Eingaben nicht vorher vereinheitlicht werden. Die gewünschte Behandlung muss deshalb vor der Berechnung festgelegt werden.

Welcher Schwellenwert gilt für ähnliche Wörter?

Es gibt keinen allgemeingültigen Schwellenwert. Der passende Grenzwert hängt von Wortlänge, Sprache und Anwendungsfall ab. Kurze Begriffe benötigen meist strengere Grenzen als lange Produktnamen.

Erkennt der Levenshtein-Algorithmus Synonyme?

Nein. Der Algorithmus vergleicht Zeichen und erkennt keine Wortbedeutungen. Synonyme wie 'Auto' und 'Fahrzeug' erfordern semantische Verfahren oder ein Wörterbuch.

Wie werden Leerzeichen und Sonderzeichen behandelt?

Leerzeichen und Sonderzeichen zählen grundsätzlich als normale Zeichen. Werden sie entfernt oder vereinheitlicht, verändert sich die berechnete Distanz. Die Vorverarbeitung muss daher für alle Datensätze gleich sein.

Eignet sich die Levenshtein-Distanz für Duplicate Content?

Die Levenshtein-Distanz kann nahezu identische kurze Texte erkennen. Für längere Seiten reicht sie allein nicht aus, weil Struktur, Wortreihenfolge und Bedeutung fehlen. Duplicate-Content-Prüfungen benötigen zusätzliche Verfahren.

Wenn du Keyworddaten, Schreibvarianten und technische Auffälligkeiten deiner Domain strukturiert auswerten möchtest, kannst du mit einem kostenlosen Account starten.

Free Account anlegen


Sie haben noch Fragen?

Kontaktieren Sie uns

SEO Agentur kostenlose SEO Potentialanalyse


Weitere Inhalte