Was ist TF-IDF / WDF*IDF?

Kurzantwort
TF-IDF und WDF*IDF gewichten Begriffe danach, wie häufig sie in einem Text und wie selten sie in einer Textsammlung vorkommen. Seltene, themenspezifische Wörter erhalten mehr Gewicht als allgemeine Begriffe. Für SEO wurden die Werte zur Wettbewerbsanalyse genutzt. Als Optimierungsziel sind sie heute überholt, weil moderne Suchsysteme Bedeutung und Zusammenhänge bewerten.
TF-IDF und WDF*IDF stammen aus der statistischen Textanalyse. Die Verfahren helfen dabei, charakteristische Begriffe eines Dokuments zu erkennen. Für deine Content-Arbeit bleibt der Grundgedanke nützlich: Prüfe, ob ein Text alle relevanten Teilfragen behandelt. Einen Zielwert für einzelne Wörter musst du dagegen nicht erreichen.
1. Was bedeutet TF-IDF?
TF-IDF steht für Term Frequency und Inverse Document Frequency. Vereinfacht beschreibt der Wert, wie wichtig ein Begriff für ein bestimmtes Dokument innerhalb einer größeren Textsammlung ist. Ein Begriff erhält einen hohen Wert, wenn er im untersuchten Dokument häufig vorkommt, in den übrigen Dokumenten aber vergleichsweise selten erscheint.
Die Berechnung besteht aus zwei Teilen:
Die vereinfachte Formel lautet:
TF-IDF = Term Frequency × Inverse Document Frequency
Ein Beispiel: Eine Textsammlung enthält 100 Dokumente. Der Begriff „Suchintention“ kommt nur in fünf davon vor. „Unternehmen“ erscheint dagegen in 80 Dokumenten. Obwohl beide Wörter in einem Text gleich oft stehen können, erhält „Suchintention“ den höheren IDF-Wert, weil der Begriff die Dokumente stärker voneinander unterscheidet.
1.1 Was ist IDF?
IDF misst die Seltenheit eines Begriffs innerhalb einer Dokumentensammlung. Eine verbreitete Grundformel lautet IDF = log(N / df). Dabei bezeichnet N die Gesamtzahl der Dokumente und df die Zahl der Dokumente, die den Begriff enthalten. Je seltener ein Wort im Korpus vorkommt, desto höher fällt sein IDF-Wert aus.
Allgemeine Wörter wie „und“, „Seite“ oder „machen“ besitzen kaum Unterscheidungskraft. Fachbegriffe wie „Canonical Tag“, „Keyword-Kannibalisierung“ oder „Suchintention“ können ein SEO-Dokument dagegen klarer charakterisieren. Stoppwörter werden bei vielen Implementierungen deshalb entfernt oder sehr niedrig gewichtet.
2. Was bedeutet WDF*IDF?
WDF*IDF verfolgt denselben Grundgedanken, verwendet innerhalb des Dokuments aber die Within Document Frequency. Die Häufigkeit eines Begriffs wird dabei normalisiert und häufig logarithmisch gedämpft. Ein Wort erhält dadurch nicht automatisch einen extrem hohen Wert, nur weil es sehr oft wiederholt wurde.
Für WDF gibt es keine einzige, verbindliche Berechnungsformel. Tools können unterschiedliche Normalisierungen, Wortstämme, Korpusgrößen und Filter einsetzen. Zwei Analyseprogramme können deshalb für denselben Text verschiedene Werte ausgeben, obwohl beide technisch korrekt rechnen.
| Verfahren | Was wird gemessen? | Typischer Einsatz |
|---|---|---|
| TF | Relative Häufigkeit eines Begriffs in einem Dokument | Einfache Textstatistik |
| IDF | Seltenheit eines Begriffs in einer Dokumentensammlung | Unterscheidung allgemeiner und spezifischer Wörter |
| TF-IDF | Kombination aus lokaler Häufigkeit und Seltenheit | Information Retrieval und Dokumentenvergleich |
| WDF*IDF | Normalisierte Begriffshäufigkeit im Verhältnis zum Korpus | Frühere SEO-Textanalysen und Wettbewerbervergleiche |
Der Wert hängt vom Vergleichskorpus ab
Ein WDF*IDF-Wert ist keine feste Eigenschaft eines Wortes. Er verändert sich, sobald andere Dokumente, Suchergebnisse oder Filter als Vergleichsbasis verwendet werden. Ein vermeintlich optimaler Wert gilt daher nur für die konkrete Analyse und nicht allgemein für das Keyword.
3. Wie nutzte SEO die Textstatistik?
SEO-Tools verglichen einen Entwurf mit Seiten, die für das gewünschte Keyword bereits gute Rankings hatten. Die Analyse zeigte Begriffe, die in diesen Wettbewerbertexten überdurchschnittlich häufig vorkamen. Ein Autor konnte daraus ableiten, welche Fachbegriffe oder Teilaspekte im eigenen Text möglicherweise fehlten.
Der sinnvolle Teil dieser Methode war nie das Erreichen einer grünen Kurve. Wertvoll war der Hinweis auf eine mögliche Inhaltslücke. Fehlen in einem Ratgeber über Wärmepumpen Begriffe wie Jahresarbeitszahl, Vorlauftemperatur und Heizlast, fehlen wahrscheinlich auch die dahinterstehenden Erklärungen.
Die Textanalyse der Performance Suite nutzt Wettbewerbsdaten deshalb als Recherchebasis. Sie stellt unter anderem rankende URLs, echte Nutzerfragen und verwandte Suchanfragen bereit. Das System kann außerdem eigene URLs erkennen, die bereits für ein Keyword ranken. Dadurch lässt sich prüfen, ob ein neuer Text eine Inhaltslücke schließt oder eine Keyword-Kannibalisierung erzeugt.

Ein solcher Vergleich ist nur belastbar, wenn die ausgewählten Seiten dieselbe Suchintention erfüllen. Vermischt eine Analyse Ratgeber, Kategorieseiten, Forenbeiträge und Produktseiten, entsteht ein statistischer Durchschnitt aus vier unterschiedlichen Seitentypen. Prüfe deshalb zuerst die SERP und den Zweck der rankenden Dokumente. Erst danach lohnt sich der Vergleich ihrer Inhalte.
4. Warum Kennzahlen Texte verschlechtern
Der Kipppunkt entsteht meist bei der redaktionellen Abnahme. Ein Text beantwortet eine wichtige Kundenfrage klar, das Analysewerkzeug meldet aber mehrere angeblich unterrepräsentierte Begriffe. Werden diese Wörter nachträglich in bestehende Sätze gedrückt, steigt der Score, während Verständlichkeit und Präzision sinken. Die Kennzahl misst dann Wortverteilung, nicht Informationsqualität.
Besonders problematisch sind starre Briefings mit langen Pflichtwortlisten. Ein Autor kann jeden Begriff formal unterbringen und trotzdem am Thema vorbeischreiben. Umgekehrt kann eine präzise Erklärung niedrige Werte erhalten, weil sie Synonyme, Beispiele oder verständlichere Formulierungen verwendet.
Behandle WDF*IDF nicht wie eine Ranking-Formel. Google veröffentlicht keine Zielwerte für einzelne Begriffe. Häufige Wiederholungen können einen Text sperrig machen und zu Keyword-Stuffing führen. Ein hoher Analysewert beweist weder Themenvollständigkeit noch eine gute Nutzererfahrung.
Moderne Suchsysteme verarbeiten nicht nur einzelne Wörter. Sie berücksichtigen Suchintentionen, Entitäten, Beziehungen zwischen Begriffen, die Struktur eines Dokuments und den Kontext einer Aussage. Auch für GEO, also Generative Engine Optimization, zählen verständliche und eigenständig zitierbare Antworten mehr als eine bestimmte Wortfrequenz.
Wenn du deine Inhalte und deren Themenabdeckung selbst prüfen möchtest, kannst du dafür einen kostenlosen Account verwenden:
5. Themenvollständigkeit statt Zielwert
Die bessere Entscheidung lautet: Prüfe Themen, Fragen und Zusammenhänge, nicht die Häufigkeit einzelner Wörter. Ein vollständiger Text enthält zentrale Fachbegriffe meist automatisch, weil sich die Sache ohne diese Begriffe kaum korrekt erklären lässt. Wer nur Wörter ergänzt, hat die Informationslücke dagegen häufig nicht geschlossen.
Für eine belastbare Inhaltsprüfung reichen fünf Schritte:
Die Reihenfolge ist wichtig. Beginnt die Arbeit mit einer Begriffsliste, entstehen häufig Absätze ohne klare Aussage. Beginnt sie mit Nutzerfragen, werden relevante Begriffe Teil einer echten Antwort. Die Performance Suite stellt dafür Keyword-Daten, Nutzerfragen und verwandte Suchanfragen bereit, die regelmäßig aktualisiert werden. Zusätzlich zeigt die Analyse die Top-100-Ergebnisse mit Informationen wie Textlänge, Keyworddichte, Linkpower und Ladezeiten.
5.1 Wann die Analyse noch nützt
TF-IDF oder WDF*IDF kann weiterhin als Hinweisgeber dienen. Bei technischen Themen fallen übersehene Fachbegriffe schneller auf. Auch bei sehr umfangreichen Textbeständen kann eine statistische Analyse Seiten markieren, die inhaltlich deutlich vom restlichen Themencluster abweichen.
Der Wert sollte jedoch eine Frage auslösen, keine automatische Änderung: „Fehlt hinter diesem Begriff ein wichtiger Sachverhalt?“ Lautet die Antwort ja, ergänze den Sachverhalt. Lautet sie nein, darfst du den Hinweis ignorieren. Diese Entscheidung kann kein Score übernehmen.
6. So gehen wir bei Content vor
Bei der OSG beginnt die Content-Optimierung mit Suchintention, Nutzerfragen und bestehenden Rankings. Danach vergleichen wir die inhaltliche Abdeckung mit passenden Wettbewerbsseiten und prüfen, welche Antworten wirklich fehlen. Das Content-Audit der Performance Suite verbindet dabei zwei Perspektiven: Welche URLs erzielen organischen Google-Traffic und welche Inhalte werden von KI-Systemen als Quellen verwendet?
Erst nach dieser Analyse folgt die redaktionelle Umsetzung. Das Team für SEO-Content-Erstellung ergänzt vollständige Erklärungen statt isolierter Pflichtbegriffe. Weitere Fachausdrücke kannst du im SEO-Lexikon nachschlagen.
7. Häufige Fragen zur Textgewichtung
Was bedeutet TF-IDF einfach erklärt?
TF-IDF zeigt, welche Wörter ein Dokument innerhalb einer Textsammlung besonders gut charakterisieren. Häufige Begriffe im einzelnen Dokument erhalten Gewicht, weitverbreitete Begriffe werden abgewertet.
Was ist IDF?
IDF steht für Inverse Document Frequency und misst, wie selten ein Begriff in einer Sammlung von Dokumenten vorkommt. Je weniger Dokumente den Begriff enthalten, desto höher ist sein IDF-Wert.
Was ist der Unterschied zwischen TF-IDF und WDF*IDF?
Beide Methoden verbinden die Häufigkeit eines Begriffs mit seiner Seltenheit im Vergleichskorpus. WDF*IDF normalisiert die Häufigkeit innerhalb des Dokuments meist stärker und dämpft häufige Wiederholungen.
Ist WDF*IDF noch wichtig für SEO?
WDF*IDF ist kein relevantes Optimierungsziel mehr. Die Analyse kann fehlende Fachbegriffe sichtbar machen, sollte aber nur als Recherchehinweis dienen. Suchintention, Themenabdeckung und verständliche Antworten sind wichtiger.
Welcher WDF*IDF-Wert ist optimal?
Es gibt keinen allgemein optimalen Wert. Das Ergebnis hängt vom Keyword, dem Vergleichskorpus, der Berechnungsformel und den untersuchten Wettbewerberseiten ab.
Kann eine TF-IDF-Analyse Keyword-Stuffing verursachen?
Ja, wenn Begriffe nur eingefügt werden, um Zielwerte zu erreichen. Wiederholungen ohne zusätzlichen Informationsgehalt verschlechtern die Lesbarkeit und machen aus einer Inhaltsanalyse eine reine Wortoptimierung.
Was ist die bessere Alternative zu WDF*IDF?
Prüfe Suchintention, Nutzerfragen, Unterthemen, Beispiele und Entscheidungskriterien. Ergänze eine fehlende Erklärung vollständig, statt lediglich den dazugehörigen Begriff häufiger einzubauen.
Nutze TF-IDF und WDF*IDF als historische Erklärung dafür, wie statistische Textanalyse funktioniert. Für deine tägliche Content-Arbeit ist eine andere Frage wertvoller: Welche Information fehlt dem Nutzer noch, damit er das Thema versteht oder eine sichere Entscheidung treffen kann?
Wenn du die Themenabdeckung deiner Website prüfen und konkrete Content-Lücken priorisieren möchtest, kannst du mit einem kostenlosen SEO-Audit starten.








Keine Kommentare vorhanden