Regressionsanalyse

Was ist eine Regressionsanalyse?

Die Regressionsanalyse ist ein statistisches Verfahren, das den Zusammenhang zwischen einer Zielgröße und einer oder mehreren Einflussgrößen beschreibt. Sie schätzt eine mathematische Funktion, etwa y = a + bx, und zeigt, wie stark sich der erwartete Zielwert verändert, wenn sich ein Einflussfaktor ändert. Eine Regression belegt allein keine Kausalität.

Die Regressionsanalyse, englisch regression analysis, übersetzt beobachtete Daten in ein mathematisches Modell. Im Online-Marketing kann die Zielgröße beispielsweise der Umsatz, die Conversion-Rate, der organische Traffic oder die Zahl der Leads sein. Als Einflussgrößen kommen unter anderem Werbeausgaben, Rankings, Preise, Ladezeiten oder saisonale Effekte infrage.

Wie funktioniert die Regressionsanalyse?

Eine Regressionsanalyse sucht eine Funktion, deren vorhergesagte Werte möglichst nah an den beobachteten Daten liegen. Bei einer einfachen linearen Regression wird eine Gerade durch die Datenpunkte gelegt. Ihre Grundform lautet y = a + bx. Dabei ist y die geschätzte Zielgröße, a der Achsenabschnitt, b der Regressionskoeffizient und x die Einflussgröße.

Der Regressionskoeffizient b gibt an, um wie viele Einheiten sich der erwartete Zielwert verändert, wenn die Einflussgröße um eine Einheit steigt. Lautet ein beispielhaftes Modell Conversions = 40 + 0,08 × Klicks, werden bei 1.000 zusätzlichen Klicks rechnerisch 80 zusätzliche Conversions erwartet. Das Modell beschreibt einen durchschnittlichen Zusammenhang innerhalb der untersuchten Daten und keine sichere Wirkung für jeden Einzelfall.

Bei der linearen Regression werden die Modellparameter üblicherweise so geschätzt, dass die Summe der quadrierten Residuen möglichst klein wird. Ein Residuum ist die Differenz zwischen einem beobachteten Wert und dem vom Modell vorhergesagten Wert. Große Residuen zeigen Datenpunkte, die das Modell nur unzureichend erklärt.

Welche Regressionsarten gibt es?

Die passende Form der Regressionsanalyse richtet sich nach der Zielgröße, der Anzahl der Einflussfaktoren und dem erwarteten Verlauf des Zusammenhangs. Eine lineare Regression eignet sich für eine metrische Zielgröße wie Umsatz oder Sitzungsdauer. Eine logistische Regression wird verwendet, wenn das Ergebnis nur zwei Zustände hat, etwa Kauf oder kein Kauf.

VerfahrenTypischer EinsatzBeispiel im Marketing
Einfache lineare RegressionEine metrische Einflussgröße und eine metrische ZielgrößeZusammenhang zwischen Klicks und Umsatz
Multiple lineare RegressionMehrere Einflussgrößen und eine metrische ZielgrößeUmsatz in Abhängigkeit von Klicks, Preis und Saison
Logistische RegressionBinäre ZielgrößeWahrscheinlichkeit eines Kaufs
Polynomiale RegressionGekrümmter ZusammenhangAbnehmender Zusatzertrag bei steigendem Werbebudget

Eine multiple Regressionsanalyse kann den Zusammenhang mehrerer Faktoren mit derselben Zielgröße getrennt schätzen. Das ist für Marketingdaten oft sinnvoll, weil Umsatz oder Traffic selten von einer einzelnen Variable abhängen. Das Modell kann beispielsweise Werbeausgaben, Wochentag, Preisaktionen und Markenbekanntheit gleichzeitig berücksichtigen, sofern genügend geeignete Beobachtungen vorliegen.

Regressionsanalyse richtig interpretieren

Koeffizienten zeigen Richtung und Stärke

Ein positiver Regressionskoeffizient beschreibt einen gleichgerichteten Zusammenhang: Steigt die Einflussgröße, steigt im Modell auch der erwartete Zielwert. Ein negativer Koeffizient beschreibt einen gegenläufigen Zusammenhang. Die Größe eines Koeffizienten ist nur zusammen mit seiner Maßeinheit interpretierbar. Ein Wert von 0,5 kann je nach Variable 0,5 Euro, 0,5 Prozentpunkte oder 0,5 zusätzliche Leads bedeuten.

R Quadrat bewertet die Modellanpassung

Das Bestimmtheitsmaß R² zeigt, welcher Anteil der beobachteten Streuung der Zielgröße durch das Modell erklärt wird. Ein R² von 0,70 bedeutet, dass die aufgenommenen Einflussgrößen 70 Prozent der Streuung in den untersuchten Daten abbilden. Der Wert beweist weder Kausalität noch Prognosequalität. Ein hohes R² kann durch Überanpassung entstehen, während ein niedrigerer Wert bei stark schwankendem Nutzerverhalten trotzdem verwertbare Hinweise liefern kann.

Das korrigierte R² berücksichtigt zusätzlich die Zahl der Einflussgrößen. Diese Variante eignet sich besser für den Vergleich multipler Modelle, weil ein gewöhnliches R² durch das Hinzufügen weiterer Variablen nicht sinkt. Prüfe bei mehreren Modellen deshalb, ob zusätzliche Faktoren auch das korrigierte R² verbessern und fachlich begründbar sind.

Signifikanz ersetzt keine Relevanz

Ein statistisch signifikanter Koeffizient deutet darauf hin, dass der geschätzte Zusammenhang unter den Modellannahmen nicht leicht durch Zufall erklärbar ist. Der häufig verwendete Schwellenwert von 0,05 für den p-Wert ist jedoch keine Naturgrenze. Bei großen Datensätzen können minimale Effekte signifikant werden, obwohl sie wirtschaftlich kaum ins Gewicht fallen. Vergleiche deshalb zusätzlich Effektgröße, Konfidenzintervall und erwarteten finanziellen Nutzen.

Voraussetzungen für belastbare Ergebnisse

Eine lineare Regressionsanalyse setzt voraus, dass das gewählte Modell zur Struktur der Daten passt. Zu den zentralen Prüfpunkten gehören ein annähernd linearer Zusammenhang, voneinander unabhängige Beobachtungen, eine möglichst konstante Streuung der Residuen und keine starke Abhängigkeit zwischen den Einflussgrößen.

  • Linearität: Der erwartete Zielwert muss sich durch die gewählte Funktionsform sinnvoll darstellen lassen.
  • Unabhängigkeit: Beobachtungen aus aufeinanderfolgenden Tagen oder Kampagnen dürfen nicht ungeprüft als unabhängig gelten.
  • Homoskedastizität: Die Streuung der Residuen sollte über den Wertebereich hinweg annähernd konstant bleiben.
  • Multikollinearität: Stark miteinander verbundene Einflussgrößen erschweren die getrennte Interpretation ihrer Koeffizienten.
  • Ausreißerprüfung: Einzelne ungewöhnliche Beobachtungen können die geschätzte Regressionsgerade deutlich verschieben.
Eine Regressionsanalyse liefert irreführende Ergebnisse, wenn Zeittrends, Saisonalität oder gemeinsame Drittvariablen fehlen. Steigen beispielsweise Suchvolumen und Umsatz gleichzeitig vor Weihnachten, belegt das Modell nicht, dass allein das Suchvolumen den Umsatz verursacht. Nimm bekannte Einflussfaktoren in das Modell auf und kontrolliere die Residuen auf systematische Muster.

Regression, Korrelation und Kausalität

Der Unterschied zwischen Korrelation und Regressionsanalyse liegt im Analyseziel. Eine Korrelation beschreibt Stärke und Richtung eines statistischen Zusammenhangs zwischen zwei Variablen. Eine Regressionsanalyse legt eine Zielgröße fest und schätzt, wie diese Zielgröße mit einer oder mehreren Einflussgrößen zusammenhängt. Bei der einfachen linearen Regression kann das Ergebnis von der gewählten Richtung abhängen.

Der Unterschied zwischen Regressionsanalyse und Kausalitätsanalyse liegt in der möglichen Aussage. Eine Regression beschreibt zunächst beobachtete Zusammenhänge. Für eine kausale Aussage muss zusätzlich ausgeschlossen werden, dass unbeobachtete Faktoren, umgekehrte Wirkungsrichtungen oder eine verzerrte Auswahl der Daten das Ergebnis erklären. Kontrollierte Experimente und sauber geplante A/B-Tests liefern dafür meist eine belastbarere Grundlage als rein beobachtete Daten.

Regressionsanalyse in SEO und SEA

Im SEO kann eine Regressionsanalyse untersuchen, wie Rankings, CTR, indexierte Seiten oder technische Kennzahlen mit organischem Traffic zusammenhängen. Die Auswahl der Variablen beginnt mit einer strukturierten Keyword-Recherche und einer zeitlich konsistenten Datengrundlage. Tageswerte vor und nach einem Google-Update dürfen beispielsweise nicht ohne Kontrollvariablen zu einer einzigen Wirkungskette verbunden werden.

Im SEA kann eine Regressionsanalyse den Zusammenhang zwischen Budget, Klickpreis, Impressionen, Conversion-Rate und Umsatz modellieren. Ein lineares Modell ist ungeeignet, wenn zusätzliche Ausgaben ab einem bestimmten Budget nur noch geringe Mehrerträge liefern. In diesem Fall sollte die Funktionsform Sättigungseffekte abbilden oder das Budget in geeignete Bereiche unterteilt werden.

Für gemeinsame Auswertungen von SEO und SEA kann eine Regressionsanalyse Überschneidungen sichtbar machen. Markenbekanntheit, Nachfrage und Saison beeinflussen häufig beide Kanäle. Wer bezahlte und organische Daten getrennt modelliert, kann denselben Nachfrageeffekt versehentlich zweimal als Kanalleistung interpretieren. Eine strukturierte Analyse der SEO- und SEA-Synergien verbessert deshalb die Auswahl der Variablen.

Regressionsmodelle prüfen und anwenden

Messbar ist die Qualität einer Regressionsanalyse zum Beispiel über R², korrigiertes R², die Größe der Residuen und die Prognosefehler bei bisher ungenutzten Daten. Teile den Datensatz dafür in Trainingsdaten zur Schätzung und Testdaten zur Prüfung. Ein Modell, das nur die Trainingsdaten gut erklärt, aber bei neuen Daten deutlich abweicht, ist überangepasst.

Eine belastbare Auswertung beginnt mit einer klaren Zielvariable und einer fachlichen Hypothese. Anschließend werden Datenquellen, Zeitraum, Granularität und mögliche Störfaktoren festgelegt. Eine strukturierte SEO-Analyse verhindert, dass Kennzahlen unterschiedlicher Ebenen ungeprüft vermischt werden, etwa tägliche Rankings mit monatlichen Umsätzen.

  • Formuliere zuerst die konkrete Frage und lege die Zielgröße fest.
  • Prüfe Daten auf fehlende Werte, Ausreißer und unterschiedliche Zeitintervalle.
  • Wähle die Regressionsart anhand der Zielgröße und des erwarteten Verlaufs.
  • Kontrolliere Koeffizienten, Residuen, R² und Prognosefehler gemeinsam.
  • Übersetze den geschätzten Effekt in eine wirtschaftlich verständliche Kennzahl.

Eine kurze Beobachtung aus Marketingprojekten: Modelle werden häufig genauer, sobald Kalenderdaten und Markenanfragen berücksichtigt werden. Der Grund ist nachvollziehbar. Feiertage, Kampagnen und bestehende Nachfrage beeinflussen Traffic und Umsatz gleichzeitig. Prüfe solche Variablen vor jeder Interpretation, damit das Modell keine saisonale Bewegung einem einzelnen Kanal zuschreibt.

Häufige Fragen zur Regressionsanalyse

Wofür braucht man eine Regressionsanalyse?

Eine Regressionsanalyse wird verwendet, um Zusammenhänge zwischen einer Zielgröße und möglichen Einflussfaktoren zu beschreiben, Effekte zu schätzen oder Prognosen zu erstellen. Typische Anwendungen sind Umsatzprognosen, Budgetanalysen und die Untersuchung von Conversion-Einflussfaktoren.

Wie viele Daten braucht eine Regressionsanalyse?

Eine feste Mindestzahl gilt nicht für jedes Modell. Der Datenbedarf steigt mit der Zahl der Einflussgrößen, der Streuung der Werte und der gewünschten Genauigkeit. Wenige Beobachtungen bei vielen Variablen führen zu instabilen Koeffizienten und erschweren die Prüfung mit separaten Testdaten.

Kann eine Regressionsanalyse die Zukunft vorhersagen?

Eine Regressionsanalyse kann erwartete Werte unter definierten Bedingungen schätzen. Die Prognose bleibt nur belastbar, wenn neue Daten einer ähnlichen Struktur folgen wie die Daten zur Modellbildung. Marktveränderungen, Kampagnen oder technische Eingriffe können die Vorhersagekraft reduzieren.

Was bedeutet ein negatives R Quadrat?

Ein gewöhnliches R Quadrat mit Achsenabschnitt liegt bei der Auswertung derselben Trainingsdaten normalerweise zwischen null und eins. Negative Werte können bei Testdaten, speziellen Modellvarianten oder einer Berechnung ohne Achsenabschnitt auftreten. Das Modell schätzt dann schlechter als eine einfache Vorhersage mit dem Mittelwert.

Sind Ausreißer bei einer Regression immer zu löschen?

Ausreißer sollten nicht automatisch entfernt werden. Zuerst ist zu prüfen, ob ein Messfehler, ein ungewöhnliches reales Ereignis oder eine eigene Datengruppe vorliegt. Das Ergebnis sollte zusätzlich mit und ohne den betreffenden Wert verglichen und die Entscheidung dokumentiert werden.

Kann man Prozentwerte mit einer Regression untersuchen?

Prozentwerte können analysiert werden, ihre Grenzen zwischen null und hundert müssen jedoch berücksichtigt werden. Eine lineare Regression kann Werte außerhalb dieses Bereichs schätzen. Abhängig von Zielgröße und Datenstruktur können logistische oder andere verallgemeinerte Regressionsmodelle geeigneter sein.

Wenn du Zusammenhänge zwischen SEO-, SEA- und Geschäftsdaten belastbar bewerten möchtest, kann ein datenbasiertes Marketing-Consulting die Modellauswahl und Interpretation fachlich absichern.

Kostenlosen Potenzialcheck anfragen


Sie haben noch Fragen?

Kontaktieren Sie uns

SEO Agentur kostenlose SEO Potentialanalyse


Weitere Inhalte