Regressionsanalyse
Was ist eine Regressionsanalyse?
Die Regressionsanalyse ist ein statistisches Verfahren, das den Zusammenhang zwischen einer Zielgröße und einer oder mehreren Einflussgrößen beschreibt. Sie schätzt eine mathematische Funktion, etwa y = a + bx, und zeigt, wie stark sich der erwartete Zielwert verändert, wenn sich ein Einflussfaktor ändert. Eine Regression belegt allein keine Kausalität.
Die Regressionsanalyse, englisch regression analysis, übersetzt beobachtete Daten in ein mathematisches Modell. Im Online-Marketing kann die Zielgröße beispielsweise der Umsatz, die Conversion-Rate, der organische Traffic oder die Zahl der Leads sein. Als Einflussgrößen kommen unter anderem Werbeausgaben, Rankings, Preise, Ladezeiten oder saisonale Effekte infrage.
Wie funktioniert die Regressionsanalyse?
Eine Regressionsanalyse sucht eine Funktion, deren vorhergesagte Werte möglichst nah an den beobachteten Daten liegen. Bei einer einfachen linearen Regression wird eine Gerade durch die Datenpunkte gelegt. Ihre Grundform lautet y = a + bx. Dabei ist y die geschätzte Zielgröße, a der Achsenabschnitt, b der Regressionskoeffizient und x die Einflussgröße.
Der Regressionskoeffizient b gibt an, um wie viele Einheiten sich der erwartete Zielwert verändert, wenn die Einflussgröße um eine Einheit steigt. Lautet ein beispielhaftes Modell Conversions = 40 + 0,08 × Klicks, werden bei 1.000 zusätzlichen Klicks rechnerisch 80 zusätzliche Conversions erwartet. Das Modell beschreibt einen durchschnittlichen Zusammenhang innerhalb der untersuchten Daten und keine sichere Wirkung für jeden Einzelfall.
Welche Regressionsarten gibt es?
Die passende Form der Regressionsanalyse richtet sich nach der Zielgröße, der Anzahl der Einflussfaktoren und dem erwarteten Verlauf des Zusammenhangs. Eine lineare Regression eignet sich für eine metrische Zielgröße wie Umsatz oder Sitzungsdauer. Eine logistische Regression wird verwendet, wenn das Ergebnis nur zwei Zustände hat, etwa Kauf oder kein Kauf.
| Verfahren | Typischer Einsatz | Beispiel im Marketing |
|---|---|---|
| Einfache lineare Regression | Eine metrische Einflussgröße und eine metrische Zielgröße | Zusammenhang zwischen Klicks und Umsatz |
| Multiple lineare Regression | Mehrere Einflussgrößen und eine metrische Zielgröße | Umsatz in Abhängigkeit von Klicks, Preis und Saison |
| Logistische Regression | Binäre Zielgröße | Wahrscheinlichkeit eines Kaufs |
| Polynomiale Regression | Gekrümmter Zusammenhang | Abnehmender Zusatzertrag bei steigendem Werbebudget |
Eine multiple Regressionsanalyse kann den Zusammenhang mehrerer Faktoren mit derselben Zielgröße getrennt schätzen. Das ist für Marketingdaten oft sinnvoll, weil Umsatz oder Traffic selten von einer einzelnen Variable abhängen. Das Modell kann beispielsweise Werbeausgaben, Wochentag, Preisaktionen und Markenbekanntheit gleichzeitig berücksichtigen, sofern genügend geeignete Beobachtungen vorliegen.
Regressionsanalyse richtig interpretieren
Koeffizienten zeigen Richtung und Stärke
Ein positiver Regressionskoeffizient beschreibt einen gleichgerichteten Zusammenhang: Steigt die Einflussgröße, steigt im Modell auch der erwartete Zielwert. Ein negativer Koeffizient beschreibt einen gegenläufigen Zusammenhang. Die Größe eines Koeffizienten ist nur zusammen mit seiner Maßeinheit interpretierbar. Ein Wert von 0,5 kann je nach Variable 0,5 Euro, 0,5 Prozentpunkte oder 0,5 zusätzliche Leads bedeuten.
R Quadrat bewertet die Modellanpassung
Das Bestimmtheitsmaß R² zeigt, welcher Anteil der beobachteten Streuung der Zielgröße durch das Modell erklärt wird. Ein R² von 0,70 bedeutet, dass die aufgenommenen Einflussgrößen 70 Prozent der Streuung in den untersuchten Daten abbilden. Der Wert beweist weder Kausalität noch Prognosequalität. Ein hohes R² kann durch Überanpassung entstehen, während ein niedrigerer Wert bei stark schwankendem Nutzerverhalten trotzdem verwertbare Hinweise liefern kann.
Das korrigierte R² berücksichtigt zusätzlich die Zahl der Einflussgrößen. Diese Variante eignet sich besser für den Vergleich multipler Modelle, weil ein gewöhnliches R² durch das Hinzufügen weiterer Variablen nicht sinkt. Prüfe bei mehreren Modellen deshalb, ob zusätzliche Faktoren auch das korrigierte R² verbessern und fachlich begründbar sind.
Signifikanz ersetzt keine Relevanz
Ein statistisch signifikanter Koeffizient deutet darauf hin, dass der geschätzte Zusammenhang unter den Modellannahmen nicht leicht durch Zufall erklärbar ist. Der häufig verwendete Schwellenwert von 0,05 für den p-Wert ist jedoch keine Naturgrenze. Bei großen Datensätzen können minimale Effekte signifikant werden, obwohl sie wirtschaftlich kaum ins Gewicht fallen. Vergleiche deshalb zusätzlich Effektgröße, Konfidenzintervall und erwarteten finanziellen Nutzen.
Voraussetzungen für belastbare Ergebnisse
Eine lineare Regressionsanalyse setzt voraus, dass das gewählte Modell zur Struktur der Daten passt. Zu den zentralen Prüfpunkten gehören ein annähernd linearer Zusammenhang, voneinander unabhängige Beobachtungen, eine möglichst konstante Streuung der Residuen und keine starke Abhängigkeit zwischen den Einflussgrößen.
Regression, Korrelation und Kausalität
Der Unterschied zwischen Korrelation und Regressionsanalyse liegt im Analyseziel. Eine Korrelation beschreibt Stärke und Richtung eines statistischen Zusammenhangs zwischen zwei Variablen. Eine Regressionsanalyse legt eine Zielgröße fest und schätzt, wie diese Zielgröße mit einer oder mehreren Einflussgrößen zusammenhängt. Bei der einfachen linearen Regression kann das Ergebnis von der gewählten Richtung abhängen.
Der Unterschied zwischen Regressionsanalyse und Kausalitätsanalyse liegt in der möglichen Aussage. Eine Regression beschreibt zunächst beobachtete Zusammenhänge. Für eine kausale Aussage muss zusätzlich ausgeschlossen werden, dass unbeobachtete Faktoren, umgekehrte Wirkungsrichtungen oder eine verzerrte Auswahl der Daten das Ergebnis erklären. Kontrollierte Experimente und sauber geplante A/B-Tests liefern dafür meist eine belastbarere Grundlage als rein beobachtete Daten.
Regressionsanalyse in SEO und SEA
Im SEO kann eine Regressionsanalyse untersuchen, wie Rankings, CTR, indexierte Seiten oder technische Kennzahlen mit organischem Traffic zusammenhängen. Die Auswahl der Variablen beginnt mit einer strukturierten Keyword-Recherche und einer zeitlich konsistenten Datengrundlage. Tageswerte vor und nach einem Google-Update dürfen beispielsweise nicht ohne Kontrollvariablen zu einer einzigen Wirkungskette verbunden werden.
Im SEA kann eine Regressionsanalyse den Zusammenhang zwischen Budget, Klickpreis, Impressionen, Conversion-Rate und Umsatz modellieren. Ein lineares Modell ist ungeeignet, wenn zusätzliche Ausgaben ab einem bestimmten Budget nur noch geringe Mehrerträge liefern. In diesem Fall sollte die Funktionsform Sättigungseffekte abbilden oder das Budget in geeignete Bereiche unterteilt werden.
Für gemeinsame Auswertungen von SEO und SEA kann eine Regressionsanalyse Überschneidungen sichtbar machen. Markenbekanntheit, Nachfrage und Saison beeinflussen häufig beide Kanäle. Wer bezahlte und organische Daten getrennt modelliert, kann denselben Nachfrageeffekt versehentlich zweimal als Kanalleistung interpretieren. Eine strukturierte Analyse der SEO- und SEA-Synergien verbessert deshalb die Auswahl der Variablen.
Regressionsmodelle prüfen und anwenden
Messbar ist die Qualität einer Regressionsanalyse zum Beispiel über R², korrigiertes R², die Größe der Residuen und die Prognosefehler bei bisher ungenutzten Daten. Teile den Datensatz dafür in Trainingsdaten zur Schätzung und Testdaten zur Prüfung. Ein Modell, das nur die Trainingsdaten gut erklärt, aber bei neuen Daten deutlich abweicht, ist überangepasst.
Eine belastbare Auswertung beginnt mit einer klaren Zielvariable und einer fachlichen Hypothese. Anschließend werden Datenquellen, Zeitraum, Granularität und mögliche Störfaktoren festgelegt. Eine strukturierte SEO-Analyse verhindert, dass Kennzahlen unterschiedlicher Ebenen ungeprüft vermischt werden, etwa tägliche Rankings mit monatlichen Umsätzen.
Eine kurze Beobachtung aus Marketingprojekten: Modelle werden häufig genauer, sobald Kalenderdaten und Markenanfragen berücksichtigt werden. Der Grund ist nachvollziehbar. Feiertage, Kampagnen und bestehende Nachfrage beeinflussen Traffic und Umsatz gleichzeitig. Prüfe solche Variablen vor jeder Interpretation, damit das Modell keine saisonale Bewegung einem einzelnen Kanal zuschreibt.
Häufige Fragen zur Regressionsanalyse
Wofür braucht man eine Regressionsanalyse?
Eine Regressionsanalyse wird verwendet, um Zusammenhänge zwischen einer Zielgröße und möglichen Einflussfaktoren zu beschreiben, Effekte zu schätzen oder Prognosen zu erstellen. Typische Anwendungen sind Umsatzprognosen, Budgetanalysen und die Untersuchung von Conversion-Einflussfaktoren.
Wie viele Daten braucht eine Regressionsanalyse?
Eine feste Mindestzahl gilt nicht für jedes Modell. Der Datenbedarf steigt mit der Zahl der Einflussgrößen, der Streuung der Werte und der gewünschten Genauigkeit. Wenige Beobachtungen bei vielen Variablen führen zu instabilen Koeffizienten und erschweren die Prüfung mit separaten Testdaten.
Kann eine Regressionsanalyse die Zukunft vorhersagen?
Eine Regressionsanalyse kann erwartete Werte unter definierten Bedingungen schätzen. Die Prognose bleibt nur belastbar, wenn neue Daten einer ähnlichen Struktur folgen wie die Daten zur Modellbildung. Marktveränderungen, Kampagnen oder technische Eingriffe können die Vorhersagekraft reduzieren.
Was bedeutet ein negatives R Quadrat?
Ein gewöhnliches R Quadrat mit Achsenabschnitt liegt bei der Auswertung derselben Trainingsdaten normalerweise zwischen null und eins. Negative Werte können bei Testdaten, speziellen Modellvarianten oder einer Berechnung ohne Achsenabschnitt auftreten. Das Modell schätzt dann schlechter als eine einfache Vorhersage mit dem Mittelwert.
Sind Ausreißer bei einer Regression immer zu löschen?
Ausreißer sollten nicht automatisch entfernt werden. Zuerst ist zu prüfen, ob ein Messfehler, ein ungewöhnliches reales Ereignis oder eine eigene Datengruppe vorliegt. Das Ergebnis sollte zusätzlich mit und ohne den betreffenden Wert verglichen und die Entscheidung dokumentiert werden.
Kann man Prozentwerte mit einer Regression untersuchen?
Prozentwerte können analysiert werden, ihre Grenzen zwischen null und hundert müssen jedoch berücksichtigt werden. Eine lineare Regression kann Werte außerhalb dieses Bereichs schätzen. Abhängig von Zielgröße und Datenstruktur können logistische oder andere verallgemeinerte Regressionsmodelle geeigneter sein.
Wenn du Zusammenhänge zwischen SEO-, SEA- und Geschäftsdaten belastbar bewerten möchtest, kann ein datenbasiertes Marketing-Consulting die Modellauswahl und Interpretation fachlich absichern.
Kostenlosen Potenzialcheck anfragen
Sie haben noch Fragen?







