Quantisierung

Was ist Quantisierung?

Quantisierung bezeichnet die Umwandlung kontinuierlicher oder hochpräziser Zahlenwerte in eine begrenzte Menge diskreter Werte. Bei KI-Modellen werden beispielsweise 32-Bit- oder 16-Bit-Zahlen durch 8-Bit- oder 4-Bit-Werte ersetzt. Dadurch sinken Speicherbedarf und Rechenaufwand, während ein möglichst großer Teil der Modellqualität erhalten bleiben soll.

Quantisierung, englisch: Quantization, reduziert die numerische Genauigkeit, mit der ein Computersystem Daten oder Modellparameter speichert und verarbeitet. Statt sehr vieler möglicher Zahlenwerte steht anschließend nur noch ein festgelegtes Raster zur Verfügung. Jeder ursprüngliche Wert wird dem nächstliegenden Wert dieses Rasters zugeordnet.

Was bedeutet Quantisierung bei KI?

Bei künstlicher Intelligenz betrifft Quantisierung vor allem die Gewichte und Aktivierungen eines neuronalen Netzes. Gewichte sind gelernte Zahlenwerte, die bestimmen, wie stark einzelne Signale innerhalb des Modells berücksichtigt werden. Aktivierungen sind Zwischenergebnisse, die während einer Berechnung entstehen. Beide werden häufig als Gleitkommazahlen gespeichert.

Ein Modell mit FP32 verwendet grundsätzlich 32 Bit pro Zahlenwert, FP16 nutzt 16 Bit. INT8 stellt Ganzzahlen mit 8 Bit dar, während INT4 mit 4 Bit arbeitet. Wird ausschließlich der Speicher für Modellgewichte betrachtet, benötigt INT8 theoretisch ein Viertel des Platzes von FP32. INT4 kommt auf ein Achtel. Zusätzliche Skalierungswerte, Metadaten und Laufzeitkomponenten erhöhen den tatsächlichen Speicherbedarf.

  • FP32: hohe numerische Genauigkeit mit 32 Bit pro Wert.
  • FP16: halbierter Rohspeicher gegenüber FP32.
  • INT8: 256 darstellbare Ganzzahlwerte.
  • INT4: 16 darstellbare Werte und entsprechend gröbere Abstufungen.

Wie funktioniert Quantisierung?

Quantisierung bildet einen Zahlenbereich auf eine kleinere Menge darstellbarer Werte ab. Eine verbreitete lineare Variante nutzt einen Skalierungsfaktor und einen Nullpunkt. Vereinfacht lautet die Berechnung: quantisierter Wert gleich gerundeter Ausgangswert geteilt durch Skalierungsfaktor, anschließend ergänzt um den Nullpunkt. Beim Dequantisieren wird diese Zuordnung näherungsweise zurückgerechnet.

Ein symmetrisches INT8-Raster kann Werte zwischen minus 1 und plus 1 beispielsweise auf Ganzzahlen zwischen minus 127 und plus 127 verteilen. Der Skalierungsfaktor beträgt dann 1 geteilt durch 127. Der Ausgangswert 0,5 wird auf 64 gerundet. Nach der Rückrechnung ergibt sich ungefähr 0,5039. Die Differenz von etwa 0,0039 ist der Quantisierungsfehler dieses Beispiels.

Ein Modell mit sieben Milliarden Parametern benötigt für die reinen Gewichte bei FP16 rechnerisch rund 14 Gigabyte. INT8 reduziert diesen theoretischen Wert auf rund 7 Gigabyte, INT4 auf rund 3,5 Gigabyte. Für die tatsächliche Ausführung kommen unter anderem Zwischenergebnisse, Kontextspeicher und Verwaltungsdaten hinzu.

Verfahren der Quantisierung

Das passende Verfahren hängt davon ab, ob ein fertiges Modell nachträglich verkleinert wird oder die geringere Präzision bereits beim Training berücksichtigt werden kann. Für Unternehmen zählt dabei weniger die Bezeichnung des Verfahrens als das Verhältnis aus Speicherbedarf, Laufzeit und Qualität bei den eigenen Aufgaben.

VerfahrenMechanikTypischer Einsatz
Post-Training QuantizationEin bereits trainiertes Modell wird nachträglich umgewandelt.Schnelle Bereitstellung ohne vollständiges erneutes Training.
Quantization-Aware TrainingDas Training simuliert die späteren Rundungsfehler.Modelle, bei denen die Qualität unter geringer Präzision möglichst stabil bleiben soll.
Weight-only QuantizationNur die Gewichte werden mit weniger Bit gespeichert.Große Sprachmodelle mit hohem Speicherbedarf.
Dynamische QuantisierungSkalierungswerte für Aktivierungen werden während der Ausführung bestimmt.Flexible Inferenz ohne vorherige Kalibrierung aller Aktivierungen.

Kalibrierung bestimmt das Zahlenraster

Bei statischen Verfahren wird häufig ein Kalibrierungsdatensatz durch das Modell geschickt. Das System ermittelt daraus typische Wertebereiche für Gewichte oder Aktivierungen. Einzelne extreme Ausreißer können das Raster stark vergrößern, sodass für häufige Werte weniger Abstufungen übrig bleiben. Der Kalibrierungsdatensatz sollte deshalb den späteren Einsatz möglichst gut abbilden.

Quantisierung verändert die Modellqualität

Der verbreitete Denkfehler lautet, dass weniger Bit automatisch ein nahezu gleich gutes Modell ergeben. Quantisierung erzeugt immer Rundungsfehler. Ob diese Fehler relevant sind, hängt von Architektur, Schicht, Aufgabe und Daten ab. Eine Zusammenfassung kann stabil bleiben, während die Erkennung seltener Entitäten oder feiner Bedeutungsunterschiede bereits messbar nachlässt.

Messbar ist Quantisierung zum Beispiel durch einen Vorher-nachher-Test mit identischen Eingaben. Vergleiche Speicherbelegung, Latenz, erzeugte Token pro Sekunde und die Qualität einer festgelegten Testsammlung. Für Marketing-Anwendungen sollte die Testsammlung reale Aufgaben wie Keyword-Klassifikation, Entitätserkennung, Textbewertung und Quellenzusammenfassung enthalten.

Eine viermal kleinere Modelldatei bedeutet nicht automatisch eine viermal schnellere Ausgabe. Die tatsächliche Geschwindigkeit hängt von Prozessor, Grafikkarte, Speicherbandbreite und der Unterstützung des gewählten Zahlenformats ab. Prüfe deshalb die Laufzeit auf der Hardware, auf der das quantisierte Modell später eingesetzt wird.

Nutzen für SEO, SEA und GEO

Für SEO, SEA und GEO hat Quantisierung eine indirekte technische Bedeutung. Kleinere Modelle lassen sich mit weniger Arbeitsspeicher betreiben und können dadurch für lokale Analysen oder spezialisierte Prozesse verfügbar werden. Mögliche Aufgaben sind die Gruppierung von Keywords, die Auswertung von Suchanfragen, die Klassifikation von Anzeigenbegriffen und die Analyse umfangreicher Textbestände.

Bei der Optimierung für KI-Suchen muss ein Modell Marken, Produkte und Quellen zuverlässig unterscheiden. Ein zu starker Qualitätsverlust kann diese Entitätserkennung beeinträchtigen. Dasselbe gilt für die Erstellung und Prüfung von KI-Texten: Ein kleineres Modell spart Ressourcen, benötigt aber weiterhin belastbare Daten, klare Vorgaben und eine fachliche Qualitätskontrolle.

Quantisierung ersetzt keine aktuelle Datenbasis. Ein kompaktes Modell kennt keine unternehmensspezifischen Rankings, Kampagnenwerte oder Wettbewerbsdaten, wenn diese Informationen nicht bereitgestellt werden. Für eine datenbasierte SEO-Analyse bleibt daher die Qualität der Eingabedaten wichtiger als die Bitbreite des verwendeten Modells.

Abgrenzung zu anderen Methoden

Der Unterschied zwischen Quantisierung und Pruning liegt im Eingriff in das Modell. Quantisierung behält die Parameter grundsätzlich bei, stellt deren Werte aber mit geringerer Genauigkeit dar. Pruning entfernt Gewichte, Verbindungen oder ganze Strukturen, die als weniger relevant bewertet wurden. Beide Methoden können kombiniert werden.

Der Unterschied zwischen Quantisierung und Wissensdestillation liegt ebenfalls im Verfahren. Bei der Destillation lernt ein kleineres Schülermodell aus den Ausgaben eines größeren Lehrermodells. Quantisierung verändert dagegen die Zahlendarstellung eines vorhandenen Modells. Destillation reduziert vor allem die Modellstruktur, Quantisierung vor allem die Präzision der gespeicherten Werte.

Häufige Fragen zur Quantisierung

Verschlechtert Quantisierung immer die Qualität eines KI-Modells?

Quantisierung verursacht Rundungsfehler, die Auswirkungen fallen jedoch je nach Modell und Aufgabe unterschiedlich aus. Ob der Qualitätsverlust relevant ist, lässt sich nur mit einer repräsentativen Testsammlung beurteilen.

Ist ein 4-Bit-Modell für professionelle Aufgaben geeignet?

Ein 4-Bit-Modell kann für Zusammenfassungen, Klassifikationen oder lokale Assistenzsysteme ausreichen. Bei sensiblen Fachfragen, komplexen Berechnungen und seltenen Entitäten sollte die Qualität gegen ein Modell mit höherer Präzision getestet werden.

Kann ein quantisiertes Modell auf einer CPU laufen?

Viele quantisierte Modelle können auf einer CPU ausgeführt werden, wenn Laufzeitumgebung und Zahlenformat unterstützt werden. Geschwindigkeit und maximal nutzbare Kontextlänge hängen weiterhin von Arbeitsspeicher, Prozessor und Modellgröße ab.

Kann man ein quantisiertes Modell weiter trainieren?

Ein weiteres Training ist möglich, erfordert aber ein dafür geeignetes Verfahren. Häufig werden zusätzliche Adapter trainiert, während die quantisierten Grundgewichte unverändert bleiben.

Was ist der Unterschied zwischen INT8 und FP8?

INT8 speichert Ganzzahlen, FP8 bildet Gleitkommazahlen mit Exponent und Mantisse ab. Beide Formate verwenden 8 Bit, verteilen ihre darstellbaren Werte jedoch unterschiedlich und benötigen passende Hardwareunterstützung.

Lässt sich Quantisierung vollständig rückgängig machen?

Die ursprünglichen Werte lassen sich aus einer quantisierten Datei normalerweise nicht exakt rekonstruieren, weil beim Runden Informationen verloren gehen. Eine Rückwandlung erzeugt nur Näherungswerte, sofern das unveränderte Ausgangsmodell nicht separat gespeichert wurde.

Wenn du KI-Auswertungen mit eigenen SEO-, SEA- und GEO-Daten testen möchtest, kannst du einen kostenlosen Zugang anlegen.

Free Account anlegen


Sie haben noch Fragen?

Kontaktieren Sie uns

SEO Agentur kostenlose SEO Potentialanalyse


Weitere Inhalte