Was Quantisierung genau ist
Quantisierung ist eine Technik, bei der die Genauigkeit der Zahlenwerte in einem KI-Modell reduziert wird (z. B. von 16-Bit auf 4-Bit). Dadurch wird das Modell deutlich kleiner und schneller, bei nur geringem Qualitätsverlust. Ein 70-Milliarden-Parameter-Modell, das normalerweise 140 GB Speicher benötigt, passt quantisiert in nur 35 GB. Das ist vergleichbar mit Bildkomprimierung: Ein JPEG-Bild ist viel kleiner als ein RAW-Foto, sieht aber für die meisten Zwecke genauso gut aus. Quantisierung ist der Schlüssel, um grosse KI-Modelle auf bezahlbarer Hardware laufen zu lassen.
So funktioniert es
In einem neuronalen Netz werden alle Berechnungen mit Zahlenwerten (Gewichtungen) durchgeführt. Standardmaessig werden diese als 16-Bit- oder 32-Bit-Gleitkommazahlen gespeichert, was hohe Präzision, aber auch viel Speicher erfordert. Bei der Quantisierung werden diese Zahlen auf weniger Bits reduziert -- z. B. 8-Bit, 4-Bit oder sogar 2-Bit. Die Gewichtungen werden dabei auf diskrete Stufen gerundet. Fortgeschrittene Methoden wie GPTQ oder AWQ quantisieren intelligent: Sie erhalten die Präzision dort, wo sie wichtig ist, und runden dort stärker, wo es wenig Auswirkung hat.
Was das für dein Unternehmen bedeutet
Quantisierung macht lokale KI für den Mittelstand erschwinglich. Ohne Quantisierung brauchtest du teure Server-GPUs mit 80 GB Speicher für grosse Modelle. Mit Quantisierung laufen leistungsstarke Modelle auch auf bezahlbarer Consumer-Hardware wie einer NVIDIA RTX 4090 mit 24 GB. Das senkt die Einstiegskosten für lokale KI erheblich, bei kaum merkbarem Qualitätsverlust. In Praxis-Tests zeigen 4-Bit-quantisierte Modelle oft nur 1-3 % weniger Qualität als das Original -- ein hervorragender Kompromiss.
Beispiele aus der Praxis
- Llama 70B in 4-Bit-Quantisierung auf einer einzelnen GPU betreiben
- 50 % weniger Hardware-Kosten durch Quantisierung
- Schnellere Antwortzeiten durch kleinere Modellgroesse
- Mistral 7B in 4-Bit-Quantisierung läuft sogar auf Laptops mit GPU
- GGUF-Format für einfache lokale Nutzung mit Ollama
Vorteile und Grenzen
Das spricht dafür
- Drastische Reduktion des Speicherbedarfs (bis zu 75 % weniger)
- Grosse Modelle laufen auf bezahlbarer Consumer-Hardware
- Schnellere Antwortzeiten durch kompaktere Modelle
- Kaum merkbarer Qualitätsverlust bei 4-Bit-Quantisierung (1-3 %)
- Einfach umsetzbar mit Tools wie Ollama, llama.cpp oder vLLM
Das solltest du einplanen
- Geringfuegiger Qualitätsverlust, besonders bei aggressiver Quantisierung (2-Bit)
- Nicht alle Aufgaben vertragen Quantisierung gleich gut -- bei Mathematik und Logik größerer Qualitätsverlust
- Quantisierte Modelle können bei seltenen Sprachen oder Fachvokabular schlechtere Ergebnisse liefern
- Technisches Verständnis für die Wahl der richtigen Quantisierungsstufe nötig