# Grafikkarte für lokale KI: Speicher entscheidet

> Speicher entscheidet, nicht Tempo: RTX 50 und Radeon RX 9000 mit VRAM, die Rechenformel je Modellklasse und der Mac. Grafikkarte für lokale KI.

Quelle: https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki
Stand: 2026-10-09

- [Der Grafikspeicher setzt die Grenze, nicht die Rechenleistung](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#der-grafikspeicher-setzt-die-grenze-nicht-die-rechenleistung)
- [So rechnest du in zehn Sekunden aus, was auf deine Karte passt](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#so-rechnest-du-in-zehn-sekunden-aus-was-auf-deine-karte-passt)
- [Zwei Zahlen im Modellnamen: nimm immer die große](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#zwei-zahlen-im-modellnamen-nimm-immer-die-grosse)
- [Diese Grafikkarten haben wie viel Speicher](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#diese-grafikkarten-haben-wie-viel-speicher)
- [Welches Modell auf welcher Karte läuft](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#welches-modell-auf-welcher-karte-laeuft)
- [Drei Dinge treiben den Speicherbedarf zusätzlich](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#drei-dinge-treiben-den-speicherbedarf-zusaetzlich)
- [Drei typische Fehlkäufe](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#drei-typische-fehlkaeufe)
- [Drei Profile und die passende Karte](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#drei-profile-und-die-passende-karte)
- [Der Mac rechnet anders: Unified Memory statt VRAM](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#der-mac-rechnet-anders-unified-memory-statt-vram)
- [NVIDIA läuft, bei AMD und Intel kommt Bastelei dazu](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#nvidia-laeuft-bei-amd-und-intel-kommt-bastelei-dazu)
- [Was du vor dem Kauf prüfst](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#was-du-vor-dem-kauf-pruefst)
- [So prüfst du vor dem Kauf, ob deine Karte schon reicht](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#so-pruefst-du-vor-dem-kauf-ob-deine-karte-schon-reicht)
- [Wenn eigene Hardware nicht die Antwort ist](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#wenn-eigene-hardware-nicht-die-antwort-ist)
- [Fazit: Speicher kaufen, nicht Tempo](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#fazit-speicher-kaufen-nicht-tempo)
- [Häufige Fragen](https://gerlinger.ai/blog/grafikkarte-fuer-lokale-ki#faq)

Das Wichtigste in Kürze

- Für lokale KI entscheidet der Grafikspeicher, nicht die Rechenleistung: Passt ein Modell nicht in den VRAM, wird es zäh statt langsamer
- Die Rechnung dauert zehn Sekunden: Milliarden Parameter mal 0,7 plus 3 GB muss unter deinen Grafikspeicher passen
- Der Zielbereich für Büroarbeit liegt bei 12 bis 16 GB VRAM, dort laufen Gemma 4 12B (7,6 GB) und Qwen 3.5 9B (6,6 GB) flüssig
- 8 GB reichen für kleine Modelle wie Qwen 3.5 4B (3,4 GB), 24 bis 32 GB öffnen die 26B-Klasse mit rund 18 GB Bedarf
- Am Mac gibt es keinen eigenen Grafikspeicher: Prozessor und Grafik teilen den Arbeitsspeicher, nutzbar sind davon rund zwei Drittel, ab 32 GB im Gerät rund drei Viertel
- NVIDIA läuft ohne Zusatzaufwand, bei AMD und Intel kommt Bastelei dazu: im Ollama-Projekt liegen dutzende offene Fehlermeldungen dazu

Für lokale KI entscheidet die Größe des Grafikspeichers, nicht die Rechenleistung der Karte. Grafikspeicher heißt im Datenblatt VRAM, gemeint ist dasselbe. Ein Modell muss vollständig in diesen Speicher passen, sonst rechnet ein Teil davon auf dem Prozessor und die Antwort tröpfelt Wort für Wort. Die praktische Zielgröße im Mittelstand liegt bei 12 bis 16 GB. Diese Seite nennt für jede aktuelle Karte den Speicher, liefert die Rechnung dazu und sagt, welches Modell auf welcher Karte läuft.

Die Grafikkarte ist dabei nur eine von drei Formen der KI-Bereitstellung. Lokale KI läuft auf eigener Hardware, [Cloud-KI](https://gerlinger.ai/lexikon/cloud-ki) beim Anbieter, [Hybrid-KI](https://gerlinger.ai/lexikon/hybrid-ki) verteilt die Aufgaben nach Sensibilität der Daten. Dieser Ratgeber behandelt die Hardware-Frage des ersten Wegs.

Der Ratgeber richtet sich an Geschäftsführer und IT-Verantwortliche, die [lokale KI](https://gerlinger.ai/lexikon/lokale-ki) einführen und vorher wissen wollen, welche Hardware sie kaufen. Wenn du die Software noch nicht eingerichtet hast, führt dich die [Anleitung zur Installation lokaler KI](https://gerlinger.ai/blog/lokale-ki-installieren-anleitung) durch die sechs Schritte davor.

![Zwei Techniker bauen eine Grafikkarte in einen Arbeitsplatzrechner ein](https://gerlinger.ai/assets/blog/grafikkarte-fuer-lokale-ki-gespraech.webp)

Video: „Lokale KI: Was auf deinen Rechner gehört, und was nicht“ (YouTube lädt erst nach dem Klick), https://www.youtube.com/watch?v=6HJki9Z4l8U

Im Video rechne ich die Speicherformel an einer 12-GB-Karte durch und zeige, welche Modelle darauf tatsächlich laufen.

### Der Grafikspeicher setzt die Grenze, nicht die Rechenleistung

Bei Spielen zählt, wie schnell eine Grafikkarte rechnet. Bei lokaler KI zählt zuerst, wie viel sie behalten kann. Ein Sprachmodell besteht aus Parametern, den Stellschrauben, die beim Training entstanden sind. Alle Parameter müssen gleichzeitig im Speicher liegen, damit das Modell antworten kann.

Passt das Modell nicht hinein, verteilt das Werkzeug es auf Grafikkarte und Arbeitsspeicher. Der ausgelagerte Teil rechnet auf dem Prozessor weiter, also um ein Vielfaches langsamer. Das Ergebnis ist keine Fehlermeldung, sondern eine Antwort, die zäh aus dem Rechner sickert. Genau dieser Effekt lässt Menschen glauben, lokale KI sei generell langsam. Meist ist nur das Modell eine Nummer zu groß gewählt.

Daraus folgt eine unbequeme Kaufregel: Eine ältere Karte mit 16 GB Speicher ist für lokale KI besser als eine neuere mit 8 GB. Die schnellere Karte hilft nichts, wenn das Modell nicht hineinpasst. Speicher schlägt Tempo, solange du unter der Grenze bleibst.

### So rechnest du in zehn Sekunden aus, was auf deine Karte passt

Die Formel lautet: Milliarden Parameter mal 0,7, plus 3 GB. Das Ergebnis muss unter deinen Grafikspeicher passen.

Ein Beispiel: Ein Modell mit 12 Milliarden Parametern rechnet sich als 12 mal 0,7 gleich 8,4, plus 3 macht 11,4 GB. Auf einer Karte mit 12 GB geht das auf, auf einer mit 8 GB nicht.

Der Faktor 0,7 ist nicht geschätzt. Modelle werden für den lokalen Betrieb quantisiert, also gröber gespeichert. Der Standard heißt Q4_K_M und braucht rund 4,9 Bit pro Gewicht, also gut 0,6 GB je Milliarde Parameter (llama.cpp, Dokumentation zur Quantisierung, 2026). Der Aufschlag auf 0,7 deckt ab, dass Dateien in der Praxis etwas größer ausfallen. Die 3 GB Puffer stehen für das Kontextfenster und den Bedarf des Betriebssystems.

Die verbreitete Kurzregel „Milliarden gleich Gigabyte" gilt nur für unkomprimierte Modelle. Bei den quantisierten Fassungen, die jedes lokale Werkzeug lädt, rechnet sie dich um mehr als 40 Prozent zu hoch. Du kaufst dann Hardware, die du nicht brauchst.

#### Zwei Zahlen im Modellnamen: nimm immer die große

Manche Modelle tragen zwei Zahlen, etwa Gemma 4 in der Kennung 26b-a4b. Diese Modelle sind als Mixture-of-Experts gebaut: Von allen Parametern rechnet pro Wort nur ein Teil mit. Google gibt für Gemma 4 mit 26 Milliarden Parametern rund 4 Milliarden aktive an (Google AI for Developers, Gemma 4 Model Overview, 2026).

Für den Speicherbedarf zählt die große Zahl. Welcher Teil des Modells rechnet, entscheidet sich erst während der Antwort, also muss alles geladen sein. Wer mit der kleinen Zahl rechnet, landet bei 4 mal 0,7 gleich 2,8 GB und wundert sich, warum das Modell auf einer 12-GB-Karte nicht läuft. Der echte Bedarf liegt bei rund 18 GB.

Der Vorteil dieser Bauart ist Tempo bei gleicher Größe, nicht ein kleinerer Speicherbedarf. Für die Kaufentscheidung ändert Mixture-of-Experts also nichts: Es zählt die Gesamtzahl der Parameter.

### Diese Grafikkarten haben wie viel Speicher

Die aktuelle Generation von NVIDIA heißt GeForce RTX 50. Die Speichergrößen laut Herstellerangaben (NVIDIA, Vergleichstabelle der RTX 50 Serie, abgerufen September 2026):

| Karte | Grafikspeicher | Größte Modellklasse | Für wen |
| --- | --- | --- | --- |
| RTX 5090 | 32 GB GDDR7 | 26B bis 32B | Mehrere Nutzer, große Dokumente |
| RTX 5080 | 16 GB GDDR7 | bis 18B | Sicherer Alltag mit Reserve |
| RTX 5070 Ti | 16 GB GDDR7 | bis 18B | Bester Kompromiss |
| RTX 5070 | 12 GB GDDR7 | bis 12B | Solider Einstieg |
| RTX 5060 Ti | 16 GB oder 8 GB | bis 18B / bis 4B | Nur die 16-GB-Fassung kaufen |
| RTX 5060 | 8 GB GDDR7 | bis 4B | Erste Versuche |
| RTX 5050 | 8 GB GDDR6 | bis 4B | Erste Versuche |

Zum Vergleichen seitlich wischen

Bei AMD heißt die aktuelle Reihe Radeon RX 9000. Die RX 9070 XT, die RX 9070 und die RX 9060 XT bringen je 16 GB mit (AMD, ROCm-Dokumentation zu GPU-Spezifikationen, Stand September 2026). Die RX 9060 XT gibt es zusätzlich als 8-GB-Fassung. Ein von AMD angekündigter Nachfolger mit größerem Speicher ist bis September 2026 nicht erschienen, an der Kaufempfehlung ändert sich deshalb nichts.

Achte bei der RTX 5060 Ti und der RX 9060 XT genau auf die Fassung. Beide Karten tragen denselben Namen, existieren aber mit 16 GB und mit 8 GB. Für lokale KI ist das der Unterschied zwischen der Büro-Klasse und ersten Versuchen.

Nach oben endet die Fahnenstange bei der RTX Pro 6000 von NVIDIA mit 96 GB Speicher, die wegen der Knappheit bei GDDR7-Speicher inzwischen 16.000 Dollar kostet, nach mehreren Preiserhöhungen seit dem Marktstart bei rund 8.500 Dollar (NVIDIA, offizielle Preisliste, und Marktpreise, September 2026). Für Büroarbeit im Mittelstand ist diese Klasse unnötig. Sie lohnt erst, wenn du sehr große Modelle selbst betreiben willst.

### Welches Modell auf welcher Karte läuft

Die folgenden Größen sind keine Schätzungen, sondern die tatsächlichen Downloadgrößen aus der Ollama-Modellbibliothek (abgerufen September 2026):

| Grafikspeicher | Modell | Belegt | Was damit geht |
| --- | --- | --- | --- |
| 8 GB | Qwen 3.5 4B | 3,4 GB | Zusammenfassen, umformulieren, übersetzen |
| 12 GB | Gemma 4 12B | 7,6 GB | Büroarbeit in voller Breite |
| 12 GB | Qwen 3.5 9B | 6,6 GB | Alternative mit mehr Reserve |
| 16 GB | Gemma 4 12B plus großes Kontextfenster | 7,6 GB plus Puffer | Lange Dokumente am Stück |
| 24 GB und mehr | Gemma 4 26B | 18 GB | Mehr Tiefe bei Analyse und Struktur |

Zum Vergleichen seitlich wischen

Der Zielbereich für den Mittelstand liegt bei 12 bis 16 GB. Dort läuft die Klasse mit rund 12 Milliarden Parametern, die im Büro die meiste Arbeit erledigt: Besprechungen zusammenfassen, Dokumente auswerten, Namen und Termine in eine Tabelle holen, Entwürfe umformulieren, übersetzen.

Unterhalb von 8 GB wird die Auswahl dünn, aber nicht leer. Ein Modell mit 4 Milliarden Parametern erledigt Textarbeit zuverlässig, es formuliert nur weniger geschliffen und verliert bei langen Vorlagen den Überblick.

Plane den Speicher nicht knapp auf das Modell, sondern auf das Modell plus Kontextfenster. Wer 16 GB statt 12 GB nimmt, kann später größere Dokumente am Stück verarbeiten, ohne die Karte zu tauschen. Das ist der häufigste Grund, warum ein Setup nach drei Monaten nicht mehr reicht.

### Drei Dinge treiben den Speicherbedarf zusätzlich

Das Modell allein bestimmt den Bedarf nicht. Drei Faktoren kommen obendrauf, und alle drei werden beim Kauf gern übersehen.

- Das Kontextfenster. Es beschreibt, wie viel Text das Modell auf einmal überblickt, und belegt zusätzlichen Speicher. Ollama richtet den Standardwert nach dem Grafikspeicher: unter 24 GB sind es 4.000 Token, zwischen 24 und 48 GB dann 32.000, darüber 256.000 (Ollama, Dokumentation zur Kontextlänge, Stand September 2026). Auf einer 12-GB-Karte überblickt das Modell also nur rund sechs Seiten, bis du den Wert selbst anhebst. Rechne bei 32.000 Token mit etwa 2 bis 4 GB zusätzlich, je nach Modell.
- Die Quantisierungsstufe. Q4_K_M ist der Standard und trifft die Mitte zwischen Größe und Qualität. Eine feinere Stufe wie Q5 oder Q8 liefert bessere Antworten und belegt mehr Speicher. Wer eine 16-GB-Karte hat, geht bei einem 12B-Modell besser auf eine feinere Stufe, statt ein größeres Modell zu quetschen.
- Mehrere Nutzer gleichzeitig. Arbeiten drei Mitarbeiter parallel mit derselben lokalen KI, liegt das Modell nur einmal im Speicher. Jede Anfrage braucht aber eigenen Platz für ihr Kontextfenster. Für ein Team ist deshalb eine Karte mit 24 oder 32 GB sinnvoll, auch wenn das Modell selbst auf 16 GB passt.

Speicher der größten Consumer-Grafikkarte, der RTX 5090

Speicher der RTX Pro 6000, für inzwischen 16.000 Dollar

Arbeitsspeicher, den das offene Modell Kimi K3 verlangt

### Drei typische Fehlkäufe

Ich bin Jannis Gerlinger, arbeite seit 2007 in der Digitalbranche und berate heute mittelständische Betriebe bei KI-Systemen. Aus dieser Praxis sehe ich immer wieder dieselben drei Muster. Alle drei kosten Geld, ohne die lokale KI besser zu machen.

- Die schnelle Karte mit zu wenig Speicher. Eine RTX 5060 mit 8 GB ist beim Spielen flott und für die Büro-Modellklasse zu klein. Wer die 12 GB der RTX 5070 nimmt, hat für lokale KI mehr davon, obwohl die Karte im Spiele-Vergleich schwächer aussieht.
- Die Profi-Karte für Standardaufgaben. Eine Karte mit 96 GB löst ein Problem, das im Büroalltag nicht auftritt. Zusammenfassen, umformulieren und Dokumente auswerten leisten Modelle mit 9 bis 12 Milliarden Parametern, und die passen in 12 bis 16 GB.
- Der eigene Server, bevor das Volumen da ist. Eigene Hardware rechnet sich erst ab einem hohen Verbrauch. Ein Richtwert aus der Praxis liegt bei 50 bis 100 Millionen Token im Monat, darunter ist gemietete Rechenzeit häufig günstiger (Einordnung aus dem YouTube-Kanal Everlast AI, Juni 2026, nicht unabhängig gegengerechnet). Für das erste Jahr genügt in vielen Betrieben eine gute Arbeitsplatz-Karte.

### Drei Profile und die passende Karte

| Profil | Aufgaben | Empfehlung | Warum |
| --- | --- | --- | --- |
| Einzelner Nutzer | Mails, Protokolle, Übersetzungen | 12 GB (RTX 5070) | Trägt die 12B-Klasse, günstigster brauchbarer Einstieg |
| Kleines Team, 3 bis 5 Personen | Dokumente auswerten, Wissen durchsuchen | 16 GB (RTX 5070 Ti) | Reserve für parallele Anfragen und größere Fenster |
| Kanzlei oder Praxis | Mandantenunterlagen, Berichte | 24 bis 32 GB (RTX 5090) | Lange Akten am Stück, keine Auslagerung an Dritte |

Zum Vergleichen seitlich wischen

Das dritte Profil hat einen rechtlichen Hintergrund, der die Hardware-Frage verschiebt. Für Ärzte, Anwälte, Steuerberater und Psychotherapeuten gilt § 203 StGB: Wer Mandantendaten an einen Dienstleister weitergibt, muss diesen vorher zur Verschwiegenheit verpflichten. Die Einbindung solcher Dienstleister regelt § 203 Abs. 3 StGB, die Strafandrohung von bis zu einem Jahr Freiheitsstrafe oder Geldstrafe steht in Absatz 1. Wer die Verarbeitung im eigenen Haus behält, umgeht diese Kette vollständig. Für diese Berufe ist die größere Karte deshalb keine Bequemlichkeit, sondern der einfachere Weg zur Rechtssicherheit.

### Der Mac rechnet anders: Unified Memory statt VRAM

Apple-Rechner haben keinen eigenen Grafikspeicher. Prozessor und Grafik teilen sich denselben Arbeitsspeicher, Apple nennt das Unified Memory (Apple, MLX-Dokumentation zu Unified Memory, 2026). Für lokale KI ist das ein Vorteil: Ein Mac mit viel Arbeitsspeicher stellt Modellen mehr Platz bereit als jede Consumer-Grafikkarte unterhalb der RTX 5090.

Die Grenze setzt das Betriebssystem. Metal meldet Anwendungen, wie viel sie belegen dürfen (Apple, Metal-Dokumentation zu recommendedMaxWorkingSetSize ), und Werkzeuge wie Ollama und llama.cpp behandeln diesen Wert als Obergrenze. macOS reserviert dabei ein Drittel des Arbeitsspeichers für das System, bei Geräten über 32 GB nur ein Viertel (llama.cpp, Diskussion zur Speicheraufteilung auf Apple Silicon, 2026). Bei 32 GB im Gerät stehen so etwa 21 GB für das Modell bereit, bei 64 GB rund 48 GB.

| Kriterium | NVIDIA-Grafikkarte | Mac mit Apple Silicon |
| --- | --- | --- |
| Speicher für Modelle | 8 bis 32 GB, fest verbaut | zwei Drittel des Arbeitsspeichers, ab 32 GB drei Viertel |
| Tempo bei gleicher Größe | höher | niedriger |
| Einrichtung | ohne Zusatzaufwand | ohne Zusatzaufwand, mit MLX schneller |
| Nachrüsten | Karte tauschen | gar nicht, Speicher ist verlötet |
| Betrieb rund um die Uhr | als Arbeitsplatz oder Server | eher Arbeitsplatz |

Zum Vergleichen seitlich wischen

Wer einen Mac neu bestellt und lokale KI plant, entscheidet die Speichergröße beim Kauf und danach nie wieder. Auf Apple-Chips liefert das Framework MLX zudem mehr Tempo als der Standardweg. Wie weit das trägt, zeigt der Beitrag zum [Apple M5 für lokale KI](https://gerlinger.ai/blog/apple-m5-chip-lokale-ki-unternehmen).

Unsicher, welche Karte zu deinen Anforderungen passt? In einer kostenlosen Erstberatung rechnen wir deinen Anwendungsfall gemeinsam durch: Wie viele Mitarbeiter, wie lange die Dokumente, welches Modell. Danach weißt du, ob eine 12-GB-Karte genügt oder ob 16 GB die bessere Investition sind.

### NVIDIA läuft, bei AMD und Intel kommt Bastelei dazu

Der Hersteller entscheidet über den Aufwand bei der Einrichtung. Auf NVIDIA-Karten läuft lokale KI ohne Zusatzarbeit, weil alle gängigen Werkzeuge dafür gebaut sind. Ollama unterstützt auch AMD- und Intel-Karten, dokumentiert dazu aber Einschränkungen, und im Projekt liegen dutzende offene Fehlermeldungen zu diesen Karten (Ollama, GPU-Dokumentation und offene Issues, Stand September 2026).

Für die Praxis heißt das: Wer eine Radeon im Rechner hat, kommt in der Regel zum Ziel und plant einen Abend für Treiber und Versionen ein. Wer neu kauft und keine Fehlersuche mag, nimmt NVIDIA. Diese Empfehlung ist keine Aussage über die Qualität der Karten, sondern über die Reife der Software rundherum.

![Zwei Grafikkarten mit unterschiedlicher Speichergröße nebeneinander auf einem Werkstatttisch für lokale KI](https://gerlinger.ai/assets/blog/grafikkarte-fuer-lokale-ki-vergleich.webp)

### Was du vor dem Kauf prüfst

Vier Prüfungen genügen, um die richtige Karte auszuwählen:

Entscheide, welche Aufgaben lokal laufen sollen. Zusammenfassen und umformulieren gelingt ab 4 Milliarden Parametern, für Büroarbeit in voller Breite planst du 12 Milliarden ein.

Milliarden Parameter mal 0,7 plus 3 GB. Bei zwei Zahlen im Namen die große nehmen.

Sollen mehrere hundert Seiten am Stück hineingehen, rechne mindestens 4 GB zusätzlich für das Kontextfenster.

Die Karte muss die Summe tragen. Bei RTX 5060 Ti und RX 9060 XT ausdrücklich die 16-GB-Fassung bestellen.

- Grafikspeicher passt zur Modellklasse Rechnung durchgeführt, Ergebnis liegt unter dem VRAM der Karte
- Reserve für das Kontextfenster eingeplant Mindestens 3 GB, bei langen Dokumenten mehr
- Fassung der Karte geprüft 16 GB statt 8 GB bei Modellen, die es doppelt gibt
- Hersteller bewusst gewählt NVIDIA ohne Zusatzaufwand, AMD mit Zeit für Treiber
- Netzteil und Gehäuse geprüft Leistungsaufnahme und Kartenlänge passen zum vorhandenen Rechner

### So prüfst du vor dem Kauf, ob deine Karte schon reicht

Bevor du Geld ausgibst, findest du in zehn Minuten heraus, was der vorhandene Rechner leistet. Der Ablauf besteht aus drei Prüfungen.

- Speicher der verbauten Karte auslesen. Unter Windows zeigt der Task-Manager im Reiter Leistung den dedizierten Grafikspeicher. Genauer geht es bei NVIDIA über den Befehl nvidia-smi im Terminal, der die belegte und die freie Menge nennt. Am Mac steht der gesamte Arbeitsspeicher unter „Über diesen Mac", davon rechnest du mit zwei Dritteln.
- Ein Modell laden und beobachten, wo es rechnet. Nach dem Start eines Modells zeigt der Befehl ollama ps die Spalte PROCESSOR. Steht dort 100 Prozent GPU, liegt das Modell vollständig auf der Karte. Erscheint ein Anteil CPU, wurde ausgelagert, und das Tempo bricht ein. Diese eine Zeile ist die verlässlichste Auskunft, ob deine Hardware zum Modell passt.
- Mit dem echten Dokument gegenprüfen, nicht mit „Hallo". Ein kurzer Testprompt füllt das Kontextfenster nicht und verrät deshalb nichts über den späteren Bedarf. Gib eine echte Vorlage aus deinem Alltag hinein, ein Angebot oder ein Protokoll, und schau während der Antwort erneut auf ollama ps. Erst dieser Test zeigt, ob die Karte im Arbeitsalltag trägt.

![Bildschirm mit ausgelesenem Grafikspeicher beim Test eines lokalen KI-Modells](https://gerlinger.ai/assets/blog/grafikkarte-fuer-lokale-ki-test.webp)

### Wenn eigene Hardware nicht die Antwort ist

Nicht jeder Anwendungsfall verlangt eine eigene Karte. Zwei Alternativen sind ehrlich zu nennen.

Offene Modelle bei einem Anbieter betreiben lassen. Groq, Together AI und Nebius hosten genau die Modelle, die du lokal installieren würdest. Entscheidend ist dabei der Firmensitz, nicht der Standort des Rechenzentrums: Der US CLOUD Act von 2018 verpflichtet Unternehmen unter US-Recht zur Herausgabe von Daten, auch wenn die Server in Europa stehen. Groq betreibt ein Rechenzentrum in Helsinki (Groq Newsroom, Juli 2025) und bleibt trotzdem US-Unternehmen. Nebius sitzt in Amsterdam.

Bei der Cloud bleiben, wo Daten unkritisch sind. Für allgemeine Recherche und Standardtexte ohne Personenbezug bleibt [Cloud-KI](https://gerlinger.ai/lexikon/cloud-ki) bequemer und oft günstiger. Die saubere Trennung übernimmt eine [Hybrid-KI](https://gerlinger.ai/lexikon/hybrid-ki): lokal, wo Namen oder Betriebswissen im Spiel sind, Cloud beim Rest. Die Abwägung im Detail steht im Leitfaden zu [lokaler KI im Mittelstand](https://gerlinger.ai/blog/lokale-ki-mittelstand).

Es gibt auch die harte Obergrenze. Die größten offenen Modelle sprengen jede Bürohardware: Für ein Modell wie Kimi K3 nennt die Dokumentation der Anbieter 610 GB Arbeitsspeicher, das entspricht 20 bis 40 gut ausgestatteten Bürorechnern. Solche Modelle bleiben ein Fall für gemietete Rechenzeit, nicht für den Schrank im Büro.

### Fazit: Speicher kaufen, nicht Tempo

Die Wahl der Grafikkarte für lokale KI hat eine einzige zentrale Größe: den Grafikspeicher. Rechne dein Zielmodell mit dem Faktor 0,7 plus 3 GB Puffer durch. Bei zwei Zahlen im Namen zählt die große. Kaufe dann die Karte mit dem meisten Speicher in deinem Budget.

Für den Mittelstand heißt das konkret: 12 GB sind der Einstieg, 16 GB die Empfehlung mit Reserve, 32 GB der Weg, wenn mehrere Mitarbeiter gleichzeitig arbeiten oder Dokumente sehr lang werden. Am Mac entscheidet die Speichergröße beim Kauf, weil sie sich später nicht ändern lässt.

Und die vielleicht wichtigste Erkenntnis: Der Sprung von 8 auf 16 GB verändert mehr als jeder Generationswechsel bei gleicher Speichergröße. Wer heute eine Karte für lokale KI aussucht, kauft Kapazität, nicht Bildrate.

Du willst wissen, welche Aufgaben in deinem Betrieb überhaupt lokal laufen sollten, bevor du Hardware bestellst? In einer kostenlosen Erstberatung sortieren wir deine Prozesse nach Sensibilität und Nutzen. Danach steht fest, welche Modellklasse du brauchst und welche Karte dazu passt.

Jannis Gerlinger berät kleine und mittlere Unternehmen bei der Einführung von Künstlicher Intelligenz und setzt die Lösungen selbst um: KI-Assistenten, Automationen und individuelle Web-Apps. Als Geschäftsführer der JANGER GmbH arbeitet er seit 2007 an digitalen Systemen für Handwerk, Handel und Industrie, von Onlineshops bis zu internen Werkzeugen. Seine vom TÜV Rheinland geprüfte Qualifikation in Verkaufspsychologie verbindet technisches Know-how mit einem tiefen Verständnis für Geschäftsprozesse.

### Häufige Fragen.

Deine Frage fehlt? [Schreib mir](mailto:hallo@gerlinger.ai), ich antworte innerhalb eines Werktags.

#### Wie viel VRAM brauche ich für lokale KI?

Rechne mit Milliarden Parameter mal 0,7 plus 3 GB Puffer. Ein Modell mit 12 Milliarden Parametern braucht so rund 11 GB und passt auf eine 12-GB-Karte. Für Büroarbeit im Mittelstand ist der Bereich 12 bis 16 GB die sinnvolle Zielgröße, 8 GB reichen für kleine Modelle bis 4 Milliarden Parameter.

#### Welche Grafikkarte ist die beste für lokale KI?

Die beste Karte ist die mit dem meisten Speicher in deinem Budget, nicht die schnellste. In der RTX 50 Serie sind das die RTX 5070 Ti und die RTX 5080 mit je 16 GB, nach oben die RTX 5090 mit 32 GB. Für den Einstieg genügt eine RTX 5070 mit 12 GB.

#### Reichen 8 GB VRAM für lokale KI?

Ja, für kleine Modelle. Qwen 3.5 mit 4 Milliarden Parametern belegt 3,4 GB und läuft auf einer 8-GB-Karte flüssig. Für die Klasse mit 12 Milliarden Parametern, die im Büro die meiste Arbeit erledigt, wird es zu knapp: Gemma 4 12B belegt 7,6 GB und braucht mit Kontextfenster mehr Luft.

#### Was passiert, wenn das Modell nicht in den Grafikspeicher passt?

Das Werkzeug verteilt das Modell auf Grafikkarte und Prozessor. Der Teil im Arbeitsspeicher rechnet deutlich langsamer, die Antwort tröpfelt dann Wort für Wort. Das Modell arbeitet weiter, taugt aber nicht mehr für den Alltag.

#### Ist ein Mac oder eine Grafikkarte besser für lokale KI?

Beides funktioniert, der Unterschied liegt in der Bauart. Am Mac teilen Prozessor und Grafik denselben Arbeitsspeicher. macOS reserviert davon ein Drittel für das System, bei Geräten über 32 GB nur ein Viertel. Ein Mac mit 32 GB stellt so etwa 21 GB für das Modell bereit, ein Mac mit 64 GB rund 48 GB. Dafür ist eine NVIDIA-Karte bei gleicher Speichergröße schneller.

#### Läuft lokale KI auf einer AMD Radeon?

Ja, mit mehr Aufwand. Ollama unterstützt AMD- und Intel-Karten, dokumentiert dazu aber Einschränkungen, und im Projekt liegen dutzende offene Fehlermeldungen zu diesen Karten (Stand September 2026). Wer eine Radeon RX 9070 XT mit 16 GB besitzt, kommt zum Ziel. Wer neu kauft und keine Fehlersuche will, nimmt NVIDIA.

#### Brauche ich überhaupt eine Grafikkarte für lokale KI?

Für erste Tests nein, der Prozessor allein genügt. Dann antwortet die KI aber so langsam, dass Warten zur Regel wird. Sobald mehrere Mitarbeiter damit arbeiten sollen, ist eine Grafikkarte mit ausreichend Speicher die Voraussetzung für brauchbares Tempo.

### Passt dazu.

Drei Beiträge, die dieselbe Frage aus einem anderen Winkel beantworten.

#### GEO für Unternehmen: Sichtbar bei ChatGPT und Google AI

GEO erklärt: Wie kleine und mittlere Unternehmen bei ChatGPT, Perplexity und Google AI Overviews sichtbar werden, mit Checkliste und echten Studienzahlen.

#### KI-Chatbot-Anbieter Vergleich 2026: Die Wahl für KMU

KI-Chatbot-Anbieter im Vergleich 2026: Preise, Hosting-Standort und AVV von Flowmatiq, moinAI, Lime Connect, Chatarmin und Melibo für deine Auswahl.

#### Europäische KI-Anbieter im Vergleich 2026

Europäische KI-Anbieter wie Mistral und Aleph Alpha im DSGVO-Vergleich zu OpenAI und Anthropic: Datenstandort, Kosten und Auswahlkriterien 2026.
