Start / Blog / Lokale KI installieren: Anleitung in 6 Schritten

Praxis-Guides

Lokale KI installieren: Anleitung in 6 Schritten

Lokale KI installieren ohne Cloud: Schritt-für-Schritt mit Ollama, LM Studio und GPT4All. Plus Modell- und Hardware-Wahl für den Mittelstand 2026.

Inhaltsverzeichnis

Inhalt

Das Wichtigste in Kürze

  • Lokale KI installierst du in 6 Schritten: Werkzeug wählen, installieren, Modell laden, testen, mit eigenen Daten verbinden, absichern
  • Für Einsteiger ohne Terminal ist LM Studio am einfachsten, für Entwickler und Server ist Ollama der Standard
  • Eine Faustregel für den Speicher: rund 0,7 GB VRAM pro Milliarde Parameter, ein 8B-Modell braucht so etwa 6 bis 7 GB
  • Gemma 4, Qwen 3.5, Llama und DeepSeek laufen lokal und sprechen Deutsch, Gemma 4 steht seit April 2026 unter Apache 2.0
  • Lokale KI verarbeitet alle Daten im Haus, das löst das Datenschutz-Hemmnis, das laut Bitkom (2025) 48 Prozent der Unternehmen beim KI-Einsatz nennen
  • Claude, ChatGPT und Gemini lassen sich nicht lokal installieren, weil Anthropic, OpenAI und Google die Gewichte ihrer Top-Modelle nicht veröffentlichen, offene Modelle wie Llama, Qwen oder Mistral schon

Lokale KI installierst du in sechs Schritten: Werkzeug auswählen, Werkzeug installieren, ein Modell laden, die ersten Prompts testen, die KI mit deinen eigenen Daten verbinden und das Setup absichern. Auf einem aktuellen Bürorechner bist du in unter einer Stunde startklar. Die komplette Software ist kostenlos, alle Daten bleiben im Haus.

Diese Anleitung zeigt dir den praktischen Weg, ohne Vorwissen vorauszusetzen. Sie richtet sich an Geschäftsführer und IT-Verantwortliche im Mittelstand. Du setzt lokale KI selbst auf oder willst den Aufwand realistisch einschätzen. Wenn du zuerst die strategische Frage klären willst, ob sich lokale KI gegenüber der Cloud lohnt, hilft der Leitfaden zu lokaler KI im Mittelstand.

IT-Techniker und Auszubildende schließen einen Rechner unter dem Schreibtisch an
Vorschaubild des Videos: Lokale KI: Was auf deinen Rechner gehört, und was nicht 23 Min Lokale KI: Was auf deinen Rechner gehört, und was nichtYouTube lädt erst nach dem Klick
Im Video siehst du die Installation und die Modellwahl in echt: welche Modelle auf eine 12-GB-Karte passen, wie du das vorher ausrechnest und wo die Cloud weiter gewinnt.

Lokale KI läuft vollständig auf deiner eigenen Hardware

Lokale KI ist ein KI-System, das komplett auf den eigenen Geräten eines Unternehmens läuft, ohne Daten an externe Cloud-Dienste zu senden. Statt eine Anfrage an einen Anbieter wie OpenAI zu schicken, verarbeitet ein Werkzeug auf deinem Rechner die Anfrage selbst. Du nutzt dafür offene Modelle wie Llama, Qwen oder Mistral, die als Open-Source-KI frei verfügbar sind. Chat-Produkte wie Claude, ChatGPT oder Gemini bleiben dabei außen vor: Anthropic, OpenAI und Google veröffentlichen die Gewichte ihrer Top-Modelle nicht, eine lokale Installation ist technisch nicht möglich.

Der Unterschied zur Cloud ist einfach erklärt. Cloud-KI startet in Minuten ohne eigene Hardware, lokale KI hält alle Daten im Haus und erfüllt die DSGVO ohne Auftragsverarbeitung. Bei lokaler KI verlässt kein Dokument, keine Kundenakte und kein Prompt dein Netzwerk. Genau das ist für viele Mittelständler der entscheidende Punkt.

Der Datenschutz ist 2026 das stärkste Argument für den lokalen Weg. Ich bin Jannis Gerlinger, Geschäftsführer der JANGER GmbH und seit 2007 in der Digitalbranche, heute mit Fokus auf KI, mit vom TÜV Rheinland geprüfter Qualifikation in Verkaufspsychologie. Dabei sehe ich es immer wieder: Die Wahl zwischen Cloud und lokal entscheidet über den Datenschutz. Laut Bitkom (2025) nennt fast die Hälfte der Unternehmen genau hier die größten Bedenken beim KI-Einsatz.

48%

der Unternehmen beklagen die hohen Anforderungen an den Datenschutz beim KI-Einsatz

Bitkom, 2025
39%

haben Angst, dass Daten in falsche Hände geraten

Bitkom, 2025
57%

der Unternehmen ab 20 Beschäftigten nutzen bereits KI

Bitkom, Sept 2026

Lokale KI nimmt beiden Bedenken die Grundlage: Ohne Datenabfluss und ohne externe Verarbeitung entfällt das Risiko. Die Technik dahinter ist ein LLM, ein großes Sprachmodell, das auf deiner Hardware rechnet. Diese Form der Bereitstellung gehört zur Kategorie On-Premise, also der Betrieb von Software auf eigenen Systemen statt in fremden Rechenzentren.

Diese drei Voraussetzungen brauchst du

Bevor du loslegst, prüfst du drei Dinge: genug Arbeitsspeicher, eine geeignete Grafikkarte und etwas freien Festplattenplatz. Lokale KI braucht vor allem schnellen Speicher, weil das Modell komplett geladen werden muss.

Der wichtigste Wert ist der Grafikspeicher, kurz VRAM. Als Faustregel gilt: rund 0,7 GB VRAM pro Milliarde Parameter bei gängiger Quantisierung, plus 3 GB Puffer für Kontextfenster und System. Ein Modell mit 8 Milliarden Parametern belegt so rund 5,6 GB und braucht mit Puffer etwa 8,6 GB. Quantisierung verkleinert das Modell, indem sie die Zahlen im Modell gröber speichert, fast ohne Qualitätsverlust.

  • Grafikkarte (GPU) mit 8 GB VRAMReicht für Modelle bis 8 Milliarden Parameter. Mehr VRAM erlaubt größere, klügere Modelle.
  • Arbeitsspeicher (RAM): mindestens 16 GBFür kleine Modelle bis 8 Milliarden Parameter. Für 70B-Modelle eher 64 GB oder mehr.
  • Freier Speicherplatz: 10 bis 50 GBJedes Modell belegt 4 bis 40 Gigabyte, je nach Größe. Plane Platz für zwei bis drei Modelle ein.
  • Betriebssystem aktuellWindows 11, aktuelles macOS oder eine gängige Linux-Distribution funktionieren alle.

Eine wichtige Entwarnung: Es muss nicht der teure Server sein. Eine einzelne moderne Grafikkarte wie eine NVIDIA RTX 5090 mit 32 GB VRAM (Stand Mitte 2026 ab rund 2.500 Euro, je nach Verfügbarkeit auch mehr) bewältigt bereits anspruchsvolle Modelle. Wer Apple bevorzugt, betreibt selbst 70B-Modelle auf einem MacBook Pro, wie der Beitrag zum Apple M5 für lokale KI zeigt. Auch auf einem Laptop ohne dedizierte Grafikkarte reicht für erste Tests der Prozessor allein, dann antwortet die KI eben langsamer.

Beim Hersteller der Karte gibt es einen praktischen Unterschied, der selten in Anleitungen steht. Auf NVIDIA-Karten läuft lokale KI ohne Zusatzaufwand, bei AMD und Intel kommt Bastelei dazu. Ollama unterstützt beide, nennt in seiner GPU-Dokumentation aber eigene Voraussetzungen für ROCm und Vulkan, und im Projekt liegen über 30 offene Fehlermeldungen zu AMD- und Intel-Karten (Ollama, GPU-Dokumentation und offene Issues, Stand August 2026). Wer eine Radeon im Rechner hat, kommt meist zum Ziel, plant aber einen Abend mit Treibern ein. Wer neu kauft und keine Lust auf Fehlersuche hat, nimmt NVIDIA. Die Auswahl nach Speichergröße steht im Ratgeber zur Grafikkarte für lokale KI.

Workstation mit leistungsstarker Grafikkarte für lokale KI in einem deutschen Mittelstands-Büro

In 6 Schritten zur eigenen lokalen KI

Der folgende Ablauf führt dich vom leeren Rechner zur funktionierenden KI. Jeder Schritt baut auf dem vorherigen auf. Plane für den ersten Durchlauf etwa eine Stunde ein.

Lokale KI installieren: der 6-Schritte-Weg
01
Schritt 1: Werkzeug auswählen

Entscheide zwischen LM Studio (grafisch, für Einsteiger), Ollama (Terminal, für Entwickler und Server) oder GPT4All (sehr einfach, läuft auch nur auf dem Prozessor).

02
Schritt 2: Werkzeug installieren

Lade das Werkzeug von der offiziellen Seite und installiere es wie jede andere Software. Ollama richtet sich als Hintergrunddienst ein, LM Studio und GPT4All starten als Fenster-Werkzeug mit Oberfläche.

03
Schritt 3: Modell laden

Wähle ein Modell aus dem integrierten Katalog, etwa Gemma 4 12B. Das Werkzeug lädt je nach Modellgröße 4 bis 20 Gigabyte herunter. Bei Ollama genügt ein Befehl wie ollama run gemma4:12b.

04
Schritt 4: Erste Prompts testen

Stelle der KI konkrete Aufgaben aus deinem Alltag: eine E-Mail zusammenfassen, einen Text umformulieren, eine Tabelle erklären. So prüfst du Qualität und Tempo.

05
Schritt 5: Mit eigenen Daten verbinden

Aktiviere die Dokumenten-Funktion (RAG), damit die KI Fragen anhand deiner echten Firmendokumente beantwortet. GPT4All bringt das mit, für mehr nutzt du AnythingLLM oder Open WebUI.

06
Schritt 6: Setup absichern

Lege fest, wer Zugriff hat, schalte unnötige Telemetrie ab und dokumentiere das System für deinen Datenschutzbeauftragten.

Schritt 1 bis 3: Vom Download zum laufenden Modell

Die ersten drei Schritte bringen dich zu einer KI, mit der du chatten kannst. Mit LM Studio sieht das so aus: Du installierst das Werkzeug, klickst auf die integrierte Modellsuche, lädst Gemma 4 12B und beginnst im Chat-Fenster. Du brauchst dafür weder das Terminal noch eine Zeile Code.

Mit Ollama läuft es über die Kommandozeile. Nach der Installation tippst du ollama run gemma4:12b und das Werkzeug lädt das Modell und startet den Chat. Ollama läuft danach als Dienst im Hintergrund und bietet eine Schnittstelle, die mit der OpenAI-API kompatibel ist. Das ist der Grund, warum Entwickler Ollama bevorzugen: Bestehende Anwendungen lassen sich oft mit minimalem Aufwand auf das lokale Modell umstellen.

Bildschirm zeigt das Chat-Fenster einer lokal installierten KI neben einem Terminal mit Ollama

Schritt 4 bis 6: Vom Spielzeug zum Werkzeug

Nach den ersten Prompts trennt sich die Spielerei vom echten Nutzen. Den größten Hebel bringt Schritt 5, die Verbindung mit deinen eigenen Daten. Genau dafür gibt es RAG, ein Verfahren, das ein Sprachmodell mit einer Vektor-Datenbank deiner Dokumente verbindet. Die KI sucht dann zuerst in deinen Unterlagen und antwortet auf dieser Basis, statt allgemein zu raten.

Ein Beispiel: Stell dir vor, du lädst deine Angebotsvorlagen, Preislisten und das Handbuch in das System. Danach beantwortet die lokale KI Fragen wie "Welche Garantie geben wir auf Bauteil X?" mit der korrekten Stelle aus deinem Handbuch. GPT4All bringt eine einfache Version dieser Funktion bereits mit. Für mehr Nutzer und Komfort setzt du Werkzeuge wie AnythingLLM oder Open WebUI auf Ollama auf.

Schritt 6 sichert den Betrieb ab. Lege fest, wer das System nutzen darf, und schalte optionale Telemetrie ab. Bei lokaler KI bleibt der Datenschutz nur dann lückenlos, wenn auch Zugriffe und Protokolle sauber geregelt sind.

Du willst lokale KI nicht nur testen, sondern sauber im Unternehmen verankern? In einer kostenlosen Erstberatung klären wir, welches Werkzeug, welches Modell und welche Hardware zu deinen Anforderungen passen und wie du DSGVO-sicher startest.

Analysegespräch buchen

Ollama, LM Studio oder GPT4All: das passende Werkzeug

Drei Werkzeuge dominieren 2026 die lokale KI im Mittelstand. Sie erreichen dasselbe Ziel auf unterschiedlichen Wegen. Die Wahl hängt davon ab, ob du eine grafische Oberfläche willst, eine Schnittstelle für eigene Anwendungen brauchst oder maximale Einfachheit suchst.

Ollama ist ein quelloffenes Kommandozeilen-Werkzeug für Entwickler und Server mit einer OpenAI-kompatiblen Schnittstelle. LM Studio ist ein kostenloses grafisches Werkzeug für Einsteiger ohne Terminal-Kenntnisse. GPT4All ist ein kostenloses quelloffenes Desktop-Werkzeug von Nomic AI, die lokale KI auch ganz ohne Grafikkarte startet und keine Internetverbindung braucht.

KriteriumOllamaLM StudioGPT4All
BedienungTerminalgrafische Oberflächegrafische Oberfläche
Für wenEntwickler, ServerEinsteigerabsolute Einsteiger
Schnittstelle (API)ja, OpenAI-kompatibelja, lokaler Serverja, lokaler Server
Dokumente (RAG)über Zusatz-Werkzeugüber Zusatz-Werkzeugeingebaut
Quelloffenja (MIT)neinja
Läuft ohne GPUja, langsamerja, langsamerja, optimiert für CPU

Zum Vergleichen seitlich wischen

Für die meisten Mittelständler gilt eine klare Empfehlung. Ohne Terminal startest du am besten mit LM Studio. Für ein lokales KI-System mit mehreren Nutzern oder eigener Software ist Ollama die richtige Wahl. GPT4All passt, wenn ein einzelner Mitarbeiter auf einem Notebook ohne starke Grafikkarte schnell etwas ausprobieren will.

Ein Hinweis zum Datenschutz: Bei der Inferenz, also der eigentlichen Verarbeitung, senden alle drei Werkzeuge keine Inhalte nach außen. Unterschiede gibt es bei der Telemetrie des Werkzeugs selbst. Ollama ist quelloffen und sammelt keine Nutzungsdaten, LM Studio ist closed source und hat eine anonyme Analyse standardmäßig aktiviert. Diese Analyse lässt sich in den Einstellungen abschalten.

Lokale KI braucht ein Modell, das zur Hardware passt

Das Modell entscheidet über Qualität und Tempo. 2026 steht eine ausgereifte Auswahl bereit, die von der 8-GB-Grafikkarte bis zur Workstation alles bedient. Vier Modellfamilien sind für den deutschen Mittelstand besonders relevant, weil sie Deutsch beherrschen und frei verfügbar sind.

ModellStärkeDeutschBelegt auf der Karte
Qwen 3.5 9BAllrounder, guter Einstiegja6,6 GB
Gemma 4 12BBüroarbeit, Apache 2.0ja7,6 GB
Qwen 3.5 4Bschwache Hardware, Notebookja3,4 GB
Gemma 4 26Bmehr Tiefe, Mixture-of-Expertsja18 GB

Zum Vergleichen seitlich wischen

Die Größenangaben stammen von den Tag-Seiten der Ollama-Modellbibliothek (abgerufen im August 2026) und meinen die tatsächliche Downloadgröße in der gängigen 4-Bit-Fassung. Für den Start empfehle ich Gemma 4 mit 12 Milliarden Parametern auf einer 12-GB-Karte. Diese Kombination läuft flüssig, spricht Deutsch und deckt fast alle Büroaufgaben ab. Steht nur eine 8-GB-Karte bereit, nimm Qwen 3.5 mit 4 Milliarden Parametern.

Die Faustregel und die Falle bei zwei Zahlen

Die Faustregel mit dem Faktor 0,7 ist nicht geraten. Das gepresste GGUF-Format braucht bei der Standard-Quantisierung Q4_K_M rund 4,9 Bit pro Gewicht, also gut 0,6 GB je Milliarde Parameter (llama.cpp, Dokumentation zur Quantisierung, 2026). Der Aufschlag auf 0,7 deckt den Zwischenspeicher fürs Kontextfenster ab. Die einfachere Regel „Milliarden gleich Gigabyte" gilt nur für unkomprimierte Modelle und rechnet dich bei den gepressten um mehr als 40 Prozent zu hoch.

Bei manchen Modellen stehen zwei Zahlen nebeneinander, etwa Gemma 4 in der Kennung 26b-a4b. Für den Speicherbedarf zählt immer die große Zahl. Die kleine sagt nur, wie viele Parameter pro Wort mitrechnen, nicht wie viele geladen sein müssen. Diese Bauart heißt Mixture-of-Experts. Google gibt für Gemma 4 mit 26 Milliarden Parametern rund 4 Milliarden aktive an (Google AI for Developers, Gemma 4 Model Overview, 2026), im Speicher liegen trotzdem alle 26. Wer die kleine Zahl nimmt, rechnet mit 2,8 GB und landet tatsächlich bei rund 18 GB.

Der Vorteil dieser Bauart ist Tempo, nicht Speicher. Ein Mixture-of-Experts-Modell antwortet bei gleicher Größe deutlich schneller als ein klassisches Modell, weil pro Wort nur ein Bruchteil der Parameter rechnet. Auf die Frage, ob es auf deine Karte passt, hat das keinen Einfluss.

Im Zweifel startest du klein und wechselst später auf ein größeres Modell, wenn die Qualität nicht reicht. Welche Karte für welche Modellklasse reicht, steht ausführlich im Ratgeber zur Grafikkarte für lokale KI.

Die Fassung im Katalog ist nicht immer das Original

Ein Modell aus dem Katalog eines Werkzeugs kann anders eingestellt sein als das Original des Herstellers. Der wichtigste Fall betrifft das Kontextfenster, also die Textmenge, die das Modell auf einmal überblickt. Ollama richtet den Standardwert nach deinem Grafikspeicher: unter 24 GB sind es 4.000 Token, zwischen 24 und 48 GB dann 32.000, darüber 256.000 (Ollama, Dokumentation zur Kontextlänge, Stand August 2026). Auf einer typischen Bürokarte mit 12 oder 16 GB überblickt das Modell also rund sechs Seiten, obwohl es ein Vielfaches könnte.

Der Haken liegt im Verhalten bei Überschreitung: Ollama schneidet den überzähligen Teil still ab, ohne Warnung und ohne Fehlermeldung. Du bekommst also eine Zusammenfassung, die einen Teil des Dokuments nie gesehen hat. Über die Kommandozeile arbeitet llama.cpp mit einem festen Standardwert von 4.096 Token (llama-cli-Handbuch, 2026). LM Studio prüft dagegen beim Laden, was in deinen Speicher passt.

Vor dem ersten langen Dokument also das Kontextfenster hochsetzen, in Ollama über die Umgebungsvariable OLLAMA_CONTEXT_LENGTH oder pro Sitzung mit /set parameter num_ctx. Und danach gegenprüfen, ob das Modell noch vollständig auf der Grafikkarte liegt: Ein größeres Fenster kostet zusätzlichen Speicher.

Diese Aufgaben übernimmt lokale KI im Mittelstand

Lokale KI entlastet dein Team bei wiederkehrender Schreib- und Sucharbeit, ohne dass sensible Daten das Haus verlassen. Der Wert steckt nicht in einer einzelnen Funktion, sondern in der Summe der Stunden, die zurück ins Tagesgeschäft fließen. Drei Einsatzfelder bringen meist den schnellsten Nutzen.

  • Wissen sofort auffindbar machen: Statt im Ordner-Dschungel zu suchen, fragst du die KI und bekommst die Antwort samt Fundstelle aus deinen eigenen Dokumenten. Das kann die Suche von Minuten auf Sekunden verkürzen.
  • Routine-Korrespondenz entwerfen: Antwortmails, Protokolle und Textbausteine entstehen als Entwurf in Sekunden, dein Team prüft und gibt frei. Die manuelle Tipparbeit schrumpft auf das Kontrollieren.
  • Vertrauliche Texte verarbeiten: Verträge zusammenfassen, lange Unterlagen auswerten, Notizen strukturieren. Genau hier spielt lokale KI ihre Stärke aus, weil die Daten das Netzwerk nie verlassen.

Der gemeinsame Nenner ist der Datenschutz. Sobald personenbezogene oder geheime Daten im Spiel sind, ist der lokale Weg dem Cloud-Weg überlegen. Für unkritische Aufgaben wie allgemeine Recherche bleibt die Cloud eine bequeme Ergänzung. Eine Hybrid-Strategie kombiniert daher beides, abhängig von der Sensibilität der Daten.

Ein realistischer Einstieg beginnt mit einem einzigen Anwendungsfall. Du wählst den Prozess mit dem höchsten manuellen Aufwand, richtest lokale KI dafür ein und misst die gesparte Zeit in Stunden pro Woche. Erst wenn diese Zahl steht, erweiterst du auf weitere Aufgaben.

Offene Modelle ohne eigene Hardware: der Firmensitz entscheidet

Du musst offene Modelle nicht selbst betreiben. Anbieter wie Groq, Together AI und Nebius hosten genau die Modelle, die du auch lokal installieren würdest, und stellen sie über eine Schnittstelle bereit. Das ist der Mittelweg zwischen eigener Grafikkarte und einem Chat-Dienst wie ChatGPT: Du bleibst bei offenen Modellen, sparst aber die Anschaffung.

Bei der Wahl des Anbieters zählt der Firmensitz, nicht der Standort des Rechenzentrums. Grund ist der US CLOUD Act von 2018: Er verpflichtet Unternehmen, die US-Recht unterliegen, Daten auf Anordnung herauszugeben, auch wenn die Server in Europa stehen. Groq betreibt zum Beispiel ein Rechenzentrum in Helsinki (Groq Newsroom, Juli 2025), bleibt als US-Unternehmen aber im US-Rechtsraum. Nebius sitzt in Amsterdam und damit im europäischen Rechtsraum.

WegWo liegen die DatenAufwandWann sinnvoll
Eigene Grafikkarteim HausEinrichtung, WartungPersonenbezug oder Betriebswissen im Spiel
Anbieter in Europabeim Anbieter, EU-RechtZugangsdaten, kein Betriebviele Nutzer, wenig eigene IT
Anbieter in den USAbeim Anbieter, US-RechtZugangsdaten, kein Betriebunkritische Inhalte, maximales Tempo

Zum Vergleichen seitlich wischen

Wer die europäische Anbieterlandschaft im Ganzen abwägen will, findet den Vergleich im Beitrag zu europäischen KI-Anbietern.

Lokale KI stößt an drei Grenzen

Lokale KI ist stark, aber kein Allheilmittel. Drei Grenzen solltest du kennen, bevor du zu viel erwartest. Wer sie von Anfang an mitdenkt, plant entspannt und realistisch.

  • Die Hardware-Grenze. Die größten und klügsten Modelle, vergleichbar mit den besten Cloud-Diensten, brauchen Hardware, die schnell fünfstellig kostet. Auf einem normalen Notebook läuft nur die kleinere Liga. Für reine Recherche und Standard-Texte ohne sensible Daten bleibt Cloud-KI oft günstiger und bequemer. Die ehrliche Abwägung zwischen beiden Wegen steht im Leitfaden zu lokaler KI im Mittelstand.
  • Der Wartungsaufwand. Lokale KI bedeutet, dass du Updates, Sicherung und Zugriffsrechte selbst verantwortest. Bei einem einzelnen Nutzer ist das überschaubar, bei einem Team braucht es eine zuständige Person.

Lade Modelle und Werkzeuge nur von offiziellen Quellen herunter, etwa der Ollama-Website oder von Hugging Face. Modelle aus unbekannten Quellen können manipuliert sein. Prüfe bei sensiblen Setups, ob ein Modell wirklich offline arbeitet, indem du die Netzwerkverbindung testweise trennst.

  • Die Antwortqualität. Ein lokales Modell mit 9 bis 12 Milliarden Parametern ist nützlich, aber nicht so leistungsfähig wie die größten Cloud-Modelle. Für viele Büroaufgaben reicht das völlig. Für komplexe juristische oder strategische Analysen merkst du den Unterschied. Hier hilft die Hybrid-Strategie: lokal, wo Daten sensibel sind, Cloud, wo maximale Qualität zählt und die Daten unkritisch sind.

Wer diese drei Grenzen kennt, startet mit realistischen Erwartungen.

Unsicher, ob lokale KI zu deinen Prozessen passt? In einer kostenlosen Erstberatung schauen wir gemeinsam auf deine Anforderungen, deine Daten und deine Hardware und finden den pragmatischen Weg, ohne dass du dich vorher festlegen musst.

Analysegespräch buchen
Porträt von Jannis Gerlinger
Jannis Gerlinger KI-Berater und Geschäftsführer, JANGER GmbH

Jannis Gerlinger berät kleine und mittlere Unternehmen bei der Einführung von Künstlicher Intelligenz und setzt die Lösungen selbst um: KI-Assistenten, Automationen und individuelle Web-Apps. Als Geschäftsführer der JANGER GmbH arbeitet er seit 2007 an digitalen Systemen für Handwerk, Handel und Industrie, von Onlineshops bis zu internen Werkzeugen. Seine vom TÜV Rheinland geprüfte Qualifikation in Verkaufspsychologie verbindet technisches Know-how mit einem tiefen Verständnis für Geschäftsprozesse.

Häufige Fragen.

Deine Frage fehlt? Schreib mir, ich antworte innerhalb eines Werktags.

Was kostet es, lokale KI zu installieren?

Die Software ist kostenlos. Ollama, LM Studio und GPT4All sind gratis, ebenso die offenen Modelle wie Llama, Qwen oder Mistral. Du zahlst nur die Hardware. Auf einem vorhandenen Bürorechner mit moderner Grafikkarte startest du ohne zusätzliche Kosten. Für mehrere Nutzer rechnest du mit einem GPU-Server ab etwa 8.000 Euro (Stand Mitte 2026).

Brauche ich Programmierkenntnisse, um lokale KI zu installieren?

Nein. Mit LM Studio oder GPT4All installierst du lokale KI komplett über eine grafische Oberfläche, ohne eine einzige Zeile Code. Du lädst das Werkzeug herunter, wählst ein Modell aus einer Liste und chattest los. Nur Ollama setzt Grundkenntnisse im Terminal voraus, belohnt dich dafür aber mit einer Schnittstelle für eigene Anwendungen.

Welche Hardware brauche ich für lokale KI?

Für kleine Modelle bis 8 Milliarden Parameter reicht ein aktueller Rechner mit 16 GB Arbeitsspeicher und einer Grafikkarte mit 8 GB VRAM. Für größere 70B-Modelle reicht eine einzelne Grafikkarte wie die RTX 5090 mit 32 GB VRAM nicht mehr aus, dafür brauchst du zwei GPUs im Verbund oder einen Mac mit viel Unified Memory ab 64 GB. Notfalls läuft kleine lokale KI auch nur auf dem Prozessor, dann aber langsamer.

Ist lokale KI wirklich DSGVO-konform?

Lokale KI bietet einen hohen Datenschutz, weil keine Daten das Unternehmen verlassen. Es gibt keinen Drittlandtransfer und keine Auftragsverarbeitung durch einen Cloud-Anbieter. Das senkt das rechtliche Risiko deutlich. DSGVO-Konformität hängt aber zusätzlich von deinen internen Prozessen ab, etwa Zugriffsrechten und Protokollierung.

Welches lokale KI-Modell ist das beste für den Anfang?

Gemma 4 mit 12 Milliarden Parametern ist 2026 die beste Einstiegswahl. Es belegt 7,6 GB und passt damit auf eine 12-GB-Karte, spricht Deutsch und deckt die meisten Büroaufgaben ab. Auf einer 8-GB-Karte nimmst du Qwen 3.5 mit 4 Milliarden Parametern (3,4 GB). Wer mehr Reasoning braucht, greift zu DeepSeek.

Kann lokale KI auf meine eigenen Firmendokumente zugreifen?

Ja, über ein RAG-System. RAG verbindet das Sprachmodell mit einer Vektor-Datenbank deiner Dokumente. Die KI beantwortet Fragen dann anhand deiner echten Inhalte, statt zu raten. GPT4All bringt eine einfache Dokumenten-Funktion bereits mit, für größere Setups baust du RAG mit Werkzeugen wie AnythingLLM oder Open WebUI darauf auf.

Warum stehen bei manchen Modellen zwei Größen nebeneinander?

Diese Modelle sind als Mixture-of-Experts gebaut, etwa Gemma 4 in der Kennung 26b-a4b. Die große Zahl nennt alle Parameter, die kleine nur die, die pro Wort mitrechnen. Für den Speicherbedarf zählt immer die große: Gemma 4 26B belegt rund 18 GB, obwohl nur 4 Milliarden Parameter aktiv arbeiten. Der Vorteil dieser Bauart ist Tempo, nicht Speicher.

Läuft lokale KI auch auf einer AMD-Grafikkarte?

Ja, aber mit mehr Aufwand als bei NVIDIA. Ollama unterstützt AMD- und Intel-Karten, nennt dazu aber eigene Voraussetzungen für ROCm und Vulkan, und im Projekt liegen über 30 offene Fehlermeldungen zu diesen Karten (Stand August 2026). Wer eine Radeon besitzt, kommt meist zum Ziel und plant einen Abend für Treiber ein. Wer neu kauft, nimmt NVIDIA und spart sich die Fehlersuche.

Kann ich Claude, ChatGPT oder Gemini lokal installieren?

Nein. Anthropic, OpenAI und Google veröffentlichen die Gewichte ihrer Top-Modelle Claude, ChatGPT und Gemini nicht, eine lokale Installation ist technisch nicht möglich. Offene Modelle mit freigegebenen Gewichten wie Llama, Qwen, Mistral oder Googles eigene Gemma-Reihe laufen dagegen vollständig auf eigener Hardware, das ist der Weg, den diese Anleitung zeigt.