KI-Tools einsteiger

Lokal betriebene Modelle

KI-Sprachmodelle, die vollständig auf der eigenen Unternehmenshardware laufen, ohne Datenübertragung an externe Cloud-Dienste. Alle Verarbeitungsschritte finden im eigenen Netzwerk statt.

Ausführliche Erklärung

Lokal betriebene Modelle – auch als On-Premise-KI oder Self-Hosted AI bezeichnet – sind KI-Sprachmodelle, die auf der unternehmenseigenen IT-Infrastruktur ausgeführt werden. Im Gegensatz zu Cloud-basierten Lösungen wie ChatGPT oder Claude verbleiben sämtliche verarbeiteten Daten im eigenen Netzwerk. Die Modelle selbst sind häufig Open Source und stehen kostenfrei zur Verfügung, etwa Meta Llama, Mistral oder Qwen. Zur Ausführung werden spezielle Software-Tools wie Ollama (kommandozeilenbasiert) oder LM Studio (grafische Oberfläche) eingesetzt, die auch auf handelsüblichen Rechnern mit ausreichend Arbeitsspeicher lauffähig sind.

Für KMU ergeben sich drei zentrale Vorteile: Erstens bleibt die vollständige Datenhoheit beim Unternehmen, da keine Informationen an externe Anbieter übermittelt werden. Zweitens entfallen nach der initialen Hardware-Investition laufende API-Gebühren oder Lizenzkosten. Drittens lassen sich datenschutzrechtliche Anforderungen der DSGVO einfacher erfüllen, da kein Drittstaatentransfer und keine Auftragsverarbeitung mit Cloud-Anbietern erforderlich sind. Quantisierte Modellvarianten reduzieren dabei den Speicherbedarf erheblich: Modelle wie Llama 3.2 laufen bereits mit 8 GB RAM, größere Modelle benötigen dedizierte GPUs mit entsprechendem VRAM.

Wichtige Einschränkung: Lokal betriebene Modelle erreichen je nach Anwendungsfall und Modellgröße etwa 90-95 Prozent der Leistung von kommerziellen Spitzenmodellen. Für sehr komplexe Aufgaben oder spezialisierte Funktionen kann eine Cloud-Lösung weiterhin überlegen sein. Zudem ist internes IT-Know-how oder externe Unterstützung erforderlich, um die Systeme zu installieren, zu konfigurieren und zu betreiben. Eine Hybrid-Strategie – lokale Modelle für Standardaufgaben, Cloud-Dienste für hochkomplexe Anfragen – hat sich in der Praxis vielfach bewährt.

Praxisbeispiel

Eine Steuerberatungskanzlei mit 12 Mitarbeitenden in Graz setzt ein lokal betriebenes Llama-3-Modell auf einem dedizierten Server ein. Mandantendokumente werden ausschließlich intern analysiert und zusammengefasst, ohne dass Daten die Kanzlei verlassen. Die einmalige Hardware-Investition von etwa 4.000 Euro amortisiert sich nach sechs Monaten gegenüber einem Cloud-Abonnement. Die Kanzlei erfüllt damit ihre strengen Verschwiegenheitspflichten und vermeidet datenschutzrechtliche Risiken.

Code-Beispiel

#!/bin/bash
# Lokales Modell mit Ollama starten
# Installation: https://ollama.ai

# Modell herunterladen
ollama pull llama3.2

# Modell starten und interaktiv nutzen
ollama run llama3.2

# Oder via API ansprechen (OpenAI-kompatibel)
curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Fasse folgendes Dokument zusammen: ..."
}'

Quellen

Zuletzt aktualisiert: 6. Juli 2026