Warum lokale Modelle 2026 wieder Sinn machen
Ende 2023 sah es aus als wäre das Thema durch. GPT-4 war zu gut, lokal zu schlecht, die Hardware zu teuer. Drei Jahre später sieht die Rechnung anders aus.
Die Modelle sind auf einem Level wo Llama 4 Scout in 4bit-Quantisierung für 80 Prozent der Alltagsaufgaben reicht. Gebrauchte M2-Macs mit 64 GB Unified Memory bekommst du unter 1500 Euro. Und die API-Kosten von Claude oder GPT summieren sich bei Vielnutzung schneller als gedacht.
Wenn du täglich mit KI arbeitest, rechnet sich lokales Setup nach drei bis sechs Monaten.
Die Frage ist nur: welche Lösung für welche Hardware.
Ollama — der einfache Einstieg
Ollama ist der Weg des geringsten Widerstands. Du installierst ein Tool, ziehst ein Modell, startest.
ollama pull llama4:scout
ollama run llama4:scout
Drei Befehle, läuft. Es bringt eine REST-API mit, integriert sich problemlos mit Open WebUI, funktioniert als Backend für Claude Code Skills oder VS Code-Extensions.
Was ich gemessen habe auf dem M3 Max mit Llama 4 Scout (17B in 4bit):
| Metrik | Wert | |---|---| | Tokens pro Sekunde (Inference) | ~42 | | Tokens pro Sekunde (Prompt-Eval) | ~380 | | RAM-Verbrauch | ~11 GB | | Start-Zeit des Modells | ~6s |
Schwäche: Ollama abstrahiert viel. Du kannst nicht einfach exotische Quantisierungen verwenden oder den Prompt-Format-Stack feinjustieren. Für 90 Prozent der User ist das okay. Für den Rest ist es frustrierend.
MLX — wenn du Apple Silicon hast
Apple's MLX-Framework nutzt Unified Memory konsequent aus. Das heißt konkret: Dein GPU teilt sich den RAM mit der CPU, keine Daten müssen kopiert werden. Das macht bei großen Modellen einen spürbaren Unterschied.
pip install mlx-lm
mlx_lm.generate --model mlx-community/Llama-4-Scout-17B-MLX-4bit --prompt "..."
Die Messung auf demselben M3 Max, gleiches Modell, gleicher Prompt:
| Metrik | Ollama | MLX | |---|---|---| | Inference (Tokens/s) | ~42 | ~58 | | Prompt-Eval (Tokens/s) | ~380 | ~510 | | Start-Zeit | ~6s | ~4s |
Das sind rund 38 Prozent mehr Inference-Speed. Bei intensiver Nutzung über den Tag ist das der Unterschied zwischen "angenehm" und "da tippt jemand live mit".
Schwäche: Nur Apple Silicon. Auf Intel-Macs oder PCs kannst du MLX vergessen — es ist in Metal Performance Shaders verwurzelt.
llama.cpp — die Hardcore-Option
llama.cpp ist die Basis von Ollama und vielen anderen Wrappern. Wenn du es direkt nutzt, hast du jeden Hebel selbst in der Hand.
git clone https://github.com/ggerganov/llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release
./build/bin/llama-server -m model.gguf -ngl 99 -c 8192
Messung auf dem RTX-4090-Rechner mit Llama 4 Scout in Q5_K_M:
| Metrik | Wert | |---|---| | Inference (Tokens/s) | ~74 | | Prompt-Eval (Tokens/s) | ~1200 | | VRAM-Verbrauch | ~14 GB | | Start-Zeit | ~8s |
Die 4090 ist brachial. Wenn du ein produktives Setup für dein Team bauen willst und ein Budget für ordentliche Hardware hast, ist das hier der Weg.
Schwäche: Konfigurations-Fehler tun weh. Falsche Kontext-Größe, unpassende Quantisierung, ungenügendes GPU-Layer-Offloading — und dein Setup ist plötzlich dreimal langsamer oder produziert Gibberish. Plane 4-6 Stunden für das initiale Tuning ein.
Die ehrliche Empfehlung nach Setup
Schluss mit Theorie. Was solltest du nehmen.
| Dein Setup | Empfehlung | Warum | |---|---|---| | MacBook Air M2 16 GB | Ollama mit Llama 3.1 8B oder Qwen 2.5 7B | MLX wäre schneller, lohnt aber Aufwand nicht für kleine Modelle | | MacBook Pro M2/M3 32 GB+ | MLX mit Llama 4 Scout 4bit | Apple-Silicon-Optimierung voll ausnutzen | | M3 Max / M4 Max 64-128 GB | MLX mit Scout oder 70B-Modellen | Großer RAM = große Modelle | | Windows/Linux + RTX 3090+ | llama.cpp mit CUDA | Maximale Kontrolle, beste Performance | | Server-Setup für Team | llama.cpp als Server + Ollama als Proxy | Beste Mischung aus Performance und Einfachheit | | Du willst nur ausprobieren | Ollama | 10 Minuten zum ersten Output |
Welches Modell für welchen Job
Stand April 2026, aus meinen eigenen Tests:
- Coding-Aufgaben lokal: Qwen 3 Coder 32B in 4bit ist überraschend nah an Claude Sonnet für reine Code-Generierung
- Allgemeine Aufgaben: Llama 4 Scout 17B — schneller als Behemoth, qualitativ sehr solide
- Reasoning-intensive Tasks: DeepSeek-R1 — wenn du die längeren Wartezeiten aushältst
- Deutsch besonders gut: Mistral Large 3 — deutlich natürlicher als Llama in Umgangssprache
Für die 16-GB-Kategorie ist Qwen 2.5 7B Instruct mein Daily Driver geworden. Es hat weniger Drama als Llama 3.1 8B, verschluckt weniger Umlaute, hält saubere JSON-Outputs.
Was du jetzt tun kannst
Wenn du noch nie lokal gearbeitet hast: Installier Ollama, zieh ein Modell, teste eine Woche parallel zu deinem Cloud-LLM. Du wirst merken wo es dir genügt, wo es dich nervt. Beide Erkenntnisse sind wertvoll.
Wenn du schon lokal arbeitest aber auf Ollama sitzt und Apple Silicon hast: Probier MLX. Der Speed-Gewinn ist real und der Umstellungsaufwand überschaubar.
Weiterlesen
Der Claude-Code-Artikel erklärt wie du lokale Modelle als Backend nutzt. Der MCP-Artikel zeigt wie du deine lokalen Modelle an Tools anschließt.
Welches Setup nutzt du? Diskussion läuft in der Zone "KI Agents & MCPs" im Discord.

