KI-Tools
Lokale Inferenz im Vergleich
Sprachmodelle lokal auf dem eigenen Rechner ausführen, ohne Cloud, ohne Abo, ohne Datenweitergabe.
6 Werkzeuge geprüft · herstellerunabhängig
Ein Sprachmodell auf der eigenen Maschine auszuführen heißt Inferenz: kein Abo, keine Cloud, keine Daten nach außen. Ollama und LM Studio machen den Anfang leicht, das Modell wird geladen und läuft. Wenn viele Leute gleichzeitig fragen, übernimmt vLLM, das die Anfragen bündelt und den Speicher der Grafikkarte in Seiten verwaltet, statt für jede Anfrage einen eigenen Block zu reservieren. Was an Hardware nötig ist, hängt am Modell: Für 7 Milliarden Parameter reicht ein Laptop mit 16 GB Arbeitsspeicher, darüber gehört eine Grafikkarte mit mindestens 8 GB eigenem Speicher dazu.
Die 6 bestbewerteten im Überblick
| Werkzeug | Bewertung | Preismodell | Betriebsort | DSGVO | Quelloffen |
|---|---|---|---|---|---|
| llama.cpp Empfehlung | 5,0 von 5 | Kostenlos | auf eigener Hardware | ja | ja |
| vLLM Empfehlung | 5,0 von 5 | Kostenlos | auf eigener Hardware | nein | ja |
| LM Studio | 4,5 von 5 | Kostenlos | auf eigener Hardware | nein | nein |
| LiteLLM | 4,0 von 5 | Freemium | auf eigener Hardware | nein | ja |
| Ollama | 4,0 von 5 | Freemium | beides möglich | nein | ja |
| OpenRouter | 3,5 von 5 | Freemium | Cloud | nein | nein |
Alle 6 in dieser Kategorie
Sortiert nach Bewertung, die höchste zuerst.
Häufige Fragen zu Lokale Inferenz
Was ist Inferenz bei Sprachmodellen?
Inferenz heißt, ein fertig trainiertes Sprachmodell auszuführen, also eine Eingabe hineinzugeben und eine Antwort herauszubekommen. Ollama, LM Studio und vLLM übernehmen das auf deiner eigenen Maschine, und damit geht keine Eingabe an einen Dienst außerhalb.
Welche Hardware brauche ich für lokale Sprachmodelle?
Für kleine Modelle mit 7 Milliarden Parametern reichen 16 GB Arbeitsspeicher und ein aktueller Laptop. Für mittlere mit 30 Milliarden gehören 32 bis 64 GB dazu oder eine Grafikkarte mit 16 GB eigenem Speicher. Sobald mehrere Leute gleichzeitig fragen, braucht es eine eigene NVIDIA-Karte, etwa A100, H100 oder RTX 4090. Macs mit Apple Silicon von M1 bis M4 teilen sich den Speicher zwischen Prozessor und Grafikeinheit und kommen dadurch bei großen Modellen günstiger weg.
Was ist der Unterschied zwischen Ollama und vLLM?
Ollama ist für den Anfang gebaut: ein Befehl im Terminal, und das Modell läuft. Das reicht für Entwicklung, Vorführungen und einzelne Nutzer. vLLM ist für den Dauerbetrieb gebaut, bündelt eingehende Anfragen und verwaltet den Speicher der Grafikkarte in Seiten, wodurch es bei vielen gleichzeitigen Anfragen deutlich mehr durchsetzt. Nimm Ollama zum Ausprobieren und vLLM auf dem Server.
Das passende Werkzeug nicht gefunden?
Sag uns, was der Vorgang bei dir leisten soll. Wir nennen dir die Werkzeuge, die dafür in Frage kommen, und was sie im laufenden Einsatz kosten.