Lokale Inferenz
LiteLLM im Test
LiteLLM ist ein quelloffener Vermittler zwischen den eigenen Anwendungen und den Modellen von mehr als 140 KI-Anbietern, erreichbar über eine einzige, zu OpenAI kompatible Schnittstelle. Eine gehostete Fassung gibt es nicht, LiteLLM arbeitet im eigenen Docker-Container, wahlweise auf Kubernetes oder vollständig vom Netz getrennt. Der Kern steht unter MIT-Lizenz, die Funktionen für große Häuser für Anmeldung, Prüfprotokolle und Mandantentrennung kosten extra.
Stand 4. August 2026
| Preismodell | Freemium, Selbst gehostet kostenlos (MIT), Enterprise nach Anfragemenge auf Anfrage, 30 Tage Testschlüssel |
|---|---|
| Betriebsort | auf eigener Hardware |
| DSGVO | im Einzelfall zu prüfen |
| Quelloffen | ja, MIT (Enterprise-Verzeichnis proprietär) |
Sobald mehr als ein KI-Modell im Einsatz ist, wächst der Verwaltungsaufwand schnell. Jeder Anbieter bringt ein eigenes Schnittstellenformat mit, dazu getrennte Zugangsschlüssel und eine getrennte Rechnung, die am Monatsende eine Gesamtsumme zeigt und keine Aufteilung nach Teams. LiteLLM setzt sich als Vermittler davor. Die Anwendungen sprechen nur noch eine Adresse an, und du entscheidest an einer Stelle, welches Modell dahinter antwortet und was es kosten darf.
Wichtigste Funktionen
- Eine Schnittstelle für alle Anbieter: Anwendungen sprechen LiteLLM im OpenAI-Format an, dahinter stehen Modelle von OpenAI, Anthropic, Google, Microsoft Azure, AWS Bedrock, Mistral und selbst betriebenen Servern. Ein Modellwechsel ist ein geänderter Eintrag in der Konfiguration, der Programmcode bleibt unangetastet. Die Herstellerseite zählt aktuell 1.892 einzelne Modelle bei über 140 Anbietern.
- Budgets und Kostenübersicht: Jeder ausgegebene Schlüssel gehört zu einem Team oder Projekt und bekommt ein Ausgabenlimit, das sich täglich oder monatlich zurücksetzt. LiteLLM rechnet die Kosten jeder einzelnen Anfrage über alle Anbieter hinweg zusammen. Ihr seht den Verbrauch einer Abteilung damit an einer Stelle und müsst ihn nicht aus 5 Anbieterrechnungen zusammensuchen.
- Ausweichen bei Störungen: Fällt ein Anbieter aus oder greift dessen Anfragelimit, schickt LiteLLM dieselbe Anfrage automatisch an ein hinterlegtes Ersatzmodell. Mehrere Endpunkte desselben Anbieters nimmst du zusätzlich in eine Lastverteilung, etwa 2 Azure-Regionen für dasselbe Modell.
- Automatische Modellwahl: Seit Version 1.94 vom Juli 2026 stuft LiteLLM eingehende Anfragen selbst ein und schickt einfache an ein günstiges Modell, während schwierige an ein starkes gehen. Für die Einstufung stehen Kennzahlen der Anfrage wie Länge und Codeanteil zur Wahl, dazu Schlüsselwortregeln oder ein kleines Klassifizierungsmodell. Eine laufende Unterhaltung bleibt auf Wunsch bei dem Modell, das die erste Frage beantwortet hat.
- MCP-Server zentral verwalten: LiteLLM bündelt die Werkzeug-Server des Model Context Protocol, über das ein KI-Modell auf Systeme wie Jira, GitLab oder GitHub zugreift, und gibt sie mit Rechten je Team weiter. Version 1.95 von Anfang August 2026 ergänzt die Anmeldung über OAuth im Namen des Nutzers und findet neu hinzugekommene Server selbständig.
- Maskierung personenbezogener Daten: Über Microsoft Presidio, das als eigener Container im Firmennetz läuft, erkennt LiteLLM Namen, E-Mail-Adressen, Telefonnummern oder Kartennummern und ersetzt sie durch Platzhalter, bevor die Anfrage den Modellanbieter erreicht. Wahlweise blockiert LiteLLM die Anfrage ganz. Diese Funktion kostet nichts.
Preise und Tarife
Virtuelle Schlüssel, Budgets, Anfragelimits, Ausweichmodelle, Protokollierung, die automatische Modellwahl und Kennzahlen im Prometheus-Format für die Überwachung gehören zur freien Fassung. Bezahlt wird die Infrastruktur, also ein Server oder Container samt PostgreSQL-Datenbank und ab mehreren Instanzen zusätzlich Redis, dazu die Nutzungsgebühren der angebundenen Modellanbieter.
Für die Enterprise-Fassung nennt der Hersteller BerriAI keinen Listenpreis. Die Preisseite sagt nur, wonach sich der Betrag richtet, nämlich nach der jährlichen Anfragemenge, der Betriebsform und dem gewünschten Support, ausdrücklich nicht nach verbrauchten Token. Dafür gibt es dort die Anmeldung über das zentrale Firmenkonto (SSO) samt automatischem Abgleich der Nutzerlisten (SCIM), die Prüfung der Anmeldedaten nach den Standards OIDC und JWT, Prüfprotokolle mit Aufbewahrungsfristen, die Anbindung an Passwortspeicher wie HashiCorp Vault oder Azure Key Vault, mehrere Regionen unter einer Steuerung sowie Support mit zugesagten Reaktionszeiten.
Einzelne dieser Funktionen sind in kleinem Umfang frei, die Anmeldung über das Firmenkonto etwa bis 5 Nutzer. Wer die Enterprise-Fassung prüfen will, bekommt einen 30 Tage gültigen Schlüssel ohne Angabe einer Kreditkarte. Was am Ende im Angebot und auf der Serverrechnung steht, sind Nettobeträge, zu denen die Umsatzsteuer hinzukommt.
Für wen ist LiteLLM geeignet?
- Firmen, die mehrere KI-Anbieter parallel nutzen: Wenn ein Produkt auf OpenAI läuft, das nächste auf Anthropic und daneben ein eigenes Modell im Rechenzentrum steht, wandert die Verwaltung dieser Wege an eine Stelle. Der Wechsel eines Anbieters kostet dann eine Zeile in der Konfiguration.
- IT- und Plattformteams, die internen Abteilungen KI-Zugang geben: Jede Abteilung bekommt einen eigenen Schlüssel mit eigenem Budget, und ihr zieht einen einzelnen Schlüssel zurück, ohne dass die anderen Projekte stehen. Die Auswertung zeigt je Team und Projekt, wofür das Geld ausgegeben wurde.
- Behörden und Kanzleien, die ihre Modelle selbst betreiben: Wer ohnehin auf der eigenen Hardware rechnet, bekommt mit LiteLLM die Verwaltungsschicht darüber, mit Schlüsseln, Rechten und Protokollen. Selbst in einem vom Internet vollständig getrennten Netz läuft LiteLLM.
DSGVO und Datenschutz
LiteLLM läuft vollständig auf eurer eigenen Hardware, eine gehostete Fassung verkauft der Hersteller nicht. BerriAI aus San Francisco bekommt aus einer selbst betriebenen Installation nach eigener Angabe weder Daten noch Telemetriedaten. Fragen und Antworten stehen nur dann in der Datenbank, wenn du die Einstellung store_prompts_in_spend_logs ausdrücklich einschaltest, ab Werk ist sie aus, gezählt werden sonst nur Kosten und Verbrauch. BerriAI weist SOC 2 Type I und ISO 27001 aus, die Prüfberichte gibt es allerdings nur für Unternehmenskunden auf Anfrage.
Der Datenschutz entscheidet sich bei einem Vermittler trotzdem an den Modellen, die dahinter hängen, denn LiteLLM leitet die Anfragen nur weiter. Die Wege, die in der Dokumentation zuerst auftauchen, führen zu OpenAI, Anthropic, Google Vertex AI und AWS Bedrock, also zu Anbietern außerhalb der EU. Damit stellen sich dieselben Fragen wie beim direkten Zugriff auf diese Dienste, vom Auftragsverarbeitungsvertrag über die Standardvertragsklauseln bis zur Prüfung des Drittlandtransfers.
Hängst du stattdessen lokale Modelle oder einen europäischen Anbieter dahinter, dann antwortet das Modell im eigenen Rechenzentrum oder wenigstens innerhalb der EU. Die eingebaute Maskierung über Presidio nimmt personenbezogene Angaben schon vor dem Absenden aus dem Text, eine Rechtsgrundlage ersetzt sie nicht.
Wir führen LiteLLM deshalb ohne DSGVO-Kennzeichen. Ob eine Installation den Anforderungen genügt, hängt allein von der Auswahl der angebundenen Modelle ab, und diese Auswahl trifft der Betreiber. Als Baustein einer datenschutzkonformen Architektur ist LiteLLM gut geeignet, besonders in der vom Netz getrennten Variante mit eigenen Modellen. Die Prüfung des Gesamtaufbaus nimmt es niemandem ab.
Alternativen zu LiteLLM
- OpenRouter: Derselbe Gedanke als fertiger Dienst in der Cloud, ohne eigene Installation. Der Start dauert Minuten, dafür laufen alle Anfragen über die Server eines US-Anbieters.
- Portkey: Vermittler mit stärkerem Schwerpunkt auf Auswertung und Regelwerken, als Cloud-Dienst und mit Selbstbetrieb als Option. Die Oberfläche ist ausgereifter, dafür fällt der freie Umfang kleiner aus.
- Langfuse: Auf Protokollierung und Bewertung von KI-Anwendungen zugeschnitten, verteilt aber keine Anfragen und verwaltet keine Zugangsschlüssel. Beide Werkzeuge ergänzen sich, LiteLLM schickt seine Protokolle direkt an Langfuse.
Wofür LiteLLM taugt
- Mehr als 140 Anbieter und rund 1.900 Modelle über eine einzige Schnittstelle
- Budgets, Anfragelimits und Kostenübersicht je Schlüssel, Team und Projekt
- Maskierung personenbezogener Daten über Microsoft Presidio gehört zum freien Teil
- Betrieb bis hin zur vollständig vom Netz getrennten Installation, ohne Telemetrie an den Hersteller
- Über 55.000 GitHub-Sterne, mehrere Veröffentlichungen pro Woche
Wo es hakt
- Der Betrieb braucht Docker-Kenntnisse, eine PostgreSQL-Datenbank und ab mehreren Instanzen Redis
- Anmeldung über SSO, Prüfprotokolle und Mandantentrennung sind ab 5 Nutzern kostenpflichtig
- Kein Listenpreis für die Enterprise-Fassung, jedes Angebot läuft über den Vertrieb
- Über 4.700 offene Meldungen im Repository, deshalb gehört im Produktivbetrieb eine feste Version in die Konfiguration
Wofür es eingesetzt wird
Einheitliche Schnittstelle für mehrere KI-Anbieter · Ausweichmodell bei Ausfall oder Anfragelimit · Budgets und Kostenübersicht je Team · Protokollierung und Auswertung von KI-Anfragen