Zum Inhalt springen
Alle Modelle im Vergleich
Platz 7 im Vergleich

Inkling-Small

Thinking Machines Lab · USA · veröffentlicht 30. Juli 2026

89 % Gesamtbewertung

Die kleine Schwester von Inkling mit einem Viertel der Parameter und praktisch gleicher Leistung. Als quantisierte GGUF-Fassung läuft sie auf einer Workstation mit 128 GB Arbeitsspeicher, versteht Text, Bild und Audio.

Modell auf Hugging Face ansehen

Bewertung im Detail

Gesamtnote aus drei gewichteten Dimensionen. Wie wir bewerten

Leistung (55 %) 88 %
DSGVO- und EU-Eignung (30 %) 84 %
Lizenz-Offenheit (15 %) 100 %

Fähigkeitsprofil

Wo Inkling-Small stark ist, über sechs Säulen auf einer Skala von 0 bis 100. Die gestrichelte Linie ist der Median aller 31 Modelle im Vergleich. Wie die Säulen entstehen

Coding 90 Mathe & Logik 95 Wissen 78 Deutsch 82 Agentik 92 Kontext 86*
Inkling-Small Median aller Modelle * redaktionelle Einschätzung (kein belegter Benchmark)
Fähigkeitsprofil von Inkling-Small, Werte von 0 bis 100
SäuleWertGrundlage
Programmierung90benchmarkbelegt
Mathematik & Logik95benchmarkbelegt
Wissen78benchmarkbelegt
Deutsch & Sprache82benchmarkbelegt
Agentik & Werkzeuge92benchmarkbelegt
Langer Kontext86redaktionelle Einschätzung
Mathematik & Logik 95
mehrstufiges Rechnen und logisches Schließen mit prüfbarer Lösung
Agentik & Werkzeuge 92
Werkzeuge selbständig aufrufen und mehrstufige Abläufe steuern
Programmierung 90
Code schreiben und debuggen, ganze Repositories über viele Schritte bearbeiten
Langer Kontext · Einschätzung 86
nutzbare Leistung über sehr lange Eingaben, nicht nur die Fenstergröße
Deutsch & Sprache 82
Sprachverständnis und Mehrsprachigkeit, mit Blick auf Deutsch
Wissen 78
Fach- und Allgemeinwissen über viele Domänen hinweg

Stärkste Säule: Mathematik & Logik. Belegte Werte stammen aus den dokumentierten Benchmarks unten (baseline-korrigiert normalisiert), mit "Einschätzung" markierte Säulen sind eine redaktionelle Einordnung, weil kein vergleichbarer Benchmark vorlag. Details zur Methodik stehen auf der Übersichtsseite.

Steckbrief

Architektur
Mixture-of-Experts
Parameter
276 Mrd. gesamt, 12 Mrd. aktiv je Token
Kontextfenster
1 Mio. TokenVolle 1.048.576 Token, auch in den quantisierten GGUF-Fassungen für den lokalen Betrieb.
Lizenz
Apache 2.0
Eingabe
Text, Bild, Audio (nur Text-Ausgabe)
Lokaler Betrieb
Workstation ab 128 GB Arbeitsspeicher (3-Bit-GGUF), unquantisiert 543 GB
Bei EU-Hostern
SeltenKein EU-Hoster bestätigt, die Hersteller-API läuft über Tinker in den USA; die offenen Gewichte lassen sich in Europa selbst betreiben
Cloud-API (Richtwert)
0,26 € Eingabe / 1,04 € Ausgabe je Mio. TokenTinker-API, Richtwert, umgerechnet aus USD

Offiziell in der Modellkarte beziffert. 42 Schichten, je Token 6 von 256 Experten plus 2 geteilte Experten.

Benchmarks

Zu diesem Modell liegt neben den Hersteller-Angaben eine unabhängige Einordnung vor (Artificial Analysis).

40 Artificial Analysis Index (unabhängig)
80,2 SWE-bench Verified
89,5 GPQA Diamond
1269 GDPval-AA v2, Elo

Inkling-Small ist am 30. Juli 2026 erschienen, zwei Wochen nach dem großen Inkling, und stammt wie dieses von Thinking Machines Lab, dem Start-up der früheren OpenAI-Technikchefin Mira Murati. Mit 276 Milliarden Parametern, von denen je Token 12 Milliarden aktiv sind, hat es weniger als ein Drittel der Größe des Flaggschiffs und kommt im unabhängigen Artificial-Analysis-Index trotzdem auf 40 von dessen 41 Punkten. Bei mehreren Aufgabentypen liegt das kleine Modell sogar vorn, etwa mit 80,2 % gegenüber 77,6 % bei SWE-bench Verified, bei der Werkzeug-Nutzung (Elo 1269 gegenüber 1238) und bei der Anweisungstreue (82,2 % gegenüber 79,8 % bei IFBench). Thinking Machines führt das auf eine überarbeitete Trainingsmischung für das kleinere Modell zurück.

Praktisch nutzbar wird das Modell durch die quantisierten Fassungen, die Unsloth als GGUF-Dateien bereitstellt (Repository unsloth/Inkling-Small-GGUF auf Hugging Face). Unquantisiert braucht Inkling-Small rund 543 GB Speicher und damit ein Rechenzentrum. Die 3-Bit-Fassung passt in 98 GB und läuft auf einem Mac Studio oder einer Workstation mit 128 GB Arbeitsspeicher, bei etwa 73 % der ursprünglichen Genauigkeit. Wer mehr Genauigkeit braucht, nimmt die 4-Bit-Fassung mit rund 163 GB. Das Kontextfenster von einer Million Token bleibt dabei erhalten. Betrieben wird das Ganze über llama.cpp, SGLang oder vLLM.

In der Eingabe versteht Inkling-Small neben Text auch Bilder und Audio, es antwortet ausschließlich in Text. Die Lizenz ist Apache 2.0 und erlaubt die kommerzielle Nutzung ohne Auflagen. Schwächer als beim großen Inkling fällt das Faktenwissen aus, bei SimpleQA Verified erreicht es 20,6 % gegenüber 43,9 %. Ein europäischer Hoster ist nicht bestätigt, die Hersteller-API läuft über die Tinker-Plattform in den USA. Der DSGVO-konforme Einsatz entsteht hier also über den Betrieb auf eigener Hardware. Anders als beim großen Inkling ist das bei diesem Modell realistisch.

Stärken

  • +Erreicht 40 von 41 Punkten des großen Inkling im Artificial-Analysis-Index und übertrifft es bei SWE-bench Verified, Werkzeug-Nutzung und Anweisungstreue
  • +Läuft dank quantisierter GGUF-Fassungen auf einem Mac Studio oder einer Workstation mit 128 GB statt im Rechenzentrum
  • +Apache 2.0, versteht Bilder und Audio direkt in der Eingabe, Kontextfenster von einer Million Token

Grenzen

  • Deutlich schwächeres Faktenwissen als das große Inkling, 20,6 % gegenüber 43,9 % bei SimpleQA Verified
  • Kein europäischer Hoster, die Hersteller-API läuft über Tinker in den USA
  • Gibt ausschließlich Text aus, erzeugt also keine Bilder oder Sprache

Quelle: Offizielle HF-Modellkarte thinkingmachines/Inkling-Small, Thinking-Machines-Ankündigung vom 30.07.2026 und Artificial Analysis. Stand der Recherche: 14. August 2026. Die Prozent-Bewertung ist eine redaktionelle Einschätzung von gewusst:KI.

Lokale KI im eigenen Unternehmen aufbauen

Wir begleiten die Auswahl des passenden Modells, die Hardware-Planung und den Betrieb, lokal oder bei einem europäischen Hoster. Einen Einstieg bietet unser Workshop zu lokaler KI oder ein direktes Gespräch.