Zum Inhalt springen
Alle Modelle im Vergleich

Platz 29 im Vergleich

Nemotron 3.5 Lightning 30B

NVIDIA · USA · veröffentlicht 11. August 2026

80 % Gesamtbewertung

Von 30 Milliarden Parametern rechnen nur 3 je Token mit, das macht das Modell schnell und billig. Artificial Analysis misst 351 Token/s in der Ausgabe, den ersten Platz unter 134 gemessenen Modellen. Im Intelligenz-Index derselben Messung erreicht es 24 Punkte, Qwen3.6-35B-A3B kommt bei ähnlicher Größe auf 32.

Modell auf Hugging Face ansehen

Bewertung im Detail

Gesamtnote aus 3 gewichteten Dimensionen. Wie wir bewerten

Leistung (55 %) 74 %
DSGVO- und EU-Eignung (30 %) 84 %
Lizenz-Offenheit (15 %) 95 %

Fähigkeitsprofil

Wo Nemotron 3.5 Lightning 30B stark ist, über 6 Säulen auf einer Skala von 0 bis 100. Die gestrichelte Linie ist der Median aller 32 Modelle im Vergleich. Wie die Säulen entstehen

Coding 62 Mathe & Logik 78* Wissen 82 Deutsch 78* Agentik 74 Kontext 86
Nemotron 3.5 Lightning 30B Median aller Modelle * redaktionelle Einschätzung (kein belegter Benchmark)
Fähigkeitsprofil von Nemotron 3.5 Lightning 30B, Werte von 0 bis 100
SäuleWertGrundlage
Programmierung62benchmarkbelegt
Mathematik & Logik78redaktionelle Einschätzung
Wissen82benchmarkbelegt
Deutsch & Sprache78redaktionelle Einschätzung
Agentik & Werkzeuge74benchmarkbelegt
Langer Kontext86benchmarkbelegt
Langer Kontext 86
nutzbare Leistung über sehr lange Eingaben, nicht nur die Fenstergröße
Wissen 82
Fach- und Allgemeinwissen über viele Domänen hinweg
Mathematik & Logik · Einschätzung 78
mehrstufiges Rechnen und logisches Schließen mit prüfbarer Lösung
Deutsch & Sprache · Einschätzung 78
Sprachverständnis und Mehrsprachigkeit, mit Blick auf Deutsch
Agentik & Werkzeuge 74
Werkzeuge selbständig aufrufen und mehrstufige Abläufe steuern
Programmierung 62
Code schreiben und debuggen, ganze Repositories über viele Schritte bearbeiten

Stärkste Säule: Langer Kontext. Belegte Werte stammen aus den dokumentierten Benchmarks unten (baseline-korrigiert normalisiert), mit "Einschätzung" markierte Säulen sind eine redaktionelle Einordnung, weil kein vergleichbarer Benchmark vorlag. Details zur Methodik stehen auf der Übersichtsseite.

Steckbrief

Architektur
Hybrid (Mamba-2, Attention, MoE)
Parameter
30 Mrd. gesamt, 3 Mrd. aktiv je Token
Kontextfenster
1 Mio. TokenAuf einer einzelnen H100 nennt NVIDIA 256K Token als praktikabel, die volle Million braucht mehr Speicher.
Lizenz
OpenMDW-1.1Offene Modell-Lizenz der Linux Foundation, die Gewichte, Code, Daten und die erzeugten Ausgaben in einem Dokument abdeckt. Kommerzielle Nutzung ohne Auflagen, damit deutlich freier als die frühere NVIDIA-eigene Lizenz.
Eingabe
Text
Lokaler Betrieb
Eine GPU ab 32 GB (RTX 5090, NVFP4) oder DGX Spark, offiziell 1× H100
Bei EU-Hostern
TeilweiseNebius (Niederlande) unter den Inferenz-Anbietern
Cloud-API (Richtwert)
0,04 € Eingabe / 0,17 € Ausgabe je Mio. TokenOpenRouter, Richtwert, umgerechnet aus USD

Benchmarks

Zu diesem Modell liegt neben den Hersteller-Angaben eine unabhängige Einordnung vor (Artificial Analysis).

24 Artificial Analysis Index (unabhängig)
351 Token/s Ausgabetempo (unabhängig)
81,9 MMLU Pro
51,6 SWE-bench Verified

Nemotron 3.5 Lightning ist aus dem großen Nemotron 3 Ultra destilliert und auf Tempo getrimmt. Die hybride Architektur wechselt Mamba-2-Schichten mit Mixture-of-Experts ab und setzt nur an wenigen Stellen klassische Attention ein. Von 30 Milliarden Parametern rechnen 3 je Token mit. Artificial Analysis misst 351 Token/s in der Ausgabe und 0,85 Sekunden bis zum ersten Token, in beidem liegt das Modell vorn. Eine Million Eingabe-Token kostet über die API 4 Cent.

Das Tempo kostet Denkleistung. Im Intelligenz-Index von Artificial Analysis erreicht Lightning 24 Punkte und liegt damit hinter Qwen3.6-35B-A3B mit 32 und Muse Glimmer mit 35, bei SWE-bench Verified sind es 51,6 und bei Terminal-Bench 2.1 nur 24,6. Das Modell taugt für viele gleichartige Schritte, etwa das Klassifizieren von Belegen oder das Zusammenfassen langer Akten, nicht für die schwierige Aufgabe am Ende einer Kette. Bei der Lizenz hat NVIDIA umgestellt und gibt Lightning unter OpenMDW-1.1 der Linux Foundation frei statt unter der eigenen Nemotron-Lizenz, was die kommerzielle Nutzung ohne Rückfrage erlaubt. Nebius in den Niederlanden führt das Modell auf europäischen Servern, für den DSGVO-konformen Betrieb ohne eigene Hardware ist das der kurze Weg.

Wofür es taugt

  • Höchstes gemessenes Ausgabetempo im ganzen Vergleich, 351 Token/s bei Artificial Analysis
  • Sehr günstig über die API, 4 Cent je Mio. Eingabe-Token, und bei Nebius in der EU verfügbar
  • OpenMDW-1.1 der Linux Foundation, natives 1-Millionen-Kontextfenster durch die Mamba-2-Schichten

Wo es hakt

  • Im Intelligenz-Index von Artificial Analysis nur 24 Punkte, Qwen3.6-35B-A3B kommt bei ähnlicher Größe auf 32
  • Terminal-Bench 2.1 bei 24,6, für längere Arbeit an der Kommandozeile zu wenig
  • Sehr geschwätzig, Artificial Analysis zählt 100 Mio. Ausgabe-Token gegenüber 42 Mio. im Median

Quelle: Offizielle HF-Modellkarte nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 und Artificial Analysis, August 2026 · Stand der Recherche 21. August 2026 · die Bewertung ist eine redaktionelle Einschätzung von gewusst:KI