Platz 29 im Vergleich
Nemotron 3.5 Lightning 30B
NVIDIA · USA · veröffentlicht 11. August 2026
Von 30 Milliarden Parametern rechnen nur 3 je Token mit, das macht das Modell schnell und billig. Artificial Analysis misst 351 Token/s in der Ausgabe, den ersten Platz unter 134 gemessenen Modellen. Im Intelligenz-Index derselben Messung erreicht es 24 Punkte, Qwen3.6-35B-A3B kommt bei ähnlicher Größe auf 32.
Modell auf Hugging Face ansehenBewertung im Detail
Gesamtnote aus 3 gewichteten Dimensionen. Wie wir bewerten
Fähigkeitsprofil
Wo Nemotron 3.5 Lightning 30B stark ist, über 6 Säulen auf einer Skala von 0 bis 100. Die gestrichelte Linie ist der Median aller 32 Modelle im Vergleich. Wie die Säulen entstehen
| Säule | Wert | Grundlage |
|---|---|---|
| Programmierung | 62 | benchmarkbelegt |
| Mathematik & Logik | 78 | redaktionelle Einschätzung |
| Wissen | 82 | benchmarkbelegt |
| Deutsch & Sprache | 78 | redaktionelle Einschätzung |
| Agentik & Werkzeuge | 74 | benchmarkbelegt |
| Langer Kontext | 86 | benchmarkbelegt |
Stärkste Säule: Langer Kontext. Belegte Werte stammen aus den dokumentierten Benchmarks unten (baseline-korrigiert normalisiert), mit "Einschätzung" markierte Säulen sind eine redaktionelle Einordnung, weil kein vergleichbarer Benchmark vorlag. Details zur Methodik stehen auf der Übersichtsseite.
Steckbrief
- Architektur
- Hybrid (Mamba-2, Attention, MoE)
- Parameter
- 30 Mrd. gesamt, 3 Mrd. aktiv je Token
- Kontextfenster
- 1 Mio. TokenAuf einer einzelnen H100 nennt NVIDIA 256K Token als praktikabel, die volle Million braucht mehr Speicher.
- Lizenz
- OpenMDW-1.1Offene Modell-Lizenz der Linux Foundation, die Gewichte, Code, Daten und die erzeugten Ausgaben in einem Dokument abdeckt. Kommerzielle Nutzung ohne Auflagen, damit deutlich freier als die frühere NVIDIA-eigene Lizenz.
- Eingabe
- Text
- Lokaler Betrieb
- Eine GPU ab 32 GB (RTX 5090, NVFP4) oder DGX Spark, offiziell 1× H100
- Bei EU-Hostern
- TeilweiseNebius (Niederlande) unter den Inferenz-Anbietern
- Cloud-API (Richtwert)
- 0,04 € Eingabe / 0,17 € Ausgabe je Mio. TokenOpenRouter, Richtwert, umgerechnet aus USD
Benchmarks
Zu diesem Modell liegt neben den Hersteller-Angaben eine unabhängige Einordnung vor (Artificial Analysis).
Nemotron 3.5 Lightning ist aus dem großen Nemotron 3 Ultra destilliert und auf Tempo getrimmt. Die hybride Architektur wechselt Mamba-2-Schichten mit Mixture-of-Experts ab und setzt nur an wenigen Stellen klassische Attention ein. Von 30 Milliarden Parametern rechnen 3 je Token mit. Artificial Analysis misst 351 Token/s in der Ausgabe und 0,85 Sekunden bis zum ersten Token, in beidem liegt das Modell vorn. Eine Million Eingabe-Token kostet über die API 4 Cent.
Das Tempo kostet Denkleistung. Im Intelligenz-Index von Artificial Analysis erreicht Lightning 24 Punkte und liegt damit hinter Qwen3.6-35B-A3B mit 32 und Muse Glimmer mit 35, bei SWE-bench Verified sind es 51,6 und bei Terminal-Bench 2.1 nur 24,6. Das Modell taugt für viele gleichartige Schritte, etwa das Klassifizieren von Belegen oder das Zusammenfassen langer Akten, nicht für die schwierige Aufgabe am Ende einer Kette. Bei der Lizenz hat NVIDIA umgestellt und gibt Lightning unter OpenMDW-1.1 der Linux Foundation frei statt unter der eigenen Nemotron-Lizenz, was die kommerzielle Nutzung ohne Rückfrage erlaubt. Nebius in den Niederlanden führt das Modell auf europäischen Servern, für den DSGVO-konformen Betrieb ohne eigene Hardware ist das der kurze Weg.
Wofür es taugt
- Höchstes gemessenes Ausgabetempo im ganzen Vergleich, 351 Token/s bei Artificial Analysis
- Sehr günstig über die API, 4 Cent je Mio. Eingabe-Token, und bei Nebius in der EU verfügbar
- OpenMDW-1.1 der Linux Foundation, natives 1-Millionen-Kontextfenster durch die Mamba-2-Schichten
Wo es hakt
- Im Intelligenz-Index von Artificial Analysis nur 24 Punkte, Qwen3.6-35B-A3B kommt bei ähnlicher Größe auf 32
- Terminal-Bench 2.1 bei 24,6, für längere Arbeit an der Kommandozeile zu wenig
- Sehr geschwätzig, Artificial Analysis zählt 100 Mio. Ausgabe-Token gegenüber 42 Mio. im Median
Quelle: Offizielle HF-Modellkarte nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16 und Artificial Analysis, August 2026 · Stand der Recherche 21. August 2026 · die Bewertung ist eine redaktionelle Einschätzung von gewusst:KI