Nemotron-Cascade 2
NVIDIA · USA · veröffentlicht 19. März 2026
Ein kompaktes Reasoning-Modell, das mit nur 3 Milliarden aktiven Parametern bei Mathematik- und Informatik-Olympiaden Goldmedaillen-Niveau erreicht und lokal auf einer Consumer-GPU läuft.
Modell auf Hugging Face ansehenBewertung im Detail
Gesamtnote aus drei gewichteten Dimensionen. Wie wir bewerten
Fähigkeitsprofil
Wo Nemotron-Cascade 2 stark ist, über sechs Säulen auf einer Skala von 0 bis 100. Die gestrichelte Linie ist der Median aller 24 Modelle im Vergleich. Wie die Säulen entstehen
| Säule | Wert | Grundlage |
|---|---|---|
| Programmierung | 84 | benchmarkbelegt |
| Mathematik & Logik | 94 | benchmarkbelegt |
| Wissen | 76 | redaktionelle Einschätzung |
| Deutsch & Sprache | 74 | redaktionelle Einschätzung |
| Agentik & Werkzeuge | 72 | redaktionelle Einschätzung |
| Langer Kontext | 96 | benchmarkbelegt |
Stärkste Säule: Langer Kontext. Belegte Werte stammen aus den dokumentierten Benchmarks unten (baseline-korrigiert normalisiert), mit „Einschätzung" markierte Säulen sind eine redaktionelle Einordnung, weil kein vergleichbarer Benchmark vorlag. Details zur Methodik stehen auf der Übersichtsseite.
Steckbrief
- Architektur
- Mixture-of-Experts
- Parameter
- 30 Mrd. gesamt, 3 Mrd. aktiv je Token
- Kontextfenster
- 1 Mio. TokenNIAH-Score 99,0 über 1 Mio. Token.
- Lizenz
- NVIDIA Nemotron Open Model LicenseOffene Gewichte, aber eigene NVIDIA-Lizenz, nicht so permissiv wie MIT oder Apache 2.0.
- Eingabe
- Text
- Lokaler Betrieb
- Eine GPU (ab 24 GB, RTX 4090, quantisiert)
- Bei EU-Hostern
- SeltenKein EU-Hoster bestätigt, Self-Hosting; NVIDIA-Cloud in den USA
Benchmarks
Die folgenden Werte sind Hersteller-Angaben. Eine unabhängige Verifikation lag zum Stand dieser Seite nicht vor.
Nemotron-Cascade 2 zeigt, dass echtes mathematisches und algorithmisches Denken nicht zwingend große Modelle braucht. Mit nur 3 Milliarden aktiven Parametern (30 Milliarden gesamt, Mixture-of-Experts) löst es Aufgaben auf dem Niveau internationaler Mathematik- und Informatik-Olympiaden und erreicht Goldmedaillen bei IMO 2025, IOI 2025 und den ICPC World Finals. Das Kontextfenster reicht bis zu einer Million Token mit einem Needle-in-a-Haystack-Score von 99,0.
Das Training nutzt einen mehrstufigen Reinforcement-Learning-Ansatz, bei dem Mathematik, Code und Alignment separat optimiert werden. Ein wählbarer Thinking-Modus zeigt den Denkprozess, ein Instruct-Modus antwortet direkt. Dank der wenigen aktiven Parameter läuft das Modell quantisiert auf einer einzelnen Consumer-Grafikkarte. Die Lizenz ist eine eigene NVIDIA Nemotron Open Model License, weniger permissiv als MIT oder Apache. Ein europäischer Hoster ist nicht bestätigt, der DSGVO-konforme Betrieb läuft über eigene Hardware.
Stärken
- +Goldmedaillen-Niveau bei IMO, IOI und ICPC 2025
- +Läuft quantisiert auf einer einzelnen GPU
- +1-Million-Kontextfenster mit NIAH-Score 99,0
Grenzen
- −Eigene NVIDIA-Lizenz, weniger permissiv als MIT oder Apache
- −Spezialisiert auf Reasoning und Code, kein breiter Allrounder
- −Kein EU-Hoster bestätigt, NVIDIA-Cloud in den USA
Quelle: Offizielle HF-Modellkarte nvidia/Nemotron-Cascade-2-30B-A3B, März 2026. Stand der Recherche: 17. Juli 2026. Die Prozent-Bewertung ist eine redaktionelle Einschätzung von gewusst:KI.
Lokale KI im eigenen Unternehmen aufbauen
Wir begleiten die Auswahl des passenden Modells, die Hardware-Planung und den Betrieb, lokal oder bei einem europäischen Hoster. Einen Einstieg bietet unser Workshop zu lokaler KI oder ein direktes Gespräch.