Platz 2 im Vergleich
DeepSeek V4 Flash 0731
DeepSeek · China · veröffentlicht 31. Juli 2026
Die Ende Juli 2026 nachtrainierte Fassung von DeepSeek V4 Flash. Sie schlägt bei agentischen Aufgaben die deutlich größere Pro-Variante und ist mit 24 Cent je Million Ausgabe-Token das günstigste Modell im Vergleich.
Modell auf Hugging Face ansehenBewertung im Detail
Gesamtnote aus 3 gewichteten Dimensionen. Wie wir bewerten
Fähigkeitsprofil
Wo DeepSeek V4 Flash 0731 stark ist, über 6 Säulen auf einer Skala von 0 bis 100. Die gestrichelte Linie ist der Median aller 32 Modelle im Vergleich. Wie die Säulen entstehen
| Säule | Wert | Grundlage |
|---|---|---|
| Programmierung | 95 | benchmarkbelegt |
| Mathematik & Logik | 94 | benchmarkbelegt |
| Wissen | 82 | benchmarkbelegt |
| Deutsch & Sprache | 84 | redaktionelle Einschätzung |
| Agentik & Werkzeuge | 98 | benchmarkbelegt |
| Langer Kontext | 92 | redaktionelle Einschätzung |
Stärkste Säule: Agentik & Werkzeuge. Belegte Werte stammen aus den dokumentierten Benchmarks unten (baseline-korrigiert normalisiert), mit "Einschätzung" markierte Säulen sind eine redaktionelle Einordnung, weil kein vergleichbarer Benchmark vorlag. Details zur Methodik stehen auf der Übersichtsseite.
Steckbrief
- Architektur
- Mixture-of-Experts
- Parameter
- 304 Mrd. gesamt, 13 Mrd. aktiv je Token
- Kontextfenster
- 1 Mio. TokenAus der config.json belegt (max_position_embeddings 1.048.576), per YaRN um den Faktor 16 aus einem Basisfenster von 65.536 Token erweitert.
- Lizenz
- MIT
- Eingabe
- Text
- Lokaler Betrieb
- Workstation oder Server ab rund 300 GB Speicher (FP8), offiziell 4x GB300
- Bei EU-Hostern
- TeilweiseHostYourAI (Niederlande) betreibt DeepSeek V4 Flash auf EU-GPUs mit Auftragsverarbeitungsvertrag, Stand 01.08.2026 allerdings noch die Preview-Fassung und nicht die 0731-Version
- Cloud-API (Richtwert)
- 0,12 € Eingabe / 0,24 € Ausgabe je Mio. TokenDeepSeek-API, Richtwert, umgerechnet aus USD
Die 304 Mrd. stammen aus den Safetensors-Metadaten der Modellkarte und schließen ein angehängtes Vorhersage-Modul (DSpark) von rund 20 Mrd. Parametern ein, das die Ausgabe beschleunigt. Das Sprachmodell selbst hat 284 Mrd. Parameter. Die Architektur mit 6 von 256 Experten je Token plus einem geteilten Experten ist aus der config.json belegt.
Benchmarks
Zu diesem Modell liegt neben den Hersteller-Angaben eine unabhängige Einordnung vor (Artificial Analysis).
DeepSeek-V4-Flash-0731 ist am 31. Juli 2026 erschienen und löst die Preview-Fassung vom April ab. Am Aufbau des Modells hat sich nichts geändert, es wurde lediglich neu nachtrainiert. Der Sprung ist trotzdem erheblich. Artificial Analysis misst unabhängig einen Intelligence-Index von 50, 10 Punkte über der Vorfassung und 6 Punkte über der mehr als fünfmal so großen Pro-Variante. Am deutlichsten wird der Fortschritt bei agentischen Aufgaben, also beim selbständigen Aufrufen von Werkzeugen über viele Arbeitsschritte hinweg. Dort steigt der gemessene Elo-Wert von 1189 auf 1559, deutlich über allen anderen Modellen, für die Artificial Analysis diesen Wert bisher ausweist. Der Hersteller meldet 82,7 bei Terminal-Bench 2.1 und 70,3 bei Toolathlon-Verified, unabhängig nachgemessen liegt der Terminal-Bench-Wert bei 79 %.
Für Unternehmen ist vor allem die Betreibbarkeit interessant. Von den 304 Milliarden Parametern sind je Token nur 13 Milliarden aktiv, in FP8-Genauigkeit belegt das Modell rund 300 GB. Damit reicht eine gut ausgestattete Workstation, wo die Pro-Variante ein Rack voller Grafikkarten braucht. Die Gewichte stehen frei unter MIT-Lizenz auf Hugging Face, ohne Zugangssperre und ohne Umsatzklausel. Der API-Preis liegt bei rund 0,12 Euro je Million Eingabe- und 0,24 Euro je Million Ausgabe-Token, bei wiederholten Eingaben sinkt der Eingabepreis über den Zwischenspeicher auf ein Fünfzigstel. Wer keine eigene Hardware stellen möchte, findet mit HostYourAI in den Niederlanden einen europäischen Anbieter samt Auftragsverarbeitungsvertrag, dort läuft Stand 1. August 2026 allerdings noch die ältere Preview-Fassung.
Eine Schwäche bleibt die Faktentreue. Im AA-Omniscience-Index steht das Modell bei -16, gibt bei Wissensfragen also vergleichsweise oft eine falsche Antwort, statt die Wissenslücke einzuräumen. Für Aufgaben, bei denen das Modell mit den Unterlagen des Unternehmens arbeitet und nicht aus dem Gedächtnis antwortet, fällt das kaum ins Gewicht. Als Nachschlagewerk taugt es nicht. Bilder und Audio verarbeitet DeepSeek V4 Flash nicht, es bleibt ein reines Textmodell.
Wofür es taugt
- Sehr stark bei Werkzeug-Nutzung und mehrstufigen Abläufen, der von Artificial Analysis gemessene Elo-Wert steigt gegenüber der Vorfassung von 1189 auf 1559
- Niedrigster API-Preis im Feld, bei wiederholten Eingaben sinkt er über den Zwischenspeicher auf ein Fünfzigstel
- MIT-Lizenz, offene Gewichte ohne Zugangssperre, Kontextfenster von einer Million Token
Wo es hakt
- Schwache Faktentreue, im AA-Omniscience-Index bei -16
- Verarbeitet ausschließlich Text, keine Bilder und kein Audio
- Der europäische Anbieter führt bisher nur die ältere Preview-Fassung, mit dieser Version bleibt vorerst nur der Betrieb auf eigener Infrastruktur
Quelle: Offizielle HF-Modellkarte deepseek-ai/DeepSeek-V4-Flash-0731, config.json und Artificial Analysis, Juli 2026 · Stand der Recherche 21. August 2026 · die Bewertung ist eine redaktionelle Einschätzung von gewusst:KI