DeepSeek veröffentlicht V4.1-Flash mit nativem Bildverständnis
DeepSeek launched V4.1-Flash on its API, introduced lower prices and outlined the retirement and rerouting of earlier V4 models.
Kurze Antwort
Was kündigte DeepSeek mit der Veröffentlichung von DeepSeek-V4.1-Flash an?
DeepSeek released V4.1-Flash, a 552-billion-parameter mixture-of-experts model with native visual understanding. The company says its asymmetric architecture activates 8 billion parameters for input and 16 billion for output. The model is live through the DeepSeek API, where it carries new peak and off-peak pricing.
Das Wichtigste
- DeepSeek says V4.1-Flash is the smallest model in its new architecture family and includes native visual understanding.
- Laut DeepSeek aktiviert das Mixture-of-Experts-Modell mit 552 Milliarden Parametern 8 Milliarden Parameter für die Eingabe und 16 Milliarden für die Ausgabe.
- DeepSeek says the model’s KV cache requires one-quarter of the HBM and one-eighth of the SSD storage used by the previous generation.
- V4.1-Flash ist über die DeepSeek-API unter dem Modellnamen deepseek-flash verfügbar.
- DeepSeek said all deepseek-v4-pro requests will begin routing to V4.1-Flash at 04:00 UTC on September 14, 2026.
DeepSeek hat DeepSeek-V4.1-Flash veröffentlicht, ein neues Mixture-of-Experts-Modell mit nativem visuellem Verständnis, das über seine API verfügbar ist. Das Unternehmen bezeichnet es als kleinstes Modell einer neuen Architekturfamilie, die auf höhere Leistungsfähigkeit, schnellere Inferenz, größeren Durchsatz und die Skalierung auf größere Modelle ausgelegt ist.
Entwickler können das Modell über deepseek-flash auswählen. DeepSeek veröffentlichte zudem auf Hugging Face Links zum Modell und zum technischen Bericht.
Asymmetrische Architektur
DeepSeek zufolge verfügt V4.1-Flash über 552 Milliarden Parameter und nutzt eine neue kausale Encoder-Decoder-Architektur. Nach Angaben des Unternehmens aktiviert das Modell bei der Verarbeitung von Eingaben 8 Milliarden Parameter und bei der Ausgabe 16 Milliarden.
Das Unternehmen gibt an, neue Vortrainingsmethoden sowie ein in größerem Maßstab durchgeführtes Nachtraining mittels Reinforcement Learning eingesetzt zu haben. DeepSeek zufolge übertrifft die daraus resultierende Benchmark-Leistung jene von Spitzenmodellen, darunter das hauseigene DeepSeek-V4-Pro.
DeepSeek meldete außerdem einen geringeren Speicherbedarf für den Key-Value-Cache des Modells. Im Vergleich zur vorherigen Generation benötigt V4.1-Flash nach Angaben des Unternehmens für seinen KV-Cache nur ein Viertel des High-Bandwidth Memory und ein Achtel des SSD-Speichers. DeepSeek zufolge kann diese Komprimierung die Kosten bei Cache-Treffern deutlich senken, die nach Angaben des Unternehmens häufig einen großen Teil der Kosten für Agenten ausmachen.
API-Änderungen und Modell-Routing
V4.1-Flash ist über die DeepSeek-API mit nativer multimodaler Unterstützung verfügbar. DeepSeek hat V4-Flash und V4-Flash-Vision-Exp eingestellt. Anfragen über deepseek-v4-flash und deepseek-v4-flash-vision-exp werden zur Wahrung der Kompatibilität jedoch vorübergehend an das neue Modell weitergeleitet.
Das Unternehmen erklärte, von mehreren Parteien durchgeführte Tests hätten V4.1-Flash bei Leistung, Kosten, Geschwindigkeit und Gesamtlaufzeit vor V4-Pro eingeordnet. DeepSeek lässt V4-Pro schrittweise auslaufen.
Ab dem 14. September 2026 um 04:00 Uhr UTC werden alle an deepseek-v4-pro gesendeten Anfragen an V4.1-Flash weitergeleitet und zu den Tarifen von V4.1-Flash abgerechnet. DeepSeek zufolge bleibt diese Regelung bis zur Einführung von V4.1-Pro bestehen.
DeepSeek nannte WorkBuddy einschließlich CodeBuddy sowie OpenCode als offizielle Partner, die V4.1-Flash vollständig unterstützen.
Preise und Bereitstellung
Zeitgleich mit der Veröffentlichung führte DeepSeek neue API-Preise ein. Nach Angaben des Unternehmens bleibt die Unterscheidung zwischen Haupt- und Nebenzeiten bestehen, um die Nachfrage auszugleichen. Die Tarife außerhalb der Hauptzeiten liegen bei 50 % der Hauptzeittarife. Die neuen Preise traten am 10. September 2026 um 04:00 Uhr UTC in Kraft.
Das Unternehmen erklärte, die Architektur von V4.1-Flash ermögliche es, mehr Nutzer zu geringeren Kosten zu bedienen, und diese Einsparungen würden an API-Kunden weitergegeben.
DeepSeek kündigte außerdem an, gemeinsam mit der Open-Source-Community die Inferenz für V4.1-Flash zu unterstützen und weitere Bereitstellungsoptionen zu prüfen. In seiner Ankündigung forderte das Unternehmen Organisationen, die Bereitstellungen mit mindestens 2.000 GPUs und einem Speichercluster planen, zur Kontaktaufnahme auf.
Quelle: DeepSeeks Ankündigung „DeepSeek-V4.1-Flash Release“, veröffentlicht am 10. September 2026.
Häufige Fragen
- Was ist DeepSeek-V4.1-Flash?
- DeepSeek describes V4.1-Flash as the smallest model in its new architecture family. It is a 552-billion-parameter mixture-of-experts model with native visual understanding.
- How can developers access V4.1-Flash?
- The model is live on the DeepSeek API under the name deepseek-flash. DeepSeek also linked to the model and its technical report on Hugging Face.
- What happens to DeepSeek’s earlier V4 models?
- DeepSeek retired V4-Flash and V4-Flash-Vision-Exp, with their existing model names temporarily routing to V4.1-Flash. The company also said deepseek-v4-pro requests will route to V4.1-Flash from September 14 until V4.1-Pro launches.
- How does V4.1-Flash pricing work?
- DeepSeek said peak and off-peak pricing will continue, with off-peak rates set at 50% of peak rates. The new pricing took effect at 04:00 UTC on September 10, 2026.