€0.00 — free as in speechtonight's forecast: clear skies over production Cache: warm · Deploys: fair, 0% rollbacks expectedset by moonlight, shipped before dawn · deploy freely Page A2

The Daily Commit The Nightly Build

Dev news, typeset daily — PHP · AI · The Wider Stack

The developer's evening paper — PHP · AI · The Wider Stack

Donnerstag, 10. September 2026 Vol. I — No. 515 · MorgenausgabeSpätausgabe EN DE FR ES

AI · Releases

DeepSeek veröffentlicht V4.1-Flash mit offenen Gewichten und 8B aktiven Parametern

DeepSeek hat die offenen Gewichte von DeepSeek V4.1-Flash auf Hugging Face veröffentlicht.

kuratiert von Sönke

Das Mixture-of-Experts-Modell hat rund 500B Parameter, aktiviert aber nur 8B pro Token. Die Community bemängelt den hohen Hardwarebedarf und vergleicht die Leistung mit einem dichten 62B-Modell.

DeepSeek hat die Gewichte für DeepSeek V4.1-Flash auf Hugging Face unter dem Konto deepseek-ai veröffentlicht. Die Ankündigung wurde schnell einer der Top-Posts auf r/LocalLLaMA.

Das Modell ist ein spärliches Mixture-of-Experts-Design. Community-Angaben nennen ein Backbone im Bereich von 485B bis 552B Gesamtparametern, wobei pro Token nur 8B Parameter aktiv sind. Die Architektur nutzt 1 gemeinsamen Experten und 384 geroutete Experten pro MoE-Schicht, wobei 6 geroutete Experten pro Token aktiviert werden.

Weitere Komponenten sind Single-Pass mHC, ein überarbeitetes Residual-Stream-Mixing mit Mega-mHC-Kernel, ein Engram-Konditionalspeicher mit 196B Parametern, auf den spärlich per tokenbasiertem Lookup zugegriffen wird, sowie DSpark Speculative Decoding mit semi-autoregressiver Entwurfsgenerierung. Das Kontextfenster soll eine Million Token betragen.

Der Name "Flash" bezieht sich auf günstige, schnelle Inferenz: Nur 8B aktive Parameter bedeuten niedrige API-Kosten. Beim lokalen Hosting sieht es anders aus. Ein Kommentator mit einem 256GB-Xeon-Server schätzt, 384GB RAM zu benötigen. Auch auf zwei DGX-Spark-Systeme passt das Modell nicht. Nutzer diskutieren bereits NVFP4-Quantisierung, wobei die 196B-Engram-Komponente im Speicher bleiben soll.

Nach der im Thread genannten sqrt(P x A)-Metrik dürfte die Leistung etwa einem ähnlich trainierten dichten 62B-Modell entsprechen. Einige Kommentatoren hätten eine dichte Variante in dieser Größe vorgezogen. Frühe Nutzer berichten dennoch von schnellen, hochwertigen Antworten, selbst auf einem Mac Studio.

Originalquelle lesen (Englisch) ↗

Artikel bewerten: 0

Leserforum

Noch keine Beiträge — eröffne die Debatte.

The Daily CommitThe Nightly Build — Page A1