DeepSeek hat die Gewichte für DeepSeek V4.1-Flash auf Hugging Face unter dem Konto deepseek-ai veröffentlicht. Die Ankündigung wurde schnell einer der Top-Posts auf r/LocalLLaMA.

Das Modell ist ein spärliches Mixture-of-Experts-Design. Community-Angaben nennen ein Backbone im Bereich von 485B bis 552B Gesamtparametern, wobei pro Token nur 8B Parameter aktiv sind. Die Architektur nutzt 1 gemeinsamen Experten und 384 geroutete Experten pro MoE-Schicht, wobei 6 geroutete Experten pro Token aktiviert werden.

Weitere Komponenten sind Single-Pass mHC, ein überarbeitetes Residual-Stream-Mixing mit Mega-mHC-Kernel, ein Engram-Konditionalspeicher mit 196B Parametern, auf den spärlich per tokenbasiertem Lookup zugegriffen wird, sowie DSpark Speculative Decoding mit semi-autoregressiver Entwurfsgenerierung. Das Kontextfenster soll eine Million Token betragen.

Der Name "Flash" bezieht sich auf günstige, schnelle Inferenz: Nur 8B aktive Parameter bedeuten niedrige API-Kosten. Beim lokalen Hosting sieht es anders aus. Ein Kommentator mit einem 256GB-Xeon-Server schätzt, 384GB RAM zu benötigen. Auch auf zwei DGX-Spark-Systeme passt das Modell nicht. Nutzer diskutieren bereits NVFP4-Quantisierung, wobei die 196B-Engram-Komponente im Speicher bleiben soll.

Nach der im Thread genannten sqrt(P x A)-Metrik dürfte die Leistung etwa einem ähnlich trainierten dichten 62B-Modell entsprechen. Einige Kommentatoren hätten eine dichte Variante in dieser Größe vorgezogen. Frühe Nutzer berichten dennoch von schnellen, hochwertigen Antworten, selbst auf einem Mac Studio.