€0.00 — free as in speechtonight's forecast: clear skies over production Cache: warm · Deploys: fair, 0% rollbacks expectedset by moonlight, shipped before dawn · deploy freely Page A2

The Daily Commit The Nightly Build

Dev news, typeset daily — PHP · AI · The Wider Stack

The developer's evening paper — PHP · AI · The Wider Stack

jeudi 10 septembre 2026 Vol. I — No. 515 · Édition du matinÉdition du soir EN DE FR ES

AI · Versions

DeepSeek publie V4.1-Flash en poids ouverts avec 8B de paramètres actifs

DeepSeek a publié les poids ouverts de DeepSeek V4.1-Flash sur Hugging Face.

sélectionné par Sönke

Le modèle mixture-of-experts totalise environ 500B de paramètres mais n'en active que 8B par token. La communauté souligne les exigences matérielles élevées et compare ses capacités à un modèle dense de 62B.

DeepSeek a publié les poids de DeepSeek V4.1-Flash sur Hugging Face sous le compte deepseek-ai. L'annonce est rapidement devenue l'un des posts les plus populaires de r/LocalLLaMA.

Le modèle repose sur une architecture mixture-of-experts éparsée. Selon la communauté, le backbone compte entre 485B et 552B de paramètres au total, avec seulement 8B de paramètres actifs par token. L'architecture utilise 1 expert partagé et 384 experts routés par couche MoE, avec 6 experts routés activés par token.

Parmi les autres composants figurent Single-Pass mHC, un mixage révisé du flux résiduel avec un noyau Mega-mHC, une mémoire conditionnelle Engram de 196B de paramètres, consultée de façon éparse par lookup basé sur les tokens, et DSpark, un décodage spéculatif semi-autorégressif. La fenêtre de contexte atteindrait un million de tokens.

Le nom « Flash » renvoie à une inférence rapide et peu coûteuse : 8B de paramètres actifs se traduisent par des coûts API réduits. L'hébergement local est une autre affaire. Un commentateur équipé d'un serveur Xeon de 256 Go estime avoir besoin de 384 Go de RAM. Le modèle ne tient pas non plus sur deux systèmes DGX Spark. Des utilisateurs discutent déjà d'une quantification NVFP4 en gardant le composant Engram de 196B en mémoire.

Selon la métrique sqrt(P x A) citée dans le fil, les capacités devraient correspondre à peu près à celles d'un modèle dense de 62B entraîné de manière comparable. Certains commentateurs auraient préféré une variante dense de cette taille. Les premiers utilisateurs rapportent néanmoins des réponses rapides et de qualité, même sur un Mac Studio.

Lire la source originale (en anglais) ↗

Évaluer cet article : 0

Tribune des lecteurs

Pas encore de contributions — lance le débat.

The Daily CommitThe Nightly Build — Page A1