DeepSeek a publié les poids de DeepSeek V4.1-Flash sur Hugging Face sous le compte deepseek-ai. L'annonce est rapidement devenue l'un des posts les plus populaires de r/LocalLLaMA.
Le modèle repose sur une architecture mixture-of-experts éparsée. Selon la communauté, le backbone compte entre 485B et 552B de paramètres au total, avec seulement 8B de paramètres actifs par token. L'architecture utilise 1 expert partagé et 384 experts routés par couche MoE, avec 6 experts routés activés par token.
Parmi les autres composants figurent Single-Pass mHC, un mixage révisé du flux résiduel avec un noyau Mega-mHC, une mémoire conditionnelle Engram de 196B de paramètres, consultée de façon éparse par lookup basé sur les tokens, et DSpark, un décodage spéculatif semi-autorégressif. La fenêtre de contexte atteindrait un million de tokens.
Le nom « Flash » renvoie à une inférence rapide et peu coûteuse : 8B de paramètres actifs se traduisent par des coûts API réduits. L'hébergement local est une autre affaire. Un commentateur équipé d'un serveur Xeon de 256 Go estime avoir besoin de 384 Go de RAM. Le modèle ne tient pas non plus sur deux systèmes DGX Spark. Des utilisateurs discutent déjà d'une quantification NVFP4 en gardant le composant Engram de 196B en mémoire.
Selon la métrique sqrt(P x A) citée dans le fil, les capacités devraient correspondre à peu près à celles d'un modèle dense de 62B entraîné de manière comparable. Certains commentateurs auraient préféré une variante dense de cette taille. Les premiers utilisateurs rapportent néanmoins des réponses rapides et de qualité, même sur un Mac Studio.




Commentaires
Pas encore de commentaire — écris le premier.
Lance la discussion
Pas de compte ni de mot de passe — saisis simplement ton adresse e-mail et nous t’envoyons un lien de connexion à usage unique. Première visite ? Tout se met en place automatiquement.
Ton évaluation sera appliquée automatiquement après ta connexion.
Vérifie ta boîte mail
Nous avons envoyé un lien de connexion à …. Ouvre-le sur cet appareil — cet onglet te connectera automatiquement.
Rien reçu ? Vérifiez le dossier spam — et marquez le message « Non spam » pour qu'il arrive directement la prochaine fois.