DeepSeek a publié DeepSeek-V4-Flash-0731 sur Hugging Face, en livrant les poids le jour même de l'annonce, sans campagne de compte à rebours. Le modèle est distribué sous licence MIT pure.

L'efficacité est remarquable : le modèle est livré déjà quantifié en FP4, pour une taille totale d'environ 167GB. Selon la communauté, il atteint le niveau de GLM-5.2 avec beaucoup moins de VRAM, et certains benchmarks le placent devant DeepSeek-V4-Pro. D'après la fiche du modèle, les benchmarks d'agents de code ont été évalués avec le mode minimal de DeepSeek Harness, un nouveau framework d'agents officiel annoncé pour bientôt, avec un effort de raisonnement maximal, une température de 1.0 et un top_p de 0.95.

La communauté de l'IA locale a vivement réagi : les utilisateurs saluent la publication immédiate des poids ouverts et discutent de l'exécution sur du matériel grand public, avec des demandes de builds GGUF et de quantifications Q2–Q4 pour des configurations comme un M5 Max ou une machine avec 64GB de RAM et une 3090. Les premiers testeurs jugent la qualité très élevée, avec un rendu UI proche du niveau d'Opus.