DeepSeek a présenté deepseek-v4-flash-vision-exp, un modèle qui accepte des images en plus du texte. Les développeurs peuvent lui demander de décrire des images ou de lire du texte dans des captures d'écran. Il peut aussi analyser des graphiques. Les formats pris en charge sont JPEG, PNG, GIF et WebP, détectés à partir du contenu réel du fichier et non du nom ou du type MIME déclaré.

Trois méthodes permettent d'envoyer une image, toutes au format Chat Completions compatible OpenAI. La première intègre une data URL encodée en base64 dans la requête, comptabilisée dans la limite de 48 Mio du corps de requête. La deuxième transmet une URL http(s) publique que le modèle télécharge lui-même ; l'URL ne doit pas dépasser 8192 caractères, le fichier 32 Mio, et le téléchargement doit aboutir en 60 secondes. La troisième référence un file_id de la Files API, ce qui autorise des images jusqu'à 64 Mio et convient à une réutilisation entre requêtes.

Un champ detail optionnel contrôle le prétraitement : low réduit l'image à 512x512 pour une inférence plus rapide et moins chère, tandis que high, original et auto conservent actuellement l'image d'origine.

Les images sont facturées en tokens. Chaque image est redimensionnée avant l'inférence pour atteindre environ le nombre de pixels d'une image 800x800, les petites étant agrandies et les grandes réduites. Il en résulte un plafond de 384 tokens par image : une image 2000x2000 et une 5000x5000 coûtent donc pareil. Dans une requête multi-images, chaque image est comptée indépendamment.

Les limites comprennent un corps de requête de 48 Mio, 32 Mio par image inline ou URL, 600 images par requête et 8192 px maximum par côté, ramené à 4096 px quand une requête contient 15 images ou plus. La taille totale est plafonnée à 64 Mio sans images file_id et 200 Mio avec.

Des restrictions s'appliquent : les images ne sont autorisées que dans les messages utilisateur, et les autres modèles DeepSeek rejettent les images avec une erreur 400. Le modèle est aussi accessible via l'endpoint /messages compatible Anthropic et la Responses API compatible OpenAI, où les images circulent sous forme de blocs image ou de parties input_image avec les mêmes trois méthodes d'entrée.