DeepSeek ha presentado deepseek-v4-flash-vision-exp, un modelo que acepta imágenes junto con texto. Los desarrolladores pueden pedirle que describa imágenes o que lea texto de capturas de pantalla. También puede analizar gráficos. Los formatos admitidos son JPEG, PNG, GIF y WebP, detectados a partir del contenido real del archivo y no del nombre ni del tipo MIME declarado.

Hay tres formas de enviar una imagen, todas en el formato Chat Completions compatible con OpenAI. La primera incrusta una data URL codificada en base64 en la petición, que cuenta para el límite de 48 MiB del cuerpo. La segunda pasa una URL http(s) pública que el modelo descarga por sí mismo; la URL puede tener como máximo 8192 caracteres, el archivo 32 MiB, y la descarga debe completarse en 60 segundos. La tercera referencia un file_id de la Files API, lo que permite imágenes de hasta 64 MiB y sirve para reutilizar la misma imagen entre peticiones.

Un campo detail opcional controla el preprocesado: low reduce la imagen a 512x512 para una inferencia más rápida y barata, mientras que high, original y auto mantienen actualmente la imagen original.

Las imágenes se facturan como tokens. Cada imagen se redimensiona antes de la inferencia hasta aproximadamente el número de píxeles de una imagen de 800x800, ampliando las pequeñas y reduciendo las grandes. El resultado es un tope de 384 tokens por imagen, de modo que una imagen de 2000x2000 y una de 5000x5000 cuestan lo mismo. En peticiones con varias imágenes, cada una se cuenta de forma independiente.

Los límites incluyen un cuerpo de petición de 48 MiB, 32 MiB por imagen inline o URL, 600 imágenes por petición y un máximo de 8192 px por lado, que baja a 4096 px cuando la petición contiene 15 imágenes o más. El tamaño total se limita a 64 MiB sin imágenes file_id y a 200 MiB con ellas.

Hay restricciones: las imágenes solo se permiten en mensajes de usuario, y los demás modelos de DeepSeek rechazan la entrada de imágenes con un error 400. El modelo también es accesible a través del endpoint /messages compatible con Anthropic y de la Responses API compatible con OpenAI, donde las imágenes viajan como bloques image o partes input_image con los mismos tres métodos de entrada.