DeepSeek hat deepseek-v4-flash-vision-exp vorgestellt, ein Modell, das Bilder zusammen mit Text entgegennimmt. Entwickler können es Bilder beschreiben oder Text aus Screenshots lesen lassen. Zudem kann es Diagramme analysieren. Unterstützt werden JPEG, PNG, GIF und WebP, erkannt am tatsächlichen Dateiinhalt und nicht am Dateinamen oder deklarierten MIME-Typ.

Es gibt drei Wege, ein Bild zu senden, alle im OpenAI-kompatiblen Chat-Completions-Format. Der erste bettet eine base64-kodierte Data-URL direkt in die Anfrage ein, die auf das 48-MiB-Limit des Request-Bodys angerechnet wird. Der zweite übergibt eine öffentliche http(s)-URL, die das Modell selbst lädt; die URL darf höchstens 8192 Zeichen lang sein, die Datei maximal 32 MiB groß, und der Download muss innerhalb von 60 Sekunden abgeschlossen sein. Der dritte Weg referenziert eine file_id aus der Files API, was Einzelbilder bis 64 MiB erlaubt und sich für wiederholte Nutzung eignet.

Ein optionales detail-Feld steuert die Vorverarbeitung: low skaliert auf 512x512 herunter für schnellere, günstigere Inferenz, während high, original und auto derzeit das Originalbild behalten.

Bilder werden als Tokens abgerechnet. Jedes Bild wird vor der Inferenz auf ungefähr die Pixelzahl eines 800x800-Bildes skaliert, kleine hoch, große herunter. Daraus ergibt sich eine Obergrenze von 384 Tokens pro Bild, sodass ein 2000x2000- und ein 5000x5000-Bild gleich viel kosten. Bei Anfragen mit mehreren Bildern wird jedes Bild unabhängig gezählt.

Zu den Limits gehören 48 MiB Request-Body, 32 MiB pro Inline- oder URL-Bild, 600 Bilder pro Anfrage und maximal 8192 px pro Seite, was bei 15 oder mehr Bildern auf 4096 px sinkt. Die Gesamtgröße ist auf 64 MiB ohne file_id-Bilder und 200 MiB mit ihnen begrenzt.

Einschränkungen gelten: Bilder sind nur in User-Nachrichten erlaubt, und andere DeepSeek-Modelle lehnen Bildeingaben mit einem 400-Fehler ab. Das Modell ist auch über den Anthropic-kompatiblen /messages-Endpunkt und die OpenAI-kompatible Responses API erreichbar, wo Bilder als image-Blöcke oder input_image-Teile mit denselben drei Eingabemethoden übertragen werden.