DeepSeek lance un modèle vision expérimental

Original : DeepSeek-v4-flash-vision-exp

Pourquoi c'est important

DeepSeek étend son offre API aux capacités vision, renforçant la concurrence dans le marché des LLM multimodaux.

DeepSeek a publié le modèle deepseek-v4-flash-vision-exp, capable d'analyser des images (JPEG, PNG, GIF, WebP) aux côtés de texte via une API compatible OpenAI, avec trois méthodes d'envoi d'images disponibles.

DeepSeek a mis en ligne la documentation officielle de son nouveau modèle expérimental deepseek-v4-flash-vision-exp, doté de capacités multimodales. Ce modèle accepte des images en entrée conjointement avec du texte, permettant des usages tels que la description d'images, la lecture de texte dans des captures d'écran ou l'analyse de graphiques. Les formats supportés sont JPEG, PNG, GIF et WebP, détectés à partir du contenu réel du fichier. L'API est compatible avec le format OpenAI Chat Completions. Trois méthodes d'envoi sont disponibles : l'encodage Base64 inline (limite de 48 MiB), un lien URL externe (image jusqu'à 32 MiB, téléchargement sous 60 secondes, URL max 8 192 caractères), et la référence via le Files API (jusqu'à 64 MiB, idéale pour la réutilisation). Le point d'accès est https://api.deepseek.com. Le modèle est également disponible via la Responses API.

Source

api-docs.deepseek.com — Lire l'original →