Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

DeepSeek : la lecture d'images arrive sur son modèle rapide, en expérimental

3 min de lecture · api-docs.deepseek.com · 21 août 2026

D'après DeepSeek - Notes de version, 21 août 2026, relayé par X (@deepseek_ai)

DeepSeek : la lecture d'images arrive sur son modèle rapide, en expérimental

Image : générée (Gemini)

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Sur les capacités de texte pur - agent, raisonnement, connaissances générales - DeepSeek affirme que le nouveau modèle est au même niveau que DeepSeek-V4-Flash, la version textuelle déjà offerte.
  • Sur les épreuves d'agent qui exigent de comprendre une image, DeepSeek annonce un bond important, qui rapprocherait ses capacités de celles d'Opus-4.8. C'est une affirmation du fabricant : aucune reproduction indépendante n'accompagne l'annonce.
  • Les scores déclarés par DeepSeek vont de 83,9 sur Terminal Bench 2.1 à 64,3 sur Chartography (lecture de graphiques), 36,5 sur ApexBench et 27,3 sur Agents' Last Exam. Aucun de ces chiffres n'a été refait par un tiers à ce jour.
  • DeepSeek précise elle-même que dans deux de ces épreuves, ApexBench et Agents' Last Exam, le modèle purement textuel « ignore les éléments multimodaux » : la comparaison y est donc mécaniquement favorable au nouveau. Pour les sept autres, la note ne dit rien.
  • Le modèle porte l'étiquette « Exp » pour expérimental et s'appelle par le nom deepseek-v4-flash-vision-exp. Il conserve le contexte d'un million de jetons.

Pourquoi ça compte

L'intérêt de cette sortie n'est pas le score, c'est le prix. Un modèle capable de lire des captures d'écran, des formulaires ou des graphiques ouvre des usages à fort volume - traiter des milliers de documents, piloter une interface - qui restaient trop coûteux avec les grands modèles. La prudence reste de mise : l'étiquette expérimentale signifie qu'un modèle peut changer ou disparaître sans préavis, et aucun tiers n'a encore refait les mesures.

Chiffre-clé

0,22 $ US par million de jetons en entrée, pour du texte que le service n'a pas déjà gardé en mémoire (« hors cache »), en heures creuses - selon la grille tarifaire de DeepSeek consultée le 21 août 2026. Le tarif de pointe est le double.

Citation

« Sur les épreuves d'agent qui exigent la compréhension visuelle, DeepSeek-V4-Flash-Vision-Exp réalise un bond significatif, ce qui rapproche ses capacités d'agent multimodal d'Opus-4.8. (« bringing its multimodal agent capabilities close to Opus-4.8 ») » Notes de version de DeepSeek, 21 août 2026

Ce que ça change au Québec

🇨🇦 La grille de DeepSeek double ses tarifs pendant deux plages d'heures pleines, de 01:00 à 04:00 et de 06:00 à 10:00 UTC. Converties à l'heure du Québec en période d'heure avancée (UTC-4), elles tombent de 21h à minuit puis de 2h à 6h du matin : une journée de travail ordinaire se déroule donc entièrement au tarif réduit, moitié prix. À revérifier au passage à l'heure normale en novembre.

Action concrète

Si vous testez ce modèle, gardez à l'esprit le suffixe « Exp » : un modèle expérimental n'offre aucune garantie de stabilité et peut être retiré. Prévoyez un repli vers un AUTRE modèle capable de lire des images, jamais vers une version purement textuelle : un modèle aveugle ne signale pas qu'il a manqué l'image, il répond quand même. Et mesurez la qualité sur vos propres documents plutôt que sur les scores annoncés.

« DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities - including agents, reasoning, and world knowledge. On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major... »

Fondée sur la source originale

Sources

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !