
21 августа DeepSeek открыла через API доступ к мультимодальной модели DeepSeek-V4-Flash-Vision-Exp — первой версии линейки V4 Flash, которая умеет не только обрабатывать текст, но и анализировать изображения, скриншоты и смешанные запросы с картинками.
Компания заявляет, что в обычных текстовых задачах новинка не уступает DeepSeek-V4-Flash, тогда как на бенчмарках, где агенту нужно понимать визуальный контекст, прирост оказывается заметным: модель приблизилась к Claude Opus 4.8 от Anthropic и обошла флагман конкурента в трёх тестах из одиннадцати — Agents' Last Exam, ZeroBench и Chartography.
Разработчики могут вызывать модель через API, указав параметр model='deepseek-v4-flash-vision-exp'; формат совместим с OpenAI и Anthropic, поэтому её можно подключать к уже существующим агентным пайплайнам. Вместе с релизом вышла версия DeepSeek Harness 0.1.1 и бесплатный Files API, который позволяет загрузить картинку один раз и дальше ссылаться на неё по идентификатору.
Модель пока носит экспериментальный статус — в названии стоит приставка Exp, — но для команд, которым нужны агенты, умеющие разбирать скриншоты, графики и интерфейсы, релиз выглядит одним из самых заметных за неделю, тем более что DeepSeek традиционно предлагает API заметно дешевле западных аналогов.



























