DeepSeek добавила зрение своей быстрой модели. 21 августа компания открыла в API экспериментальную DeepSeek-V4-Flash-Vision-Exp — версию, которая принимает текст и изображения в одном запросе. Для разработчика вход простой: указать model='deepseek-v4-flash-vision-exp'. Если нужно быстро проверить вызов или собрать прототип, пригодится помощник для работы с кодом.
Главная новость здесь не в самом слове «мультимодальность». DeepSeek встроила работу с картинками в знакомые API-форматы и оценивает каждое изображение максимум в 384 входных токена по тарифу V4-Flash. На бумаге это небольшая техническая деталь. На практике — более понятная стоимость для агентов, которые читают скриншоты, схемы и документы.
- Что именно выпустила DeepSeek
- Какие форматы поддерживает мультимодальный API
- Как считаются изображения и почему важны 384 токена
- Что меняет бесплатный Files API
- Где новинку можно проверить на практике
- Что проверить до внедрения в продукт
- FAQ
- Глоссарий
- Читайте также
- Релиз состоялся 21 августа 2026 года.
- API принимает смешанный ввод: текст плюс изображения.
- Files API позволяет загрузить картинку один раз и повторно обращаться к ней по
file_id.
Что именно выпустила DeepSeek
DeepSeek называет новинку экспериментальной мультимодальной моделью. По официальному анонсу её текстовые возможности соответствуют DeepSeek-V4-Flash: это относится к агентным задачам, рассуждению и общим знаниям. Разница появляется, когда в контекст входит изображение.
Компания отдельно показала рост на мультимодальных агентных тестах. В этих тестах результат приблизился к Opus-4.8. Формулировка важна: речь идёт не о полном превосходстве над другой моделью и не обо всех возможных бенчмарках, а о конкретном классе мультимодальных агентных задач.
Одновременно вышел DeepSeek Harness 0.1.1 с готовой поддержкой нового идентификатора модели. Это снижает порог первого запуска: разработчику не нужно придумывать собственную прослойку только ради выбора модели. Остальные детали интеграции лучше сверять с документацией API перед переносом прототипа в рабочую систему.
Почему это важно: DeepSeek не вынесла зрение в отдельный экзотический интерфейс. Мультимодальный ввод доступен через привычные форматы запросов, поэтому эксперимент можно встроить в существующий агентный контур небольшим изменением конфигурации.
Какие форматы поддерживает мультимодальный API
В анонсе перечислены три интерфейса: Chat Completions, Messages и Responses. В запросе можно смешивать текст и изображения. Саму картинку разрешено передать строкой base64, внешней ссылкой или через Files API.
У каждого способа свой практический смысл. Base64 удобно использовать, когда файл уже находится у приложения и его нужно отправить одним запросом. Внешний URL сокращает подготовку, если изображение доступно по устойчивой ссылке. Files API полезен, когда один и тот же объект участвует в нескольких обращениях.
Кажется, что эти варианты взаимозаменяемы, но на деле архитектура будет разной. Одноразовый скриншот не обязательно хранить. Схему, которую агент анализирует несколько раз, разумнее сначала загрузить и затем ссылаться на неё по идентификатору. Выбрать подходящий вариант можно рядом с другими моделями DeepSeek и требованиями конкретного продукта.
Как считаются изображения и почему важны 384 токена
DeepSeek сообщает, что каждое изображение токенизируется для биллинга и занимает до 384 токенов. Эти токены оплачиваются по тарифу V4-Flash. Это не обещание фиксированной цены всего запроса: итог по-прежнему зависит от текстового входа, ответа модели и действующего тарифа.
Зато верхняя граница для изображения делает предварительную оценку прозрачнее. Команда может посчитать, сколько картинок проходит через сценарий, добавить объём текста и сравнить варианты до запуска. Такой расчёт особенно полезен там, где агент получает изображения регулярно, а не один раз на демонстрации.
Сам лимит не доказывает точность на мелком тексте, сложных чертежах или некачественных фото. Официальный анонс таких гарантий не даёт. Поэтому реальный тест должен повторять рабочие условия: те же размеры файлов, тот же язык, те же типы изображений и те же вопросы.
Практический вывод: сначала возьмите 20–30 типичных изображений, заранее задайте критерий правильного ответа и измерьте стоимость. Красивого примера из презентации недостаточно, чтобы оценить производственный сценарий.
Что меняет бесплатный Files API
Вместе с моделью DeepSeek объявила о запуске Files API. По официальной странице сервис бесплатен: изображение можно загрузить один раз, получить file_id и повторно использовать этот идентификатор в следующих запросах. Повторная отправка самого файла не требуется.
Главная экономия здесь — пропускная способность между приложением и API. Представьте агента, который десять раз отвечает на разные вопросы по одной диаграмме. Без файлового интерфейса приложение каждый раз передаёт изображение заново. С file_id оно повторно ссылается на уже загруженный объект.
Официальный анонс не описывает срок хранения, ограничения размера и правила удаления на этой странице. Эти параметры нельзя угадывать. Перед работой с чувствительными данными команда должна открыть актуальное руководство Files API, проверить политику хранения и заложить удаление файлов в собственный процесс.
Где новинку можно проверить на практике
Первый понятный сценарий — агент, который получает скриншот интерфейса и текстовую задачу. Например, ему можно показать экран приложения и попросить описать, что пользователь должен сделать дальше. Это пример применения, а не заявление DeepSeek о гарантированной точности.
Второй сценарий — повторные вопросы к одному изображению. Команда загружает схему через Files API, а затем по очереди просит модель найти ключевые блоки, объяснить связи и подготовить краткое резюме. Здесь полезность file_id проверяется буквально за несколько запросов.
Третий сценарий — разбор визуального референса в контентном процессе. Пользователь передаёт изображение вместе с инструкцией, а помощник для создания контента получает дополнительный контекст. В каждом случае нужен контроль человеком: мультимодальная модель может уверенно ошибиться, а статус Exp прямо напоминает, что релиз предназначен прежде всего для проверки.
Что проверить до внедрения в продукт
Начните с совместимости. Новый идентификатор должен проходить через выбранный SDK или агентный фреймворк, а формат изображения — соответствовать актуальному руководству. Затем проверьте задержку, стоимость и качество на собственном наборе задач.
Не переносите вывод из одного бенчмарка на весь продукт. Близость к Opus-4.8 заявлена для мультимодальных агентных тестов. Она ничего автоматически не говорит о распознавании каждого документа, точности координат или работе с видео.
Наконец, отделите факты релиза от проектных решений. DeepSeek подтверждает три API-формата, смешанный ввод, три способа передачи изображений и Files API. Политику хранения, допустимые файлы и лимиты нужно брать из текущего руководства. Такой подход выглядит осторожнее рекламного пересказа, зато он позволяет собрать рабочий пилот без сюрпризов.
Источник: официальный анонс DeepSeek от 21 августа 2026 года.
FAQ
Когда вышла DeepSeek-V4-Flash-Vision-Exp?
Официальная страница релиза датирована 21 августа 2026 года. На ней DeepSeek сообщила, что модель уже доступна на API Platform.
Какой идентификатор нужно указать в запросе?
В параметре модели используется deepseek-v4-flash-vision-exp. Перед запуском проверьте, что SDK пропускает этот идентификатор без собственной подмены.
Какие способы передачи изображения поддерживаются?
Анонс перечисляет base64, внешний URL и Files API. Текст и изображение можно объединить в одном входе.
Сколько токенов занимает изображение?
DeepSeek указывает верхнюю границу до 384 токенов на одно изображение. Биллинг идёт по тарифу V4-Flash.
Зачем нужен Files API?
Он позволяет загрузить изображение один раз и повторно ссылаться на него по file_id, не передавая файл в каждом запросе.
Можно ли считать модель готовой для любого продакшена?
Нет универсальной гарантии. Модель обозначена как экспериментальная, поэтому качество, задержку и ограничения нужно проверить на собственном сценарии до внедрения.
Глоссарий
| Термин | Что означает в материале |
|---|---|
| Мультимодальный ввод | Передача модели текста и изображения в рамках одного запроса. |
| Chat Completions | Один из API-форматов, для которых DeepSeek заявила поддержку новой модели. |
| Files API | Интерфейс загрузки изображения с последующим обращением к нему по идентификатору. |
file_id | Идентификатор уже загруженного файла, который можно использовать повторно. |
| Exp | Обозначение экспериментального статуса в имени модели. |




