Dinkin Logo
DINKIN
Новая модель DeepSeek-V4-Flash-Vision-Exp и API
Назад к новостям
21 августа 2026Редакция Dinkin

Новая модель DeepSeek-V4-Flash-Vision-Exp и API

DeepSeek добавила зрение своей быстрой модели. 21 августа компания открыла в API экспериментальную DeepSeek-V4-Flash-Vision-Exp — версию, которая принимает текст и изображения в одном запросе. Для разработчика вход простой: указать model='deepseek-v4-flash-vision-exp'. Если нужно быстро проверить вызов или собрать прототип, пригодится помощник для работы с кодом.

Главная новость здесь не в самом слове «мультимодальность». DeepSeek встроила работу с картинками в знакомые API-форматы и оценивает каждое изображение максимум в 384 входных токена по тарифу V4-Flash. На бумаге это небольшая техническая деталь. На практике — более понятная стоимость для агентов, которые читают скриншоты, схемы и документы.

Оглавление
Коротко
  • Релиз состоялся 21 августа 2026 года.
  • API принимает смешанный ввод: текст плюс изображения.
  • Files API позволяет загрузить картинку один раз и повторно обращаться к ней по file_id.

Что именно выпустила DeepSeek

DeepSeek называет новинку экспериментальной мультимодальной моделью. По официальному анонсу её текстовые возможности соответствуют DeepSeek-V4-Flash: это относится к агентным задачам, рассуждению и общим знаниям. Разница появляется, когда в контекст входит изображение.

Компания отдельно показала рост на мультимодальных агентных тестах. В этих тестах результат приблизился к Opus-4.8. Формулировка важна: речь идёт не о полном превосходстве над другой моделью и не обо всех возможных бенчмарках, а о конкретном классе мультимодальных агентных задач.

Одновременно вышел DeepSeek Harness 0.1.1 с готовой поддержкой нового идентификатора модели. Это снижает порог первого запуска: разработчику не нужно придумывать собственную прослойку только ради выбора модели. Остальные детали интеграции лучше сверять с документацией API перед переносом прототипа в рабочую систему.

Почему это важно: DeepSeek не вынесла зрение в отдельный экзотический интерфейс. Мультимодальный ввод доступен через привычные форматы запросов, поэтому эксперимент можно встроить в существующий агентный контур небольшим изменением конфигурации.

Какие форматы поддерживает мультимодальный API

В анонсе перечислены три интерфейса: Chat Completions, Messages и Responses. В запросе можно смешивать текст и изображения. Саму картинку разрешено передать строкой base64, внешней ссылкой или через Files API.

У каждого способа свой практический смысл. Base64 удобно использовать, когда файл уже находится у приложения и его нужно отправить одним запросом. Внешний URL сокращает подготовку, если изображение доступно по устойчивой ссылке. Files API полезен, когда один и тот же объект участвует в нескольких обращениях.

Кажется, что эти варианты взаимозаменяемы, но на деле архитектура будет разной. Одноразовый скриншот не обязательно хранить. Схему, которую агент анализирует несколько раз, разумнее сначала загрузить и затем ссылаться на неё по идентификатору. Выбрать подходящий вариант можно рядом с другими моделями DeepSeek и требованиями конкретного продукта.

Как считаются изображения и почему важны 384 токена

DeepSeek сообщает, что каждое изображение токенизируется для биллинга и занимает до 384 токенов. Эти токены оплачиваются по тарифу V4-Flash. Это не обещание фиксированной цены всего запроса: итог по-прежнему зависит от текстового входа, ответа модели и действующего тарифа.

Зато верхняя граница для изображения делает предварительную оценку прозрачнее. Команда может посчитать, сколько картинок проходит через сценарий, добавить объём текста и сравнить варианты до запуска. Такой расчёт особенно полезен там, где агент получает изображения регулярно, а не один раз на демонстрации.

Сам лимит не доказывает точность на мелком тексте, сложных чертежах или некачественных фото. Официальный анонс таких гарантий не даёт. Поэтому реальный тест должен повторять рабочие условия: те же размеры файлов, тот же язык, те же типы изображений и те же вопросы.

Практический вывод: сначала возьмите 20–30 типичных изображений, заранее задайте критерий правильного ответа и измерьте стоимость. Красивого примера из презентации недостаточно, чтобы оценить производственный сценарий.

Что меняет бесплатный Files API

Вместе с моделью DeepSeek объявила о запуске Files API. По официальной странице сервис бесплатен: изображение можно загрузить один раз, получить file_id и повторно использовать этот идентификатор в следующих запросах. Повторная отправка самого файла не требуется.

Главная экономия здесь — пропускная способность между приложением и API. Представьте агента, который десять раз отвечает на разные вопросы по одной диаграмме. Без файлового интерфейса приложение каждый раз передаёт изображение заново. С file_id оно повторно ссылается на уже загруженный объект.

Официальный анонс не описывает срок хранения, ограничения размера и правила удаления на этой странице. Эти параметры нельзя угадывать. Перед работой с чувствительными данными команда должна открыть актуальное руководство Files API, проверить политику хранения и заложить удаление файлов в собственный процесс.

Где новинку можно проверить на практике

Первый понятный сценарий — агент, который получает скриншот интерфейса и текстовую задачу. Например, ему можно показать экран приложения и попросить описать, что пользователь должен сделать дальше. Это пример применения, а не заявление DeepSeek о гарантированной точности.

Второй сценарий — повторные вопросы к одному изображению. Команда загружает схему через Files API, а затем по очереди просит модель найти ключевые блоки, объяснить связи и подготовить краткое резюме. Здесь полезность file_id проверяется буквально за несколько запросов.

Третий сценарий — разбор визуального референса в контентном процессе. Пользователь передаёт изображение вместе с инструкцией, а помощник для создания контента получает дополнительный контекст. В каждом случае нужен контроль человеком: мультимодальная модель может уверенно ошибиться, а статус Exp прямо напоминает, что релиз предназначен прежде всего для проверки.

Что проверить до внедрения в продукт

Начните с совместимости. Новый идентификатор должен проходить через выбранный SDK или агентный фреймворк, а формат изображения — соответствовать актуальному руководству. Затем проверьте задержку, стоимость и качество на собственном наборе задач.

Не переносите вывод из одного бенчмарка на весь продукт. Близость к Opus-4.8 заявлена для мультимодальных агентных тестов. Она ничего автоматически не говорит о распознавании каждого документа, точности координат или работе с видео.

Наконец, отделите факты релиза от проектных решений. DeepSeek подтверждает три API-формата, смешанный ввод, три способа передачи изображений и Files API. Политику хранения, допустимые файлы и лимиты нужно брать из текущего руководства. Такой подход выглядит осторожнее рекламного пересказа, зато он позволяет собрать рабочий пилот без сюрпризов.

Источник: официальный анонс DeepSeek от 21 августа 2026 года.

FAQ

Когда вышла DeepSeek-V4-Flash-Vision-Exp?

Официальная страница релиза датирована 21 августа 2026 года. На ней DeepSeek сообщила, что модель уже доступна на API Platform.

Какой идентификатор нужно указать в запросе?

В параметре модели используется deepseek-v4-flash-vision-exp. Перед запуском проверьте, что SDK пропускает этот идентификатор без собственной подмены.

Какие способы передачи изображения поддерживаются?

Анонс перечисляет base64, внешний URL и Files API. Текст и изображение можно объединить в одном входе.

Сколько токенов занимает изображение?

DeepSeek указывает верхнюю границу до 384 токенов на одно изображение. Биллинг идёт по тарифу V4-Flash.

Зачем нужен Files API?

Он позволяет загрузить изображение один раз и повторно ссылаться на него по file_id, не передавая файл в каждом запросе.

Можно ли считать модель готовой для любого продакшена?

Нет универсальной гарантии. Модель обозначена как экспериментальная, поэтому качество, задержку и ограничения нужно проверить на собственном сценарии до внедрения.

Глоссарий

ТерминЧто означает в материале
Мультимодальный вводПередача модели текста и изображения в рамках одного запроса.
Chat CompletionsОдин из API-форматов, для которых DeepSeek заявила поддержку новой модели.
Files APIИнтерфейс загрузки изображения с последующим обращением к нему по идентификатору.
file_idИдентификатор уже загруженного файла, который можно использовать повторно.
ExpОбозначение экспериментального статуса в имени модели.

Читайте также

Инструменты по теме

Эти инструменты Dinkin логично дополняют тему статьи и дают дополнительные внутренние переходы не в пустоту, а в полезные сценарии.

Поделиться статьей: