DeepSeek решил проверить, насколько далеко можно продвинуть ИИ-агента, если добавить ему зрение. 21 августа компания представила экспериментальную модель, которая умеет анализировать изображения и взаимодействовать с интерфейсами, сохранив прежние возможности в логике, программировании и работе в качестве агента.
Пока это не полноценный мультимодальный ИИ. Новинка работает с изображениями, но видео и звук пока не поддерживает. Поэтому до универсальной модели, способной воспринимать разные типы данных одновременно, DeepSeek ещё предстоит сделать следующий шаг.

Первые результаты выглядят серьёзно. В тесте ApexBench модель получила 36,5 балла против 39,4 у Opus-4.8. А вот в ZeroBench DeepSeek оказался впереди: 35 баллов против 34 у модели Anthropic.
Попробовать новинку уже можно через DeepSeek API. Модель получила название deepseek-v4-flash-vision-exp, а изображения разрешается передавать несколькими способами: через Base64, прямую ссылку или новый Files API. Последний вариант позволяет один раз загрузить файл и затем обращаться к нему по file_id в разных запросах, не передавая изображение заново.
Стоимость при этом осталась на уровне обычного V4-Flash: за изображение объёмом до 384 токенов дополнительной платы нет. Для разработчиков уже появился и DeepSeek Harness 0.1.1 с нативной поддержкой новой модели.
Пока DeepSeek добавил ИИ только одно новое чувство — зрение. Но результаты показывают, что даже этого достаточно, чтобы приблизиться к лидерам и местами их обойти.
