DeepSeek решила не ждать следующего большого релиза и открыла веса экспериментальной модели V4-Flash-Vision-Exp. В ней 305 млрд параметров, а публикация состоялась всего через 10 дней после выхода V4-Flash. Веса распространяются по лицензии MIT.

За основу взяли архитектуру V4-Flash, добавили визуальный модуль и дообучение на мультимодальных данных. Теперь модель умеет работать со скриншотами и графиками, а также использовать инструменты в агентных сценариях.

Первые результаты выглядят неоднозначно, но местами впечатляют. На Agents’ Last Exam модель набрала 27,3 балла против 25,7 у Opus 4.8, а на ZeroBench — 35 против 34. При этом на ApexBench она получила 36,5 балла, уступив Opus 4.8 с 39,4, а на Chartography разрыв составил 64,3 против 65.

Интересно, что добавление зрения не ухудшило модель только до работы с картинками. На Toolathlon-Verified результат вырос с 70,3 до 75,9, а на NL2Repo — с 54,2 до 57,7. На CyberGym, наоборот, показатель снизился с 76,7 до 75,3. На DeepSWE новинка набрала 59,3 против 58,0 у Opus 4.8, а на Terminal-Bench 2.1 — 83,9 против 85.

Вместе с весами DeepSeek открыла токенизатор, визуальный энкодер и компоненты для запуска через PyTorch, vLLM, SGLang, Transformers и Docker. Модель поддерживает несколько способов передачи изображений, а сообщество уже сделало квантованные сборки.

Но ставить точку пока рано. DeepSeek называет V4-Flash-Vision-Exp экспериментальным чекпоинтом, поэтому результаты скорее показывают направление развития архитектуры, чем характеристики будущей V4-Vision. Для рынка это означает больше открытых возможностей для экспериментов, а для бизнеса — потенциально более широкий выбор мультимодальных моделей.