DeepSeek снова решила сыграть против привычной логики рынка. Компания выпустила V4.1-Flash — младшую модель семейства, которая при этом показывает результаты на уровне Opus 5 и Sol в целом ряде тестов. Особенно заметно это в DeepSWE.

За впечатляющими цифрами стоит довольно необычная начинка. Модель построена по схеме MoE и насчитывает 552 млрд параметров, но одновременно активирует лишь 8 млрд на входе и 16 млрд на выходе.

Для этого DeepSeek использовала асимметричную архитектуру Causal Encoder–Decoder. Дополнительно разработчики изменили подходы к предварительному обучению и масштабировали reinforcement learning, чтобы модель эффективнее использовала вычисления.

Отдельно поработали с KV-кэшем — механизмом, который хранит промежуточную информацию во время работы модели. Его оптимизация позволила уменьшить объём памяти, необходимый на каждый токен, а значит, снизить нагрузку на инфраструктуру.

Но самое неприятное для конкурентов может скрываться в цене. В непиковые часы миллион входных токенов стоит $0,15, а выходных — $0,6. В периоды высокой нагрузки тарифы увеличиваются вдвое.

Получается любопытная комбинация: модель с сотнями миллиардов параметров пытается работать экономно, а по отдельным тестам приближается к гораздо более дорогим системам. Если такой баланс сохранится, рынок ИИ получит ещё один аргумент в пользу дешёвых специализированных моделей.

А чем доступнее становятся мощные ИИ-модели, тем больше бизнесов будут использовать их для поиска и анализа — и тем важнее, как ваш бренд представлен в их ответах. Выстроить эту видимость помогает агентство Carambola.pro, специализирующееся на GEO-продвижении и работе с источниками, которые цитируют нейросети.