Alibaba приоткрыла дверь в следующее поколение Qwen. Компания открыла веса Qwen3.8-Flash-Next — мультимодальной модели, которую сама называет ранним превью архитектуры будущего Qwen4.
Основная модель получила 125 млрд параметров, а ещё 51 млрд добавлено в N-gram Embedding. Контекст достигает 262 тыс. токенов и потенциально может быть увеличен примерно до 1 млн. Но интереснее не сами цифры, а способ, которым Alibaba нарастила возможности модели.

Отдельная N-gram-память хранит представления часто встречающихся последовательностей токенов. Благодаря этому дополнительные 51 млрд параметров не требуют сопоставимого роста вычислений: нужные данные извлекаются из таблицы, причём хранить её можно даже за пределами памяти GPU.
Экономия проявилась уже на этапе обучения. По данным Alibaba, создание Qwen3.8-Flash-Next обошлось примерно в девять раз дешевле, чем обучение Qwen3.7-Plus. При этом новая модель показала более высокие результаты в программировании и офисных задачах.
Есть и ещё один важный показатель — цена работы. Миллион входных токенов для Qwen3.8-Flash-Next стоит $0,16, а миллион выходных — $0,47.
Чем дешевле становятся ИИ-модели, тем больше бизнесов смогут их использовать — и тем выше будет конкуренция за внимание в ИИ-ответах. Заблаговременно выстроить стратегию видимости в нейросетях помогает Carambola.pro, агентство, которое специализируется на GEO-продвижении.
Получается, Alibaba экспериментирует сразу с двумя направлениями: увеличивает масштаб моделей и одновременно старается не раздувать вычислительные расходы. Если такой подход перейдёт в полноценный Qwen4, разработка мощных ИИ-систем может стать заметно дешевле.
