Alibaba решила не ждать полноценного запуска Qwen4 и показала модель, которая должна стать её первым публичным представителем. Qwen3.8-Flash-Next разработчики называют предварительным показом нового поколения, хотя в названии Qwen4 пока нет.

Причина раннего релиза довольно практичная: открытые веса должны появиться 26 августа в 15:00 UTC, чтобы создатели библиотек и систем инференса успели адаптировать свои решения до выхода основной версии.

Пока Alibaba раскрыла немного подробностей. Известно, что Qwen3.8-Flash-Next — мультимодальная MoE-модель, которая выйдет в обычной и FP8-версиях. Более подробное описание некоторое время находилось на ModelScope, но затем его удалили. Пользователи сохранили информацию на скриншотах и в цитатах.

Если эти данные верны, модель получила 125 млрд основных параметров и ещё 51 млрд параметров N-gram embeddings, при этом на каждый токен активируется около 6 млрд параметров. Архитектуру также изменили на уровне attention, residual-связей, embeddings и оптимизации.

Самое любопытное касается обучения. В удалённом описании утверждалось, что Flash-Next потребовала примерно в девять раз меньше вычислений, чем Qwen3.7-Plus. При сопоставимых общих возможностях разработчики заявляли о росте результатов в программировании и cowork-задачах, хотя подтверждающей таблицы с метриками не было.

Если заявленные параметры подтвердятся, Alibaba фактически дала разработчикам ранний доступ к технологической базе Qwen4. Для рынка это может означать более быструю подготовку инфраструктуры к следующему поколению моделей и снижение вычислительных затрат.