Alibaba выпустила Qwen 3.8 Flash Next, и у владельцев мощных локальных машин появился повод снова вспомнить о своих компьютерах. Модель рассчитана на запуск там, где обычные решения такого класса уже начинают упираться в объём памяти.

В основе разработки — 125 млрд параметров по схеме 6B активных параметров, при этом 51 млрд приходится на Engram. Модель построена на архитектуре следующего поколения Qwen 4 и, по заявленным результатам, проходит все бенчмарки лучше Qwen 3.8 27B.

Но интереснее другое. Qwen 3.8 Flash Next показывает результаты, сопоставимые с DeepSeek V4 Flash, которая относится к заметно более тяжёлой категории моделей. При этом новинку уже поддерживают инструменты vLLM и SGLang, поэтому запускать её локально становится проще.

Главная особенность здесь — требования к железу. Модель можно эффективно использовать на системах со 128 ГБ памяти, включая DGX Spark, Mac и компьютеры на Strix Halo. Это как раз тот объём, который позволяет получить серьёзную модель без перехода к серверной инфраструктуре.

До этого в таком сегменте был заметный пробел. Модели примерно на 30 млрд параметров спокойно работали даже на гораздо менее производительных устройствах, а DeepSeek V4 Flash и другие разработки сопоставимого масштаба уже требовали больше памяти.

Похоже, именно такой класс моделей может стать новым компромиссом между качеством и локальным запуском. Если подобных разработок станет больше, мощный домашний компьютер постепенно превратится в вполне серьёзную платформу для работы с ИИ без облака.