Z.ai официально представила GLM-5.3-Flash, и главная особенность модели скрывается не в количестве параметров. Компания решила сделать ставку на длинный контекст и снизить вычислительные затраты, сохранив возможности для сложных задач.

Модель получила 320 млрд параметров, но при генерации задействует только 18 млрд. В её основе лежит гибридная архитектура, объединяющая sparse attention и linear attention. По данным Z.ai, такой подход сократил вычисления, связанные с attention, в 3,01 раза, а объём KV-cache — в 4,44 раза.

При этом модель умеет работать с контекстом до 1 млн токенов. Более того, GLM-5.3-Flash стала первой нативно мультимодальной моделью семейства GLM-5: она способна работать не только с текстом, но и с изображениями и интерфейсами.

Отсюда и список задач, на которые её ориентировала Z.ai. Это программирование, работа в браузере и графическом интерфейсе, Blender и Office, исследовательские задачи и обработка документов. То есть модель пытаются превратить не просто в чат-бота, а в инструмент для работы с компьютером.

Есть и ещё один практический момент. В GLM Coding Plan новая модель предоставляет в три раза больше квоты, чем GLM-5.3. Весы уже опубликованы на Hugging Face, а модель доступна через API и сервисы Z.ai.

Для разработчиков это означает больше возможностей запускать длинные и сложные сценарии без такого же роста вычислительных расходов. Если заявленная экономичность подтвердится на практике, конкуренция среди моделей для агентных задач станет заметно жёстче.