Z.ai представила мультимодальную модель GLM-5.3-Flash

Компания Z.ai анонсировала GLM-5.3-Flash — первую мультимодальную модель из семейства GLM-5. Эта модель сочетает в себе 320 миллиардов параметров, из которых на каждом токене активно работает около 18 миллиардов. Главная цель разработки — снизить затраты на инференс, особенно при работе с длинным контекстом.

Одной из ключевых новшеств модели является комбинация sparse attention и linear attention, что позволяет уменьшить объем вычислений до 3,01 раза по сравнению с GLM-5.3 и размер KV-cache до 4,44 раза. Это особенно важно, так как KV-cache занимает значительную часть памяти при генерации. Контекстное окно модели достигает одного миллиона токенов.

GLM-5.3-Flash поддерживает не только текст, но и визуальные данные, предоставляя возможность анализировать интерфейсы и учитывать предыдущие действия в процессе выполнения задач. Среди главных сценариев применения — программирование, работа с браузером и GUI, создание сцен в Blender и финансовые исследования.

Модель доступна через API под идентификатором glm-5.3-flash, поддерживая совместную работу с изображениями и множественными запросами.