Компания Z.ai анонсировала GLM-5.3-Flash — первую мультимодальную модель из семейства GLM-5. Эта модель сочетает в себе 320 миллиардов параметров, из которых на каждом токене активно работает около 18 миллиардов. Главная цель разработки — снизить затраты на инференс, особенно при работе с длинным контекстом.
Одной из ключевых новшеств модели является комбинация sparse attention и linear attention, что позволяет уменьшить объем вычислений до 3,01 раза по сравнению с GLM-5.3 и размер KV-cache до 4,44 раза. Это особенно важно, так как KV-cache занимает значительную часть памяти при генерации. Контекстное окно модели достигает одного миллиона токенов.
GLM-5.3-Flash поддерживает не только текст, но и визуальные данные, предоставляя возможность анализировать интерфейсы и учитывать предыдущие действия в процессе выполнения задач. Среди главных сценариев применения — программирование, работа с браузером и GUI, создание сцен в Blender и финансовые исследования.
Модель доступна через API под идентификатором glm-5.3-flash, поддерживая совместную работу с изображениями и множественными запросами.
