Z.ai открыла GLM-5.3-Flash — контекст 1 млн токенов
Компания Z.ai открыла доступ к коду GLM-5.3-Flash. Эта нейросеть оптимизирована для максимальной экономии ресурсов. Ранее она была доступна под именем Ox Alpha на сервисе OpenRouter Inc., теперь же веса модели опубликованы на Hugging Face.
Архитектура и производительность
Модель построена на архитектуре Mixture of Experts (MoE). При общем объеме в 320 миллиардов параметров для каждого запроса активируются только 18 миллиардов. Благодаря этому система работает очень быстро.
Теперь в AI можно загружать огромные документы целиком: окно контекста поддерживает до 1 миллиона токенов (текст, изображения и видео), а на выходе нейросеть генерирует до 131 072 токена.
Для снижения нагрузки на оборудование Z.ai внедрили две технологии:
- Sparse Attention: модель анализирует только ключевые части запроса, что существенно экономит вычислительную мощность.
- Linear Attention: новый алгоритм заменил стандартную softmax function, благодаря чему расход оперативной памяти растет линейно. Если увеличить запрос вдвое, потребление памяти вырастет пропорционально, а не в квадрате.
В результате стоимость эксплуатации стала в 10 раз ниже, чем у предыдущих моделей Z.ai.
Обучение и тесты
Для обучения использовали массив из 30 триллионов токенов. Технология mHC помогла избежать искажения градиентов — так удалось точнее настроить нейронные связи и повысить эффективность модели.
В сравнении с такими гигантами, как Claude Opus 4.8, GPT-5.6 Terra и Gemini 3.7 Flash, нейросеть показала высокие результаты:
- Работа с данными: 1-е место в GDPval-AA v2. Модель лучше всех справляется с обработкой сложной информации.
- Облачная автоматизация: 2-е место в AutomationBench, что подтверждает эффективность выполнения задач в облачных приложениях.
Ранее по теме
Z.ai выпустила GLM-5.3 — конкурента OpenAI в кодинге
Больше новостей в нашем Телеграм. Подпишись!
Ссылка на источник тык.