26 августа китайская компания Z.ai выложила модель GLM-5.3-Flash. Новость выглядит как очередной анонс из ленты, но одна пара чисел в ней стоит вашего внимания, даже если вы никогда не выберете эту модель сами.
Она отстаёт от Claude Opus 4.8, одной из самых сильных и дорогих моделей на рынке, меньше чем на балл в тесте на программирование. И стоит в тридцать три раза дешевле.
Что именно вышло
Модель открытая: веса выложены под лицензией MIT, то есть их можно скачать и запускать у себя, в том числе в коммерческом продукте. Устроена по схеме, где на каждый запрос включается не вся сеть, а её часть: всего 320 миллиардов параметров, работают одновременно 18 миллиардов. Отсюда и низкая цена.
Окно контекста примерно миллион токенов, это порядка полутора тысяч страниц текста за раз. Модель сразу понимает не только текст, но и картинки с видео.
Где правда, а где маркетинг
Заявление "почти как Opus" стоит разобрать, потому что сравнения делает сам производитель, и это нормальная практика всех вендоров.
На независимом тесте Terminal-Bench 2.1 у GLM-5.3-Flash 84,3 балла против 85,0 у Claude Opus 4.8. Разрыв действительно меньше балла, и это честное сравнение.
Дальше начинается тонкость. Второе сравнение, где 29,0 против 29,5, сделано на бенчмарке Z.ai Code Bench, а его составила сама Z.ai. Совпадение результатов на собственном тесте разработчика говорит меньше, чем совпадение на чужом.
Что до цены: в прайс-листе стоит 0,15 доллара за миллион входных токенов. Сейчас идёт стартовая скидка вдвое, до 0,075, но она действует до 9 сентября 2026 года, и считать по ней долгосрочные планы не стоит. Для сравнения, вход у Claude Opus 4.8 стоит 5 долларов за миллион токенов, у флагмана OpenAI около 4. То есть даже по обычной цене, без скидки, разница примерно тридцатикратная.
Почему ваш счёт не упадёт завтра
Отсюда легко сделать вывод "значит, всё должно подешеветь в тридцать раз", и он неверный. Стоимость модели давно не главная статья в цене ИИ-инструмента.
Посчитайте, из чего складывается результат, за который вы платите. Модель обрабатывает ваш запрос, это одна часть. Но перед этим кто-то должен собрать контекст: понять, что именно из ваших данных нужно подать в этот запрос, чтобы ответ был про ваш бизнес, а не общий. После этого результат надо проверить, сохранить, показать и связать с остальной работой. Инфраструктура, хранение, проверки, поддержка.
Дешёвая модель делает дешевле один слой из пяти. Это заметная экономия, но она не превращает тридцатикратную разницу в цене токена в тридцатикратную разницу в цене продукта.
Есть и обратная сторона, о которой стоит знать. Когда самая дорогая часть дешевеет, разница между сервисами перестаёт быть в том, "какая у них модель". Все получают доступ к сопоставимому качеству за небольшие деньги. Отличаться начинают тем, что модель знает о вашем деле и насколько собранным приходит к ней контекст. Это и есть та часть, которую нельзя купить за 15 центов.
Что сделать с этим сегодня
- Если вы платите за ИИ-инструмент, посмотрите, за что именно: за доступ к модели или за работу вокруг неё. Первое дешевеет каждый квартал, второе нет.
- Если вы собираете что-то своё и упирались в стоимость запросов, пересчитайте: задача, которая полгода назад не сходилась по деньгам, сегодня может сходиться.
- Не гонитесь за самой дешёвой моделью в задачах, где ошибка дорогая. Разница в 0,7 балла на тесте превращается в заметную разницу на сложных случаях, а именно они обычно и стоят денег.
Главный вывод не про конкретную модель, а про направление. Дешёвые модели догоняют дорогие быстрее, чем ожидали почти все, и это уже не разовая новость, а тренд последних полутора лет.
---
Источники: - Z.ai Releases GLM-5.3-Flash, MarkTechPost, 26 августа 2026 - Цены на модели сверены по прайс-листам поставщиков на 31 августа 2026 года




