В начале августа 2026 года OpenAI пересмотрела цены на линейку GPT-5.6. Новость выглядит рядовой — цены на модели снижают регулярно, — но её форма важнее её факта.
Подешевели не все модели. Подешевела эксплуатация.
Что произошло
| Модель | Изменение | Цена за миллион токенов (вход / выход) |
|---|---|---|
| Luna (младшая) | −80 % | $0,20 / $1,20 |
| Terra (средняя) | −20 % | $2 / $12 |
| Sol (флагман) | без изменений | — |
Флагман не подешевел ни на цент. Вместо скидки он получил режим ускорения: до 2,5 раза быстрее за двойную цену.
Сама модель GPT-5.6 вышла 9 июля — то есть речь не о релизе. Речь именно о том, что через месяц после выхода вендор резко изменил экономику младших моделей и не тронул старшую.
Почему форма изменения важнее размера
Разное движение цен по линейке — это не техническое решение, а рыночное.
Пока модели соревновались в том, чья умнее, платили за качество ответа. Снижение цены на младшие модели при неизменной цене на флагман означает переход к другой конкуренции: за стоимость единицы работы. Младшие модели становятся товаром, за который борются ценой, а флагман остаётся премиальным продуктом для тех, кому действительно нужен максимум.
Для тех, кто внедряет ИИ в свои продукты, вывод практический: выбор модели теперь всерьёз влияет на экономику, а не только на качество. Раньше разница между младшей и старшей моделью была разницей в качестве при сопоставимых порядках цен. Теперь это разница на порядок.
Что это значит в деньгах
Возьмём типовую задачу: классификация и первичная обработка входящих обращений. 30 000 обращений в месяц, около 1 500 токенов на вход и 300 на выход.
- На младшей модели по новым ценам: примерно $20 в месяц.
- На тех же объёмах по ценам до снижения: $99 в месяц.
- На средней модели по новым ценам: около $198 в месяц.
Абсолютные числа здесь не главное — они у каждого свои. Главное соотношение: расход, который до августа обсуждался как статья бюджета, превратился в шум на фоне зарплаты одного сотрудника. А разница между младшей и средней моделью выросла до десятикратной, и её теперь нужно обосновывать качеством, а не выбирать по привычке.
В подписочных тарифах цены не изменились, но младшая и средняя модели стали расходовать меньше квоты. Если вы работаете по подписке, эффект вы увидите не в счёте, а в том, что упираетесь в лимит позже.
Что стоит пересчитать
Отложенные внедрения. Если весной вы считали ИИ-функцию, получили неприемлемую стоимость эксплуатации и отложили — расчёт устарел. Пересчитайте: с высокой вероятностью решение о переносе принималось по цифрам, которых больше нет.
Выбор модели в работающих функциях. Многие функции живут на средней или старшей модели, потому что на этапе прототипа так было проще и разница в цене не ощущалась. Сейчас она ощущается. Прогоните свои реальные запросы на младшей модели и посмотрите, где качество не падает.
Границу «делать / не делать». Функции, которые не окупались на прежней цене инференса, могли перейти в зону окупаемости. Это касается прежде всего массовых операций — обработки обращений, разметки документов, извлечения данных, — где расход прямо пропорционален объёму.
Чего пересчитывать не стоит
Стоимость модели — обычно не главная статья в бюджете внедрения. Интеграция, разметка, приёмка, эксплуатация и поддержка стоят дороже и от прайса вендора не зависят.
Поэтому снижение цены на инференс не превращает неудачную идею в удачную. Оно меняет ответ только там, где проект упирался именно в стоимость эксплуатации на объёме, — и не меняет ничего там, где он упирался в отсутствие данных, в неготовность процесса или в то, что задача была сформулирована как «внедрить ИИ», а не как конкретная работа.
Мы разбираем новости про ИИ с точки зрения внедрения в реальные продукты — коротко и по делу. Видеоверсия этого разбора: смотреть на YouTube.
Считаете внедрение ИИ и хотите проверить цифры? Напишите нам — посчитаем стоимость эксплуатации на ваших объёмах и скажем, на какой модели задача решается.
