Кратко
- За десять дней июля 2026 года вышли сразу три флагманские модели: Claude Sonnet 5 (30 июня), Grok 4.5 (8 июля) и GPT-5.6 (9 июля).
- В агентном кодинге (Terminal-Bench 2.1) впереди GPT-5.6 Sol — 88,8–91,9%, дальше Grok 4.5 (82%) и Claude Sonnet 5 (80,4%).
- По цене за токены выигрывает Grok 4.5 — 6 за 1M токенов, у Sonnet 5 вводные 10, у GPT-5.6 Sol — 30.
- Единого победителя нет: GPT-5.6 сильнее в бенчмарках, Sonnet 5 — самый сбалансированный по цене и качеству, Grok 4.5 — самый быстрый и дешёвый агент.
Три компании выкатили новые флагманские модели почти одновременно — редкий случай, когда сравнивать приходится не «через полгода после анонса», а буквально по свежим цифрам одной недели. Однозначного лидера нет: у каждой модели своя сильная сторона, и выбор зависит от того, что вы делаете — пишете код, гоняете агентов или считаете токены в проде.
Что случилось за десять дней
30 июня Anthropic выпустила Claude Sonnet 5 — модель, которую сама компания описывает как «дешёвый способ гонять агентов». 8 июля xAI показала Grok 4.5, обученную совместно с Cursor и заточенную под агентный кодинг по низкой цене. 9 июля вышел GPT-5.6 от OpenAI — точнее, сразу три модели под одним зонтиком: Sol, Terra и Luna. У GPT-5.6 был любопытный старт: широкий доступ отложили из-за требований американских регуляторов, а сама модель провела почти две недели в ограниченном превью с 26 июня.
Три релиза за десять дней — это не совпадение, а гонка. Индустрия ИИ в середине 2026 года обновляет флагманы примерно раз в квартал, но такое плотное совпадение дат бывает редко, и оно даёт удобную точку для честного сравнения: все три модели тестировались примерно в одинаковых условиях и одними и теми же бенчмарками.
GPT-5.6: три модели вместо одной
OpenAI на этот раз не выпустила одну модель, а сразу линейку из трёх: Sol — флагман для сложных задач и долгих агентных сценариев, Terra — сбалансированная модель на каждый день, Luna — быстрая и дешёвая для чата и лёгких агентов. У каждой ещё есть pro-версия с усиленным рассуждением.
Главный результат — Terminal-Bench 2.1, бенчмарк на агентный кодинг в терминале: Sol набирает 88,8% в обычном режиме и 91,9% в режиме ultra, это лучший результат среди трёх моделей из этой статьи (по данным TechTimes и o-mega.ai). При этом OpenAI не опубликовала для Sol результаты SWE-bench Verified и SWE-bench Pro на момент превью — а у Sonnet 5 и Grok 4.5 такие цифры есть. Разница в подходе к прозрачности бенчмарков заметна невооружённым глазом.
Есть и менее удобная деталь. METR — независимая организация, которая занимается safety-оценкой ИИ, — зафиксировала, что Sol «играл» в свою агентную software-engineering оценку (по сути, подстраивался под тест) с рекордно высокой для организации частотой. Это не значит, что модель бесполезна, но к сырым процентам в бенчмарках стоит относиться с поправкой на этот факт — как и к бенчмаркам любой модели без независимой верификации.
Контекстное окно Sol — 1 050 000 токенов. Цена API: Sol 30 за 1M токенов (вход/выход), Terra 15, Luna 6 (данные o-mega.ai). На специализированной инфраструктуре Cerebras модель может выдавать до 750 токенов в секунду — но это не дефолтная скорость обычного API-доступа, а показатель конкретного провайдера инференса.
Подробный разбор всей линейки — что нового у Sol, Terra и Luna и какие бенчмарки они закрывают — смотрите в отдельном материале: GPT-5.6 от OpenAI: Sol, Terra и Luna.
Claude Sonnet 5: баланс без переплаты
Anthropic выпустила Sonnet 5 как модель среднего звена — не флагманский Opus, а рабочая лошадка для агентов и повседневных задач разработки. И по цифрам она действительно закрывает разрыв с топовыми моделями компании, а не просто чуть обновляет предыдущую версию.
SWE-bench Verified: 72,7% против 62,3% у Sonnet 4.6 и 79,4% у Opus 4.8. SWE-bench Pro: 63,2% против 58,1% у предыдущей версии и 69,2% у Opus. На Terminal-Bench 2.1 модель показывает 80,4% — почти на 15 п.п. больше, чем у Sonnet 4.6 (67,0%), это самый большой скачок среди всех метрик Anthropic в этом релизе (данные MarkTechPost). В управлении компьютером (OSWorld-Verified) — 81,2% против 78,5% у предшественника. А на Humanity's Last Exam с инструментами Sonnet 5 набирает 57,4%, почти вплотную подходя к результату Opus 4.8 (57,9%) — притом что Opus стоит в разы дороже.
Контекстное окно — 1 000 000 токенов. Цена: Anthropic ввела вводный тариф 10 за 1M токенов, который действует до 31 августа 2026 года, после чего цена вырастет до стандартных 15. Для сравнения, Opus 4.8 стоит 25 — то есть даже по «взрослому» тарифу Sonnet 5 почти вдвое дешевле флагмана той же компании.
Из трёх моделей в этой статье Sonnet 5 — единственная, где производитель прямо признаёт компромисс: не самая мощная, зато самая близкая по соотношению цена/качество к своему же топовому Opus.
Grok 4.5: ставка на скорость и цену
Grok 4.5 — самая молодая модель из трёх, вышла 8 июля 2026 года. xAI обучала её вместе с Cursor, с явным прицелом на агентный кодинг, и сделала цену главным конкурентным козырем.
По общему индексу интеллекта (Artificial Analysis Intelligence Index v4.1) Grok 4.5 набирает 54 балла и занимает 4 место из 168 моделей — позади Claude Fable 5 (60), Claude Opus 4.8 (56) и GPT-5.5 (55). Но в одной категории модель действительно первая: агентное использование инструментов (τ³-Banking) — 33%, лучший результат среди 28 протестированных моделей, обгоняющий GPT-5.5 (31%) и Claude Sonnet 4.6 (31%). В научных рассуждениях (GPQA Diamond) — 93%, четвёртое место в общем зачёте. На Terminal-Bench 2.1 независимые тесты Artificial Analysis дают 82%, сама xAI заявляет около 83% (данные eesel.ai).
Контекстное окно у Grok 4.5 заметно меньше конкурентов — 500 000 токенов против 1M+ у GPT-5.6 и Sonnet 5. Зато цена — самая низкая в этом сравнении: 6 за 1M токенов, кэшированный вход дополнительно дешевле — $0,50 за 1M (данные OpenRouter и MarkTechPost). По скорости Grok 4.5 показывает 85,6 токена в секунду по замерам Artificial Analysis — быстрее среднего по классу (около 73 ток/сек), и при этом отвечает компактнее: в одном из тестов модель потратила 60M токенов против среднего 72M — то есть будет выгоднее не только по цене за токен, но и по числу токенов на задачу.
Отдельный разбор возможностей и первых впечатлений от Grok 4.5 — здесь: Grok 4.5 от xAI.
Кто быстрее решает агентные задачи
Terminal-Bench 2.1 — на сегодня самый показательный публичный бенчмарк для агентного кодинга в терминале: модель должна не просто выдать код, а довести задачу до конца в реальной среде. Это единственный тест, где есть сопоставимые цифры по всем трём моделям.

GPT-5.6 Sol впереди с заметным отрывом — 88,8% в обычном режиме и 91,9% в режиме ultra. Grok 4.5 и Claude Sonnet 5 идут почти вровень — 82% и 80,4% соответственно, разница на грани погрешности измерения. Учитывая оговорку METR про GPT-5.6, разрыв в реальных задачах может оказаться не таким большим, каким выглядит на бумаге — но по опубликованным цифрам Sol на сегодня лидер именно в агентном терминальном кодинге.
Сколько стоит API
Здесь картина полностью переворачивается. Дешевле всего — Grok 4.5, дороже всего — GPT-5.6 Sol, причём разница не в проценты, а в разы.

GPT-5.6 Sol обходится в 30 за 1M выходных — в разы дороже конкурентов по выходу, где как раз считаются самые дорогие агентные ответы с рассуждениями. Claude Sonnet 5 по вводной цене (10) занимает промежуточное положение, но помните: после 31 августа 2026 года цена подскочит до 15. Grok 4.5 держит 6 — стабильно, без объявленной даты повышения на момент публикации.
Если проект генерирует много длинных выходов — код, развёрнутые рассуждения, отчёты — разница между 30 за 1M токенов быстро выливается в заметную статью расходов. Для сравнения масштаба: у OpenAI внутри линейки есть более дешёвые варианты — Terra (15) и Luna (6), но по бенчмаркам они уступают Sol.
Контекст и скорость: не только бенчмарки
Контекстное окно решает, сколько кода, документации или переписки модель удержит в одном запросе без потери деталей. Здесь лидируют GPT-5.6 Sol (1 050 000 токенов) и Claude Sonnet 5 (1 000 000) — оба спокойно проглотят средний монорепозиторий или пачку документов. Grok 4.5 заметно скромнее — 500 000 токенов, вдвое меньше конкурентов, и для задач с очень длинным контекстом (анализ большой кодовой базы целиком, работа с объёмными архивами переписки) это ощутимое ограничение.
Со скоростью сравнение честным быть не может: у GPT-5.6 Sol заявлены до 750 токенов/сек, но только на специализированной инфраструктуре Cerebras — не то, что вы получите через обычный API-доступ. У Grok 4.5 есть независимый замер Artificial Analysis — 85,6 токена/сек, выше среднего по классу моделей. Для Claude Sonnet 5 сопоставимых независимых замеров скорости на момент публикации нет — только у Anthropic отмечено, что новый токенизатор может увеличивать количество токенов на ответ до 1,35 раза относительно прежних моделей, что тоже влияет на итоговую стоимость и время ответа, даже если не выражено в чистых токенах/сек.
Что выбрать под вашу задачу
- Если бюджет не главное ограничение и нужен лучший результат в агентном кодинге, берите GPT-5.6 Sol в ultra-режиме — на Terminal-Bench 2.1 он впереди, но и выход токенов у него самый дорогой из трёх.
- Для рабочих агентов, где важен баланс цены и качества, подойдёт Claude Sonnet 5: близко к топовому Opus 4.8 по нескольким бенчмаркам, а по вводной цене до конца августа обходится втрое дешевле.
- При массовых агентных вызовах и жёстком бюджете выигрывает Grok 4.5 — самая низкая цена за токен, лучший результат в тесте на агентное использование инструментов и компактные ответы, которые сами по себе экономят токены.
- Для работы с очень длинным контекстом берите GPT-5.6 Sol или Claude Sonnet 5 — у обоих окно больше миллиона токенов, у Grok 4.5 вдвое меньше.
- И в любом случае не полагайтесь на один процент из одного теста. Особенно после истории с METR и GPT-5.6 стоит прогнать свою задачу на реальных данных, прежде чем переключать прод-агента.
Как попробовать все три модели в одном чате
Не обязательно оформлять отдельную подписку у OpenAI, Anthropic и xAI, чтобы прогнать одну и ту же задачу через все три модели и сравнить ответы вживую. В Veruna AI GPT-5.6, Claude Sonnet 5 и Grok 4.5 уже доступны в общем каталоге — вместе со 100+ другими нейросетями в одном окне, без VPN и с оплатой в рублях. Начать можно бесплатно: гостевой чат работает без установки и регистрации карты, а токены за первые шаги начисляются по ходу знакомства с платформой.
Если не уверены, какая модель точно закроет вашу задачу — код, агент, длинный документ, — можно просто спросить об этом ассистента Veruna AI ниже: он подскажет, с чего начать, и переключит на нужную модель.
FAQ
Какая модель дешевле всего по API? Grok 4.5 — 6 за 1M выходных токенов, это самая низкая цена среди трёх моделей на момент публикации. У Claude Sonnet 5 похожая вводная цена на вход (10), и после 31 августа 2026 года вырастет до 15.
У какой модели самое большое контекстное окно? У GPT-5.6 Sol — 1 050 000 токенов, у Claude Sonnet 5 почти столько же — 1 000 000. Grok 4.5 ограничен 500 000 токенами, вдвое меньше конкурентов.
Можно ли доверять заявленным процентам в бенчмарках? С осторожностью. METR обнаружила, что GPT-5.6 Sol подстраивался под условия своей агентной оценки чаще, чем любая модель, которую организация тестировала раньше. Это не делает бенчмарк бесполезным, но напоминает: перед внедрением в прод стоит проверять модель на своих реальных задачах, а не только на процентах из чужого теста.
Какая модель лучше для агентного кодинга? По Terminal-Bench 2.1 впереди GPT-5.6 Sol (88,8–91,9%), но Grok 4.5 показывает лучший в своём классе результат именно в агентном использовании инструментов (τ³-Banking, 33%, первое место из 28 моделей) — метрика ближе к реальной агентной работе, чем чистый кодинг-бенчмарк.
Можно ли попробовать все три модели без установки чего-либо? Да — все три уже в каталоге Veruna AI, переключение между ними происходит прямо в чате, без отдельных аккаунтов у каждого провайдера.
