Лето 2026 принесло четыре крупных релиза кодинг-моделей за два месяца: Claude Opus 5 (24 июля), GPT-5.6 (9 июля), GLM-5.3 (18 августа) и DeepSeek V4 Pro 0813 (12 августа). Плюс неожиданный новичок — Qwen 3.8 27B (15 августа), который по бенчмаркам обгоняет модели в десятки раз крупнее себя. В этой статье — сравнение моделей (не агентов, а именно моделей): цены за токены, контекст, бенчмарки, для каких задач какая подходит. Акцент — на двух новых игроках: GLM-5.3 и Qwen 3.8 27B.
Все цены и цифры — «на момент публикации» (август 2026) со ссылками на первоисточники.
Что изменилось за лето 2026
Три события определили картину:
-
Цены упали. DeepSeek V4 Pro снизил стоимость флагманского API до $0.66/$1.98 (off-peak) — в 7–8 раз дешевле Opus 5. OpenAI через месяц после релиза GPT-5.6 подешевил Luna на 80% и Terra на 20% (OpenAI, 30.07.2026). Qwen 3.8 27B через API стоит $0.50/$3.00, а через Ollama — бесплатно.
-
Reasoning стал управляемым. У всех моделей теперь уровни рассуждений (effort): low / high / max. Одна и та же модель на разных уровнях работает с разной глубиной и разным расходом токенов. Simon Willison измерил разброс для GPT-5.6: от $0.0071 за задачу на Luna без рассуждений до $0.4855 на Sol с максимальным reasoning (таблица).
-
27B-модели догнали флагманов. Qwen 3.8 27B на бенчмарке SWE-bench Pro набирает 61.7% против 53.4% у Claude Opus 4.6 Max — при том что Opus значительно крупнее и дороже (модельная карта Qwen). Это не ошибка: Independent Analysis подтверждает Intelligence Index 52 для Qwen 3.8 27B против 63 для Opus 5 (Artificial Analysis).
Сравнительная таблица
| Модель | Вендор | Вход / выход, $ за 1M | Контекст | AA Index* | Лицензия | Ввод |
|---|---|---|---|---|---|---|
| Claude Opus 5 | Anthropic | $5 / $25 | 1M | 63 | проприетарная | текст + картинки |
| GPT-5.6 Sol | OpenAI | $5 / $30 | 1M | 61 | проприетарная | текст + картинки |
| GPT-5.6 Terra | OpenAI | $2.50 / $15 | 1M | 57 | проприетарная | текст + картинки |
| GPT-5.6 Luna | OpenAI | $1 / $6 | 1M | 52 | проприетарная | текст + картинки |
| GLM-5.3 | Z.AI | $1.40 / $4.40 | 1M | 60 | проприетарная | только текст |
| DeepSeek V4 Pro | DeepSeek | $0.66 / $1.98 | 1M | 53 | MIT (открытые) | текст |
| DeepSeek V4 Flash | DeepSeek | $0.22 / $0.66 | 1M | 52 | MIT (открытые) | текст |
| Qwen 3.8 27B | Alibaba | $0.50 / $3.00 | 262K–1M | 52 | Apache 2.0 | текст + видео |
* Intelligence Index v4.1.1 от Artificial Analysis — независимый агрегатор, объединяет 9 бенчмарков (GDPval-AA, τ³-Banking, Terminal-Bench, SciCode, HLE, GPQA Diamond и др.). Чем выше — тем «умнее» модель по совокупности задач.
Стоимость DeepSeek V4 Pro указана для off-peak часов; в пик (01:00–04:00 и 06:00–10:00 UTC) цены удваиваются (прайс DeepSeek). GPT-5.6 Sol с 21 августа подешевел на 20% (на 3 месяца) — фактически $4/$24 вместо стартовых $5/$30 (обновление OpenAI, 21.08.2026). Годовая подписка на GLM Coding Plan снижает цены GLM-5.3: от $12.6/мес (Lite) до $117.6/мес (Max) с кредитами (z.ai/subscribe).
Что такое Intelligence Index и зачем он нужен
Artificial Analysis собирает результаты девяти независимых бенчмарков в один индекс — Intelligence Index v4.1.1. Это способ получить хотя бы приблизительное сравнение моделей на одном поле, вместо того чтобы листать десять разных таблиц.
Важный нюанс: индекс усредняет, а значит, прячет детали. GLM-5.3 с Intelligence Index 60 — одна из самых быстрых моделей в выборке (93 ток/с против медианных 75) и одна из самых многословных (170M выходных токенов на прогон против медианных 72M) (Artificial Analysis, GLM-5.3). Claude Opus 5 с индексом 63 — вдвое медленнее (55 ток/с) и с задержкой первого токена 19.85 с против 1.92 с у GLM-5.3. Индекс не учитывает скорость — а для агентного кодинга это часто критично.
Новинки: GLM-5.3 и Qwen 3.8 27B
GLM-5.3: агентный флагман без открытых весов
GLM-5.3 вышла 18 августа 2026 — через месяц после GPT-5.6 и на неделю позже DeepSeek V4 Pro. Модель построена на базе GLM-5.2 с улучшениями только за счёт пост-тренировки (документация Z.AI).
Ключевые характеристики:
- 753 млрд параметров (MoE), контекст 1M токенов, выход до 128K
- Только текст — картинки не принимает (для vision есть GLM-5V-Turbo)
- Три уровня reasoning — low / high / max; отключить невозможно
- Кэш-вход со скидкой 81% — $0.26 за 1M вместо $1.40
Где GLM-5.3 выделяется:
- Скорость: 93.2 ток/с и задержка 1.92 с — одна из самых быстрых reasoning-моделей. Для сравнения, Opus 5 — 55 ток/с и 19.85 с TTFT. На длинных агентных сессиях это ощутимая разница.
- Собственный бенчмарк Z.ai Code Bench: GLM-5.3 на Max набирает 34.5% против 29.5% у Claude Opus 4.8 на High — при том, что GLM-5.3 потребляет вдвое меньше токенов (документация).
- Кибербезопасность: 84.5% на CyberGym — выше GPT-5.6 Sol (83.6%) и Mythos 5 (83.8%) (документация).
- Закрытые веса. В отличие от GLM-5.2 (MIT), GLM-5.3 — проприетарная модель. Запускать её можно только через API Z.AI или подписку GLM Coding Plan.
GLM-5.3 унаследовала базу GLM-5.2, но все улучшения — за счёт пост-тренировки. Это значит, что архитектура и веса совместимы, а отличия — в поведении модели на длинных агентных траекториях.
Qwen 3.8 27B: маленькая модель с большими результатами
Qwen 3.8 27B — это 27-миллиардная плотная модель от Alibaba (не MoE), вышедшая 15 августа 2026. Apache 2.0, запускается локально через Ollama на обычном ноутбуке. Принимает картинки и видео нативно.
Но главное — бенчмарки:
| Бенчмарк | Qwen 3.8 27B | Claude Opus 4.6 Max | Разница |
|---|---|---|---|
| SWE-bench Pro | 61.7 | 53.4 | +8.3 (27B впереди) |
| LiveCodeBench v6 | 90.3 | 88.8 | +1.5 |
| Terminal Bench 2.1 | 73.0 | 78.2 | −5.2 |
| GPQA Diamond | 89.2 | 91.3 | −2.1 |
| DeepSWE 1.1 | 42.2 | — | — |
Источник: модельная карта Qwen 3.8 27B, август 2026.
27-миллиардная модель обходит 400+ милліардного Opus на SWE-bench Pro — это впечатляет, но требует оговорки. Бенчмарк замеряет способность исправлять баги в реальных репозиториях, и Qwen 3.8 27B на нём силён. На Terminal Bench 2.1 (агентная работа в терминале) Opus всё ещё впереди. На LiveCodeBench (соревновательное программирование) 27B-модель тоже чуть быстрее.
Где запускать:
- Локально через Ollama:
ollama run hf.co/Qwen/Qwen3.8-27B— 17 ГБ квантизированная модель, работает на 16+ ГБ RAM (Docker, LM Studio, vLLM) - QwenCloud API: $0.50/$3.00 за 1M токенов, контекст до 1M через YaRN RoPE scaling (QwenCloud)
- Через агенты: Claude Code, Cline, OpenCode — подключается как OpenAI-совместимый провайдер
Simon Willison проверил модель и сделал важное наблюдение:
Qwen 3.8 27B defaults to wildly overthinking things — it defaults to xhigh reasoning which results in enormous reasoning traces. I’d recommend running it on low or no reasoning.
Qwen 3.8 27B по умолчанию безумно много думает — она стартует с xhigh reasoning и выдаёт огромные цепочки рассуждений. Рекомендую запускать на low или без reasoning.
Это важно для практики: при reasoning = low модель работает быстрее и дешевле, а качество на большинстве кодинг-задач остаётся высоким.
Бенчмарки: почему они противоречат друг другу
На первый взгляд — парадокс. GPT-5.6 Sol обходит Fable 5 на Agents’ Last Exam (53.6 против 40.5 — разница 13.1 балла), а на SWE-bench Pro Claude Fable 5 набирает 80% против 64.6% у Sol (Simon Willison). OpenAI прямо заявляет, что ~30% задач SWE-bench Pro «сломаны» — тесты требуют конкретной реализации, не описанной в условии (пост OpenAI, 08.07.2026).
Что это значит на практике:
- SWE-bench Pro — хороший индикатор работы с реальными репозиториями, но с проблемами воспроизводимости. Абсолютные цифры вендоров читайте скептически.
- Agents’ Last Exam — длинные рабочие процессы (55 областей). Ближе к реальному агентному кодингу, но создавался самими вендорами.
- Terminal Bench — прямой замер агентных действий в терминале. GLM-5.3 на v3.0 набирает 28.3 (обновлённая версия бенчмарка, несравнима со старыми).
- LiveCodeBench — соревновательное программирование. Хорош для оценки «чистого» кодинга без контекста проекта.
Единственный надёжный способ проверить модель — прогнать на ней свою задачу и сравнить с альтернативой. Бенчмарки — отправная точка, а не окончательный ответ.
Для каких задач какая модель
Ежедневный кодинг в агенте
Для рутины — Sonnet 5 или GPT-5.6 Terra. Обе дают 90% результата флагмана за 3–5 раз меньше денег. Claude Code на Pro-плане ($20/мес) по умолчанию использует Sonnet 5; Codex на Plus-плане ($20/мес) — GPT-5.6. Если агент не упирается в качество — переплачивать за Opus или Sol нет смысла.
Дёшево и много токенов
Агентные задачи сжирают десятки миллионов токенов: на каждом шаге агент пересылает контекст заново. Здесь выигрывают DeepSeek V4 Pro ($0.66/$1.98 off-peak) и Qwen 3.8 27B через API ($0.50/$3.00) или локально (бесплатно). GLM-5.3 при среднем расходе выходит около $0.90 за 1M токенов с учётом кэша (кэш −81%).
Максимум качества на сложных задачах
Длинные миграции, многодневные автономные сессии, архитектурные решения — здесь флагманы. Claude Opus 5 (AA Index 63) и GPT-5.6 Sol (61) — два сильнейших варианта. GLM-5.3 с индексом 60 — близкий конкурент, при этом вдвое дешевле по выходу ($4.40 против $25/$30) и значительно быстрее.
Локально или под NDA
Если код не должен покидать машину — Qwen 3.8 27B через Ollama. Apache 2.0, 17 ГБ, работает на ноутбуке с 16+ ГБ RAM. До выхода Qwen 3.8 доминировал Qwen3-Coder-30B-A3B — 27B-модель его превосходит по всем ключевым бенчмаркам. Подробно про локальный запуск — в статье «Локальные нейросети для кодинга».
Быстрые правки и генерация кода
GPT-5.6 Luna — самая быстрая из флагманских моделей (149 ток/с), при этом $1/$6 за токены. Если задача — «напиши функцию» или «почини этот тест», Luna закроет её быстрее и дешевле всех.
Российские реалии
Доступность
- Claude Opus 5 — Россия отсутствует в списке поддерживаемых стран. API и claude.ai заблокированы. Работает через VPN.
- GPT-5.6 (Luna/Terra/Sol) — OpenAI блокирует российские IP с декабря 2022. Нужен VPN для входа.
- GLM-5.3 — сайт z.ai и API
api.z.aiдоступны без VPN. Скачивание и запросы работают напрямую. - DeepSeek V4 Pro —
api.deepseek.comдоступен без VPN (проверено из Самары, август 2026). Подробнее — в статье «DeepSeek V4 Pro 0813». - Qwen 3.8 27B — локальный запуск работает без VPN и интернета. API Alibaba (DashScope) — доступен, но с оговорками по оплате.
- Gemini 3.7 Flash — бесплатный API-ключ AI Studio заводится с Google-аккаунтом из РФ. Подробнее — в статье «Gemini CLI».
Оплата
Российские Visa и Mastercard не работают ни в одном из перечисленных сервисов. Рабочие варианты:
- Карта UnionPay — подходит для части сервисов, зависит от банка.
- Зарубежная карта — если есть.
- Посредники — AITUNNEL (aitunnel.ru) принимает рубли и выдаёт API-ключи для Claude и OpenAI-совместимых сервисов.
- Криптовалюта — для DeepSeek API и части сервисов.
Тема оплаты AI-сервисов из РФ в рунете освещена фрагментарно: есть обзоры на Habr (как оплатить ChatGPT), общий разбор Gemini в России, но подробных инструкций по DeepSeek API и QwenCloud из РФ нет. Если есть реальный опыт — делитесь в комментариях.
Что реально работает из РФ без VPN и зарубежной карты
Три варианта: локальный Qwen 3.8 27B (бесплатно), DeepSeek API (доступен, оплата через обходы) и GLM-5.3 через ZCode с бесплатным 5-дневным периодом (документация). Всё остальное — с VPN и зарубежной оплатой.
Честные ограничения
- Бенчмарки не сходятся друг с другом и с реальностью. GPT-5.6 Sol лидирует на Agents’ Last Exam, Claude Fable 5 — на SWE-bench Pro, GLM-5.3 — на CyberGym. OpenAI публично критикует SWE-bench Pro. Абсолютные цифры — реклама; относительный порядок моделей — ориентир.
- Цены не стабильны. DeepSeek уже поднимал прайс в августе. OpenAI снижал через три недели после релиза. GLM Coding Plan даёт скидки через годовую подписку. Перед крупными тратами проверяйте актуальный прайс.
- Reasoning стоит токенов. Модель на max reasoning потребляет в 3–5 раз больше токенов, чем на low. Для рутинных задач — low, для сложных — high. Max — только когда критически важно.
- Длинные сессии деградируют. Все модели «тупеют» на длинном контексте. Лечится гигиеной контекста: компактизация, файлы-конвенции (
CLAUDE.md,AGENTS.md), сброс сессии между задачами. - GLM-5.3 — только текст. Картинки, скриншоты, дизайн-макеты на вход не принимает. Для vision-задач нужна другая модель.
- GLM-5.3 — закрытые веса. В отличие от GLM-5.2 (MIT), модель нельзя запустить локально или у стороннего провайдера.
- Qwen 3.8 27B — 27B parameters. На сложных многофайловых архитектурных задачах 27-миллиардная модель всё ещё уступает флагманам. Intelligence Index 52 против 63 у Opus 5 — разница ощутима на длинных агентных траекториях.
- OpenAI предупреждает о бенчмарках. По их аудиту ~30% задач SWE-bench Pro содержат тесты, требующие конкретной реализации, не описанной в условии (OpenAI, 08.07.2026). Учитывайте это при сравнении цифр.
Краткая памятка
| Задача | Модель | Цена (вход/выход за 1M) |
|---|---|---|
| Ежедневный кодинг | Sonnet 5 / GPT-5.6 Terra | $2/$10 / $2.50/$15 |
| Быстрые правки | GPT-5.6 Luna | $1/$6 |
| Дёшево и много | DeepSeek V4 Pro | $0.66/$1.98 |
| Локально / NDA | Qwen 3.8 27B (Ollama) | бесплатно |
| Максимум качества | Claude Opus 5 / GPT-5.6 Sol | $5/$25 / $4/$24* |
| Скорость + качество | GLM-5.3 | $1.40/$4.40 |
| Бюджет ₽0 из РФ | Qwen 3.8 27B (Ollama) | бесплатно |
* GPT-5.6 Sol — со скидкой 20% с 21.08.2026 на 3 месяца (фактически ~$4/$24 вместо стартовых $5/$30).
Источники
- Artificial Analysis Intelligence Index v4.1.1 — методология
- Anthropic — Claude Opus 5
- OpenAI — GPT-5.6, 09.07.2026
- OpenAI — снижение цен GPT-5.6 Luna/Terra, 30.07.2026
- OpenAI — проблемы SWE-bench Pro, 08.07.2026
- Z.AI — GLM-5.3, документация
- Z.AI — GLM Coding Plan, подписки
- DeepSeek — API Pricing
- Hugging Face — Qwen3.8-27B, модельная карта
- QwenCloud — Qwen 3.8 27B API
- Simon Willison — GPT-5.6, 09.07.2026
- Simon Willison — Qwen 3.8 27B, 16.08.2026
- Artificial Analysis — GLM-5.3
- Artificial Analysis — Qwen 3.8 27B
