Перейти к содержимому

Модели для кодинга 2026: Claude Opus, GPT-5.6, GLM-5.3, DeepSeek V4 — что выбрать

Лето 2026 принесло четыре крупных релиза кодинг-моделей за два месяца: Claude Opus 5 (24 июля), GPT-5.6 (9 июля), GLM-5.3 (18 августа) и DeepSeek V4 Pro 0813 (12 августа). Плюс неожиданный новичок — Qwen 3.8 27B (15 августа), который по бенчмаркам обгоняет модели в десятки раз крупнее себя. В этой статье — сравнение моделей (не агентов, а именно моделей): цены за токены, контекст, бенчмарки, для каких задач какая подходит. Акцент — на двух новых игроках: GLM-5.3 и Qwen 3.8 27B.

Все цены и цифры — «на момент публикации» (август 2026) со ссылками на первоисточники.

Что изменилось за лето 2026

Три события определили картину:

  1. Цены упали. DeepSeek V4 Pro снизил стоимость флагманского API до $0.66/$1.98 (off-peak) — в 7–8 раз дешевле Opus 5. OpenAI через месяц после релиза GPT-5.6 подешевил Luna на 80% и Terra на 20% (OpenAI, 30.07.2026). Qwen 3.8 27B через API стоит $0.50/$3.00, а через Ollama — бесплатно.

  2. Reasoning стал управляемым. У всех моделей теперь уровни рассуждений (effort): low / high / max. Одна и та же модель на разных уровнях работает с разной глубиной и разным расходом токенов. Simon Willison измерил разброс для GPT-5.6: от $0.0071 за задачу на Luna без рассуждений до $0.4855 на Sol с максимальным reasoning (таблица).

  3. 27B-модели догнали флагманов. Qwen 3.8 27B на бенчмарке SWE-bench Pro набирает 61.7% против 53.4% у Claude Opus 4.6 Max — при том что Opus значительно крупнее и дороже (модельная карта Qwen). Это не ошибка: Independent Analysis подтверждает Intelligence Index 52 для Qwen 3.8 27B против 63 для Opus 5 (Artificial Analysis).

Сравнительная таблица

Модель Вендор Вход / выход, $ за 1M Контекст AA Index* Лицензия Ввод
Claude Opus 5 Anthropic $5 / $25 1M 63 проприетарная текст + картинки
GPT-5.6 Sol OpenAI $5 / $30 1M 61 проприетарная текст + картинки
GPT-5.6 Terra OpenAI $2.50 / $15 1M 57 проприетарная текст + картинки
GPT-5.6 Luna OpenAI $1 / $6 1M 52 проприетарная текст + картинки
GLM-5.3 Z.AI $1.40 / $4.40 1M 60 проприетарная только текст
DeepSeek V4 Pro DeepSeek $0.66 / $1.98 1M 53 MIT (открытые) текст
DeepSeek V4 Flash DeepSeek $0.22 / $0.66 1M 52 MIT (открытые) текст
Qwen 3.8 27B Alibaba $0.50 / $3.00 262K–1M 52 Apache 2.0 текст + видео

* Intelligence Index v4.1.1 от Artificial Analysis — независимый агрегатор, объединяет 9 бенчмарков (GDPval-AA, τ³-Banking, Terminal-Bench, SciCode, HLE, GPQA Diamond и др.). Чем выше — тем «умнее» модель по совокупности задач.

Стоимость DeepSeek V4 Pro указана для off-peak часов; в пик (01:00–04:00 и 06:00–10:00 UTC) цены удваиваются (прайс DeepSeek). GPT-5.6 Sol с 21 августа подешевел на 20% (на 3 месяца) — фактически $4/$24 вместо стартовых $5/$30 (обновление OpenAI, 21.08.2026). Годовая подписка на GLM Coding Plan снижает цены GLM-5.3: от $12.6/мес (Lite) до $117.6/мес (Max) с кредитами (z.ai/subscribe).

Сравнение цен моделей для кодинга: от $0.22 за вход DeepSeek V4 Flash до $30 за выход GPT-5.6 Sol
Цены за 1M токенов (вход/выход) по официальным прайсам провайдеров на август 2026. DeepSeek V4 Pro — off-peak. Qwen 3.8 27B — QwenCloud API.

Что такое Intelligence Index и зачем он нужен

Artificial Analysis собирает результаты девяти независимых бенчмарков в один индекс — Intelligence Index v4.1.1. Это способ получить хотя бы приблизительное сравнение моделей на одном поле, вместо того чтобы листать десять разных таблиц.

Важный нюанс: индекс усредняет, а значит, прячет детали. GLM-5.3 с Intelligence Index 60 — одна из самых быстрых моделей в выборке (93 ток/с против медианных 75) и одна из самых многословных (170M выходных токенов на прогон против медианных 72M) (Artificial Analysis, GLM-5.3). Claude Opus 5 с индексом 63 — вдвое медленнее (55 ток/с) и с задержкой первого токена 19.85 с против 1.92 с у GLM-5.3. Индекс не учитывает скорость — а для агентного кодинга это часто критично.

Новинки: GLM-5.3 и Qwen 3.8 27B

GLM-5.3: агентный флагман без открытых весов

GLM-5.3 вышла 18 августа 2026 — через месяц после GPT-5.6 и на неделю позже DeepSeek V4 Pro. Модель построена на базе GLM-5.2 с улучшениями только за счёт пост-тренировки (документация Z.AI).

Ключевые характеристики:

  • 753 млрд параметров (MoE), контекст 1M токенов, выход до 128K
  • Только текст — картинки не принимает (для vision есть GLM-5V-Turbo)
  • Три уровня reasoning — low / high / max; отключить невозможно
  • Кэш-вход со скидкой 81% — $0.26 за 1M вместо $1.40

Где GLM-5.3 выделяется:

  • Скорость: 93.2 ток/с и задержка 1.92 с — одна из самых быстрых reasoning-моделей. Для сравнения, Opus 5 — 55 ток/с и 19.85 с TTFT. На длинных агентных сессиях это ощутимая разница.
  • Собственный бенчмарк Z.ai Code Bench: GLM-5.3 на Max набирает 34.5% против 29.5% у Claude Opus 4.8 на High — при том, что GLM-5.3 потребляет вдвое меньше токенов (документация).
  • Кибербезопасность: 84.5% на CyberGym — выше GPT-5.6 Sol (83.6%) и Mythos 5 (83.8%) (документация).
  • Закрытые веса. В отличие от GLM-5.2 (MIT), GLM-5.3 — проприетарная модель. Запускать её можно только через API Z.AI или подписку GLM Coding Plan.

GLM-5.3 унаследовала базу GLM-5.2, но все улучшения — за счёт пост-тренировки. Это значит, что архитектура и веса совместимы, а отличия — в поведении модели на длинных агентных траекториях.

Документация Z.AI

Qwen 3.8 27B: маленькая модель с большими результатами

Qwen 3.8 27B — это 27-миллиардная плотная модель от Alibaba (не MoE), вышедшая 15 августа 2026. Apache 2.0, запускается локально через Ollama на обычном ноутбуке. Принимает картинки и видео нативно.

Но главное — бенчмарки:

Бенчмарк Qwen 3.8 27B Claude Opus 4.6 Max Разница
SWE-bench Pro 61.7 53.4 +8.3 (27B впереди)
LiveCodeBench v6 90.3 88.8 +1.5
Terminal Bench 2.1 73.0 78.2 −5.2
GPQA Diamond 89.2 91.3 −2.1
DeepSWE 1.1 42.2

Источник: модельная карта Qwen 3.8 27B, август 2026.

27-миллиардная модель обходит 400+ милліардного Opus на SWE-bench Pro — это впечатляет, но требует оговорки. Бенчмарк замеряет способность исправлять баги в реальных репозиториях, и Qwen 3.8 27B на нём силён. На Terminal Bench 2.1 (агентная работа в терминале) Opus всё ещё впереди. На LiveCodeBench (соревновательное программирование) 27B-модель тоже чуть быстрее.

Где запускать:

  • Локально через Ollama: ollama run hf.co/Qwen/Qwen3.8-27B — 17 ГБ квантизированная модель, работает на 16+ ГБ RAM (Docker, LM Studio, vLLM)
  • QwenCloud API: $0.50/$3.00 за 1M токенов, контекст до 1M через YaRN RoPE scaling (QwenCloud)
  • Через агенты: Claude Code, Cline, OpenCode — подключается как OpenAI-совместимый провайдер

Simon Willison проверил модель и сделал важное наблюдение:

Qwen 3.8 27B defaults to wildly overthinking things — it defaults to xhigh reasoning which results in enormous reasoning traces. I’d recommend running it on low or no reasoning.

Qwen 3.8 27B по умолчанию безумно много думает — она стартует с xhigh reasoning и выдаёт огромные цепочки рассуждений. Рекомендую запускать на low или без reasoning.

Simon Willison, 16.08.2026

Это важно для практики: при reasoning = low модель работает быстрее и дешевле, а качество на большинстве кодинг-задач остаётся высоким.

Бенчмарки: почему они противоречат друг другу

На первый взгляд — парадокс. GPT-5.6 Sol обходит Fable 5 на Agents’ Last Exam (53.6 против 40.5 — разница 13.1 балла), а на SWE-bench Pro Claude Fable 5 набирает 80% против 64.6% у Sol (Simon Willison). OpenAI прямо заявляет, что ~30% задач SWE-bench Pro «сломаны» — тесты требуют конкретной реализации, не описанной в условии (пост OpenAI, 08.07.2026).

Что это значит на практике:

  • SWE-bench Pro — хороший индикатор работы с реальными репозиториями, но с проблемами воспроизводимости. Абсолютные цифры вендоров читайте скептически.
  • Agents’ Last Exam — длинные рабочие процессы (55 областей). Ближе к реальному агентному кодингу, но создавался самими вендорами.
  • Terminal Bench — прямой замер агентных действий в терминале. GLM-5.3 на v3.0 набирает 28.3 (обновлённая версия бенчмарка, несравнима со старыми).
  • LiveCodeBench — соревновательное программирование. Хорош для оценки «чистого» кодинга без контекста проекта.

Единственный надёжный способ проверить модель — прогнать на ней свою задачу и сравнить с альтернативой. Бенчмарки — отправная точка, а не окончательный ответ.

Для каких задач какая модель

Какую модель выбрать для кодинга: 3 вопроса — приватность, бюджет, тип задачи
Три вопроса, которые определяют выбор модели. Схема: ip-calculator.ru, по официальным данным августа 2026.

Ежедневный кодинг в агенте

Для рутины — Sonnet 5 или GPT-5.6 Terra. Обе дают 90% результата флагмана за 3–5 раз меньше денег. Claude Code на Pro-плане ($20/мес) по умолчанию использует Sonnet 5; Codex на Plus-плане ($20/мес) — GPT-5.6. Если агент не упирается в качество — переплачивать за Opus или Sol нет смысла.

Дёшево и много токенов

Агентные задачи сжирают десятки миллионов токенов: на каждом шаге агент пересылает контекст заново. Здесь выигрывают DeepSeek V4 Pro ($0.66/$1.98 off-peak) и Qwen 3.8 27B через API ($0.50/$3.00) или локально (бесплатно). GLM-5.3 при среднем расходе выходит около $0.90 за 1M токенов с учётом кэша (кэш −81%).

Максимум качества на сложных задачах

Длинные миграции, многодневные автономные сессии, архитектурные решения — здесь флагманы. Claude Opus 5 (AA Index 63) и GPT-5.6 Sol (61) — два сильнейших варианта. GLM-5.3 с индексом 60 — близкий конкурент, при этом вдвое дешевле по выходу ($4.40 против $25/$30) и значительно быстрее.

Локально или под NDA

Если код не должен покидать машину — Qwen 3.8 27B через Ollama. Apache 2.0, 17 ГБ, работает на ноутбуке с 16+ ГБ RAM. До выхода Qwen 3.8 доминировал Qwen3-Coder-30B-A3B — 27B-модель его превосходит по всем ключевым бенчмаркам. Подробно про локальный запуск — в статье «Локальные нейросети для кодинга».

Быстрые правки и генерация кода

GPT-5.6 Luna — самая быстрая из флагманских моделей (149 ток/с), при этом $1/$6 за токены. Если задача — «напиши функцию» или «почини этот тест», Luna закроет её быстрее и дешевле всех.

Российские реалии

Доступность

  • Claude Opus 5 — Россия отсутствует в списке поддерживаемых стран. API и claude.ai заблокированы. Работает через VPN.
  • GPT-5.6 (Luna/Terra/Sol) — OpenAI блокирует российские IP с декабря 2022. Нужен VPN для входа.
  • GLM-5.3 — сайт z.ai и API api.z.ai доступны без VPN. Скачивание и запросы работают напрямую.
  • DeepSeek V4 Proapi.deepseek.com доступен без VPN (проверено из Самары, август 2026). Подробнее — в статье «DeepSeek V4 Pro 0813».
  • Qwen 3.8 27B — локальный запуск работает без VPN и интернета. API Alibaba (DashScope) — доступен, но с оговорками по оплате.
  • Gemini 3.7 Flash — бесплатный API-ключ AI Studio заводится с Google-аккаунтом из РФ. Подробнее — в статье «Gemini CLI».

Оплата

Российские Visa и Mastercard не работают ни в одном из перечисленных сервисов. Рабочие варианты:

  • Карта UnionPay — подходит для части сервисов, зависит от банка.
  • Зарубежная карта — если есть.
  • Посредники — AITUNNEL (aitunnel.ru) принимает рубли и выдаёт API-ключи для Claude и OpenAI-совместимых сервисов.
  • Криптовалюта — для DeepSeek API и части сервисов.

Тема оплаты AI-сервисов из РФ в рунете освещена фрагментарно: есть обзоры на Habr (как оплатить ChatGPT), общий разбор Gemini в России, но подробных инструкций по DeepSeek API и QwenCloud из РФ нет. Если есть реальный опыт — делитесь в комментариях.

Что реально работает из РФ без VPN и зарубежной карты

Три варианта: локальный Qwen 3.8 27B (бесплатно), DeepSeek API (доступен, оплата через обходы) и GLM-5.3 через ZCode с бесплатным 5-дневным периодом (документация). Всё остальное — с VPN и зарубежной оплатой.

Честные ограничения

  • Бенчмарки не сходятся друг с другом и с реальностью. GPT-5.6 Sol лидирует на Agents’ Last Exam, Claude Fable 5 — на SWE-bench Pro, GLM-5.3 — на CyberGym. OpenAI публично критикует SWE-bench Pro. Абсолютные цифры — реклама; относительный порядок моделей — ориентир.
  • Цены не стабильны. DeepSeek уже поднимал прайс в августе. OpenAI снижал через три недели после релиза. GLM Coding Plan даёт скидки через годовую подписку. Перед крупными тратами проверяйте актуальный прайс.
  • Reasoning стоит токенов. Модель на max reasoning потребляет в 3–5 раз больше токенов, чем на low. Для рутинных задач — low, для сложных — high. Max — только когда критически важно.
  • Длинные сессии деградируют. Все модели «тупеют» на длинном контексте. Лечится гигиеной контекста: компактизация, файлы-конвенции (CLAUDE.md, AGENTS.md), сброс сессии между задачами.
  • GLM-5.3 — только текст. Картинки, скриншоты, дизайн-макеты на вход не принимает. Для vision-задач нужна другая модель.
  • GLM-5.3 — закрытые веса. В отличие от GLM-5.2 (MIT), модель нельзя запустить локально или у стороннего провайдера.
  • Qwen 3.8 27B — 27B parameters. На сложных многофайловых архитектурных задачах 27-миллиардная модель всё ещё уступает флагманам. Intelligence Index 52 против 63 у Opus 5 — разница ощутима на длинных агентных траекториях.
  • OpenAI предупреждает о бенчмарках. По их аудиту ~30% задач SWE-bench Pro содержат тесты, требующие конкретной реализации, не описанной в условии (OpenAI, 08.07.2026). Учитывайте это при сравнении цифр.

Краткая памятка

Задача Модель Цена (вход/выход за 1M)
Ежедневный кодинг Sonnet 5 / GPT-5.6 Terra $2/$10 / $2.50/$15
Быстрые правки GPT-5.6 Luna $1/$6
Дёшево и много DeepSeek V4 Pro $0.66/$1.98
Локально / NDA Qwen 3.8 27B (Ollama) бесплатно
Максимум качества Claude Opus 5 / GPT-5.6 Sol $5/$25 / $4/$24*
Скорость + качество GLM-5.3 $1.40/$4.40
Бюджет ₽0 из РФ Qwen 3.8 27B (Ollama) бесплатно

* GPT-5.6 Sol — со скидкой 20% с 21.08.2026 на 3 месяца (фактически ~$4/$24 вместо стартовых $5/$30).

Источники

  1. Artificial Analysis Intelligence Index v4.1.1 — методология
  2. Anthropic — Claude Opus 5
  3. OpenAI — GPT-5.6, 09.07.2026
  4. OpenAI — снижение цен GPT-5.6 Luna/Terra, 30.07.2026
  5. OpenAI — проблемы SWE-bench Pro, 08.07.2026
  6. Z.AI — GLM-5.3, документация
  7. Z.AI — GLM Coding Plan, подписки
  8. DeepSeek — API Pricing
  9. Hugging Face — Qwen3.8-27B, модельная карта
  10. QwenCloud — Qwen 3.8 27B API
  11. Simon Willison — GPT-5.6, 09.07.2026
  12. Simon Willison — Qwen 3.8 27B, 16.08.2026
  13. Artificial Analysis — GLM-5.3
  14. Artificial Analysis — Qwen 3.8 27B

Насколько публикация полезна?

Нажмите на звезду, чтобы оценить!

Средняя оценка / 5. Количество оценок:

Оценок пока нет. Поставьте оценку первым.

Добавить комментарий

Adblock
detector