«Нейросеть для программирования» — запрос, под которым скрывается конкретный вопрос: какую модель подключить к агенту или редактору, чтобы она писала код лучше остальных. В августе 2026 года ответ разложен по полкам: Claude (Anthropic) — Sonnet 5, Opus 5 и Fable 5; OpenAI — семейство GPT-5.6 (Luna, Terra, Sol); Google — Gemini 3.7 Flash; плюс открытые модели DeepSeek V4 Pro 0813, Qwen3-Coder и GLM-5.2. Ниже — сравнение именно моделей: цены за токены, контекст, на какие задачи какая годится, и что из этого реально доступно из России. Все цены и версии — на момент публикации (август 2026) со ссылками на первоисточники.
Отличие от соседних статей блога: здесь разбираем модели, а не агентов и не способы сэкономить. Инструменты, которые эти модели двигают (Claude Code, Codex, Gemini CLI, Cline, OpenCode), уже разобраны в статьях «Лучший ИИ-агент для кодинга» и «Бесплатные инструменты агентского кодинга». Здесь — про сами модели: чем они отличаются, сколько стоят токены и какая под какую задачу.
Как устроены кодинг-модели в 2026 году
Разница между моделями в трёх параметрах: цена за токены, размер контекста и «уровень рассуждений» (reasoning). Именно третий пункт в 2026 году двигает качество сильнее всего — у моделей появился управляемый режим рассуждений, и одна и та же модель на разных уровнях effort работает с разной глубиной и разным расходом токенов.
Ключевые факты по линейкам на август 2026:
- Claude (Anthropic): Sonnet 5 — $2 за 1 млн входных и $10 за 1 млн выходных токенов, контекст 1 млн токенов; Opus 5 — $5/$25, контекст 1 млн; Fable 5 — $10/$50, флагман для самых сложных и длинных задач. У всех трёх промпт-кэширование экономит до 90% на входных токенах (страница Sonnet 5, страница Opus 5, страница Fable 5).
- OpenAI GPT-5.6: Luna — $1/$6, Terra — $2.5/$15, Sol — $5/$30; контекст 1 млн токенов, максимум 128 000 токенов на выход. Знания — до 16 февраля 2026 (анонс и гайд Simon Willison, 09.07.2026).
- Gemini 3.7 Flash (Google): анонс 13.08.2026, вводная цена $0.75/$3.75 за 1 млн токенов до конца года, с 1 января 2027 — $1.5/$7.5. По бенчмаркам — 43.6% на FrontierCode 1.1 Main против 34.4% у Gemini 3.6 Flash и 65.3% на DeepSWE v1.1 против 49.0% (анонс в блоге Google).
- DeepSeek V4 Pro 0813: релиз 12.08.2026, только API. $0.435 вход / $0.87 выход за 1 млн токенов, кэш-хит всего $0.0036; контекст 1 млн, до 384K токенов на выход. Веса открыты в тот же день: 1.7 трлн параметров, 893 ГБ (прайс DeepSeek API, веса на Hugging Face, заметка Simon Willison, 12.08.2026).
- Qwen3-Coder (Alibaba): линейка с открытыми весами, заточенная под агентский кодинг. Старшая версия 480B-A35B (480 млрд параметров, активны 35, архитектура MoE), контекст 256K «из коробки» до 1M; обучалась на 7.5 трлн токенов, 70% — код (блог Qwen, июль 2025). Младшая 30B-A3B — стандарт для локального запуска через Ollama.
- GLM-5.2 (Z.ai): $1.4/$4.4 за 1 млн токенов, кэш-вход $0.26, контекст 1 млн токенов, до 128K на выход. Сильнейшая открытая модель по Terminal-Bench 2.1 (81.0) и SWE-bench Pro (62.1), веса открыты под лицензией MIT (документация GLM-5.2, прайс Z.ai).



Сравнительная таблица: цена, контекст, лимиты
| Модель | Вендор | Вход / выход, $ за 1M токенов | Контекст | Выход (max) | Кэш-вход | Для чего |
|---|---|---|---|---|---|---|
| Sonnet 5 | Anthropic | $2 / $10 | 1M | — | −90% | ежедневный кодинг, агенты «рабочая лошадка» |
| Opus 5 | Anthropic | $5 / $25 | 1M | — | −90% | сложный код, где нужно больше «думать» |
| Fable 5 | Anthropic | $10 / $50 | 1M | — | −90% | долгие автономные задачи, большие миграции |
| GPT-5.6 Luna | OpenAI | $1 / $6 | 1M | 128K | автоматический | быстрые правки, автодополнение, много токенов дёшево |
| GPT-5.6 Terra | OpenAI | $2.5 / $15 | 1M | 128K | автоматический | баланс цена/качество для агентов |
| GPT-5.6 Sol | OpenAI | $5 / $30 | 1M | 128K | автоматический | максимальная глубина, сложные задачи |
| Gemini 3.7 Flash | $0.75 / $3.75 | 1M* | — | — | дешёвый агентный кодинг, WebDev-задачи | |
| DeepSeek V4 Pro 0813 | DeepSeek | $0.435 / $0.87 | 1M | 384K | $0.0036 | открытые веса, дёшево и много |
| Qwen3-Coder 30B/480B | Alibaba | локально бесплатно | 256K–1M | — | — | локальный запуск, NDA-код |
| GLM-5.2 | Z.ai | $1.4 / $4.4 | 1M | 128K | $0.26 | дёшево, открытые веса (MIT), длинный контекст |
* Размер контекста Gemini 3.7 Flash в анонсе напрямую не назван; предшественник Gemini 3.6 Flash работал с 1M. Точное значение проверяйте в документации Google на момент публикации.
Источники цифр — по каждой модели в разделе выше. Для Qwen3-Coder указываем локальный вариант: облачный API Alibaba доступен, но для большинства русскоязычных сценариев модель интересна именно локально.
Как модели отличаются по качеству: бенчмарки и что они значат
Цены сами по себе ничего не говорят о качестве — поэтому смотрим на независимые бенчмарки, которые реально повторяют работу агента.
- SWE-bench Verified — задачи «исправь баг в реальном репозитории». Классика, но OpenAI прямо предупреждает о проблемах с бенчмарками такого типа: по их аудиту примерно 30% тасков SWE-bench Pro «сломаны» — тесты требуют конкретной реализации, не заявленной в условии, или промпт недоопределён (пост OpenAI о проблемах SWE-bench Pro, 08.07.2026). На нём Claude Fable 5 показывает 80%, GPT-5.6 Sol — 64.6% (самоотчёт, Simon Willison).
- Agents’ Last Exam — длинные профессиональные рабочие процессы в 55 областях. GPT-5.6 Sol набирает 53.6 против Claude Fable 5 с адаптивными рассуждениями (разница 13.1 балла); Terra и Luna, по заявлению OpenAI, обходят Fable 5 при ~1/16 стоимости (Simon Willison).
- FrontierCode 1.1 Main (Cognition) — Gemini 3.7 Flash: 43.6% против 34.4% у 3.6 Flash (анонс Google).
- Terminal-Bench 2.1 — GLM-5.2: 81.0, вплотную к Claude Opus 4.8 (85.0) и сильно выше предыдущей GLM-5.1 (62.0) (документация GLM-5.2).
Честная оговорка: бенчмарки считают разные вещи разными способами, и каждый вендор публикует выгодные ему. Единственный надёжный способ — прогнать свою задачу на двух-трёх кандидатах и сравнить результат. Практический пример: в статье «Переписываем 15-летний легаси-проект с ИИ-агентами» пайплайн planner→coder→reviewer работал на связке флагманских и дешёвых моделей, и именно микс дал результат.
Как выбрать модель под свою задачу

Ежедневная работа в агенте: Sonnet 5 или GPT-5.6 Terra
Самый частый сценарий — агент вроде Claude Code или Codex правит код, запускает тесты, итерирует. Здесь флагман не нужен: Sonnet 5 (дефолт Claude Code на Pro-плане) и GPT-5.6 Terra дают 90% результата флагмана за заметно меньшие деньги. На языке цифр: Sonnet 5 в 5 раз дешевле Fable 5 по входу и в 5 раз по выходу (цены Anthropic).
Нужно очень дёшево и много токенов: DeepSeek V4 Pro или GLM-5.2
Агентные задачи сжигают десятки миллионов токенов: на каждом шаге агент пересылает контекст заново. Здесь выигрывают DeepSeek V4 Pro 0813 ($0.435/$0.87) и GLM-5.2 ($1.4/$4.4). Практический пример из рунета: в кейсе «GLM-5.2 в Cline» (июль 2026) смесь вход/выход 2:1 даёт около $2.40 за 1 млн токенов у GLM-5.2 против $4.67 у Sonnet 5 — примерно в 1.9 раза дешевле на сырых тарифах (разбор в статье про Cline). Отдельная тема — промпт-кэширование: оно режет этот счёт ещё сильнее, и без него агентный кодинг заметно дороже.
Максимум качества и автономность: Claude Fable 5, Opus 5, GPT-5.6 Sol
Когда задача сложная, длинная и результат должен быть «с первого раза» — большой рефакторинг, миграция на тысячи строк, многодневная сессия агента — включают флагман. Fable 5 по позиционированию Anthropic — «самая способная модель для амбициозных кодинг-проектов, включая миграции и многодневные автономные сессии» (страница Fable 5). OpenAI в ответ делает ставку на эффективность токенов: Sol обходит Fable 5 на Agents’ Last Exam при ~1/4 расчётной стоимости (Simon Willison). Оба утверждения — заявления вендоров, в бенчмарках не сходятся: на SWE-bench Pro Fable 5 опережает Sol 80% против 64.6%.
Локально или NDA: Qwen3-Coder через Ollama
Если код не должен покидать машину — единственный вариант локальная модель. Qwen3-Coder-30B-A3B (19 ГБ, контекст 256K) через Ollama — стандарт для домашнего железа. Подробно с кейсами людей (от ноутбука с 4 ГБ VRAM до пары RTX 3090) — в статье «Локальные нейросети для кодинга: Qwen3-Coder через Ollama». Честное ограничение: локальные модели слабее облачных флагманов на сложных многофайловых задачах, это «офлайн-запасной вариант», а не замена.

Практика: как подключить модель и примеры промптов
Модель сама по себе не пишет код — её нужно подключить к агенту или редактору. Это делается либо подпиской (модель уже внутри Claude Code/Codex), либо API-ключом к любому совместимому агенту.
Подключение модели через API-ключ
Совместимость моделей с агентами в 2026 году — стандарт: Claude API понимают Claude Code и десятки агентов, OpenAI API — Codex, а DeepSeek и GLM предоставляют совместимые эндпоинты.
# DeepSeek V4 Pro — OpenAI-совместимый API (базовый URL: api.deepseek.com)
curl $DEEPSEEK_BASE_URL/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{"model":"deepseek-v4-pro","messages":[{"role":"user","content":"Напиши функцию парсинга CSV без зависимостей"}],"thinking":{"type":"enabled"}}'
# GLM-5.2 — совместимый эндпоинт Z.ai (базовый URL: api.z.ai/api/paas/v4)
curl $GLM_BASE_URL/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $GLM_API_KEY" \
-d '{"model":"glm-5.2","messages":[{"role":"user","content":"..."}]}'
Обе команды — из официальной документации (DeepSeek, Z.ai). Установка и настройка конкретных агентов — в наших гайдах: Claude Code, Codex CLI, Gemini CLI, OpenCode.
Примеры промптов, которые по-разному «чувствуют» модели
Промпт сам по себе не зависит от модели, но модели с разным reasoning-режимом реагируют на него по-разному. Два рабочих шаблона:
1. Задача с проверкой — дайте модели способ убедиться, что код работает. Формулировка из практики Claude Code:
Напиши тесты для модуля авторизации, запусти их и исправь все падения.
2. Задача с ограничениями — заставьте модель держать контекст проекта. Пример из официальных сценариев GLM-5.2:
«Пожалуйста, строго следуй инженерным стандартам текущего репозитория. Не добавляй новые зависимости, не меняй контракты API и не коммить изменения без запроса. После завершения правок запусти сборку, линтер и тесты, затем сообщи о результатах проверки и выявленных рисках». (документация GLM-5.2)
Разница моделей проявляется не в первом ответе, а в длине сессии: флагманы дольше держат нить на больших контекстах, дешёвые модели на длинных сессиях заметнее «тупеют». Про управление контекстом и файлы-конвенции CLAUDE.md/AGENTS.md — в статье про файл AGENTS.md и MCP.
Российские реалии: что работает из РФ без VPN и как платить
Главный практический вопрос для русскоязычного программиста — не «какая модель лучше», а «до какой модели я вообще могу достучаться». Разбивка по каждой линейке на момент публикации:
- Claude (Sonnet/Opus/Fable 5) — Россия отсутствует в списке поддерживаемых стран Anthropic, прямой доступ к API и claude.ai с российского IP заблокирован (список стран). Нужен VPN и зарубежная карта для оплаты: российские Visa/Mastercard не принимаются, реальные пути — UnionPay (не у всех банков), крипта через посредников или юрлицо в поддерживаемой стране. Подробно — в статье «Как установить Claude Code».
- OpenAI GPT-5.6 (Luna/Terra/Sol) — OpenAI блокирует доступ с российских IP с декабря 2022 («ChatGPT: как пользоваться нейросетью в России»). Работает через VPN, оплата — зарубежной картой или через сервисы-посредники; личный опыт оплаты подписок разобран в «Как оплатить подписку ChatGPT из России в 2026 году».
- Gemini 3.7 Flash — бесплатный тариф через API-ключ Google AI Studio заводится с обычным Google-аккаунтом и работает из РФ без привязки карты; для стабильности лучше держать один VPN-выход. Подробности про API-доступ — в статье про Gemini CLI и в русскоязычном разборе «Gemini в России».
- DeepSeek V4 Pro 0813 — API
api.deepseek.comдоступен из России без VPN (проверено в августе 2026 с машины в Самаре, по опыту из статьи «Reasonix: DeepSeek-агент»). А вот оплата — больное место: свежих русскоязычных инструкций по пополнению баланса почти нет, тема в рунете не освещена. Известно: российские Visa/Mastercard не работают, рабочие варианты — UnionPay, зарубежная карта или посредники. Сам DeepSeek предупреждает на странице цен, что планирует существенно поднять тарифы в ближайшем будущем — закладываться на текущие цены на годы вперёд не стоит (прайс). - Qwen3-Coder — локальный запуск через Ollama работает в РФ без VPN, бесплатно и без карт (Tproger, апрель 2026); свежий русскоязычный опыт прогона Qwen3-Coder через Kilo Code, Aider и OpenCode — Habr, апрель 2026. Облачный API Alibaba (DashScope) из РФ оплатить сложно, русскоязычных инструкций по этому пути мы не нашли.
- GLM-5.2 (Z.ai) — международный API Z.ai принимает зарубежные карты; российские Visa/Mastercard не работают, проверенного пути оплатой Mir/UnionPay нет. Рабочие обходы: зарубежная карта, криптопосредники либо российские OpenAI-совместимые шлюзы с оплатой в рублях (пример настройки — AITUNNEL). В рунете GLM-5.2 освещали в основном как новость: анонс на Хабре.
Итог по РФ короткий: без VPN и без зарубежной карты из перечисленного доступны локальный Qwen3-Coder (бесплатно), DeepSeek API (доступен, но оплата через обходы) и бесплатный тариф Gemini API. Всё остальное — с VPN и зарубежной оплатой.
Честные ограничения моделей
- Бенчмарки не сходятся. Fable 5 лидирует на SWE-bench Pro (80%), GPT-5.6 Sol — на Agents’ Last Exam, причём сами вендоры оспаривают бенчмарки друг друга (OpenAI называет ~30% задач SWE-bench Pro «сломанными»). Выбор по бенчмаркам — лотерея; выбор по своей задаче — надёжен.
- Reasoning стоит токенов. Глубокие рассуждения на флагмане — это десятки тысяч «невидимых» токенов. Simon Willison измерил разброс: от 0.71 цента за задачу на GPT-5.6 Luna без рассуждений до 48.55 цента на Sol с максимальным reasoning (таблица цен по уровням рассуждений). Цена за токен — не цена за задачу.
- Длинные сессии деградируют. Любая модель «тупеет» по мере роста контекста; флагманы держатся дольше, дешёвые — заметно хуже. Это ограничение решается не моделью, а гигиеной контекста (компакция,
CLAUDE.md,/clear). - Открытые веса ≠ бесплатная работа. DeepSeek V4 Pro 0813 (893 ГБ) или Qwen3-Coder-480B (290 ГБ) требуют серьёзного железа; большинство людей используют их через API или младшие версии.
- Доступность в РФ — отдельное ограничение, разобранное выше: часть моделей недоступна без VPN, часть — без решения вопроса оплаты.
- Промпт-инъекции и автономность. Чем автономнее модель, тем выше риск, что она выполнит вредоносную команду из враждебного контекста. Ограничивайте права агента и проверяйте диффы.
Вывод
«Лучшей нейросети для программирования» не существует — есть модели под задачи и бюджет. Для ежедневной работы в агенте — Sonnet 5 или GPT-5.6 Terra. Для долгих сложных миграций — Claude Fable 5, Opus 5 или GPT-5.6 Sol. Для дёшево и много — DeepSeek V4 Pro, GLM-5.2, Gemini 3.7 Flash. Для локального кода и NDA — Qwen3-Coder через Ollama. Из России без VPN и зарубежных карт реально работают локальные модели, DeepSeek API (с оговорками по оплате) и бесплатный тариф Gemini.
Начните с малого: подключите одну дешёвую модель к агенту и дайте ей задачу с проверкой — тесты прогоняются, результат виден. Потом, если упрётесь в качество, поднимитесь на ступень выше. Базовые понятия — в статье «Что такое агентный кодинг», а сравнение самих инструментов — в статье «Лучший ИИ-агент для кодинга».
