Лето 2026 принесло тренд, который многие пропустили: маленькие модели стали достаточно умными для реальной работы. Не для экспериментов и не «как забава на выходных» — а для повседневных задач: рутина, генерация кода, правки, исследования, ответы на вопросы по кодовой базе. При этом они быстрые — от 100 токенов в секунду — и дешёвые: копейки за задачу, которая на флагманской модели обошлась бы в доллар.
Конкретика: gpt-5.6-luna выдаёт ~100 ток/с в реальной работе (Calvin French-Owen, основатель Segment, август 2026 (https://calvinfo.com/small-models-have-arrived)), по данным Artificial Analysis — до 184 ток/с ( Artificial Analysis (https://artificialanalysis.ai/models#speed)). Qwen 3.8 27B — 27-миллиардная модель, которая запускается на ноутбуке с 16 ГБ RAM и стоит $0 (Apache 2.0). GLM-5.3 — open-weight с 28 августа 2026, Intelligence Index 60 ( Artificial Analysis (https://artificialanalysis.ai/models/glm-5-3)). И Qwen3.8-Flash-Next — MoE-архитектура с 125 млрд параметров, из которых на каждом шаге активны только 6 млрд.
В этой статье — когда маленькой модели хватает, когда нужна большая, как подключить и что реально работает на практике. Все цены и цифры — «на момент публикации» (август 2026).

Почему маленькие модели вдруг стали работать
Три фактора сошлись одновременно.
Цены упали. OpenAI снизил стоимость GPT-5.6 Luna на 80% через три недели после релиза ( обновление OpenAI, 30.07.2026 (https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/)). DeepSeek V4 Pro подешевел до $0.66/$1.98 за 1M токенов ( DeepSeek API Pricing (https://api-docs.deepseek.com/quick_start/pricing)). Qwen через Ollama — бесплатно.
Архитектура стала эффективнее. Mixture of Experts (MoE) позволяет иметь огромную модель (125 млрд параметров), но на каждом шаге активировать только малую часть (6 млрд). Результат — качество большой модели, скорость маленькой. Подробно про MoE — в разборе Qwen3.8-Flash-Next.
Бенчмарки подтверждают. Qwen 3.8 27B набирает 61.7% на SWE-bench Pro против 53.4% у Claude Opus 4.6 Max ( модельная карта Qwen 3.8 27B (https://huggingface.co/Qwen/Qwen3.8-27B)) — 27-миллиардная модель обходит 400+ миллиардного флагмана на задачах исправления багов в реальных репозиториях.
GPT-5.6 Luna: быстрый и дешёвый API
GPT-5.6 Luna — младшая модель из семейства GPT-5.6 ( OpenAI, июль 2026 (https://openai.com/index/gpt-5-6/)). Позиционирование — скорость и стоимость, а не максимальное качество.
Ключевые характеристики на момент публикации:
- Скорость: ~100 ток/с в реальной работе ( Calvin French-Owen (https://calvinfo.com/small-models-have-arrived), август 2026); по данным Artificial Analysis — 184 ток/с через API OpenAI ( Artificial Analysis (https://artificialanalysis.ai/models#speed)).
- Цена: $1/$6 за 1M токенов (вход/выход) — после снижения на 80% ( обновление OpenAI (https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/)).
- Контекст: 1M токенов.
- Intelligence Index: 52 по версии Artificial Analysis (https://artificialanalysis.ai/models/gpt-5-6-luna).
- Доступ: API OpenAI, Codex CLI, ChatGPT.
Для сравнения: GPT-5.6 Sol (старшая модель) — 74 ток/с и $5/$30 (после скидки 20% с 21.08 — ~$4/$24). Разница в цене — в 5 раз по выходу, в 3–4 раза по входу. Для рутинных задач переплата за Sol не оправдана.
Calvin French-Owen (основатель Segment, CTO) описывает практический кейс: исследовательская задача — проанализировать тысячи электронных писем и построить персонализированный новостной сайт. На модели Sonnet-класса — ~$1 за задачу. На Luna — ~$0.10. Разница в 10 раз при приемлемом качестве:
I regularly see it do ~100 tps, and rip around my codebase, email, and knowledge base. Of course, the biggest thing with luna is the cost. I have tried running some fairly complicated research threads, and it is pretty tough to run up a large bill. Even having it search across thousands of emails, I end up with an API cost in the tens of cents.
— Calvin French-Owen, «Small Models Have Arrived» (https://calvinfo.com/small-models-have-arrived), 26.08.2026
Qwen 3.8 27B: модель для ноутбука
Qwen 3.8 27B — плотная (не MoE) 27-миллиардная модель от Alibaba, вышедшая 15 августа 2026 ( Hugging Face (https://huggingface.co/Qwen/Qwen3.8-27B)). Apache 2.0, запускается локально без интернета и без ключей.
- Размер на диске: 17 ГБ (квантизированная Q4_K_M через LM Studio).
- Скорость: 15–30 ток/с на M5 Max MacBook Pro и DGX Spark ( Simon Willison, 16.08.2026 (https://simonwillison.net/2026/Aug/16/qwen-38-27b/)).
- Контекст: 262K токенов нативно, до 1M через экстраполяцию.
- Ввод: текст + изображения + видео.
- SWE-bench Pro: 61.7% — выше Claude Opus 4.6 Max (53.4%).
Simon Willison проверил модель и подключил к агенту Pi (терминальный агент с коротким system prompt). Агент на Qwen 3.8 27B (LM Studio, DGX Spark) успешно анализировал кодовую базу Datasette:
One of the biggest questions around local models is whether or not they have enough horsepower to successfully run a coding agent loop. Coding agents require long context, strong code generation support and reliable tool-calling. On paper Qwen 3.8 27B has all three of these, so is it up to the task? My initial experiments with Pi have been very promising.
— Simon Willison (https://simonwillison.net/2026/Aug/16/qwen-38-27b/), 16.08.2026
Запуск через Ollama:
ollama run hf.co/Qwen/Qwen3.8-27B
Важный нюанс: модель по умолчанию стартует с xhigh reasoning — она «мыслит» десятки тысяч токенов даже на простых запросах. Simon Willison рекомендует запускать на low или отключить reasoning целиком. На ноутбуке xhigh reasoning превращает генерацию SVG-круга в 21-минутное приключение с 22 276 токенами рассуждений.
MoE: архитектура, которая делает большие модели маленькими
Mixture of Experts (MoE) — архитектура, при которой модель содержит много «экспертов», но для каждого токена активируется только часть из них. Результат: общее число параметров огромное (модель «знает» много), но вычислительные затраты на генерацию — как у маленькой.
Пример: Qwen3.8-Flash-Next ( Hugging Face, Qwen (https://huggingface.co/Qwen/Qwen3.8-Flash-Next), 26.08.2026):
— Всего параметров: 125 млрд.
— Активных на каждом шаге: 6 млрд (10 маршрутизированных + 1 общий эксперт).
— N-gram embedding: 51 млрд дополнительных параметров.
— Эффект: «превью архитектуры Qwen4» — модель значительно умнее плотных 6-миллиардных, но потребляет ресурсы ближе к маленьким.
Для сравнения: Qwen 3.8 27B — плотная, все 27 млрд активны на каждом шаге. На DGX Spark она выдаёт 15–30 ток/с. MoE-модели при аналогичном железе работают быстрее за счёт меньшего числа активных параметров.
| Характеристика | Плотная (Qwen 3.8 27B) | MoE (Qwen3.8-Flash-Next) |
|---|---|---|
| Всего параметров | 27 млрд | 125 млрд |
| Активных на шаг | 27 млрд | 6 млрд |
| Память на диске | ~17 ГБ (Q4) | ~73–79 ГБ (кванты Unsloth) |
| Скорость на Spark | 15–30 ток/с | выше (меньше активных параметров) |
| Для ноутбука | да (16+ ГБ RAM) | нет (нужен сервер) |
| Лицензия | Apache 2.0 | qwen-community-1.0 |
Кванты Qwen3.8-Flash-Next: Unsloth выпустили UD-IQ1_S (72.5 ГБ) и UD-Q2_K_XL (78.9 ГБ) ( Hugging Face, Unsloth (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF)). Simon Willison тестировал оба на DGX Spark.
GLM-5.3: открытые веса на Pareto-фронтейне
GLM-5.3 от Z.AI вышла 18 августа как проприетарная модель, но 28 августа веса были открыты ( zai-org/GLM-5.3 на Hugging Face (https://huggingface.co/zai-org/GLM-5.3)).
- Intelligence Index: 60 ( Artificial Analysis (https://artificialanalysis.ai/models/glm-5-3)) — на одном уровне с GPT-5.6 Sol (61), лишь чуть ниже Opus 5 (63).
- Скорость: 93 ток/с, задержка первого токена 1.92 с — одна из самых быстрых reasoning-моделей ( там же).
- Цена API: $1.40/$4.40 за 1M токенов; кэш-вход со скидкой 81% — $0.26 ( документация Z.AI (https://docs.z.ai/guides/overview/pricing)).
- Контекст: 1M токенов, MoE 753 млрд параметров.
GLM-5.3 вписывается в тренд «маленьких быстрых моделей» по-своему: она не маленькая (753 млрд), но быстрая и дешёвая относительно качества. На Pareto-кривой «умность / стоимость» она рядом с лёгкими моделями, хотя по архитектуре — ближе к флагманам.
Как подключить к агенту — разобрано в статье GLM-5.3 open-weight: запуск локально и в агентах.
Сравнение: когда какая модель
| Задача | Модель | Цена (вход/выход за 1M) | Скорость | Почему именно она |
|---|---|---|---|---|
| «Напиши функцию» | GPT-5.6 Luna | $1 / $6 | ~100–184 ток/с | Быстро, дёшево, достаточно умно |
| Ежедневный кодинг в агенте | Qwen 3.8 27B (Ollama) | бесплатно | 15–30 ток/с | Локально, без ключей, Apache 2.0 |
| Исследование / email / документы | GPT-5.6 Luna | $1 / $6 | ~100 ток/с | Копейки за тысячи запросов |
| Рутина с большим расходом токенов | DeepSeek V4 Pro | $0.66 / $1.98 | — | Самый дешёвый API |
| Агент на ноутбуке (NDA/приватность) | Qwen 3.8 27B | бесплатно | 15–30 ток/с | Не покидает машину |
| Максимум качества | Claude Opus 5 / GPT-5.6 Sol | $5/$25 / ~$4/$24 | 55–74 ток/с | Intelligence Index 61–63 |
| Скорость + качество + цена | GLM-5.3 | $1.40 / $4.40 | 93 ток/с | Pareto-фронт, AA Index 60 |
| Многофайловый рефакторинг | Qwen3.8-Flash-Next (сервер) | API / бесплатно | MoE | 125B/6B, превью архитектуры Qwen4 |
Правило: 90% повседневных задач закрываются маленькой или средней моделью. Флагманы нужны для сложных многошаговых задач, где критична точность рассуждений на длинном контексте.
Когда маленькой модели хватает, а когда нет
Calvin French-Owen формулирует ключевое разделение:
Across his various startups, Peter has seen two kinds of work: the “IQ 180” work — some mad scientist genius type comes up with some crazy solution you have never thought of; and the “token spewer” work — being ultra responsive, pushing the ball forward across dozens of different fronts.
— Calvin French-Owen (https://calvinfo.com/small-models-have-arrived), 26.08.2026
Peter Линн (сооснователь Segment, Charm Industrial, Revoy) утверждает, что ~95% его работы — «токен-спитер»: ответы на вопросы, рутина, проверки, мелкие правки, генерация тестов, документация, парсинг данных. Для этого маленькие модели подходят идеально.
Где маленькая модель не справится:
— Длинные многошаговые агентные сессии (50+ итераций) — контекст съедается, модель «забывает» ранние инструкции.
— Архитектурные решения — здесь нужен «IQ 180» и флагман.
— Сложный рефакторинг с десятками файлов — агентный цикл на маленькой модели деградирует быстрее.
Как проверить: дайте маленькой модели одну конкретную задачу с тестами для проверки. Если тесты проходят — модель подходит. Если нет — попробуйте модель покрупнее. Подробнее про агентный цикл «промпт → план → правки → проверка» — в статье что такое агентный кодинг.
Практика: как подключить маленькую модель
Вариант 1: API (GPT-5.6 Luna)
Через Codex CLI:
npm install -g @openai/codex
codex --model gpt-5.6-luna
Настройка модели по умолчанию — в файле ~/.codex/config.toml:
[model]
default = "gpt-5.6-luna"
Через Claude Code с API-ключом OpenAI:
export OPENAI_API_KEY="your-key"
claude --model openai/gpt-5.6-luna
Вариант 2: локально через Ollama (Qwen 3.8 27B)
# Установка Ollama
curl -fsSL https://ollama.com/install.sh | sh
# Скачивание модели (17 ГБ)
ollama pull qwen3.8:27b
# Проверка
ollama run qwen3.8:27b
Подключение к агентам:
# Claude Code (нужна Ollama 0.15+)
ollama launch claude --model qwen3.8:27b
# OpenCode
ollama launch opencode --model qwen3.8:27b
# Aider
export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/qwen3.8:27b
Подробная инструкция — в статье Локальные нейросети для кодинга: Qwen3-Coder через Ollama.
Вариант 3: LM Studio (визуальный интерфейс)
LM Studio (https://lmstudio.ai/) — десктопное приложение с графическим интерфейсом. Скачиваете модель одним кликом, запускаете сервер, подключаете агента по OpenAI-совместимому API на localhost:1234.
Российские реалии
Доступность маленьких моделей
Локальные модели (Ollama, LM Studio) — лучший вариант для РФ. Работают без VPN, без интернета, без ключей. Qwen 3.8 27B через Ollama — Apache 2.0, бесплатно, ничего не блокируется. Подробный опыт запуска из РФ — в статье Локальные нейросети для кодинга и обзор на Хабре (https://habr.com/ru/articles/1024884/).
API GPT-5.6 Luna — OpenAI блокирует российские IP с декабря 2022. Вход и оплата — через VPN и зарубежную карту. Российские Visa/Mastercard не работают. Посредники (AITUNNEL и подобные) принимают рубли, но это дополнительный риск и комиссия.
GLM-5.3 — сайт z.ai и API api.z.ai доступны без VPN ( документация Z.AI (https://docs.z.ai/guides/overview/pricing)). Бесплатный 5-дневный период через ZCode (https://zcode.z.ai/en/docs/welcome). Оплата — зарубежной картой или криптой.
DeepSeek V4 Pro — api.deepseek.com доступен без VPN. Оплата — через обходы.
Оплата
Российские Visa/Mastercard не работают ни в одном из зарубежных AI-сервисов. Варианты:
— Локальные модели — бесплатно, без оплаты.
— UnionPay — подходит для части сервисов, зависит от банка.
— Посредники — AITUNNEL (https://aitunnel.ru/tools/cline) принимает рубли.
— Криптовалюта — для DeepSeek API и части сервисов.
Разбор оплаты AI-сервисов из РФ — на Habr (https://habr.com/ru/companies/tehrevizor/articles/1015580/) и обзор Gemini в России (https://aimarketcap.ru/gemini-v-rossii/). Подробных инструкций по оплате QwenCloud и DeepSeek API из РФ в рунете мало — тема не освещена.
Честные ограничения
- Скорость на локальном железе. Qwen 3.8 27B выдаёт 15–30 ток/с на DGX Spark и M5 Max — это приемлемо, но медленнее облачных API. Если скорость критична — Luna (100+ ток/с) или GLM-5.3 (93 ток/с) через API.
- Маленькая модель — маленький контекст агентного цикла. Claude Code требует минимум 35K токенов контекста (иначе ошибка). На 4 ГБ VRAM потолок — ~32K. Модель, которая не тянет контекст, выглядит глупой, хотя проблема в настройке.
- Reasoning по умолчанию. Qwen 3.8 27B стартует с xhigh reasoning, тратя десятки тысяч токенов на простые задачи. Отключите reasoning или поставьте low — и модель станет быстрее в 10 раз без потери качества на рутине.
- Маленькие модели путают инструменты. При большом числе MCP-тулзов (20+) маленькая модель начинает слать запросы не туда. Начните с 3–5 инструментов.
- Качество ниже флагманов. Intelligence Index 52 (Luna, Qwen 3.8 27B) против 63 (Opus 5) — разница ощутима на сложных задачах. Для рутины — незаметна.
- Цены нестабильны. OpenAI снижал Luna через три недели после релиза. GLM Coding Plan даёт скидки через годовую подписку. Перед крупными тратами проверяйте актуальный прайс.
Вывод
Маленькие модели — это не компромисс, а правильный инструмент для правильных задач. 90% работы разработчика — «токен-спитер»: рутина, правки, генерация, исследования. Для этого Luna (~100 ток/с, копейки), Qwen 3.8 27B (бесплатно, на ноутбуке) и GLM-5.3 (быстро, дёшево, open-weight) подходят лучше, чем флагманы за $25–30 за выходной миллион токенов.
Флагманы (Opus 5, Sol) нужны для «IQ 180» задач — сложных архитектурных решений, длинных автономных сессий, критически важных миграций. Но и там имеет смысл чередовать: рутина на маленькой модели, критические шаги — на флагмане.
Для России локальные модели — это ещё и единственный способ работать с ИИ без VPN и зарубежных карт. Qwen 3.8 27B через Ollama — бесплатный, приватный, офлайн-вариант, который закрывает большинство повседневных задач.
Дальше по теме: модели для кодинга 2026: сравнение, локальные нейросети для кодинга: Qwen3-Coder через Ollama, лучший ИИ для кодинга: сравнение, что такое агентный кодинг.
