Перейти к содержимому

Маленькие быстрые модели для кодинга: gpt-5.6-luna и компания

Лето 2026 принесло тренд, который многие пропустили: маленькие модели стали достаточно умными для реальной работы. Не для экспериментов и не «как забава на выходных» — а для повседневных задач: рутина, генерация кода, правки, исследования, ответы на вопросы по кодовой базе. При этом они быстрые — от 100 токенов в секунду — и дешёвые: копейки за задачу, которая на флагманской модели обошлась бы в доллар.

Конкретика: gpt-5.6-luna выдаёт ~100 ток/с в реальной работе (Calvin French-Owen, основатель Segment, август 2026 (https://calvinfo.com/small-models-have-arrived)), по данным Artificial Analysis — до 184 ток/с ( Artificial Analysis (https://artificialanalysis.ai/models#speed)). Qwen 3.8 27B — 27-миллиардная модель, которая запускается на ноутбуке с 16 ГБ RAM и стоит $0 (Apache 2.0). GLM-5.3 — open-weight с 28 августа 2026, Intelligence Index 60 ( Artificial Analysis (https://artificialanalysis.ai/models/glm-5-3)). И Qwen3.8-Flash-Next — MoE-архитектура с 125 млрд параметров, из которых на каждом шаге активны только 6 млрд.

В этой статье — когда маленькой модели хватает, когда нужна большая, как подключить и что реально работает на практике. Все цены и цифры — «на момент публикации» (август 2026).

Qwen3.8-Flash-Next на Hugging Face — MoE 125B/6B
Qwen3.8-Flash-Next — мультимодальная MoE-модель, «превью архитектуры Qwen4». Источник: huggingface.co/Qwen/Qwen3.8-Flash-Next.

Почему маленькие модели вдруг стали работать

Три фактора сошлись одновременно.

Цены упали. OpenAI снизил стоимость GPT-5.6 Luna на 80% через три недели после релиза ( обновление OpenAI, 30.07.2026 (https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/)). DeepSeek V4 Pro подешевел до $0.66/$1.98 за 1M токенов ( DeepSeek API Pricing (https://api-docs.deepseek.com/quick_start/pricing)). Qwen через Ollama — бесплатно.

Архитектура стала эффективнее. Mixture of Experts (MoE) позволяет иметь огромную модель (125 млрд параметров), но на каждом шаге активировать только малую часть (6 млрд). Результат — качество большой модели, скорость маленькой. Подробно про MoE — в разборе Qwen3.8-Flash-Next.

Бенчмарки подтверждают. Qwen 3.8 27B набирает 61.7% на SWE-bench Pro против 53.4% у Claude Opus 4.6 Max ( модельная карта Qwen 3.8 27B (https://huggingface.co/Qwen/Qwen3.8-27B)) — 27-миллиардная модель обходит 400+ миллиардного флагмана на задачах исправления багов в реальных репозиториях.

GPT-5.6 Luna: быстрый и дешёвый API

GPT-5.6 Luna — младшая модель из семейства GPT-5.6 ( OpenAI, июль 2026 (https://openai.com/index/gpt-5-6/)). Позиционирование — скорость и стоимость, а не максимальное качество.

Ключевые характеристики на момент публикации:

  • Скорость: ~100 ток/с в реальной работе ( Calvin French-Owen (https://calvinfo.com/small-models-have-arrived), август 2026); по данным Artificial Analysis — 184 ток/с через API OpenAI ( Artificial Analysis (https://artificialanalysis.ai/models#speed)).
  • Цена: $1/$6 за 1M токенов (вход/выход) — после снижения на 80% ( обновление OpenAI (https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/)).
  • Контекст: 1M токенов.
  • Intelligence Index: 52 по версии Artificial Analysis (https://artificialanalysis.ai/models/gpt-5-6-luna).
  • Доступ: API OpenAI, Codex CLI, ChatGPT.

Для сравнения: GPT-5.6 Sol (старшая модель) — 74 ток/с и $5/$30 (после скидки 20% с 21.08 — ~$4/$24). Разница в цене — в 5 раз по выходу, в 3–4 раза по входу. Для рутинных задач переплата за Sol не оправдана.

Calvin French-Owen (основатель Segment, CTO) описывает практический кейс: исследовательская задача — проанализировать тысячи электронных писем и построить персонализированный новостной сайт. На модели Sonnet-класса — ~$1 за задачу. На Luna — ~$0.10. Разница в 10 раз при приемлемом качестве:

I regularly see it do ~100 tps, and rip around my codebase, email, and knowledge base. Of course, the biggest thing with luna is the cost. I have tried running some fairly complicated research threads, and it is pretty tough to run up a large bill. Even having it search across thousands of emails, I end up with an API cost in the tens of cents.

— Calvin French-Owen, «Small Models Have Arrived» (https://calvinfo.com/small-models-have-arrived), 26.08.2026

Qwen 3.8 27B: модель для ноутбука

Qwen 3.8 27B — плотная (не MoE) 27-миллиардная модель от Alibaba, вышедшая 15 августа 2026 ( Hugging Face (https://huggingface.co/Qwen/Qwen3.8-27B)). Apache 2.0, запускается локально без интернета и без ключей.

  • Размер на диске: 17 ГБ (квантизированная Q4_K_M через LM Studio).
  • Скорость: 15–30 ток/с на M5 Max MacBook Pro и DGX Spark ( Simon Willison, 16.08.2026 (https://simonwillison.net/2026/Aug/16/qwen-38-27b/)).
  • Контекст: 262K токенов нативно, до 1M через экстраполяцию.
  • Ввод: текст + изображения + видео.
  • SWE-bench Pro: 61.7% — выше Claude Opus 4.6 Max (53.4%).

Simon Willison проверил модель и подключил к агенту Pi (терминальный агент с коротким system prompt). Агент на Qwen 3.8 27B (LM Studio, DGX Spark) успешно анализировал кодовую базу Datasette:

One of the biggest questions around local models is whether or not they have enough horsepower to successfully run a coding agent loop. Coding agents require long context, strong code generation support and reliable tool-calling. On paper Qwen 3.8 27B has all three of these, so is it up to the task? My initial experiments with Pi have been very promising.

— Simon Willison (https://simonwillison.net/2026/Aug/16/qwen-38-27b/), 16.08.2026

Запуск через Ollama:

ollama run hf.co/Qwen/Qwen3.8-27B

Важный нюанс: модель по умолчанию стартует с xhigh reasoning — она «мыслит» десятки тысяч токенов даже на простых запросах. Simon Willison рекомендует запускать на low или отключить reasoning целиком. На ноутбуке xhigh reasoning превращает генерацию SVG-круга в 21-минутное приключение с 22 276 токенами рассуждений.

MoE: архитектура, которая делает большие модели маленькими

Mixture of Experts (MoE) — архитектура, при которой модель содержит много «экспертов», но для каждого токена активируется только часть из них. Результат: общее число параметров огромное (модель «знает» много), но вычислительные затраты на генерацию — как у маленькой.

Пример: Qwen3.8-Flash-Next ( Hugging Face, Qwen (https://huggingface.co/Qwen/Qwen3.8-Flash-Next), 26.08.2026):
Всего параметров: 125 млрд.
Активных на каждом шаге: 6 млрд (10 маршрутизированных + 1 общий эксперт).
N-gram embedding: 51 млрд дополнительных параметров.
Эффект: «превью архитектуры Qwen4» — модель значительно умнее плотных 6-миллиардных, но потребляет ресурсы ближе к маленьким.

Для сравнения: Qwen 3.8 27B — плотная, все 27 млрд активны на каждом шаге. На DGX Spark она выдаёт 15–30 ток/с. MoE-модели при аналогичном железе работают быстрее за счёт меньшего числа активных параметров.

Характеристика Плотная (Qwen 3.8 27B) MoE (Qwen3.8-Flash-Next)
Всего параметров 27 млрд 125 млрд
Активных на шаг 27 млрд 6 млрд
Память на диске ~17 ГБ (Q4) ~73–79 ГБ (кванты Unsloth)
Скорость на Spark 15–30 ток/с выше (меньше активных параметров)
Для ноутбука да (16+ ГБ RAM) нет (нужен сервер)
Лицензия Apache 2.0 qwen-community-1.0

Кванты Qwen3.8-Flash-Next: Unsloth выпустили UD-IQ1_S (72.5 ГБ) и UD-Q2_K_XL (78.9 ГБ) ( Hugging Face, Unsloth (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF)). Simon Willison тестировал оба на DGX Spark.

GLM-5.3: открытые веса на Pareto-фронтейне

GLM-5.3 от Z.AI вышла 18 августа как проприетарная модель, но 28 августа веса были открыты ( zai-org/GLM-5.3 на Hugging Face (https://huggingface.co/zai-org/GLM-5.3)).

  • Intelligence Index: 60 ( Artificial Analysis (https://artificialanalysis.ai/models/glm-5-3)) — на одном уровне с GPT-5.6 Sol (61), лишь чуть ниже Opus 5 (63).
  • Скорость: 93 ток/с, задержка первого токена 1.92 с — одна из самых быстрых reasoning-моделей ( там же).
  • Цена API: $1.40/$4.40 за 1M токенов; кэш-вход со скидкой 81% — $0.26 ( документация Z.AI (https://docs.z.ai/guides/overview/pricing)).
  • Контекст: 1M токенов, MoE 753 млрд параметров.

GLM-5.3 вписывается в тренд «маленьких быстрых моделей» по-своему: она не маленькая (753 млрд), но быстрая и дешёвая относительно качества. На Pareto-кривой «умность / стоимость» она рядом с лёгкими моделями, хотя по архитектуре — ближе к флагманам.

Как подключить к агенту — разобрано в статье GLM-5.3 open-weight: запуск локально и в агентах.

Сравнение: когда какая модель

Задача Модель Цена (вход/выход за 1M) Скорость Почему именно она
«Напиши функцию» GPT-5.6 Luna $1 / $6 ~100–184 ток/с Быстро, дёшево, достаточно умно
Ежедневный кодинг в агенте Qwen 3.8 27B (Ollama) бесплатно 15–30 ток/с Локально, без ключей, Apache 2.0
Исследование / email / документы GPT-5.6 Luna $1 / $6 ~100 ток/с Копейки за тысячи запросов
Рутина с большим расходом токенов DeepSeek V4 Pro $0.66 / $1.98 Самый дешёвый API
Агент на ноутбуке (NDA/приватность) Qwen 3.8 27B бесплатно 15–30 ток/с Не покидает машину
Максимум качества Claude Opus 5 / GPT-5.6 Sol $5/$25 / ~$4/$24 55–74 ток/с Intelligence Index 61–63
Скорость + качество + цена GLM-5.3 $1.40 / $4.40 93 ток/с Pareto-фронт, AA Index 60
Многофайловый рефакторинг Qwen3.8-Flash-Next (сервер) API / бесплатно MoE 125B/6B, превью архитектуры Qwen4

Правило: 90% повседневных задач закрываются маленькой или средней моделью. Флагманы нужны для сложных многошаговых задач, где критична точность рассуждений на длинном контексте.

Когда маленькой модели хватает, а когда нет

Calvin French-Owen формулирует ключевое разделение:

Across his various startups, Peter has seen two kinds of work: the “IQ 180” work — some mad scientist genius type comes up with some crazy solution you have never thought of; and the “token spewer” work — being ultra responsive, pushing the ball forward across dozens of different fronts.

— Calvin French-Owen (https://calvinfo.com/small-models-have-arrived), 26.08.2026

Peter Линн (сооснователь Segment, Charm Industrial, Revoy) утверждает, что ~95% его работы — «токен-спитер»: ответы на вопросы, рутина, проверки, мелкие правки, генерация тестов, документация, парсинг данных. Для этого маленькие модели подходят идеально.

Где маленькая модель не справится:
— Длинные многошаговые агентные сессии (50+ итераций) — контекст съедается, модель «забывает» ранние инструкции.
— Архитектурные решения — здесь нужен «IQ 180» и флагман.
— Сложный рефакторинг с десятками файлов — агентный цикл на маленькой модели деградирует быстрее.

Как проверить: дайте маленькой модели одну конкретную задачу с тестами для проверки. Если тесты проходят — модель подходит. Если нет — попробуйте модель покрупнее. Подробнее про агентный цикл «промпт → план → правки → проверка» — в статье что такое агентный кодинг.

Практика: как подключить маленькую модель

Вариант 1: API (GPT-5.6 Luna)

Через Codex CLI:

npm install -g @openai/codex
codex --model gpt-5.6-luna

Настройка модели по умолчанию — в файле ~/.codex/config.toml:

[model]
default = "gpt-5.6-luna"

Через Claude Code с API-ключом OpenAI:

export OPENAI_API_KEY="your-key"
claude --model openai/gpt-5.6-luna

Вариант 2: локально через Ollama (Qwen 3.8 27B)

# Установка Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Скачивание модели (17 ГБ)
ollama pull qwen3.8:27b

# Проверка
ollama run qwen3.8:27b

Подключение к агентам:

# Claude Code (нужна Ollama 0.15+)
ollama launch claude --model qwen3.8:27b

# OpenCode
ollama launch opencode --model qwen3.8:27b

# Aider
export OLLAMA_API_BASE=http://127.0.0.1:11434
aider --model ollama_chat/qwen3.8:27b

Подробная инструкция — в статье Локальные нейросети для кодинга: Qwen3-Coder через Ollama.

Вариант 3: LM Studio (визуальный интерфейс)

LM Studio (https://lmstudio.ai/) — десктопное приложение с графическим интерфейсом. Скачиваете модель одним кликом, запускаете сервер, подключаете агента по OpenAI-совместимому API на localhost:1234.

Российские реалии

Доступность маленьких моделей

Локальные модели (Ollama, LM Studio) — лучший вариант для РФ. Работают без VPN, без интернета, без ключей. Qwen 3.8 27B через Ollama — Apache 2.0, бесплатно, ничего не блокируется. Подробный опыт запуска из РФ — в статье Локальные нейросети для кодинга и обзор на Хабре (https://habr.com/ru/articles/1024884/).

API GPT-5.6 Luna — OpenAI блокирует российские IP с декабря 2022. Вход и оплата — через VPN и зарубежную карту. Российские Visa/Mastercard не работают. Посредники (AITUNNEL и подобные) принимают рубли, но это дополнительный риск и комиссия.

GLM-5.3 — сайт z.ai и API api.z.ai доступны без VPN ( документация Z.AI (https://docs.z.ai/guides/overview/pricing)). Бесплатный 5-дневный период через ZCode (https://zcode.z.ai/en/docs/welcome). Оплата — зарубежной картой или криптой.

DeepSeek V4 Pro — api.deepseek.com доступен без VPN. Оплата — через обходы.

Оплата

Российские Visa/Mastercard не работают ни в одном из зарубежных AI-сервисов. Варианты:
Локальные модели — бесплатно, без оплаты.
UnionPay — подходит для части сервисов, зависит от банка.
Посредники — AITUNNEL (https://aitunnel.ru/tools/cline) принимает рубли.
Криптовалюта — для DeepSeek API и части сервисов.

Разбор оплаты AI-сервисов из РФ — на Habr (https://habr.com/ru/companies/tehrevizor/articles/1015580/) и обзор Gemini в России (https://aimarketcap.ru/gemini-v-rossii/). Подробных инструкций по оплате QwenCloud и DeepSeek API из РФ в рунете мало — тема не освещена.

Честные ограничения

  • Скорость на локальном железе. Qwen 3.8 27B выдаёт 15–30 ток/с на DGX Spark и M5 Max — это приемлемо, но медленнее облачных API. Если скорость критична — Luna (100+ ток/с) или GLM-5.3 (93 ток/с) через API.
  • Маленькая модель — маленький контекст агентного цикла. Claude Code требует минимум 35K токенов контекста (иначе ошибка). На 4 ГБ VRAM потолок — ~32K. Модель, которая не тянет контекст, выглядит глупой, хотя проблема в настройке.
  • Reasoning по умолчанию. Qwen 3.8 27B стартует с xhigh reasoning, тратя десятки тысяч токенов на простые задачи. Отключите reasoning или поставьте low — и модель станет быстрее в 10 раз без потери качества на рутине.
  • Маленькие модели путают инструменты. При большом числе MCP-тулзов (20+) маленькая модель начинает слать запросы не туда. Начните с 3–5 инструментов.
  • Качество ниже флагманов. Intelligence Index 52 (Luna, Qwen 3.8 27B) против 63 (Opus 5) — разница ощутима на сложных задачах. Для рутины — незаметна.
  • Цены нестабильны. OpenAI снижал Luna через три недели после релиза. GLM Coding Plan даёт скидки через годовую подписку. Перед крупными тратами проверяйте актуальный прайс.

Вывод

Маленькие модели — это не компромисс, а правильный инструмент для правильных задач. 90% работы разработчика — «токен-спитер»: рутина, правки, генерация, исследования. Для этого Luna (~100 ток/с, копейки), Qwen 3.8 27B (бесплатно, на ноутбуке) и GLM-5.3 (быстро, дёшево, open-weight) подходят лучше, чем флагманы за $25–30 за выходной миллион токенов.

Флагманы (Opus 5, Sol) нужны для «IQ 180» задач — сложных архитектурных решений, длинных автономных сессий, критически важных миграций. Но и там имеет смысл чередовать: рутина на маленькой модели, критические шаги — на флагмане.

Для России локальные модели — это ещё и единственный способ работать с ИИ без VPN и зарубежных карт. Qwen 3.8 27B через Ollama — бесплатный, приватный, офлайн-вариант, который закрывает большинство повседневных задач.

Дальше по теме: модели для кодинга 2026: сравнение, локальные нейросети для кодинга: Qwen3-Coder через Ollama, лучший ИИ для кодинга: сравнение, что такое агентный кодинг.

Насколько публикация полезна?

Нажмите на звезду, чтобы оценить!

Средняя оценка / 5. Количество оценок:

Оценок пока нет. Поставьте оценку первым.

Добавить комментарий

Adblock
detector