Перейти к содержимому

Локальный или облачный кодинг-агент: где запускать в 2026

«Claude Code или Codex?» — вопрос, который задают чаще, чем «где это должно крутиться». Между тем решение о запуске меняет три вещи сразу: уходит ли ваш код на чужой сервер, сколько вы платите и что вы можете сделать без интернета. По Wordstat «claude code локально» — 282 показа в базе и 32 в точной форме, «локальные модели 2026» — 155 при нуле в точной; тема ещё не разобрана в рунете системно. Ниже — три схемы запуска, что реально тянет железо и как считать стоимость, не обманывая себя.

Три схемы, а не две

Выбор не сводится к «облако против локально». Есть промежуточный вариант, который в 2026-м выбирает большинство команд:

Схема Приватность Качество Деньги Кому подходит
Облачный агент низкая: код уходит вендору максимум (frontier-модель) подписка или оплата за токены команда, сложные задачи, есть валюта для оплаты
Локальная модель + CLI максимум: код не покидает машину заметно ниже frontier один раз железо + электричество приватный код, офлайн, ограниченный бюджет
Гибрид настраиваемая максимум там, где нужно железо + токены большинство команд
Схема: три архитектуры запуска кодинг-агента
Три схемы запуска и их компромиссы: приватность, качество, деньги, требования к железу и доступность из РФ.

Что решает приватность на практике

Локальный запуск — это не про политику, а про физику: если модель работает на вашей машине, код физически не может утечь к вендору. Но важна деталь: «локально» относится к модели, а не к агенту. CLI-агент всё равно может ходить в сеть за погодой, документацией или MCP-сервером, если вы это разрешили. Проверьте, что именно уходит наружу, прежде чем считать схему приватной.

Второй нюанс — где вы хотите выполнять агента, а не где его модель. Dan Hopwood в разборе «Running coding agents on a €30 Linux box» описывает третий путь: агенты вообще не на ноутбуке и не в облаке вендора, а на дешёвом постоянно включённом Linux-сервере (Netcup, 12 ядер, 32 ГБ, около €30 в месяц). Логика простая: сессия агента не должна умирать от закрытой крышки ноутбука.

Пост Dan Hopwood о запуске кодинг-агентов на Linux-коробке за €30
Схема автора: ноутбук и телефон — просто окна в постоянно работающий Linux-сервер. Источник: danhopwood.com, 08.09.2026.

Его аргумент против облачных продуктов интересен тем, что он измерен, а не заявлен: по его наблюдению, каждый hosted-продукт (Claude Code в вебе, Codex cloud, Jules) привязывает сессию к одному GitHub-репозиторию и одному вендору. Для одного репозитория это нормально, но его работа требует 13 репозиториев, которые читают друг друга, и 16 MCP-серверов — ни один продукт такого не видит. Отсюда правило размеров, которое он вывел: одна сессия Claude Code — базовая нагрузка, каждая дополнительная добавляет около 200 МБ, плюс память под её MCP-серверы. 16 ГБ хватает, 32 ГБ — с запасом под браузер.

Сколько тянет железо

Главное ограничение локального запуска — VRAM. Если модель не помещается в видеопамять целиком, часть слоёв уходит в системную RAM и скорость падает в разы. Ориентиры по объёму из официальных карточек моделей на ollama.com и обзоров железа:

VRAM Что комфортно Пример модели (Q4)
8 ГБ 7-8B qwen2.5-coder:7b (4,7 ГБ)
16 ГБ 7-14B комфортно, 24-32B впритык qwen2.5-coder:14b (9,0 ГБ)
32 ГБ 27-32B + большой контекст qwen2.5-coder:32b (20 ГБ)
250 ГБ класс 480B (серверное железо) qwen3-coder:480b (290 ГБ)
Схема: таблица требований к VRAM для локальных моделей
Ориентиры по VRAM для квантов Q4 и правила выбора модели под своё железо. Источники: ollama.com/library, обзоры на Habr.

Практические правила, которые стоит держать в голове:

  • Счёт на глаз: VRAM ≈ параметры (в млрд) × биты квантизации ÷ 8 + KV-кэш. Под длинный контекст KV-кэш занимает ещё 1–2 ГБ сверху, и это часто забывают.
  • Оставляйте запас. Рекомендация из обзоров железа — 2 ГБ свободной VRAM. При нехватке оффлоад на CPU обваливает скорость до однозначных токенов в секунду.
  • Длинный контекст дорог. На GTX 1080 Ti prefill на 125 тысяч токенов занимал около 6 минут — то есть «залил весь репозиторий в контекст» на слабом железе превращается в ожидание.

Официальная карточка qwen3-coder:30b в Ollama подтверждает ограничение MoE-моделей: 30B всего, но лишь 3,3B активных параметров — она быстрая на потребительских GPU, тогда как 480B-версия требует «минимум 250 ГБ памяти».

Гибрид на практике

Самый рабочий вариант для большинства — не выбирать, а развести задачи. Логика такая:

  1. Локальная модель — для рутины: автодополнение, переименования, разбор незнакомого файла, генерация теста по существующей функции. Здесь приватность не страдает, а качество модели 7–14B достаточно.
  2. Облако — для сложного: архитектурные решения, незнакомая кодовая база, задачи, где важна frontier-модель. Сюда уходит только то, что не жалко отправить наружу.
  3. Код остаётся локально через git: облачный агент получает конкретную задачу, а не весь репозиторий.

Типичная настройка локального стека через Ollama и запуск CLI-агента на нём:

# 1) ставим Ollama и тянем coder-модель под свой VRAM
ollama pull qwen2.5-coder:14b

# 2) проверяем, что модель отвечает и видит контекст
ollama run qwen2.5-coder:14b "напиши функцию на Python, которая проверяет ISBN-13"

# 3) локальный OpenAI-совместимый API живёт на порту 11434
#    (его же подхватывают LM Studio на 1234 и большинство CLI-агентов)
export OPENAI_BASE_URL="http://localhost:11434/v1"

# 4) агент с локальной моделью: все правки — на вашей машине
ollama launch opencode --model qwen2.5-coder:14b
Страница модели на Ollama: семейство qwen2.5-coder и запуск с агентами
Официальная страница модели: размеры от 0.5b до 32b и готовые команды запуска для Claude Code, OpenCode и других агентов. Источник: ollama.com/library/qwen2.5-coder.

LM Studio решает ту же задачу через графический интерфейс: скачал модель, поднял локальный сервер, подключил к нему редактор. Для тех, кто не хочет возиться с терминалом, этот путь короче.

Сайт LM Studio: локальный агент для открытых моделей
LM Studio продвигает локальный запуск агентов: модель работает на вашей машине, наружу код не уходит. Источник: lmstudio.ai.

Как считать стоимость

Здесь важно не путать. Облако — это переменные расходы: подписка Claude Pro стоит $17–20 в месяц при оплате за год, Max — от $100, а API-тарификация считается за токены. Локальный запуск — расходы постоянные: железо и электричество.

Считаем честно, на примере. Допущения (не факт, а расчёт):

  • готовая сборка с GPU на 16 ГБ — возьмём условные 150 000 ₽ в текущих ценах;
  • срок службы — 4 года, то есть ~3 125 ₽/мес;
  • потребление под нагрузкой — 250 Вт средних, 8 часов в день, тариф 6 ₽/кВт·ч → ~360 ₽/мес.

Итого локальный запуск обходится roughly 3 500 ₽/мес — без подписок, без валюты, без привязки к чужой карте. Для сравнения, облачная подписка Max — от $100 в месяц, что по курсу кратно больше, плюс регулярные сложности с оплатой из РФ. Важная оговорка: локальная модель класса 14B не равна frontier-модели по качеству, поэтому сравнивать «в лоб» цены нельзя — сравнивать нужно стоимость на решённую задачу приемлемого качества.

Российские реалии

Для многих локальный запуск — не про технику, а про независимость от зарубежных подписок и карт:

  • Железо. GPU в РФ дороже и с ограничениями поставок. Для моделей до 14B часто достаточно уже имеющегося игрового ПК или Mac — тогда отдельные затраты вообще не возникают. Аккуратнее с б/у картами из майнинга: риск отвала памяти.
  • Софт. Ollama, LM Studio, llama.cpp и сами веса моделей бесплатны и ставятся без VPN — оплачивать нечего.
  • Оплата облака. Если облако всё же нужно, российские Visa и Mastercard не проходят: Stripe блокирует BIN, а дальше антифрод по гео-IP и требования 3D Secure. Рабочие варианты — посредники и зарубежные виртуальные карты, их сравнение есть в разборе «пять рабочих карт для оплаты подписок» на Klerk.
  • Русскоязычные материалы. Полезны обзор железа под локальный ИИ на Habr — «Сколько нужно VRAM», практические заметки «Локальные LLM на слабом железе» и разбор подбора моделей «Локальные LLM: обзор и тестирование». С vc.ru пригодится гайд по LM Studio — там же отмечено, что при полностью локальном запуске подписка не нужна вовсе.

Ограничения

  • Локальные модели не равны frontier. 7–32B модели закрывают автодополнение, рефакторинг и типовые задачи, но в «придумай неочевидное решение» заметно слабее. Если задача требует максимума качества, честнее признать, что облако выигрывает.
  • VRAM не резиновая. Как только модель не влезает в память, скорость падает в разы, и работа локально становится больнее, чем платить за API.
  • Агент не равно модель. Локальная модель при агенте с доступом в сеть не означает приватности: MCP-серверы и веб-поиск по-прежнему ходят наружу.
  • Обслуживание — ваше. Обновления, драйверы, квантизация, память под контекст: облако не просит чинить CUDA после апдейта.
  • Расчёт стоимости приблизителен. Цены на железо и электричество меняются, срок службы у всех разный — цифра выше показывает метод, а не точный результат.
  • Размеры моделей актуальны на момент публикации. Ollama обновляет свои сборки, и «влезает/не влезает» может меняться от версии к версии.

Вывод

Выбор «локально или облако» — это ответ на два вопроса: готовы ли вы отправлять код наружу и готовы ли платить за это подпиской. Хотите приватность и не хотите зависеть от зарубежных карт — поднимайте Ollama или LM Studio и берите модель под свой VRAM, начиная с честной оценки доступной памяти. Нужен максимум качества — держите облако для сложного, а рутину отдайте локальной модели. Гибрид выигрывает у крайностей почти всегда: код остаётся у вас, а frontier-модель работает там, где она реально нужна.

Связанные статьи

Читайте также: Кейс: кодинг-агенты на Linux-коробке за €30: что реально тянет · Сколько стоит ИИ-агент в 2026: цены, подписки и оплата из России

Насколько публикация полезна?

Нажмите на звезду, чтобы оценить!

Средняя оценка / 5. Количество оценок:

Оценок пока нет. Поставьте оценку первым.

Добавить комментарий

Adblock
detector