Aider и локальные модели: как программировать с ИИ без облака

Aider — терминальный AI-«парный программист» с открытым исходным кодом: вы работаете в своём редакторе, а Aider в соседнем терминале обсуждает с вами изменения и сам правит файлы и делает git-коммиты. Его главная особенность для нашего разговора — он умеет работать не только с облачными моделями (Claude, GPT, DeepSeek), но и с локальными — через Ollama, LM Studio или llama.cpp.

Локальный вариант стоит того, чтобы о нём рассказать отдельно: код не покидает машину, токены бесплатны, интернет и VPN не нужны — а для России это ещё и отсутствие проблем с оплатой зарубежных сервисов. Честно и сразу: локальные модели заметно слабее флагманских облачных. Но, как показывают свежие кейсы ниже, с правильной настройкой они справляются с реальной работой — и с каждым месяцем всё лучше.

Материал собран из реального опыта людей (реддит-треды и гайд-кейсы весны–лета 2026) плюс официальная документация Aider для точных команд.

Почему локально — и когда не стоит

Локально Облачные модели
Приватность код не уходит с машины код отправляется провайдеру
Цена бесплатно подписка или оплата токенов
Интернет/VPN не нужен нужен (и в РФ часто VPN)
Оплата из РФ не нужна карты РФ не проходят, нужны обходы
Качество на сложных задачах ниже топ-уровень
Железо видеокарта с 12–24 ГБ VRAM не нужно

Локальный ИИ-кодинг — разумный выбор, когда код конфиденциальный, когда хочется нулевой цены за токены или когда в облако попасть сложно. Неразумный — когда нужен максимум качества на сложных архитектурных задачах: тут локальные модели пока проигрывают.

Что понадобится

  • Видеокарта с 12–24 ГБ видеопамяти. Ориентиры из реальных кейсов: RX 9070 XT 16 ГБ и RTX 5090 (Linux, Ollama + Aider), RTX 12–24 ГБ с разными квантизациями. Без GPU тоже можно (модель поедет на CPU, но медленно — 1–3 токена/с против 30–40).

Сноска про цены в России (ориентировочно, август 2026 — цифры плавают, перед покупкой сверяйтесь на e-katalog или в DNS): новая RX 9070 XT 16 ГБ — порядка 65–80 тыс. ₽; RTX 5070 Ti 16 ГБ — 95–115 тыс. ₽; RTX 5090 — от 300 тыс. ₽. Бюджетный путь — б/у RTX 3090 с 24 ГБ видеопамяти на вторичке (~70–90 тыс. ₽): в 24 ГБ влезают и контекст, и квантизация Q6+, а это главное для агентской работы.
Ollama или LM Studio — рантайм, который держит модель и отдаёт её по локальному API.
Aider — сам «парный программист».
Кодинг-модель — например, Qwen3.6 35B (о ней — все кейсы ниже; есть и другие свежие кодинг-модели 2026 года).

Установка и настройка: коротко и по докам

Установка Aider:

python -m pip install aider-install
aider-install

Настройка Ollama (пример с Qwen3.6):

export OLLAMA_API_BASE=http://127.0.0.1:11434
ollama pull qwen3.6:35b
OLLAMA_CONTEXT_LENGTH=8192 ollama serve

Запуск Aider с локальной моделью (префикс ollama_chat/ рекомендован документацией):

cd /ваш/проект
aider --model ollama_chat/qwen3.6:35b

Для LM Studio всё то же самое, только сервер поднимается в самой программе (localhost:1234/v1) и префикс модели — lmstudio/. Подробные команды — в документации Aider по Ollama и по LM Studio.

Локальные модели подключают и другие агенты

Aider — не единственный вариант, и способность работать с локальными моделями есть у большинства свежих агентов кодинга:

  • OpenCode — из коробки подключает локальные модели через Ollama и любые OpenAI-совместимые серверы (список провайдеров — в документации); бесплатен и работает в РФ без VPN (см. гайд по установке).
  • Cline — расширение для VS Code, умеет Ollama и LM Studio.
  • Continue.dev — open-source расширение, заточенное под локальные модели с самого начала.
  • Cursor и Windsurf — подключают локальные модели через кастомный OpenAI-совместимый endpoint, но по удобству уступают перечисленным выше.

Разница обычно не в «умеет/не умеет», а в том, как агент собирает контекст и ремонтирует диффы — то есть в обвязке, о которой речь ниже.

Схема связки Aider с локальной моделью
Схема: Aider обращается к Ollama или LM Studio по локальному API, модель работает на GPU — в облако ничего не уходит.

Кейс 1: «Обвязка важнее модели» — локальная связка почти догнала флагман

В апреле 2026 разработчик Итай Инбар задался вопросом не «побьёт ли открытая модель GPT-5.4 Codex», а другим: может ли комбинация локальных моделей + обвязки + ремонтных циклов + маршрутизации на домашнем железе вплотную приблизиться к флагманским кодинг-моделям на его реальной работе. Ответ, по его словам, — «да, на удивление» (реддит-тред, апрель 2026, код little-coder).

Он взял 10 реальных задач из своего Go-репозитория (изменения CLI, контроль зависимостей, версии, абстракции времени, таксономии ошибок) и прогнал на них разные связки:

Конфигурация Задач сдано тесты
GPT-5.4 Codex (best-of) 10/10
Маршрутизированный локальный процесс 9/10
Qwen3.6 + little-coder 8/10
Qwen3.0 + little-coder 5/10
Исходная «самодельная» обвязка 3/10

Вывод, который стоит вынести из кейса: обвязка решает не меньше модели. Одна и та же Qwen3.6 поднималась с 3/10 до 8/10 только за счёт правильного скаффолда (как Aider собирает контекст, как ремонтируются сломанные диффы), а маршрутизация между локальной и облачной моделями довела результат до 9/10.

Справедливости ради: в комментариях к треду автора за использование Ollama в бенчмарках критиковали («от этого бенчмарка плачет младенец Иисус») — мол, результаты зависят от рантайма. Вывод для читателя: цифры — ориентир, а не истина в последней инстанции.

Кейс 2: квантизация — где реально ломается агентская работа

Второй тред (июнь 2026) — из повседневности: человек гоняет Ollama + Aider на Linux с RX 9070 XT (16 ГБ VRAM, 32 ГБ RAM) и выбирает квантизацию для Qwen3.6 35B-A3B MoE: IQ3_M влезает в 16 ГБ целиком, IQ4_NL (~20 ГБ) проливает 3–4 ГБ в оперативку.

Практический опыт из комментариев:

  • на 12 ГБ VRAM с проливом в RAM — q5 даёт ~30 токенов/с;
  • на 24 ГБ с проливом — q8: ~40 токенов/с в начале контекста и падение до ~10 к концу;
  • показательное: «у меня модель работала только начиная с Q6 и без квантования KV-кэша — ниже она зацикливалась и переставала вызывать инструменты после ~50k токенов, то есть через 3–5 сообщений агентской работы. Одноразовые задачи при этом выполняла»;
  • другой участник: «Q4_NL отлично работает под Claude Code без квантования KV-кэша и с контекстом ~200k, но параметры вроде top_k/top_p надо выставлять вручную».

Практический вывод: для «одноразовых» задач (сгенерировать функцию) хватает и низкой квантизации. Для агентской работы (Aider, Claude Code — многоходовка с вызовами инструментов) важнее стабильность: качественная квантизация (Q5/Q6+), целый KV-кэш и влезающий в VRAM контекст. Скорость генерации тут вторична — в том же треде люди спокойно работали на 10–30 токенах/с.

Кейс 3: тихий баг LM Studio — диффы обрезаются молча

Гайд-кейс Джована Чана (июнь 2026, dev.to, aicoderscope.com) про Aider + LM Studio подсвечивает грабли, о которых не пишут в доках: у локальных моделей есть потолок выходных токенов, и когда Aider просит большой дифф, сервер LM Studio молча обрезает его посреди функции — без единой ошибки. Aider применяет обрезанный дифф, и код ломается непонятно как.

Лечится явным переопределением лимита выходных токенов для модели в .aider.model.settings.yml. Второй подводный камень из того же текста — «модель-ловушка»: при подключении лучше указывать не полный GGUF-ID, а короткое имя, иначе модель может не определиться. Плюс приятная деталь: LM Studio в окне Discover сразу показывает VRAM-оценку каждой квантизации («Q4_K_M — 20.1 ГБ») — удобно новичку.

Собственно, поэтому автор и рекомендует LM Studio вместо Ollama в двух случаях: Windows (автоподбор CUDA экономит минут двадцать настройки) и «десктоп-сервер для ноутбука» через LM Link. На macOS и Linux проще остаться на Ollama — она проще.

Советы по итогам кейсов

  • Берите кодинг-модель, а не универсальную, и смотрите на VRAM-оценку квантизации — не на «самую умную».
  • Для агентской работы жертвуйте скоростью ради стабильности: квантизация Q5/Q6+, без квантования KV-кэша, контекст, влезающий в видеопамять.
  • Дробите задачи: локальные контекстные окна маленькие, длинные сессии деградируют.
  • Обвязка решает: та же модель с правильным скаффолдом (как Aider) выдаёт кратно лучший результат.
  • Не списывайте локальный ИИ со счетов, но и не переоценивайте: для рутины и приватного кода — отлично; для сложной архитектуры — облачные модели, и это нормально.

Итог

Локальный ИИ-кодинг — уже не экзотика, а рабочий сценарий на домашнем железе: бесплатно, приватно, без интернета, VPN и зарубежных карт — для российского пользователя это отдельный плюс. Флагманов он не заменяет, но с правильной моделью, квантизацией и обвязкой закрывает заметную долю реальной работы.

Честное примечание: свежих русскоязычных разборов связки Aider с локальными моделями почти нет (тема в рунете не освещена), поэтому материал опирается на англоязычные кейсы — ссылки в тексте.

Серия по агентскому кодингу: начало — «Что такое агентный кодинг», бесплатный вход в тему — «Как установить OpenCode».

Насколько публикация полезна?

Нажмите на звезду, чтобы оценить!

Средняя оценка / 5. Количество оценок:

Оценок пока нет. Поставьте оценку первым.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *