Локальная нейросеть для кодинга — модель, которая живёт на вашей машине: без VPN и зарубежных карт. Разбираем Qwen3-Coder через Ollama и подключение к агентам — Claude Code, Aider, OpenCode.
В этой статье разбираем связку, которая на момент публикации (август 2026) считается одной из самых рабочих: модель Qwen3-Coder из семейства Qwen от Alibaba и рантайм Ollama, который её скачивает и держит. Плюс — три реальных кейса людей, которые уже гоняют эту связку с агентами: от ноутбука с видеокартой на 4 ГБ до пары RTX 3090.
Что такое Qwen3-Coder
Qwen3-Coder — это линейка моделей Alibaba, заточенных под агентский кодинг: чтение репозитория, работу с инструментами, многошаговые задачи. Старшая версия — Qwen3-Coder-480B-A35B-Instruct: 480 млрд параметров, из которых на каждом шаге активны только 35 (архитектура Mixture of Experts, MoE). Контекст — 256K токенов «из коробки», до 1M с экстраполяцией. Модель обучали на 7,5 трлн токенов (70% — код) и прогоняли через долгосрочное RL с инструментами в 20 000 параллельных окружений, поэтому в бенчмарках типа SWE-Bench Verified она показывает лучшие результаты среди открытых моделей (блог Qwen, июль 2025).

Нам интереснее младшая версия — Qwen3-Coder-30B-A3B: 30 млрд параметров, активны 3,3 млрд. Это означает, что скорость генерации как у маленькой модели, а качество — почти как у большой. Именно она доступна в Ollama как qwen3-coder:30b (19 ГБ на диске, контекст 256K). Для домашнего железа это разумный максимум: старшая 480B тянет 290 ГБ и требует минимум 250 ГБ памяти (страница модели в Ollama).

qwen3-coder:30b — 19 ГБ и 256K контекста, qwen3-coder:480b — 290 ГБ. Здесь же видно, что Ollama умеет подключать модель к Claude Code и OpenCode одной командой. Источник: ollama.com/library/qwen3-coder.Зачем тут Ollama
Ollama — это рантайм с открытым исходным кодом (лицензия MIT): скачивает модель из своего реестра, держит её в памяти и отдаёт по локальному API. Установка — одна команда, ключи не нужны, модели после скачивания работают офлайн.
Но для агентского кодинга важнее другое: Ollama умеет подключать вашу локальную модель к агентам одной командой — ollama launch. Для Claude Code, OpenCode, Codex и других. Агент при этом думает, что общается с облачным API, а на самом деле модель крутится у вас на машине.

ollama launch claude подключает Claude Code к локальной модели через Anthropic-совместимый API. Источник: docs.ollama.com/integrations/claude-code.Схема связки:

Кейс 1: «Хочу такой же опыт, как с Claude Code, но на локальной модели»
Апрель 2026 года, сабреддит r/LocalLLaMA. Пользователь alfons_fhl описывает ровно ту ситуацию, из-за которой люди приходят к локальным моделям:
«Я пользуюсь Claude Code CLI с Opus 4.6 и кучей MCP — и это реально затягивает. Просто говоришь, что построить, и он всё делает: читает кодовую базу, пишет код, запускает команды, сам чинит свои ошибки. Чистый вайбкодинг. Теперь я хочу то же самое, но с Qwen3-Coder-next, запущенным локально. Не автодополнение в стиле Copilot, а полноценный автономный агентный опыт». (r/LocalLLaMA, апрель 2026)
В комментариях — практика, которая пригодится всем. Три вывода.
Вывод 1: связка «Claude Code + локальная модель» работает, но с оговорками. Пользователь canred проверил её на Qwen3-Coder и Gemma:
«Я пробовал [Claude Code] с qwen3-coder и gemma4 e4b. Qwen задачу выполнил, gemma — нет. Оценка опыта в обоих случаях: держите острые предметы подальше. Как proof of concept работает, про продакшен забудьте».
И там же — ключевое техническое ограничение:
«Нужна модель, поддерживающая минимум 35K контекста. Claude Code тащит очень много контекста, и если модель его не тянет, будет ошибка».
Вывод 2: редирект делается через переменные окружения. PieArtistic9707 показывает, как перенаправить Claude CLI на локальный сервер: задаётся ANTHROPIC_BASE_URL на ваш сервер и фиктивный токен, а имя модели подставляется в ANTHROPIC_DEFAULT_SONNET_MODEL (в его случае — GGUF-файл Wrench-35B-A3B). В доки Ollama вынесен тот же принцип: ANTHROPIC_BASE_URL=http://localhost:11434 + ANTHROPIC_AUTH_TOKEN=ollama.
Вывод 3: OpenCode — лучший «переводчик» вызовов инструментов. Ещё один участник:
«Я в основном на OpenCode. Раньше был Roo и Cline в VS Code. Вызов инструментов у OpenCode пока работает лучше всего в моих тестах». (там же)
То есть связка реально работает, но первый блин комом: у локальных моделей меньше контекста, чем у флагманов, и агентный цикл с большими промптами — самое слабое место.
Кейс 2: агентский воркспейс на видеокарте с 4 ГБ памяти
Самый показательный свежий кейс (июль 2026) — автор maikerukonare собрал полноценный агентский воркспейс на RTX 3050 Ti Laptop с 4 ГБ VRAM (i7-12700H, 32 ГБ RAM, Ubuntu): чат, вызовы инструментов, RAG по своим документам, артефакты — всё на локальных Qwen через встроенный Ollama, без единого облачного ключа (r/LocalLLaMA, 25 июля 2026).
Замеры скорости (Q4_K_M, тёплый старт, медиана из трёх):
| Модель | Скорость | Память |
|---|---|---|
| qwen3.5:0.8b | 122 ток/с | ~1,4 ГБ, целиком в GPU |
| qwen3.5:2b-q4_K_M | 96 ток/с | ~2,4 ГБ, целиком в GPU |
| qwen3.5:4b | 25 ток/с | ~3,4 ГБ, треть утекает в CPU |
| qwen3.5:9b | 8,6 ток/с | в основном CPU, нужно ~8 ГБ |
Вывод автора: слабое железо выживает только за счёт MoE-моделей. В комментариях ему подсказали попробовать Qwen3.6-35B-A3B (та же схема «35B всего, 3B активны»), и он удивился:
«Я вечером поэкспериментировал с Qwen3.6 в MoE-режиме и реально получил около 22 ток/с — даже больше твоей оценки в 15. Всё ещё сильно медленнее почти 100 ток/с маленьких плотных моделей, но заметно умнее. Отлично справился со сложными артефактами на 400+ строк». (там же)
И второе наблюдение — про вызовы инструментов:
«Включаешь много инструментов — маленькие модели начинают их путать. Один раз моя 7B отправила „создай HTML-артефакт…“ в генератор картинок и нарисовала интерфейс». (там же)
Практические правила из этого кейса: на слабом железе включайте меньше инструментов, контекст ограничивайте (32K — потолок для 4 ГБ), и держите отдельную маленькую кодинг-модель для задач «написать файл целиком» — общая модель на таких размерах пишет недоделанный HTML.
Кейс 3: что выбрать под 2× RTX 3090 (48 ГБ)
Свежий тред «Что бы вы запустили на двух RTX 3090?» (июль 2026) — про выбор модели под конкретное железо (r/LocalLLaMA, 25 июля 2026). Пользователь купил две 3090 по $1000 и спрашивает: какую модель, какую квантизацию, какой движок.
Топовый ответ про кодинг:
«Для 48 ГБ два выбора прямо сейчас: Qwen3.6-27B для общего пользования (Q8 — около 30 ГБ, остаётся место под контекст) и qwen3-coder-next 80B-A3B в 4-бит для агентского кодинга — примерно 40 ГБ, поэтому держите длину контекста умеренной». (там же)
Плюс дельные замечания по железу:
- 3090 — это Ampere, у неё нет FP8-тензорных ядер: формат FP8 в vLLM просто деквантизуется без выигрыша в скорости — берите AWQ/GPTQ INT4 или GGUF.
- Движок: vLLM с tensor parallelism для «рабочей лошадки», llama.cpp — для всего нового, потому что GGUF появляется в первый же день.
- Не ждите замены облачным флагманам: «считайте локальную модель офлайн-запасным вариантом и всегда включённым автодополнением, а не заменой».
В этом же треде прогнали TP vs PP на Qwen3.6-27B Q8 и выяснили, что на PCIe 4.0 tensor parallelism даёт ~15% к декодингу, но ~31% штрафа к чтению промпта (prefill): для больших кодовых баз это невыгодно. Если коротко — на двух 3090 без NVLink сначала тестируйте оба режима.
Как запустить: пошагово
Собираем всё из кейсов и официальных доков.
Шаг 1. Установить Ollama и скачать модель
# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh
# Windows (PowerShell)
irm https://ollama.com/install.ps1 | iex
Затем скачиваем кодинг-модель (на момент публикации — Qwen3-Coder 30B, 19 ГБ):
ollama pull qwen3-coder:30b
Проверить, что модель на месте: ollama ls.
Шаг 2. Чат напрямую (для проверки)
ollama run qwen3-coder:30b
>>> Напиши функцию на Python, которая читает CSV и считает сумму по колонке
Модель отвечает в терминале, без интернета. Если скорость не устраивает — смотрите замеры из кейса 2: на 4 ГБ VRAM 35B-A3B даёт ~22 ток/с, на M4 Pro (48 ГБ) — порядка 150 ток/с (замеры с Хабра).
Шаг 3. Подключить агента
Claude Code — одной командой (нужна Ollama 0.15+):
ollama launch claude --model qwen3-coder:30b
Ollama сама настроит Anthropic-совместимый API на localhost:11434 и запустит Claude Code в текущем терминале. Альтернатива — руками:
export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3-coder:30b
OpenCode — так же:
ollama launch opencode --model qwen3-coder:30b
Aider — классический вариант (подробно разобран в нашей статье про Aider и локальные модели):
export OLLAMA_API_BASE=http://127.0.0.1:11434
cd /ваш/проект
aider --model ollama_chat/qwen3-coder:30b
Префикс ollama_chat/ рекомендован документацией Aider. И не забудьте поднять контекст сервера, иначе Ollama молча обрежет половину диалога:
OLLAMA_CONTEXT_LENGTH=32768 ollama serve
Про выбор размера контекста — отдельно: у Claude Code минимум 35K (иначе ошибка, кейс 1), доки Ollama советуют 64K+ для кодовых репозиториев. На 4 ГБ VRAM потолок — около 32K. На Mac с 48 ГБ и выше берите 64K смело.

Российские реалии
Тут локальные модели выигрывают у облачных безоговорочно — проверено практикой:
- Ollama доступна из РФ без VPN. Установщик, сайт и реестр моделей на момент апреля 2026 года не блокировались; если корпоративная сеть фильтрует — модели тянутся с Hugging Face в формате GGUF и подключаются через
ollama createс собственным Modelfile (Tproger, апрель 2026). - Оплата не нужна вообще. Ни подписок, ни карт, ни посредников: всё бесплатно (MIT), токены не списываются. Для РФ это закрывает главную боль — невозможность платить за зарубежные API.
- Код не покидает машину. Для коммерческих проектов и NDA это решающий аргумент, и он же снимает вопросы про то, куда утекают промпты.
- Свежий русскоязычный опыт есть — и он совпадает с англоязычным: разбор на Хабре (апрель 2026) прогнал Qwen3-Coder-30B-A3B через Kilo Code, Aider и OpenCode на MacBook M4 Pro и пришёл к выводу, что для разовых задач локальные модели годятся, для постоянной агентской работы — пока тяжело (Habr, апрель 2026). Плюс общий обзор локальных LLM на Хабре (сентябрь 2025) и опыт вайбкодинга на бесплатных моделях без VPN (spryt.ru, июль 2026).
Советы по итогам кейсов
- Берите MoE-модель с пометкой Coder. Qwen3-Coder-30B-A3B — оптимум для одной видеокарты: скорость маленькой модели, качество большой. Проверено на 4 ГБ VRAM и на 48 ГБ.
- Контекст решает больше скорости. Claude Code требует минимум 35K, доки Ollama советуют 64K+. Модель, которая «не тянет контекст», будет падать с ошибкой или молча резать диалог — и выглядеть тупой, хотя виноват не интеллект, а настройка.
- Меньше инструментов на слабом железе. Включаете 20 тулзов — маленькая модель начинает путать, куда слать запрос. Начните с 3–5 и добавляйте по мере сил.
- Поднимайте контекст сервера явно.
OLLAMA_CONTEXT_LENGTH=32768 ollama serve— иначе Ollama молча отбрасывает всё, что не влезло в дефолтные 2K. - Держите вторую маленькую кодинг-модель для задач «сгенерируй файл целиком»: на малых размерах общие модели пишут недоделанный код, а кодинг-тюнинг спасает.
- Ожидания — как у офлайн-запаса, а не замены Claude/GPT. Все три кейса сходятся: локальная модель — это бесплатный, приватный, офлайн-вариант для рутины и NDA-кода, а не замена флагманам на сложной архитектуре.
Честные ограничения
- Качество ниже флагманов. Прямая цитата из кейса 1: «как proof of concept работает, про продакшен забудьте». На сложных многофайловых задачах локальная 30B уступает облачным топам.
- Агентский режим — самое слабое место. В замерах с Хабра (M4 Pro, 48 ГБ) локальные модели в чате работали приемлемо, а в режиме агента время росло с минут до десятков минут, ноутбук грелся до ~100 °C, а у Claude Code с qwen3-coder-30b на этапе ревью модель крашилась с ошибкой стриминга (Habr, апрель 2026).
- Нужно железо. 19 ГБ под модель — это только веса; плюс контекст, плюс сама система. Комфортный минимум — 24 ГБ RAM (или VRAM), а для 480B — 250 ГБ.
- Версии меняются быстро. Размеры и команды актуальны на август 2026 года. Уже сейчас в Ollama есть и
qwen3-coder:480b-cloud, и свежие модели линейки (Qwen3-Coder-next, Qwen3.6-35B-A3B) — проверяйтеollama lsи библиотеку моделей перед покупкой железа.
Вывод
Qwen3-Coder через Ollama — самый короткий путь к локальному ИИ-кодингу: одна команда установки, одна команда скачивания модели, одна команда подключения агента. Кейсы людей подтверждают: на 4 ГБ VRAM это работает (медленно, но работает), на 48 ГБ — вполне прилично, а для России это ещё и единственный способ получить ИИ-кодинг без VPN, зарубежных карт и утечки кода. Ожидания при этом держите честными: локальная модель закрывает рутину и приватные задачи, а флагманам пока проигрывает на сложной архитектуре.
Дальше по теме: что такое агентный кодинг, Aider и локальные модели, как установить OpenCode, как установить Claude Code.