Перейти к содержимому

Локальные нейросети для кодинга: запускаем Qwen3-Coder через Ollama

Локальная нейросеть для кодинга — модель, которая живёт на вашей машине: без VPN и зарубежных карт. Разбираем Qwen3-Coder через Ollama и подключение к агентам — Claude Code, Aider, OpenCode.

В этой статье разбираем связку, которая на момент публикации (август 2026) считается одной из самых рабочих: модель Qwen3-Coder из семейства Qwen от Alibaba и рантайм Ollama, который её скачивает и держит. Плюс — три реальных кейса людей, которые уже гоняют эту связку с агентами: от ноутбука с видеокартой на 4 ГБ до пары RTX 3090.

Что такое Qwen3-Coder

Qwen3-Coder — это линейка моделей Alibaba, заточенных под агентский кодинг: чтение репозитория, работу с инструментами, многошаговые задачи. Старшая версия — Qwen3-Coder-480B-A35B-Instruct: 480 млрд параметров, из которых на каждом шаге активны только 35 (архитектура Mixture of Experts, MoE). Контекст — 256K токенов «из коробки», до 1M с экстраполяцией. Модель обучали на 7,5 трлн токенов (70% — код) и прогоняли через долгосрочное RL с инструментами в 20 000 параллельных окружений, поэтому в бенчмарках типа SWE-Bench Verified она показывает лучшие результаты среди открытых моделей (блог Qwen, июль 2025).

Репозиторий QwenLM/Qwen3-Coder на GitHub
Официальный репозиторий модели: 16,8 тыс. звёзд, в ветке main уже лежит релиз qwen3-coder-next и технический отчёт. Источник: github.com/QwenLM/Qwen3-Coder.

Нам интереснее младшая версия — Qwen3-Coder-30B-A3B: 30 млрд параметров, активны 3,3 млрд. Это означает, что скорость генерации как у маленькой модели, а качество — почти как у большой. Именно она доступна в Ollama как qwen3-coder:30b (19 ГБ на диске, контекст 256K). Для домашнего железа это разумный максимум: старшая 480B тянет 290 ГБ и требует минимум 250 ГБ памяти (страница модели в Ollama).

Страница qwen3-coder в библиотеке Ollama: команды запуска и размеры моделей
Библиотека Ollama: qwen3-coder:30b — 19 ГБ и 256K контекста, qwen3-coder:480b — 290 ГБ. Здесь же видно, что Ollama умеет подключать модель к Claude Code и OpenCode одной командой. Источник: ollama.com/library/qwen3-coder.

Зачем тут Ollama

Ollama — это рантайм с открытым исходным кодом (лицензия MIT): скачивает модель из своего реестра, держит её в памяти и отдаёт по локальному API. Установка — одна команда, ключи не нужны, модели после скачивания работают офлайн.

Но для агентского кодинга важнее другое: Ollama умеет подключать вашу локальную модель к агентам одной командойollama launch. Для Claude Code, OpenCode, Codex и других. Агент при этом думает, что общается с облачным API, а на самом деле модель крутится у вас на машине.

Документация Ollama по интеграции Claude Code
Официальные доки Ollama: ollama launch claude подключает Claude Code к локальной модели через Anthropic-совместимый API. Источник: docs.ollama.com/integrations/claude-code.

Схема связки:

Схема: агенты подключаются к Qwen3-Coder через локальный API Ollama
Один локальный API — Claude Code, Aider и OpenCode ходят в один и тот же Ollama на localhost:11434. Модель в облако не уходит.

Кейс 1: «Хочу такой же опыт, как с Claude Code, но на локальной модели»

Апрель 2026 года, сабреддит r/LocalLLaMA. Пользователь alfons_fhl описывает ровно ту ситуацию, из-за которой люди приходят к локальным моделям:

«Я пользуюсь Claude Code CLI с Opus 4.6 и кучей MCP — и это реально затягивает. Просто говоришь, что построить, и он всё делает: читает кодовую базу, пишет код, запускает команды, сам чинит свои ошибки. Чистый вайбкодинг. Теперь я хочу то же самое, но с Qwen3-Coder-next, запущенным локально. Не автодополнение в стиле Copilot, а полноценный автономный агентный опыт». (r/LocalLLaMA, апрель 2026)

В комментариях — практика, которая пригодится всем. Три вывода.

Вывод 1: связка «Claude Code + локальная модель» работает, но с оговорками. Пользователь canred проверил её на Qwen3-Coder и Gemma:

«Я пробовал [Claude Code] с qwen3-coder и gemma4 e4b. Qwen задачу выполнил, gemma — нет. Оценка опыта в обоих случаях: держите острые предметы подальше. Как proof of concept работает, про продакшен забудьте».

И там же — ключевое техническое ограничение:

«Нужна модель, поддерживающая минимум 35K контекста. Claude Code тащит очень много контекста, и если модель его не тянет, будет ошибка».

Вывод 2: редирект делается через переменные окружения. PieArtistic9707 показывает, как перенаправить Claude CLI на локальный сервер: задаётся ANTHROPIC_BASE_URL на ваш сервер и фиктивный токен, а имя модели подставляется в ANTHROPIC_DEFAULT_SONNET_MODEL (в его случае — GGUF-файл Wrench-35B-A3B). В доки Ollama вынесен тот же принцип: ANTHROPIC_BASE_URL=http://localhost:11434 + ANTHROPIC_AUTH_TOKEN=ollama.

Вывод 3: OpenCode — лучший «переводчик» вызовов инструментов. Ещё один участник:

«Я в основном на OpenCode. Раньше был Roo и Cline в VS Code. Вызов инструментов у OpenCode пока работает лучше всего в моих тестах». (там же)

То есть связка реально работает, но первый блин комом: у локальных моделей меньше контекста, чем у флагманов, и агентный цикл с большими промптами — самое слабое место.

Кейс 2: агентский воркспейс на видеокарте с 4 ГБ памяти

Самый показательный свежий кейс (июль 2026) — автор maikerukonare собрал полноценный агентский воркспейс на RTX 3050 Ti Laptop с 4 ГБ VRAM (i7-12700H, 32 ГБ RAM, Ubuntu): чат, вызовы инструментов, RAG по своим документам, артефакты — всё на локальных Qwen через встроенный Ollama, без единого облачного ключа (r/LocalLLaMA, 25 июля 2026).

Замеры скорости (Q4_K_M, тёплый старт, медиана из трёх):

Модель Скорость Память
qwen3.5:0.8b 122 ток/с ~1,4 ГБ, целиком в GPU
qwen3.5:2b-q4_K_M 96 ток/с ~2,4 ГБ, целиком в GPU
qwen3.5:4b 25 ток/с ~3,4 ГБ, треть утекает в CPU
qwen3.5:9b 8,6 ток/с в основном CPU, нужно ~8 ГБ

Вывод автора: слабое железо выживает только за счёт MoE-моделей. В комментариях ему подсказали попробовать Qwen3.6-35B-A3B (та же схема «35B всего, 3B активны»), и он удивился:

«Я вечером поэкспериментировал с Qwen3.6 в MoE-режиме и реально получил около 22 ток/с — даже больше твоей оценки в 15. Всё ещё сильно медленнее почти 100 ток/с маленьких плотных моделей, но заметно умнее. Отлично справился со сложными артефактами на 400+ строк». (там же)

И второе наблюдение — про вызовы инструментов:

«Включаешь много инструментов — маленькие модели начинают их путать. Один раз моя 7B отправила „создай HTML-артефакт…“ в генератор картинок и нарисовала интерфейс». (там же)

Практические правила из этого кейса: на слабом железе включайте меньше инструментов, контекст ограничивайте (32K — потолок для 4 ГБ), и держите отдельную маленькую кодинг-модель для задач «написать файл целиком» — общая модель на таких размерах пишет недоделанный HTML.

Кейс 3: что выбрать под 2× RTX 3090 (48 ГБ)

Свежий тред «Что бы вы запустили на двух RTX 3090?» (июль 2026) — про выбор модели под конкретное железо (r/LocalLLaMA, 25 июля 2026). Пользователь купил две 3090 по $1000 и спрашивает: какую модель, какую квантизацию, какой движок.

Топовый ответ про кодинг:

«Для 48 ГБ два выбора прямо сейчас: Qwen3.6-27B для общего пользования (Q8 — около 30 ГБ, остаётся место под контекст) и qwen3-coder-next 80B-A3B в 4-бит для агентского кодинга — примерно 40 ГБ, поэтому держите длину контекста умеренной». (там же)

Плюс дельные замечания по железу:

  • 3090 — это Ampere, у неё нет FP8-тензорных ядер: формат FP8 в vLLM просто деквантизуется без выигрыша в скорости — берите AWQ/GPTQ INT4 или GGUF.
  • Движок: vLLM с tensor parallelism для «рабочей лошадки», llama.cpp — для всего нового, потому что GGUF появляется в первый же день.
  • Не ждите замены облачным флагманам: «считайте локальную модель офлайн-запасным вариантом и всегда включённым автодополнением, а не заменой».

В этом же треде прогнали TP vs PP на Qwen3.6-27B Q8 и выяснили, что на PCIe 4.0 tensor parallelism даёт ~15% к декодингу, но ~31% штрафа к чтению промпта (prefill): для больших кодовых баз это невыгодно. Если коротко — на двух 3090 без NVLink сначала тестируйте оба режима.

Как запустить: пошагово

Собираем всё из кейсов и официальных доков.

Шаг 1. Установить Ollama и скачать модель

# macOS / Linux
curl -fsSL https://ollama.com/install.sh | sh

# Windows (PowerShell)
irm https://ollama.com/install.ps1 | iex

Затем скачиваем кодинг-модель (на момент публикации — Qwen3-Coder 30B, 19 ГБ):

ollama pull qwen3-coder:30b

Проверить, что модель на месте: ollama ls.

Шаг 2. Чат напрямую (для проверки)

ollama run qwen3-coder:30b
>>> Напиши функцию на Python, которая читает CSV и считает сумму по колонке

Модель отвечает в терминале, без интернета. Если скорость не устраивает — смотрите замеры из кейса 2: на 4 ГБ VRAM 35B-A3B даёт ~22 ток/с, на M4 Pro (48 ГБ) — порядка 150 ток/с (замеры с Хабра).

Шаг 3. Подключить агента

Claude Code — одной командой (нужна Ollama 0.15+):

ollama launch claude --model qwen3-coder:30b

Ollama сама настроит Anthropic-совместимый API на localhost:11434 и запустит Claude Code в текущем терминале. Альтернатива — руками:

export ANTHROPIC_AUTH_TOKEN=ollama
export ANTHROPIC_API_KEY=""
export ANTHROPIC_BASE_URL=http://localhost:11434
claude --model qwen3-coder:30b

OpenCode — так же:

ollama launch opencode --model qwen3-coder:30b

Aider — классический вариант (подробно разобран в нашей статье про Aider и локальные модели):

export OLLAMA_API_BASE=http://127.0.0.1:11434
cd /ваш/проект
aider --model ollama_chat/qwen3-coder:30b

Префикс ollama_chat/ рекомендован документацией Aider. И не забудьте поднять контекст сервера, иначе Ollama молча обрежет половину диалога:

OLLAMA_CONTEXT_LENGTH=32768 ollama serve

Про выбор размера контекста — отдельно: у Claude Code минимум 35K (иначе ошибка, кейс 1), доки Ollama советуют 64K+ для кодовых репозиториев. На 4 ГБ VRAM потолок — около 32K. На Mac с 48 ГБ и выше берите 64K смело.

Схема: какую модель Qwen3-Coder выбрать под железо
Три варианта: 30b (19 ГБ, 1 видеокарта / Mac), 480b (290 ГБ, сервер или Mac с 250+ ГБ памяти) и 480b-cloud (облачная версия, платится по токенам, железо не нужно).

Российские реалии

Тут локальные модели выигрывают у облачных безоговорочно — проверено практикой:

  • Ollama доступна из РФ без VPN. Установщик, сайт и реестр моделей на момент апреля 2026 года не блокировались; если корпоративная сеть фильтрует — модели тянутся с Hugging Face в формате GGUF и подключаются через ollama create с собственным Modelfile (Tproger, апрель 2026).
  • Оплата не нужна вообще. Ни подписок, ни карт, ни посредников: всё бесплатно (MIT), токены не списываются. Для РФ это закрывает главную боль — невозможность платить за зарубежные API.
  • Код не покидает машину. Для коммерческих проектов и NDA это решающий аргумент, и он же снимает вопросы про то, куда утекают промпты.
  • Свежий русскоязычный опыт есть — и он совпадает с англоязычным: разбор на Хабре (апрель 2026) прогнал Qwen3-Coder-30B-A3B через Kilo Code, Aider и OpenCode на MacBook M4 Pro и пришёл к выводу, что для разовых задач локальные модели годятся, для постоянной агентской работы — пока тяжело (Habr, апрель 2026). Плюс общий обзор локальных LLM на Хабре (сентябрь 2025) и опыт вайбкодинга на бесплатных моделях без VPN (spryt.ru, июль 2026).

Советы по итогам кейсов

  • Берите MoE-модель с пометкой Coder. Qwen3-Coder-30B-A3B — оптимум для одной видеокарты: скорость маленькой модели, качество большой. Проверено на 4 ГБ VRAM и на 48 ГБ.
  • Контекст решает больше скорости. Claude Code требует минимум 35K, доки Ollama советуют 64K+. Модель, которая «не тянет контекст», будет падать с ошибкой или молча резать диалог — и выглядеть тупой, хотя виноват не интеллект, а настройка.
  • Меньше инструментов на слабом железе. Включаете 20 тулзов — маленькая модель начинает путать, куда слать запрос. Начните с 3–5 и добавляйте по мере сил.
  • Поднимайте контекст сервера явно. OLLAMA_CONTEXT_LENGTH=32768 ollama serve — иначе Ollama молча отбрасывает всё, что не влезло в дефолтные 2K.
  • Держите вторую маленькую кодинг-модель для задач «сгенерируй файл целиком»: на малых размерах общие модели пишут недоделанный код, а кодинг-тюнинг спасает.
  • Ожидания — как у офлайн-запаса, а не замены Claude/GPT. Все три кейса сходятся: локальная модель — это бесплатный, приватный, офлайн-вариант для рутины и NDA-кода, а не замена флагманам на сложной архитектуре.

Честные ограничения

  • Качество ниже флагманов. Прямая цитата из кейса 1: «как proof of concept работает, про продакшен забудьте». На сложных многофайловых задачах локальная 30B уступает облачным топам.
  • Агентский режим — самое слабое место. В замерах с Хабра (M4 Pro, 48 ГБ) локальные модели в чате работали приемлемо, а в режиме агента время росло с минут до десятков минут, ноутбук грелся до ~100 °C, а у Claude Code с qwen3-coder-30b на этапе ревью модель крашилась с ошибкой стриминга (Habr, апрель 2026).
  • Нужно железо. 19 ГБ под модель — это только веса; плюс контекст, плюс сама система. Комфортный минимум — 24 ГБ RAM (или VRAM), а для 480B — 250 ГБ.
  • Версии меняются быстро. Размеры и команды актуальны на август 2026 года. Уже сейчас в Ollama есть и qwen3-coder:480b-cloud, и свежие модели линейки (Qwen3-Coder-next, Qwen3.6-35B-A3B) — проверяйте ollama ls и библиотеку моделей перед покупкой железа.

Вывод

Qwen3-Coder через Ollama — самый короткий путь к локальному ИИ-кодингу: одна команда установки, одна команда скачивания модели, одна команда подключения агента. Кейсы людей подтверждают: на 4 ГБ VRAM это работает (медленно, но работает), на 48 ГБ — вполне прилично, а для России это ещё и единственный способ получить ИИ-кодинг без VPN, зарубежных карт и утечки кода. Ожидания при этом держите честными: локальная модель закрывает рутину и приватные задачи, а флагманам пока проигрывает на сложной архитектуре.

Дальше по теме: что такое агентный кодинг, Aider и локальные модели, как установить OpenCode, как установить Claude Code.

Насколько публикация полезна?

Нажмите на звезду, чтобы оценить!

Средняя оценка / 5. Количество оценок:

Оценок пока нет. Поставьте оценку первым.

Добавить комментарий

Adblock
detector