Cline — бесплатный open-source агент для VS Code: ставится из маркетплейса, платишь только за модель. Разбор установки, дешёвых моделей (GLM-5.2, локальные через Ollama) и кейса с цифрами.
В августе 2026 у Cline на GitHub 66 тыс. звёзд и почти 5 млн установок в маркетплейсе VS Code — это одна из главных open-source связок «агент в редакторе + своя модель»: расширение распространяется бесплатно под лицензией Apache-2.0, а за модель вы платите отдельно. Ниже — установка, настройка провайдера и разбор реального кейса: инженер Owen из блога Ofox в конце июля 2026 подключил к Cline модель GLM-5.2 от Z.ai, посчитал стоимость против Claude Sonnet 5 и наступил на пару граблей (первоисточник, 28.07.2026). Цифры и версии — на момент публикации.
Что такое Cline
Cline — это AI-агент, который живёт прямо в редакторе и терминале: читает файлы, пишет код, выполняет команды, умеет открывать браузер. Ключевое отличие от автодополнения в стиле Copilot — агентный цикл: он сам обходит проект, вносит изменения через diff, запускает тесты и чинит найденные ошибки. Каждое действие требует явного одобрения — файлы и команды не выполняются без вашего согласия (официальные доки).

Cline не привязан к одному провайдеру: из коробки поддерживаются Anthropic (Claude), OpenAI, Google Gemini, OpenRouter, AWS Bedrock, Azure, Cerebras/Groq, локальные рантаймы Ollama и LM Studio и любой OpenAI-совместимый API (README проекта). Отсюда и смысл фразы «платишь только за модель»: расширение открытое и бесплатное, а стоимость складывается из тарифов выбранной модели.
Помимо расширения для VS Code есть плагин для JetBrains, CLI (npm install -g cline), веб-доска Kanban для параллельных агентов и SDK для собственных сборок (доки по установке).
Установка и настройка
Установка занимает пару минут, дальше вопрос только в том, какой провайдер указать.
- В VS Code откройте расширения (Ctrl/Cmd+Shift+X), найдите Cline и нажмите Install.
- Запустите из палитры команд (Ctrl/Cmd+Shift+P) пункт Cline: Open In New Tab — откроется панель агента.
- В панели нажмите шестерёнку — это настройки. Поле API Provider определяет всё остальное.

Варианты доступа к модели в настройках Cline:
- Cline Provider — встроенная оплата по использованию и бесплатные акции моделей для аккаунта Cline;
- ClinePass — подписка за $9.99/мес, дающая в 2–5 раз больше использования популярных открытых моделей, чем стандартный API-тариф;
- свой ключ — любой провайдер из списка или OpenAI-совместимый endpoint, включая локальные Ollama и LM Studio (доки).
Если ключ какого-то провайдера уже есть — «свой ключ» самый предсказуемый путь, именно его разбирает кейс ниже.
Какую модель выбрать, если хочется дёшево
Два рабочих направления. Первое — облачная модель с низким ценником, на август 2026 это в основном GLM-5.2 от Z.ai. Второе — локальная модель через Ollama: бесплатно и без интернета, но с железными ограничениями.
GLM-5.2 (Z.ai) — облачный вариант
GLM-5.2 — флагманская модель Z.ai (бывшая Zhipu AI), ориентированная на кодинг и длинные агентные задачи: контекст 1 млн токенов, до 128K токенов на выход, открытые веса под лицензией MIT (анонс Z.ai; референс модели). В Cline для неё есть готовый пункт провайдера.

У провайдера Z AI два региона — International (endpoint api.z.ai/api/paas/v4) и China (open.bigmodel.cn). Для кодинг-агентов Z.ai предлагает подписки GLM Coding Plan, которые подключаются к Cline тем же ключом (доки Cline по Z AI). Если идти не через нативный провайдер, а через OpenAI-совместимый шлюз — как в кейсе ниже — модель указывается полным ID z-ai/glm-5.2.
Локальные модели через Ollama — бесплатный вариант
Cline подключается к локальным моделям напрямую: провайдер Ollama, base URL http://localhost:11434, модель выбирается из выпадающего списка (то же самое работает для LM Studio и Atomic Chat). Официальные доки советуют включить Use Compact Prompt в настройках — компактный промпт заметно режет расход контекста, а локальным моделям проще всего справляться с небольшими задачами (доки по локальным моделям).
Требования к железу по докам: 16–32 ГБ оперативной памяти — маленькие и квантизованные модели, 32–64 ГБ — модели среднего размера, от 64 ГБ — крупные модели и большие контексты. Для кодинга с агентным циклом рабочий минимум на август 2026 — Qwen3-Coder-30B через Ollama (19 ГБ, 256K контекста); разбор этой связки — в отдельной статье про локальные нейросети для кодинга.
Опыт автора: цифры и грабли с GLM-5.2 в Cline
Owen из блога Ofox описал свой опыт настройки GLM-5.2 в Cline (28.07.2026). Первое, что он объясняет — почему вообще стоит считать цену модели:
«Cline bills by the token, and it is not shy about spending them. Every turn it resends your file tree, the open buffers, and the running task log, so the model you pick shows up on the invoice within a day».
«Cline списывает по токенам и не стесняется их тратить: на каждом шаге он пересылает дерево файлов, открытые буферы и журнал задачи, поэтому выбранная модель уже за день проявляется в счёте». (ofox.ai/blog/glm-5-2-in-cline-2026)
В агентном режиме модель работает с большим объёмом входных токенов на каждом шаге, поэтому именно ценник на вход решает бюджет.
Цены: GLM-5.2 против Claude Sonnet 5

| Модель | Вход | Выход | Чтение кэша | Контекст |
|---|---|---|---|---|
| GLM-5.2 | $1.4/1M | $4.4/1M | $0.26/1M | 1M |
| Claude Sonnet 5 | $2/1M | $10/1M | $0.20/1M | 1M |
Если смешать вход и выход в пропорции 2:1, как в типичной кодинг-сессии, получается около $2.40 за 1 млн токенов у GLM-5.2 против $4.67 у Sonnet 5 — примерно в 1.9 раза дешевле на сырых тарифах. С учётом кэша разрыв сужается до ~1.6×, потому что чтение кэша у Sonnet дешевле, а Cline пересылает контекст на каждом шаге. На целой команде это заметные деньги: 5 разработчиков × 20 рабочих дней с ~70% кэширования — около $208 против $348 (кейс Ofox).
Важная оговорка из первоисточника: $2/$10 для Sonnet 5 — вводные цены Anthropic, действующие до 31.08.2026; после этого стандартный тариф $3/$15, и разрыв с GLM станет ещё шире.
Грабли №1: thinking не отключается из интерфейса
GLM-5.2 — модель с рассуждением, включённым по умолчанию. У Z.ai есть документированный способ выключить его — параметр thinking: { type: disabled } в запросе. Проблема в том, что Cline через OpenAI-совместимый провайдер этот параметр не отправляет. Owen объясняет это точно:
«Cline’s OpenAI Compatible provider does not send that object. Its Model Configuration has a Reasoning Effort selector that defaults to none; set it to low, medium, or high and Cline sends a reasoning object ({enabled: true, effort}) instead. Those are two different controls, and GLM’s on/off switch is the one Cline never touches».
«OpenAI-совместимый провайдер Cline этот объект не отправляет. В конфигурации модели есть селектор Reasoning Effort — по умолчанию none; если поставить low, medium или high, Cline отправляет объект reasoning. Это два разных рычага, и именно тот, что выключает thinking у GLM, Cline не трогает никогда». (там же)

Практические следствия. Чтобы модель вообще получала подсказку об уровне рассуждений, селектор надо сдвинуть с значения none. А выключить thinking не выйдет никак — токены рассуждения списываются как выходные, так что их надо закладывать в бюджет.
Грабли №2: парсинг tool-вызовов
У GLM и других open-weight моделей на OpenAI-совместимом пути слой трансляции tool-вызовов шероховатый. Owen приводит таблицу типичных ошибок и решений (все тикеты в трекере Cline закрыты, но поведение может всплывать и на свежих версиях):
| Симптом | Причина | Решение |
|---|---|---|
model not found |
Голый ID glm-5.2 вместо полного |
Указывать z-ai/glm-5.2 с префиксом провайдера |
| Читает файлы, но не редактирует | Модель перечитывает файл без вызова правки (Cline #7486) | Держать задачи небольшими, контекст 1M; упрямые шаги — на другую модель |
| Тэги тулзов отображаются текстом, потом зависание | reasoning_content утекает в основной поток (Cline #5843) | Обновить Cline до сборки, которая парсит reasoning_content |
| Подсказка об уровне рассуждений не работает | Селектор оставлен на none — параметры не отправляются (Cline #6581) | Выставить low/medium/high в настройках модели |
| Модель «забывает» ранние шаги в середине задачи | Контекстное окно меньше, чем у модели | Выставить context window = 1000000 |
401 Unauthorized |
Ключ от другого шлюза | Ключ должен совпадать с base URL |
Стоп-правило
Owen честно оговаривает, где можно не углубляться:
«If your goal is just to point Cline at a cheap coding model, do Steps 1 through 5, set the context window, and stop. The thinking and cost sections are for people tuning spend against quality, not for the basic connect».
«Если цель — просто подключить к Cline дешёвую кодинг-модель, выполните шаги 1–5, выставьте контекстное окно и остановитесь. Разделы про thinking и цены — для тех, кто подгоняет расходы под качество, а не для базового подключения». (там же)
Пошагово: GLM-5.2 через OpenAI-совместимый провайдер
Собираем установку из кейса и доков Cline:
- В настройках Cline выберите API Provider → OpenAI Compatible.
- Base URL:
https://api.ofox.ai/v1(или endpoint вашего шлюза), API Key — ваш ключ. - Model ID:
z-ai/glm-5.2— с префиксом; голыйglm-5.2на шлюзе не найдётся. - В конфигурации модели выставите context window = 1000000 — иначе на длинных задачах Cline молча отбросит ранние шаги.
- Отправьте тестовое сообщение, например «list the files in this project». Если Cline прочитал дерево и ответил — связка работает.
Для нативного пути — провайдер Z AI в списке, регион International, ключ из дашборда z.ai/model-api и модель из выпадающего списка (доки Cline).
Советы
- Контекстное окно выставляйте явно. GLM-5.2 поддерживает 1M; оставьте дефолт Cline — модель «потеряет нить» в середине рефакторинга, и это будет выглядеть как слабость модели, хотя виновата настройка.
- Model ID — только с префиксом.
z-ai/glm-5.2, а неglm-5.2. Алиасglm-5.2[1m]— это соглашение Claude Code на кодинг-endpoint Z.ai, в поле OpenAI Compatible он не нужен. - Селектор Reasoning Effort двигайте с none, если хотите, чтобы модель вообще получала подсказку об уровне рассуждений. На none Cline не отправляет ничего.
- Закладывайте thinking в бюджет. Рассуждение у GLM-5.2 выключить нельзя, его токены идут как выходные.
- Следите за версией Cline. Парсинг reasoning_content чинили в свежих сборках; старый билд — частая причина «зависаний» на тулзах.
- Команды держите на подтверждении. Слой трансляции tool-вызовов у GLM не идеален — авто-approve на этом пути лучше не включать.
- Локальная модель — для небольших задач. Включите Use Compact Prompt и держите задачи в одном файле; большие рефакторинги локальные модели пока не тянут.
Честные ограничения
- GLM-5.2 в Cline работает через слой трансляции, а не нативный протокол: парсинг tool-вызовов исторически менее чистый, чем у Claude на Anthropic-провайдере. Для команд, завязанных на Claude, разница в цене может не окупить шероховатостей.
- Thinking нельзя выключить — это не баг, а поведение модели: даже на тривиальных шагах вы платите токены рассуждения.
- Экономия реальная, но не 5×. Сравнение с флагманом даёт ~1.6–1.9×, а не «в пять раз дешевле»; разрыв частично съедает кэш.
- Цены меняются. $2/$10 для Sonnet 5 — вводный тариф до 31.08.2026; тарифы шлюзов и Z.ai стоит сверять на момент покупки.
- Локальные модели слабее облачных флагманов на сложных многофайловых задачах, плюс нужно железо: 16–32 ГБ под маленькие модели, от 64 ГБ под серьёзные контексты.
Российские реалии
Cline бесплатен и открыт (Apache-2.0) — это снимает главный вопрос об оплате самого агента. Платить приходится только за модель, и здесь развилка.
- Установка не требует карты: расширение ставится из маркетплейса VS Code (или через Open VSX для Windsurf и VSCodium), при сетевых проблемах — вручную из релизов на GitHub. Блокировок маркетплейса на момент публикации не зафиксировано, но и проверенного русскоязычного источника на этот счёт нет — приводим как есть.
- Облачные модели. Международный API Z.ai (z.ai/model-api) принимает зарубежные карты; российские Visa/Mastercard там не работают, а проверенного пути оплаты картами Mir/UnionPay мы не нашли — тема в рунете почти не освещена, честно признаём это. Рабочие обходы: оплата с зарубежной карты, криптовалютные посредники либо российские OpenAI-совместимые шлюзы, принимающие рубли. Пример настройки Cline через такой шлюз с оплатой в рублях без VPN показан в русскоязычном гайде сервиса AITUNNEL (AITUNNEL, 27.03.2026).
- Подписка ClinePass ($9.99/мес) — тоже зарубежная оплата, те же сложности с картами.
- Локальные модели — самый «российский» вариант: Ollama ставится из открытого реестра, модели скачиваются и работают без интернета, оплаты нет вообще. Свежий русскоязычный опыт локальных моделей в кодинг-агентах — разбор на Хабре, где Qwen3-Coder-30B прогнали через Kilo Code, Aider и OpenCode на MacBook M4 Pro (Habr, апрель 2026). Про саму GLM-5.2 в рунете писали в основном как о новости: анонс с 1M контекста разбирали на Хабре ещё в июне (Habr, 13.06.2026).
Коротко: связка «Cline + локальная модель через Ollama» закрывает всё — бесплатно, без VPN и зарубежных карт; для облачной GLM-5.2 придётся решать вопрос оплаты через шлюз с рублями или зарубежную карту.
Вывод
Cline — бесплатный open-source агент, у которого действительно нет скрытой подписки: поставил расширение, подключил модель, платишь только за её токены. Кейс Owen из блога Ofox показывает, что самый дешёвый облачный путь на август 2026 — GLM-5.2 от Z.ai: примерно в 1.6–1.9× дешевле Sonnet 5 на типичной кодинг-сессии, но с двумя граблями — невыключаемым thinking и шероховатым парсингом tool-вызовов. Второй вариант — локальные модели через Ollama: медленнее и слабее, зато бесплатно и офлайн. Начинать стоит по стоп-правилу автора кейса: шаги 1–5, контекст 1M — и работать.
Дальше по теме: бесплатные IDE и инструменты для агентского кодинга, локальные нейросети для кодинга: Qwen3-Coder через Ollama, как пользоваться Cursor, лучший ИИ-агент для кодинга: сравнение.
