28 августа 2026 года Z.AI опубликовала веса модели GLM-5.3 на Hugging Face (zai-org/GLM-5.3) — крупнейшая open-weights модель для кодинга на момент публикации: 753B параметров в MoE-архитектуре, 1 млн токенов контекста, лицензия glm-5.3. Веса доступны в BF16, FP8 и F32, а сообщество уже подготовило 27 квантованных версий — от GGUF до NVFP4 и MLX.
В этой статье — пошаговый путь: как скачать веса, выбрать квант под ваше железо, запустить через Ollama или llama.cpp и подключить к кодинг-агентам. Если вы раньше использовали GLM-5.3 только через API или десктопный ZCode — это принципиально другая история: модель работает на ваших серверах, и данные не покидают вашу инфраструктуру.

Что такое GLM-5.3 и чем она отличается от предшественников
GLM-5.3 — третья итерация флагманской модели Z.AI, спроектированная специально для агентного кодинга. В отличие от GLM-5.2, которая использовала ту же базовую модель, все улучшения в5.3 достигнуты за счёт пост-тренировки (model card на HF):
- 50% прирост на Z.ai Code Bench по сравнению с GLM-5.2.
- Terminal Bench 3.0: 28.3 — SOTA среди open-weights моделей (для сравнения, GLM-5.2 набрала4.6).
- DeepSWE v1.1: 66.9 — на уровне Kimi K3 (67.5) и близко к Fable 5 (69.7).
- Агентное RL-обучение — пост-тренировка охватывает длинные цепочки действий, многоразовые вызовы инструментов и декомпозицию подзадач.
- Гибкий reasoning — три уровня продумывания (
low,high,max), управляемых параметромreasoning_effort. По умолчаниюmax(документация).
Архитектура
GLM-5.3 построена на архитектуре Mixture-of-Experts (MoE) с индексацией:
| Параметр | Значение |
|---|---|
| Общее число параметров | 753B |
| Эксперты (routed) | 256 |
| Активных экспертов на токен | 8 |
| Контекстное окно | 1 048 576 токенов |
| vocab_size | 154 880 |
| Число слоёв | 78 |
| Типичные тензоры | BF16, F8_E4M3, F32 |
8 из 256 экспертов активируются на каждый токен — это значит, что реальная вычислительная нагрузка соответствует модели размером ~47B, не 753B. Именно благодаря MoE-архитектуре квантованные версии работают быстрее, чем ожидалось от модели такого размера.

Где скачать веса и кванты
Оригинальные веса
Полные веса доступны на Hugging Face: huggingface.co/zai-org/GLM-5.3.
# Через huggingface-cli
pip install huggingface_hub
huggingface-cli download zai-org/GLM-5.3 --local-dir ./glm-5.3
# Или через git lfs
git lfs install
git clone https://huggingface.co/zai-org/GLM-5.3
Размеры файлов:
— BF16: ~1.51 ТБ (3 файла safetensors)
— F8_E4M3 (FP8): ~753 ГБ
— F32: ~3 ТБ
Квантованные версии (GGUF)
Наиболее практичный вариант — unsloth/GLM-5.3-GGUF от Unsloth (60 лайков, один из самых скачиваемых квантов). Доступные размеры (hardware compatibility на странице модели):
| Квант | Размер файла | RAM (минимум) |
|---|---|---|
| UD-IQ1_S | 217 ГБ | ~220 ГБ |
| UD-Q2_K_XL | 254 ГБ | ~255 ГБ |
| UD-Q3_K_XL | 343 ГБ | ~345 ГБ |
| UD-Q4_K_XL | 467 ГБ | ~470 ГБ |
| UD-Q5_K_XL | 562 ГБ | ~565 ГБ |
| UD-Q6_K_XL | 684 ГБ | ~690 ГБ |
| Q8_0 | 801 ГБ | ~805 ГБ |
| BF16 | 1.51 ТБ | ~1.52 ТБ |
Помимо Unsloth, на Hugging Face доступны ещё 26 квантованных версий (полный список): NVFP4 (391 ГБ), MLX для Apple Silicon (от 60 до 209 ГБ), EXL3 для exllamav3 и другие.
Другие форматы
- NVFP4: incoai/GLM-5.3-NVFP4 (391 ГБ) — компактнее GGUF Q4.
- MLX: orcarouter/GLM-5.3-MLX (127 ГБ) — оптимизировано для Apple Silicon.
- Для других форматов: huggingface.co/models?other=base_model:quantized:zai-org/GLM-5.3.
Требования к железу
GLM-5.3 — модель класса «дата-центр». Даже самый компактный квант (IQ1_S, 217 ГБ) не помещается ни в одну consumer-конфигурацию.

Реалистичные конфигурации
| Конфигурация | Квант | Стоимость (аренда/мес) | Примечание |
|---|---|---|---|
| 8× A100 80GB | Q4_K_XL (467 ГБ) | $5 000–8 000 | Минимальный комфорт |
| 4× H100 80GB | Q4_K_XL (467 ГБ) | $8 000–12 000 | Быстрее, чем A100 |
| 3× A100 80GB + CPU offload | IQ1_S (217 ГБ) | $3 000–5 000 | Медленнее, но дешевле |
| 20× A100 80GB | BF16 (1.51 ТБ) | $20 000+ | Оригинальное качество |
Стоимость аренды GPU-серверов актуальна на август 2026 и зависит от провайдера (Lambda, RunPod, vast.ai и т.д.).
Практический совет: если вы хотите просто попробовать модель — используйте API (см. раздел ниже). Локальный запуск оправдан, только если нужна полная приватность данных или вы планируете массовое использование.
Запуск через Ollama
Ollama — самый простой способ запустить GLM-5.3, если у вас есть достаточно RAM. Ollama уже поддерживает GLM-5.3 (библиотека моделей):
# Запуск GGUF-версии через Ollama
ollama run hf.co/unsloth/GLM-5.3-GGUF:UD-Q4_K_XL
# Или из официальной библиотеки Ollama
ollama run glm-5.3
На момент публикации в библиотеке Ollama есть две версии (ollama.com/search):
— glm-5.3 — флагманская модель (9,7K скачиваний)
— glm-5.3-flash — мультимодальная,18B активных параметров (24,3K скачиваний)
Ollama автоматически скачает модель при первом запуске. После загрузки сервер запустится на localhost:11434 с OpenAI-совместимым API.
Через llama.cpp (гибрид CPU+GPU)
Если нужно больше контроля над распределением нагрузки между GPU и CPU:
# Установка llama.cpp
curl -LsSf https://llama.app/install.sh | sh
# Запуск сервера с автоматическим выбором
llama serve -hf unsloth/GLM-5.3-GGUF:UD-Q4_K_XL
# Или с ручным распределением GPU layers
llama serve -hf unsloth/GLM-5.3-GGUF:UD-Q4_K_XL \
-ngl 35 \
--ctx-size 131072
Параметр -ngl задаёт количество слоёв, загружаемых на GPU. При недостатке VRAM модель автоматически offload’ит остаток на CPU — работает медленнее, но работает.
Через vLLM / SGLang (для серверных конфигураций)
Для multi-GPU серверов без offloading на CPU:
# vLLM
pip install vllm
vllm serve "zai-org/GLM-5.3"
# SGLang
pip install sglang
python3 -m sglang.launch_server \
--model-path "zai-org/GLM-5.3" \
--host 0.0.0.0 \
--port 30000
Оба варианта предоставляют OpenAI-совместимый API на порту 8000 (vLLM) или 30000 (SGLang).
Подключение к кодинг-агентам
GLM-5.3 через Ollama или llama.cpp работает как OpenAI-совместимый сервер — это значит, что её можно подключить к любому агенту, поддерживающему кастомный провайдер.
Aider
Aider подключается к любой LLM через OpenAI-совместимый API (aider.chat/docs/llms):
# После запуска Ollama/GLM-5.3
cd /path/to/your/project
# Подключение через OpenAI SDK
aider --model openai/glm-5.3 \
--openai-api-base http://localhost:11434/v1
Aider автоматически строит карту репозитория и отправляет релевантные файлы в контекст.
OpenCode
OpenCode интегрируется с Ollama из коробки (docs.ollama.com/integrations):
# OpenCode + Ollama
opencode --provider ollama --model glm-5.3
OpenCode также поддерживает подключение к любому OpenAI-совместимому серверу через параметры конфигурации.
Cline (VS Code)
Cline поддерживает Ollama как провайдер:
- Установите расширение Cline в VS Code.
- В настройках провайдера выберите Ollama.
- Укажите модель
glm-5.3. - Cline подключится к
localhost:11434автоматически.
Claude Code
Claude Code можно направить на кастомный провайдер через --model:
# Через Ollama
claude --model ollama/glm-5.3
# Или через OpenAI-совместимый endpoint
ANTHROPIC_BASE_URL=http://localhost:11434/v1 claude
Через API (без железа)
Если локальный запуск не подходит — Z.AI предоставляет API:
# Регистрация: z.ai/model-api
# API Key: z.ai/manage-apikey/apikey-list
# Pricing: z.ai/guides/overview/pricing
# Пример вызова (OpenAI-совместимый)
curl -X POST "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [{"role": "user", "content": "Помоги с рефакторингом"}]
}'
GLM Coding Plan: от $18/мес — включает GLM-5.3, GLM-5.3-Flash и совместимость с Claude Code / Cline / OpenCode (z.ai/subscribe).
Помимо Z.AI API, GLM-5.3 доступна через Together AI, Novita, Cerebras, Groq и другие inference-провайдеры (список на HF).
Настройка reasoning effort
GLM-5.3 поддерживает три уровня «мышления» — это напрямую влияет на качество и стоимость ответов (документация):
| Уровень | Когда использовать | Примеры задач |
|---|---|---|
low |
Быстрые вопросы, рутина | Форматирование, переименование, простые правки |
high |
Средняя сложность | Рефакторинг, написание тестов, объяснение кода |
max (по умолчанию) |
Сложные архитектурные задачи | Длинные агентные цепочки, отладка, написание новых модулей |
Для кодинг-агентов рекомендуется max или high: модель решает, сколько «думать» над каждым шагом, и при max результаты стабильнее на длинных траекториях.
Российские реалии
Hugging Face
Hugging Face работает из России без VPN на момент публикации (август 2026). Скачивание больших моделей через huggingface-cli идёт напрямую, но на скорости Downloads/Uploads могут быть ограничения при использовании публичных IP.
Для ускорения скачивания можно использовать зеркало hf-mirror.com (зеркало Hugging Face, расположено в Китае):
# Настройка зеркала
export HF_ENDPOINT=https://hf-mirror.com
huggingface-cli download zai-org/GLM-5.3 --local-dir ./glm-5.3
Ollama в РФ
Ollama устанавливается и работает без ограничений на любой платформе (macOS, Linux, Windows). Загрузка моделей идёт напрямую с ollama.com — без VPN.
Оплата API
Z.AI API (z.ai) — китайская компания, работает с международными картами. Visa/Mastercard ограничены для российских пользователей из-за санкций. Реальные способы оплаты: UnionPay, криптовалюта, виртуальные карты через посредников.
Cloud GPU (Lambda, RunPod, vast.ai) — оплата через Stripe, аналогичные ограничения для российских карт.
Русскоязычное освещение
Тема запуска GLM-5.3 локально в рунете освещена слабо — релиз свежий (28.08.2026), крупные публикации на Habr/vc.ru пока отсутствуют. На Habr есть обзоры предыдущих версий GLM-5.1/5.2 и руководства по запуску MoE-моделей через Ollama, но специфичных материалов по GLM-5.3 open-weight на момент написания статьи не обнаружено.
Честные ограничения
GLM-5.3 — не модель для ноутбука. Даже самый компактный квант (IQ1_S, 217 ГБ) требует сервер с тремя A100 80GB. Это оборудование стоимостью десятки тысяч долларов или аренда от $3 000/мес. Для индивидуального разработчика реалистичный путь — API или cloud GPU.
Кастомная лицензия. Лицензия glm-5.3 — не Apache 2.0 и не MIT. Она разрешает коммерческое использование, но имеет ограничения: запрещено использование для обучения конкурирующих моделей, есть ограничения на деплой в определённых юрисдикциях. Перед коммерческим использованием — прочитайте полный текст лицензии на странице модели (huggingface.co/zai-org/GLM-5.3).
Качество при экстремальном квантовании. IQ1_S (217 ГБ) и Q2_K_XL (254 ГБ) существенно теряют в качестве: модель начинает «галлюцинировать» на длинных контекстах, путает имена переменных, генерирует синтаксические ошибки. Рекомендуемый минимум для работы — Q4_K_XL.
Нет vision. GLM-5.3 — текстовая модель. Если нужна работа с изображениями, посмотрите на GLM-5.3-Flash — мультимодальную модель с18B активными параметрами.
Скорость. На cpu-only конфигурации генерация идёт порядка1–3 токенов в секунду. Для комфортной работы нужен GPU с полной загрузкой экспертов.
Сравнение: локально vs API

| Критерий | Локально | API (Z.AI / Cloud) |
|---|---|---|
| Стоимость старта | $3 000+/мес (аренда GPU) | $18/мес (Coding Plan) |
| Приватность | Полная | Зависит от провайдера |
| Настройка | Часы/дни | Минуты |
| Лимиты | Только ваше железо | Rate limits, лимиты токенов |
| Гибкость | Fine-tune, кастомизация | Только API-параметры |
| Для кого | Компании, research, compliance | Индивидуальные разработчики |
Итого
GLM-5.3 open-weight — событие, меняющее правила игры: крупнейшая модель для кодинга теперь доступна для скачивания и запуска на собственных серверах. Реалистичный путь для большинства разработчиков — API Z.AI или cloud GPU, но для компаний с требованиями к приватности локальный запуск через Ollama/llama.cpp даёт полный контроль над моделью и данными.
Если вы хотите просто попробовать — начните с API (z.ai/model-api) или бесплатного кодинг-плана. Если нужно локально — арендуйте GPU-сервер с 8× A100 и запустите Q4_K_XL через Ollama.
Подробнее о десктопном клиенте ZCode, который использует GLM-5.3 из коробки — в обзоре ZCode от Z.AI. Сравнение локальных нейросетей для кодинга — в подборке моделей для Ollama, сравнении лучших ИИ для кодинга и обзоре моделей для кодинга 2026.
