Перейти к содержимому

GLM-5.3 open-weight: скачиваем 753B-модель и запускаем локально

28 августа 2026 года Z.AI опубликовала веса модели GLM-5.3 на Hugging Face (zai-org/GLM-5.3) — крупнейшая open-weights модель для кодинга на момент публикации: 753B параметров в MoE-архитектуре, 1 млн токенов контекста, лицензия glm-5.3. Веса доступны в BF16, FP8 и F32, а сообщество уже подготовило 27 квантованных версий — от GGUF до NVFP4 и MLX.

В этой статье — пошаговый путь: как скачать веса, выбрать квант под ваше железо, запустить через Ollama или llama.cpp и подключить к кодинг-агентам. Если вы раньше использовали GLM-5.3 только через API или десктопный ZCode — это принципиально другая история: модель работает на ваших серверах, и данные не покидают вашу инфраструктуру.

Схема пути от open-weights до рабочего агента
Схема: от публикации весов на Hugging Face до подключения к кодинг-агентам. Два пути — локальный запуск (Ollama/llama.cpp) или API (Z.AI/Cloud GPU).

Что такое GLM-5.3 и чем она отличается от предшественников

GLM-5.3 — третья итерация флагманской модели Z.AI, спроектированная специально для агентного кодинга. В отличие от GLM-5.2, которая использовала ту же базовую модель, все улучшения в5.3 достигнуты за счёт пост-тренировки (model card на HF):

  • 50% прирост на Z.ai Code Bench по сравнению с GLM-5.2.
  • Terminal Bench 3.0: 28.3 — SOTA среди open-weights моделей (для сравнения, GLM-5.2 набрала4.6).
  • DeepSWE v1.1: 66.9 — на уровне Kimi K3 (67.5) и близко к Fable 5 (69.7).
  • Агентное RL-обучение — пост-тренировка охватывает длинные цепочки действий, многоразовые вызовы инструментов и декомпозицию подзадач.
  • Гибкий reasoning — три уровня продумывания (low, high, max), управляемых параметром reasoning_effort. По умолчанию max (документация).

Архитектура

GLM-5.3 построена на архитектуре Mixture-of-Experts (MoE) с индексацией:

Параметр Значение
Общее число параметров 753B
Эксперты (routed) 256
Активных экспертов на токен 8
Контекстное окно 1 048 576 токенов
vocab_size 154 880
Число слоёв 78
Типичные тензоры BF16, F8_E4M3, F32

8 из 256 экспертов активируются на каждый токен — это значит, что реальная вычислительная нагрузка соответствует модели размером ~47B, не 753B. Именно благодаря MoE-архитектуре квантованные версии работают быстрее, чем ожидалось от модели такого размера.

Бенчмарки GLM-5.3 для кодинга
Ключевые бенчмарки: GLM-5.3 — сильнейшая open-weights модель для кодинга на момент публикации (28.08.2026). Данные: huggingface.co/zai-org/GLM-5.3.

Где скачать веса и кванты

Оригинальные веса

Полные веса доступны на Hugging Face: huggingface.co/zai-org/GLM-5.3.

# Через huggingface-cli
pip install huggingface_hub
huggingface-cli download zai-org/GLM-5.3 --local-dir ./glm-5.3

# Или через git lfs
git lfs install
git clone https://huggingface.co/zai-org/GLM-5.3

Размеры файлов:
— BF16: ~1.51 ТБ (3 файла safetensors)
— F8_E4M3 (FP8): ~753 ГБ
— F32: ~3 ТБ

Квантованные версии (GGUF)

Наиболее практичный вариант — unsloth/GLM-5.3-GGUF от Unsloth (60 лайков, один из самых скачиваемых квантов). Доступные размеры (hardware compatibility на странице модели):

Квант Размер файла RAM (минимум)
UD-IQ1_S 217 ГБ ~220 ГБ
UD-Q2_K_XL 254 ГБ ~255 ГБ
UD-Q3_K_XL 343 ГБ ~345 ГБ
UD-Q4_K_XL 467 ГБ ~470 ГБ
UD-Q5_K_XL 562 ГБ ~565 ГБ
UD-Q6_K_XL 684 ГБ ~690 ГБ
Q8_0 801 ГБ ~805 ГБ
BF16 1.51 ТБ ~1.52 ТБ

Помимо Unsloth, на Hugging Face доступны ещё 26 квантованных версий (полный список): NVFP4 (391 ГБ), MLX для Apple Silicon (от 60 до 209 ГБ), EXL3 для exllamav3 и другие.

Другие форматы

Требования к железу

GLM-5.3 — модель класса «дата-центр». Даже самый компактный квант (IQ1_S, 217 ГБ) не помещается ни в одну consumer-конфигурацию.

Требования к железу
Требования к RAM/VRAM для GGUF-квантов Unsloth. Q4_K_XL (467 ГБ) — рекомендуемый баланс.

Реалистичные конфигурации

Конфигурация Квант Стоимость (аренда/мес) Примечание
8× A100 80GB Q4_K_XL (467 ГБ) $5 000–8 000 Минимальный комфорт
4× H100 80GB Q4_K_XL (467 ГБ) $8 000–12 000 Быстрее, чем A100
3× A100 80GB + CPU offload IQ1_S (217 ГБ) $3 000–5 000 Медленнее, но дешевле
20× A100 80GB BF16 (1.51 ТБ) $20 000+ Оригинальное качество

Стоимость аренды GPU-серверов актуальна на август 2026 и зависит от провайдера (Lambda, RunPod, vast.ai и т.д.).

Практический совет: если вы хотите просто попробовать модель — используйте API (см. раздел ниже). Локальный запуск оправдан, только если нужна полная приватность данных или вы планируете массовое использование.

Запуск через Ollama

Ollama — самый простой способ запустить GLM-5.3, если у вас есть достаточно RAM. Ollama уже поддерживает GLM-5.3 (библиотека моделей):

# Запуск GGUF-версии через Ollama
ollama run hf.co/unsloth/GLM-5.3-GGUF:UD-Q4_K_XL

# Или из официальной библиотеки Ollama
ollama run glm-5.3

На момент публикации в библиотеке Ollama есть две версии (ollama.com/search):
glm-5.3 — флагманская модель (9,7K скачиваний)
glm-5.3-flash — мультимодальная,18B активных параметров (24,3K скачиваний)

Ollama автоматически скачает модель при первом запуске. После загрузки сервер запустится на localhost:11434 с OpenAI-совместимым API.

Через llama.cpp (гибрид CPU+GPU)

Если нужно больше контроля над распределением нагрузки между GPU и CPU:

# Установка llama.cpp
curl -LsSf https://llama.app/install.sh | sh

# Запуск сервера с автоматическим выбором
llama serve -hf unsloth/GLM-5.3-GGUF:UD-Q4_K_XL

# Или с ручным распределением GPU layers
llama serve -hf unsloth/GLM-5.3-GGUF:UD-Q4_K_XL \
  -ngl 35 \
  --ctx-size 131072

Параметр -ngl задаёт количество слоёв, загружаемых на GPU. При недостатке VRAM модель автоматически offload’ит остаток на CPU — работает медленнее, но работает.

Через vLLM / SGLang (для серверных конфигураций)

Для multi-GPU серверов без offloading на CPU:

# vLLM
pip install vllm
vllm serve "zai-org/GLM-5.3"

# SGLang
pip install sglang
python3 -m sglang.launch_server \
    --model-path "zai-org/GLM-5.3" \
    --host 0.0.0.0 \
    --port 30000

Оба варианта предоставляют OpenAI-совместимый API на порту 8000 (vLLM) или 30000 (SGLang).

Подключение к кодинг-агентам

GLM-5.3 через Ollama или llama.cpp работает как OpenAI-совместимый сервер — это значит, что её можно подключить к любому агенту, поддерживающему кастомный провайдер.

Aider

Aider подключается к любой LLM через OpenAI-совместимый API (aider.chat/docs/llms):

# После запуска Ollama/GLM-5.3
cd /path/to/your/project

# Подключение через OpenAI SDK
aider --model openai/glm-5.3 \
  --openai-api-base http://localhost:11434/v1

Aider автоматически строит карту репозитория и отправляет релевантные файлы в контекст.

OpenCode

OpenCode интегрируется с Ollama из коробки (docs.ollama.com/integrations):

# OpenCode + Ollama
opencode --provider ollama --model glm-5.3

OpenCode также поддерживает подключение к любому OpenAI-совместимому серверу через параметры конфигурации.

Cline (VS Code)

Cline поддерживает Ollama как провайдер:

  1. Установите расширение Cline в VS Code.
  2. В настройках провайдера выберите Ollama.
  3. Укажите модель glm-5.3.
  4. Cline подключится к localhost:11434 автоматически.

Claude Code

Claude Code можно направить на кастомный провайдер через --model:

# Через Ollama
claude --model ollama/glm-5.3

# Или через OpenAI-совместимый endpoint
ANTHROPIC_BASE_URL=http://localhost:11434/v1 claude

Через API (без железа)

Если локальный запуск не подходит — Z.AI предоставляет API:

# Регистрация: z.ai/model-api
# API Key: z.ai/manage-apikey/apikey-list
# Pricing: z.ai/guides/overview/pricing

# Пример вызова (OpenAI-совместимый)
curl -X POST "https://api.z.ai/api/paas/v4/chat/completions" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [{"role": "user", "content": "Помоги с рефакторингом"}]
  }'

GLM Coding Plan: от $18/мес — включает GLM-5.3, GLM-5.3-Flash и совместимость с Claude Code / Cline / OpenCode (z.ai/subscribe).

Помимо Z.AI API, GLM-5.3 доступна через Together AI, Novita, Cerebras, Groq и другие inference-провайдеры (список на HF).

Настройка reasoning effort

GLM-5.3 поддерживает три уровня «мышления» — это напрямую влияет на качество и стоимость ответов (документация):

Уровень Когда использовать Примеры задач
low Быстрые вопросы, рутина Форматирование, переименование, простые правки
high Средняя сложность Рефакторинг, написание тестов, объяснение кода
max (по умолчанию) Сложные архитектурные задачи Длинные агентные цепочки, отладка, написание новых модулей

Для кодинг-агентов рекомендуется max или high: модель решает, сколько «думать» над каждым шагом, и при max результаты стабильнее на длинных траекториях.

Российские реалии

Hugging Face

Hugging Face работает из России без VPN на момент публикации (август 2026). Скачивание больших моделей через huggingface-cli идёт напрямую, но на скорости Downloads/Uploads могут быть ограничения при использовании публичных IP.

Для ускорения скачивания можно использовать зеркало hf-mirror.com (зеркало Hugging Face, расположено в Китае):

# Настройка зеркала
export HF_ENDPOINT=https://hf-mirror.com
huggingface-cli download zai-org/GLM-5.3 --local-dir ./glm-5.3

Ollama в РФ

Ollama устанавливается и работает без ограничений на любой платформе (macOS, Linux, Windows). Загрузка моделей идёт напрямую с ollama.com — без VPN.

Оплата API

Z.AI API (z.ai) — китайская компания, работает с международными картами. Visa/Mastercard ограничены для российских пользователей из-за санкций. Реальные способы оплаты: UnionPay, криптовалюта, виртуальные карты через посредников.

Cloud GPU (Lambda, RunPod, vast.ai) — оплата через Stripe, аналогичные ограничения для российских карт.

Русскоязычное освещение

Тема запуска GLM-5.3 локально в рунете освещена слабо — релиз свежий (28.08.2026), крупные публикации на Habr/vc.ru пока отсутствуют. На Habr есть обзоры предыдущих версий GLM-5.1/5.2 и руководства по запуску MoE-моделей через Ollama, но специфичных материалов по GLM-5.3 open-weight на момент написания статьи не обнаружено.

Честные ограничения

GLM-5.3 — не модель для ноутбука. Даже самый компактный квант (IQ1_S, 217 ГБ) требует сервер с тремя A100 80GB. Это оборудование стоимостью десятки тысяч долларов или аренда от $3 000/мес. Для индивидуального разработчика реалистичный путь — API или cloud GPU.

Кастомная лицензия. Лицензия glm-5.3 — не Apache 2.0 и не MIT. Она разрешает коммерческое использование, но имеет ограничения: запрещено использование для обучения конкурирующих моделей, есть ограничения на деплой в определённых юрисдикциях. Перед коммерческим использованием — прочитайте полный текст лицензии на странице модели (huggingface.co/zai-org/GLM-5.3).

Качество при экстремальном квантовании. IQ1_S (217 ГБ) и Q2_K_XL (254 ГБ) существенно теряют в качестве: модель начинает «галлюцинировать» на длинных контекстах, путает имена переменных, генерирует синтаксические ошибки. Рекомендуемый минимум для работы — Q4_K_XL.

Нет vision. GLM-5.3 — текстовая модель. Если нужна работа с изображениями, посмотрите на GLM-5.3-Flash — мультимодальную модель с18B активными параметрами.

Скорость. На cpu-only конфигурации генерация идёт порядка1–3 токенов в секунду. Для комфортной работы нужен GPU с полной загрузкой экспертов.

Сравнение: локально vs API

Локально vs API
Что выбрать: локальный запуск или API — зависит от ваших приоритетов.
Критерий Локально API (Z.AI / Cloud)
Стоимость старта $3 000+/мес (аренда GPU) $18/мес (Coding Plan)
Приватность Полная Зависит от провайдера
Настройка Часы/дни Минуты
Лимиты Только ваше железо Rate limits, лимиты токенов
Гибкость Fine-tune, кастомизация Только API-параметры
Для кого Компании, research, compliance Индивидуальные разработчики

Итого

GLM-5.3 open-weight — событие, меняющее правила игры: крупнейшая модель для кодинга теперь доступна для скачивания и запуска на собственных серверах. Реалистичный путь для большинства разработчиков — API Z.AI или cloud GPU, но для компаний с требованиями к приватности локальный запуск через Ollama/llama.cpp даёт полный контроль над моделью и данными.

Если вы хотите просто попробовать — начните с API (z.ai/model-api) или бесплатного кодинг-плана. Если нужно локально — арендуйте GPU-сервер с 8× A100 и запустите Q4_K_XL через Ollama.

Подробнее о десктопном клиенте ZCode, который использует GLM-5.3 из коробки — в обзоре ZCode от Z.AI. Сравнение локальных нейросетей для кодинга — в подборке моделей для Ollama, сравнении лучших ИИ для кодинга и обзоре моделей для кодинга 2026.

Насколько публикация полезна?

Нажмите на звезду, чтобы оценить!

Средняя оценка / 5. Количество оценок:

Оценок пока нет. Поставьте оценку первым.

Добавить комментарий

Adblock
detector