Перейти к содержимому

Кейс: Qwen3.8-Flash-Next — MoE 125B/6B на DGX Spark

26 августа 2026 года Alibaba выпустила Qwen3.8-Flash-Next — экспериментальную модель с архитектурой, которую команда называет «превью Qwen4». 125 млрд параметров, но на каждом шаге активны только 6 млрд. Simon Willison (автор библиотеки Datasette и один из самых активных обозревателей LLM) скачал квантизированные веса от Unsloth и запустил на DGX Spark.

В этой статье — разбор модели по первоисточникам: что внутри, как работает MoE 125B/6B, какие бенчмарки, как скачать и запустить, и почему это важно для понимания тренда «большие модели с маленьким потреблением».

Скриншот поста Simon Willison о Qwen3.8-Flash-Next
Пост Simon Willison (26.08.2026): «Another open weights model from Qwen… 125B tokens, but only 6B active which means it gets a significant performance boost.» Источник: simonwillison.net.

Что такое Qwen3.8-Flash-Next

Qwen3.8-Flash-Next — мультимодальная языковая модель (Causal Language Model with Vision Encoder) от Alibaba Qwen Team. Лицензия — qwen-community-1.0 (открытые веса). Архитектура обозначена как qwen4exp — экспериментальная основа для будущего поколения Qwen4.

Ключевые характеристики по данным карточки модели на Hugging Face (https://huggingface.co/Qwen/Qwen3.8-Flash-Next):

  • Параметры: 125 млрд total, 6 млрд активных на каждом шаге.
  • N-gram Embedding: 51 млрд дополнительных параметров (биграммы/триграммы).
  • MTP (Multi-Token Prediction): 4 млрд параметров, 1 слой.
  • Контекст: 262 144 токена нативно, до 1 000 000 через RoPE-экстраполяцию (YaRN).
  • Ввод: текст + изображения + видео (мультимодальная).
  • Эксперты MoE: 512, активируются 10 маршрутизированных + 1 общий.

Кроме открытых весов, доступна облачная версия Qwen3.8-Flash через Qwen Cloud (https://www.qwencloud.com) — продакшн-вариант с 1M контекста и встроенными инструментами. Но нас интересует локальный запуск.

Карточка Qwen3.8-Flash-Next на Hugging Face
Карточка модели Qwen/Qwen3.8-Flash-Next на Hugging Face: архитектура qwen4exp, 188K скачиваний за месяц. Источник: huggingface.co/Qwen/Qwen3.8-Flash-Next.

Архитектура: как 125 млрд становятся 6 млрд

Классические модели работают со всеми параметрами на каждом шаге: 7B — это 7B вычислений, 27B — 27B. MoE (Mixture of Experts) разбивает слой на множество «экспертов» и активирует только часть из них через маршрутизатор.

В Qwen3.8-Flash-Next это реализовано через 48 слоёв. Каждый слой содержит 3 блока Gated DeltaNet → MoE и 1 блок Qwen Sparse Attention (QSA) → MoE. Всего 512 экспертов, но на каждом токене работают всего 11 (10 маршрутизированных + 1 общий).

Схема: MoE 125B/6B — как работают активные параметры
Авторская схема: из 512 экспертов на каждый токен активны только 11. N-gram Embedding добавляет 51 млрд параметров без вычислительных затрат.

Помимо MoE, в архитектуре три ключевых новшества:

Hybrid Attention с QSA (Qwen Sparse Attention). Вместо классического механизма внимания, который обрабатывает каждый токен, QSA работает на уровне микроблоков. Это снижает латентность при длинном контексте — критично для агентных сценариев, где модель обрабатывает десятки тысяч токенов за ход.

Gated Residual. Широкие residual streams с data-dependent read gate и per-branch scalar write gate. Классические residual connections с нормализацией делают глубокое обучение управляемым; Gated Residual добавляет более тонкую регулировку потоков информации между слоями без увеличения накладных расходов на инференс.

N-gram Embedding. 51 млрд дополнительных параметров, которые не участвуют в вычислениях — они indexing-based. Биграммы и триграммы на втором слое позволяют масштабировать «знание» модели через память, а не через вычисления. Это дешевле MoE для memory-constrained ускорителей.

Бенчмарки: цифры против флагманов

Результаты с карточки модели на Hugging Face. Все модели оценены в июле–августе 2026:

Задача Qwen3.8-Flash-Next (125B/6B) Qwen 3.8 27B DeepSeek-V4-Flash Claude Opus 4.6 Max
SWE-bench Pro (кодинг) 62.5 61.7 56.0 53.4
DeepSWE 1.1 (агентный кодинг) 58.7 42.2 54.4
SWE-bench Multilingual 81.0 73.8 77.5
LiveCodeBench v6 (конкурентный кодинг) 91.9 90.3 90.6 88.8
GPQA Diamond (научные рассуждения) 91.7 89.2 90.8 91.3
CoWorkBench (офисные задачи) 73.9 70.7 45.1 68.2
IFBench (следование инструкциям) 81.3 79.5 79.2 62.5

Qwen3.8-Flash-Next с 6 млрд активных параметров обходит Claude Opus 4.6 Max на SWE-bench Pro (62.5 vs 53.4) — задачах по исправлению багов в реальных репозиториях. На LiveCodeBench v6 — 91.9 против 88.8. Разница в 62 раза по числу активных параметров (6 млрд vs ~400+ млрд у флагманов), а результаты сопоставимы или лучше.

Конечно, бенчмарки — не вся картина. На HLE (Hard Likelihood Evaluation) Claude Opus 4.6 Max всё ещё лидирует (40.0 vs 35.9). Но для кодинга — MoE-подход показывает Pareto-преимущество.

Опыт Simon Willison: DGX Spark + Unsloth-кванты

Simon Willison (https://simonwillison.net/2026/Aug/26/qwen38-flash-next/) протестировал модель на DGX Spark — компактном сервере от NVIDIA с unified memory (48 ГБ) стоимостью около $3 000.

Для запуска он использовал квантизированные GGUF-версии от Unsloth (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF):

  • UD-IQ1_S — 72.5 ГБ. Самый компактный квант. Simon генерировал SVG-иллюстрации (пеликаны на велосипеде), модель справлялась, но при 1-битном квантовании качество заметно деградирует.
  • UD-Q2_K_XL — 78.9 ГБ. Simon назвал его фаворитом. На DGX Spark с выгрузкой (offloading) части параметров на NVMe — работает, генерация приемлемая.

My favorite so far was this xhigh reasoning effort one from UD-Q2_K_XL.

— Simon Willison (https://simonwillison.net/2026/Aug/26/qwen38-flash-next/), 26.08.2026

Важный нюанс: DGX Spark имеет 48 ГБ unified memory, а кванты весят 72–79 ГБ. Для запуска требуется выгрузка части параметров на диск — это снижает скорость. Полноценный инференс возможен на серверах с 96+ ГБ VRAM.

Полная таблица квантов Unsloth

Квант Размер Бит/параметр Минимальное железо
UD-IQ1_S 72.5 ГБ ~1 DGX Spark (с offloading)
UD-IQ1_M 74.5 ГБ ~1 DGX Spark (с offloading)
UD-Q2_K_XL 78.9 ГБ ~2 DGX Spark (с offloading)
UD-IQ3_XXS 82 ГБ ~3 DGX Spark (предел)
UD-Q3_K_XL 90 ГБ ~3 DGX Spark + NVMe swap
UD-IQ4_XS 93.7 ГБ ~4 2× A6000 / A100 160G
UD-Q4_K_XL 111 ГБ ~4 A100 160G / 2× A6000
UD-Q5_K_XL 158 ГБ ~5 A100 80G × 2
UD-Q6_K_XL 169 ГБ ~6 A100 80G × 2–3
Q8_0 188 ГБ 8 A100 80G × 3
BF16 354 ГБ 16 A100 80G × 5+
Unsloth-кванты: размер vs качество
Авторская таблица: Unsloth Dynamic 3.0 кванты для Qwen3.8-Flash-Next. Рекомендация Simon Willison для DGX Spark — UD-Q2_K_XL.

Практика: как скачать и запустить

Вариант 1: llama.cpp (рекомендуется для квантов)

# Установка llama.cpp
curl -LsSf https://llama.app/install.sh | sh

# Запуск с UD-Q4_K_XL (111 ГБ — нужен сервер с достаточным VRAM)
llama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL

# Или через Docker
docker model run hf.co/unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL

Вариант 2: Ollama

# Прямой запуск (скачает GGUF автоматически)
ollama run hf.co/unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL

Вариант 3: vLLM (полные веса или GGUF)

pip install vllm
vllm serve "Qwen/Qwen3.8-Flash-Next"

# Запрос
curl -X POST "http://localhost:8000/v1/chat/completions" \
  -H "Content-Type: application/json" \
  --data '{
    "model": "Qwen/Qwen3.8-Flash-Next",
    "messages": [{"role": "user", "content": "Напиши hello world на Python"}]
  }'

Вариант 4: SGLang

pip install sglang
python3 -m sglang.launch_server \
    --model-path "Qwen/Qwen3.8-Flash-Next" \
    --host 0.0.0.0 --port 30000

Вариант 5: LM Studio (визуальный интерфейс)

LM Studio (https://lmstudio.ai/) — десктопное приложение с GUI. Открываете Models, ищете unsloth/Qwen3.8-Flash-Next-GGUF, скачиваете квант нужного размера одним кликом. Запускаете сервер, подключаете агента по OpenAI-совместимому API на localhost:1234.

Настройка thinking mode

По умолчанию модель работает в thinking mode — генерирует «рассуждения» перед ответом. Для экономии токенов на рутинных задачах:

# Отключение thinking через API
extra_body = {"chat_template_kwargs": {"enable_thinking": False}}

Уровни reasoning effort: xhigh (максимум), medium, low. Simon Willison рекомендует low для генерации кода — на DGX Spark с xhigh простая SVG-задача превращалась в 21-минутное ожидание.

Требования по железу

Минимальные и рекомендуемые конфигурации:

Сценарий Железо Квант Ожидаемая скорость
Эксперимент DGX Spark (48 ГБ) UD-IQ1_S/Q2_K_XL (с offloading) Медленная
Рабочий локальный 2× A6000 (96 ГБ) UD-Q4_K_XL (111 ГБ) Средняя
Сервер A100 160G UD-Q4_K_XL (111 ГБ) Высокая
Максимум A100 80G × 3 Q8_0 (188 ГБ) Максимальная
Облачный API Зависит от провайдера

DGX Spark — компактный AI-сервер от NVIDIA, официально стоит около $3 000. 48 ГБ unified memory, ARM-процессор. Simon Willison активно тестирует на нём локальные модели — это его основная платформа для экспериментов с открытыми весами.

Российские реалии

Доступность модели

Hugging Face — основной источник весов. В России HF работает без VPN (https://huggingface.co), но скачивание 72–354 ГБ весов требует стабильного соединения. Зеркало hf-mirror.com (https://hf-mirror.com) ускоряет скачивание через китайские CDN-серверы Alibaba.

Qwen Cloud (https://www.qwencloud.com) — облачный API. Доступность из РФ не проверена; Alibaba не публикует список заблокированных регионов.

Unsloth — кванты доступны через HF (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF), скачивание через hf-mirror.com.

DGX Spark в РФ

NVIDIA DGX Spark официально не продаётся в России. Через посредников и перекупщиков доступен, но с наценкой 30–50% и вопросами гарантии. Альтернативы для локального запуска:

  • Рабочая станция с 2× NVIDIA RTX 4090 (48 ГБ VRAM) — хватит для UD-IQ1_S (72.5 ГБ с offloading). Стоимость 400–500 тыс. руб.
  • Сервер с NVIDIA A6000 (48 ГБ) × 2 — для UD-Q2_K_XL (78.9 ГБ). Стоимость от 800 тыс. руб.
  • Аренда GPU — vast.ai, RunPod (принимают крипту). A100 80G — от $1/час.

Оплата

Российские Visa/Mastercard не работают с зарубежными сервисами. Варианты:
Локальный запуск — бесплатно, без оплаты. Это главное преимущество open-weight моделей.
Аренда GPU — через криптовалюту (BTC/USDT) или UnionPay.
Посредники — AITUNNEL (https://aitunnel.ru/) принимает рубли за часть сервисов.

Тема запуска Qwen3.8-Flash-Next и DGX Spark в рунете практически не освещена. Simon Willison — основной источник практического опыта.

Честные ограничения

  • Размер весов. Даже самый компактный квант (IQ1_S) весит 72.5 ГБ. На ноутбуке с 16 ГБ RAM — не запустится. Это серверная модель.
  • Offloading = медленно. DGX Spark (48 ГБ) не вмещает кванты целиком. Выгрузка на NVMe замедляет генерацию в 3–5 раз по сравнению с полным VRAM.
  • 1-битное квантование деградирует. UD-IQ1_S (72.5 ГБ) — экспериментальный. Для реальной работы нужен минимум Q2_K_XL (78.9 ГБ), лучше Q3_K_XL (90 ГБ) или Q4_K_XL (111 ГБ).
  • Reasoning по умолчанию. Модель тратит десятки тысяч токенов на «рассуждения» даже для простых задач. Без отключения thinking режима скорость падает в 10 раз.
  • Архитектура экспериментальная. qwen4exp — превью. Формат, параметры и поведение могут измениться в релизе Qwen4.
  • Лицензия qwen-community-1.0 — открытая, но не Apache 2.0. Проверьте условия для коммерческого использования.
  • Мультимодальность ограничена. Vision Encoder есть, но на практике на DGX Spark с квантованной моделью обработка изображений требует значительных дополнительных ресурсов.

Вывод

Qwen3.8-Flash-Next демонстрирует тренд, который определяет 2026 год: архитектурная эффективность важнее грубого масштабирования. 512 экспертов с 11 активными на шаг, N-gram Embedding для масштабирования через память, Sparse Attention для длинного контекста — всё это позволяет 6 млрд активных параметров конкурировать с 400+ млрд флагманов на кодинговых задачах.

Для практики: модель подходит тем, у кого есть сервер с 96+ ГБ VRAM (или DGX Spark для экспериментов). Qwen 3.8 27B всё ещё проще и доступнее — 17 ГБ на ноутбуке, Apache 2.0, 15–30 ток/с. Flash-Next — следующий шаг: MoE-эффективность, мультимодальность, превью архитектуры будущего.

Для России локальные open-weight модели — единственный путь работать с современными LLM без VPN и зарубежных карт. HF доступен, кванты от Unsloth скачиваются через hf-mirror.com, а CUDA-совместимое железо можно собрать или арендовать за крипту.

Дальше по теме: маленькие быстрые модели для кодинга: gpt-5.6-luna и компания, локальные нейросети для кодинга: Qwen3-Coder через Ollama, модели для кодинга 2026: сравнение, что такое агентный кодинг.

Насколько публикация полезна?

Нажмите на звезду, чтобы оценить!

Средняя оценка / 5. Количество оценок:

Оценок пока нет. Поставьте оценку первым.

Добавить комментарий

Adblock
detector