26 августа 2026 года Alibaba выпустила Qwen3.8-Flash-Next — экспериментальную модель с архитектурой, которую команда называет «превью Qwen4». 125 млрд параметров, но на каждом шаге активны только 6 млрд. Simon Willison (автор библиотеки Datasette и один из самых активных обозревателей LLM) скачал квантизированные веса от Unsloth и запустил на DGX Spark.
В этой статье — разбор модели по первоисточникам: что внутри, как работает MoE 125B/6B, какие бенчмарки, как скачать и запустить, и почему это важно для понимания тренда «большие модели с маленьким потреблением».

Что такое Qwen3.8-Flash-Next
Qwen3.8-Flash-Next — мультимодальная языковая модель (Causal Language Model with Vision Encoder) от Alibaba Qwen Team. Лицензия — qwen-community-1.0 (открытые веса). Архитектура обозначена как qwen4exp — экспериментальная основа для будущего поколения Qwen4.
Ключевые характеристики по данным карточки модели на Hugging Face (https://huggingface.co/Qwen/Qwen3.8-Flash-Next):
- Параметры: 125 млрд total, 6 млрд активных на каждом шаге.
- N-gram Embedding: 51 млрд дополнительных параметров (биграммы/триграммы).
- MTP (Multi-Token Prediction): 4 млрд параметров, 1 слой.
- Контекст: 262 144 токена нативно, до 1 000 000 через RoPE-экстраполяцию (YaRN).
- Ввод: текст + изображения + видео (мультимодальная).
- Эксперты MoE: 512, активируются 10 маршрутизированных + 1 общий.
Кроме открытых весов, доступна облачная версия Qwen3.8-Flash через Qwen Cloud (https://www.qwencloud.com) — продакшн-вариант с 1M контекста и встроенными инструментами. Но нас интересует локальный запуск.

Архитектура: как 125 млрд становятся 6 млрд
Классические модели работают со всеми параметрами на каждом шаге: 7B — это 7B вычислений, 27B — 27B. MoE (Mixture of Experts) разбивает слой на множество «экспертов» и активирует только часть из них через маршрутизатор.
В Qwen3.8-Flash-Next это реализовано через 48 слоёв. Каждый слой содержит 3 блока Gated DeltaNet → MoE и 1 блок Qwen Sparse Attention (QSA) → MoE. Всего 512 экспертов, но на каждом токене работают всего 11 (10 маршрутизированных + 1 общий).

Помимо MoE, в архитектуре три ключевых новшества:
Hybrid Attention с QSA (Qwen Sparse Attention). Вместо классического механизма внимания, который обрабатывает каждый токен, QSA работает на уровне микроблоков. Это снижает латентность при длинном контексте — критично для агентных сценариев, где модель обрабатывает десятки тысяч токенов за ход.
Gated Residual. Широкие residual streams с data-dependent read gate и per-branch scalar write gate. Классические residual connections с нормализацией делают глубокое обучение управляемым; Gated Residual добавляет более тонкую регулировку потоков информации между слоями без увеличения накладных расходов на инференс.
N-gram Embedding. 51 млрд дополнительных параметров, которые не участвуют в вычислениях — они indexing-based. Биграммы и триграммы на втором слое позволяют масштабировать «знание» модели через память, а не через вычисления. Это дешевле MoE для memory-constrained ускорителей.
Бенчмарки: цифры против флагманов
Результаты с карточки модели на Hugging Face. Все модели оценены в июле–августе 2026:
| Задача | Qwen3.8-Flash-Next (125B/6B) | Qwen 3.8 27B | DeepSeek-V4-Flash | Claude Opus 4.6 Max |
|---|---|---|---|---|
| SWE-bench Pro (кодинг) | 62.5 | 61.7 | 56.0 | 53.4 |
| DeepSWE 1.1 (агентный кодинг) | 58.7 | 42.2 | 54.4 | — |
| SWE-bench Multilingual | 81.0 | 73.8 | — | 77.5 |
| LiveCodeBench v6 (конкурентный кодинг) | 91.9 | 90.3 | 90.6 | 88.8 |
| GPQA Diamond (научные рассуждения) | 91.7 | 89.2 | 90.8 | 91.3 |
| CoWorkBench (офисные задачи) | 73.9 | 70.7 | 45.1 | 68.2 |
| IFBench (следование инструкциям) | 81.3 | 79.5 | 79.2 | 62.5 |
Qwen3.8-Flash-Next с 6 млрд активных параметров обходит Claude Opus 4.6 Max на SWE-bench Pro (62.5 vs 53.4) — задачах по исправлению багов в реальных репозиториях. На LiveCodeBench v6 — 91.9 против 88.8. Разница в 62 раза по числу активных параметров (6 млрд vs ~400+ млрд у флагманов), а результаты сопоставимы или лучше.
Конечно, бенчмарки — не вся картина. На HLE (Hard Likelihood Evaluation) Claude Opus 4.6 Max всё ещё лидирует (40.0 vs 35.9). Но для кодинга — MoE-подход показывает Pareto-преимущество.
Опыт Simon Willison: DGX Spark + Unsloth-кванты
Simon Willison (https://simonwillison.net/2026/Aug/26/qwen38-flash-next/) протестировал модель на DGX Spark — компактном сервере от NVIDIA с unified memory (48 ГБ) стоимостью около $3 000.
Для запуска он использовал квантизированные GGUF-версии от Unsloth (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF):
- UD-IQ1_S — 72.5 ГБ. Самый компактный квант. Simon генерировал SVG-иллюстрации (пеликаны на велосипеде), модель справлялась, но при 1-битном квантовании качество заметно деградирует.
- UD-Q2_K_XL — 78.9 ГБ. Simon назвал его фаворитом. На DGX Spark с выгрузкой (offloading) части параметров на NVMe — работает, генерация приемлемая.
My favorite so far was this xhigh reasoning effort one from UD-Q2_K_XL.
— Simon Willison (https://simonwillison.net/2026/Aug/26/qwen38-flash-next/), 26.08.2026
Важный нюанс: DGX Spark имеет 48 ГБ unified memory, а кванты весят 72–79 ГБ. Для запуска требуется выгрузка части параметров на диск — это снижает скорость. Полноценный инференс возможен на серверах с 96+ ГБ VRAM.
Полная таблица квантов Unsloth
| Квант | Размер | Бит/параметр | Минимальное железо |
|---|---|---|---|
| UD-IQ1_S | 72.5 ГБ | ~1 | DGX Spark (с offloading) |
| UD-IQ1_M | 74.5 ГБ | ~1 | DGX Spark (с offloading) |
| UD-Q2_K_XL | 78.9 ГБ | ~2 | DGX Spark (с offloading) |
| UD-IQ3_XXS | 82 ГБ | ~3 | DGX Spark (предел) |
| UD-Q3_K_XL | 90 ГБ | ~3 | DGX Spark + NVMe swap |
| UD-IQ4_XS | 93.7 ГБ | ~4 | 2× A6000 / A100 160G |
| UD-Q4_K_XL | 111 ГБ | ~4 | A100 160G / 2× A6000 |
| UD-Q5_K_XL | 158 ГБ | ~5 | A100 80G × 2 |
| UD-Q6_K_XL | 169 ГБ | ~6 | A100 80G × 2–3 |
| Q8_0 | 188 ГБ | 8 | A100 80G × 3 |
| BF16 | 354 ГБ | 16 | A100 80G × 5+ |

Практика: как скачать и запустить
Вариант 1: llama.cpp (рекомендуется для квантов)
# Установка llama.cpp
curl -LsSf https://llama.app/install.sh | sh
# Запуск с UD-Q4_K_XL (111 ГБ — нужен сервер с достаточным VRAM)
llama serve -hf unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
# Или через Docker
docker model run hf.co/unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
Вариант 2: Ollama
# Прямой запуск (скачает GGUF автоматически)
ollama run hf.co/unsloth/Qwen3.8-Flash-Next-GGUF:UD-Q4_K_XL
Вариант 3: vLLM (полные веса или GGUF)
pip install vllm
vllm serve "Qwen/Qwen3.8-Flash-Next"
# Запрос
curl -X POST "http://localhost:8000/v1/chat/completions" \
-H "Content-Type: application/json" \
--data '{
"model": "Qwen/Qwen3.8-Flash-Next",
"messages": [{"role": "user", "content": "Напиши hello world на Python"}]
}'
Вариант 4: SGLang
pip install sglang
python3 -m sglang.launch_server \
--model-path "Qwen/Qwen3.8-Flash-Next" \
--host 0.0.0.0 --port 30000
Вариант 5: LM Studio (визуальный интерфейс)
LM Studio (https://lmstudio.ai/) — десктопное приложение с GUI. Открываете Models, ищете unsloth/Qwen3.8-Flash-Next-GGUF, скачиваете квант нужного размера одним кликом. Запускаете сервер, подключаете агента по OpenAI-совместимому API на localhost:1234.
Настройка thinking mode
По умолчанию модель работает в thinking mode — генерирует «рассуждения» перед ответом. Для экономии токенов на рутинных задачах:
# Отключение thinking через API
extra_body = {"chat_template_kwargs": {"enable_thinking": False}}
Уровни reasoning effort: xhigh (максимум), medium, low. Simon Willison рекомендует low для генерации кода — на DGX Spark с xhigh простая SVG-задача превращалась в 21-минутное ожидание.
Требования по железу
Минимальные и рекомендуемые конфигурации:
| Сценарий | Железо | Квант | Ожидаемая скорость |
|---|---|---|---|
| Эксперимент | DGX Spark (48 ГБ) | UD-IQ1_S/Q2_K_XL (с offloading) | Медленная |
| Рабочий локальный | 2× A6000 (96 ГБ) | UD-Q4_K_XL (111 ГБ) | Средняя |
| Сервер | A100 160G | UD-Q4_K_XL (111 ГБ) | Высокая |
| Максимум | A100 80G × 3 | Q8_0 (188 ГБ) | Максимальная |
| Облачный API | — | — | Зависит от провайдера |
DGX Spark — компактный AI-сервер от NVIDIA, официально стоит около $3 000. 48 ГБ unified memory, ARM-процессор. Simon Willison активно тестирует на нём локальные модели — это его основная платформа для экспериментов с открытыми весами.
Российские реалии
Доступность модели
Hugging Face — основной источник весов. В России HF работает без VPN (https://huggingface.co), но скачивание 72–354 ГБ весов требует стабильного соединения. Зеркало hf-mirror.com (https://hf-mirror.com) ускоряет скачивание через китайские CDN-серверы Alibaba.
Qwen Cloud (https://www.qwencloud.com) — облачный API. Доступность из РФ не проверена; Alibaba не публикует список заблокированных регионов.
Unsloth — кванты доступны через HF (https://huggingface.co/unsloth/Qwen3.8-Flash-Next-GGUF), скачивание через hf-mirror.com.
DGX Spark в РФ
NVIDIA DGX Spark официально не продаётся в России. Через посредников и перекупщиков доступен, но с наценкой 30–50% и вопросами гарантии. Альтернативы для локального запуска:
- Рабочая станция с 2× NVIDIA RTX 4090 (48 ГБ VRAM) — хватит для UD-IQ1_S (72.5 ГБ с offloading). Стоимость 400–500 тыс. руб.
- Сервер с NVIDIA A6000 (48 ГБ) × 2 — для UD-Q2_K_XL (78.9 ГБ). Стоимость от 800 тыс. руб.
- Аренда GPU — vast.ai, RunPod (принимают крипту). A100 80G — от $1/час.
Оплата
Российские Visa/Mastercard не работают с зарубежными сервисами. Варианты:
— Локальный запуск — бесплатно, без оплаты. Это главное преимущество open-weight моделей.
— Аренда GPU — через криптовалюту (BTC/USDT) или UnionPay.
— Посредники — AITUNNEL (https://aitunnel.ru/) принимает рубли за часть сервисов.
Тема запуска Qwen3.8-Flash-Next и DGX Spark в рунете практически не освещена. Simon Willison — основной источник практического опыта.
Честные ограничения
- Размер весов. Даже самый компактный квант (IQ1_S) весит 72.5 ГБ. На ноутбуке с 16 ГБ RAM — не запустится. Это серверная модель.
- Offloading = медленно. DGX Spark (48 ГБ) не вмещает кванты целиком. Выгрузка на NVMe замедляет генерацию в 3–5 раз по сравнению с полным VRAM.
- 1-битное квантование деградирует. UD-IQ1_S (72.5 ГБ) — экспериментальный. Для реальной работы нужен минимум Q2_K_XL (78.9 ГБ), лучше Q3_K_XL (90 ГБ) или Q4_K_XL (111 ГБ).
- Reasoning по умолчанию. Модель тратит десятки тысяч токенов на «рассуждения» даже для простых задач. Без отключения thinking режима скорость падает в 10 раз.
- Архитектура экспериментальная.
qwen4exp— превью. Формат, параметры и поведение могут измениться в релизе Qwen4. - Лицензия qwen-community-1.0 — открытая, но не Apache 2.0. Проверьте условия для коммерческого использования.
- Мультимодальность ограничена. Vision Encoder есть, но на практике на DGX Spark с квантованной моделью обработка изображений требует значительных дополнительных ресурсов.
Вывод
Qwen3.8-Flash-Next демонстрирует тренд, который определяет 2026 год: архитектурная эффективность важнее грубого масштабирования. 512 экспертов с 11 активными на шаг, N-gram Embedding для масштабирования через память, Sparse Attention для длинного контекста — всё это позволяет 6 млрд активных параметров конкурировать с 400+ млрд флагманов на кодинговых задачах.
Для практики: модель подходит тем, у кого есть сервер с 96+ ГБ VRAM (или DGX Spark для экспериментов). Qwen 3.8 27B всё ещё проще и доступнее — 17 ГБ на ноутбуке, Apache 2.0, 15–30 ток/с. Flash-Next — следующий шаг: MoE-эффективность, мультимодальность, превью архитектуры будущего.
Для России локальные open-weight модели — единственный путь работать с современными LLM без VPN и зарубежных карт. HF доступен, кванты от Unsloth скачиваются через hf-mirror.com, а CUDA-совместимое железо можно собрать или арендовать за крипту.
Дальше по теме: маленькие быстрые модели для кодинга: gpt-5.6-luna и компания, локальные нейросети для кодинга: Qwen3-Coder через Ollama, модели для кодинга 2026: сравнение, что такое агентный кодинг.
