Qwen3.8-27B: бенчмарки уровня Opus 4.6 Max в dense-модели на 27B
14 августа 2026 Alibaba выпустила компактную версию поколения Qwen3.8: плотная модель с нативным пониманием изображений и видео, контекст 262K и управление глубиной мышления в трёх уровнях. Разбираем архитектуру, официальные бенчмарки и то, что это значит для частной LLM в закрытом контуре.
Что произошло
3 августа 2026 Alibaba выпустила флагман поколения, Qwen3.8-Max: MoE-модель на 2,4 трлн параметров (95B активных) с контекстом в 1 млн токенов. Чуть больше недели спустя, 14 августа, команда опубликовала Qwen3.8-27B, компактную версию того же поколения: плотную модель без MoE-экспертов, рассчитанную на развёртывание на рабочих станциях и средних серверх.
Почему релиз важен для локальных LLM:
- Шаг, а не патч. Между Qwen3.6-27B (май 2026) и Qwen3.8-27B агентное кодирование выросло с 13.3 до 42.2 на DeepSWE 1.1, а computer use - с 63.9 до 84.3 на OSWorld-Verified. Это не итерация, а смена класса.
- Первая мультимодальная компактная Qwen. Встроенный vision-энкодер принимает изображения и видео, в том числе многочасовые: скриншоты, чертежи, документы, записи с камер. Для мультимодальных агентных сценариев не нужен отдельный стек.
- Управление мышлением. Три уровня reasoning_effort (xhigh / medium / low) - прямой инструмент контроля соотношения цена/качество в production, о котором мы писали в разборе MTP-ускорения.
Ключевые цифры
Архитектура: что внутри
Gated DeltaNet + Gated Attention
Гибридная раскладка 16 x (3 x DeltaNet-FFN -> 1 x Attention-FFN): 64 слоя, скрытое 5120. Три слоя из четырёх - линейное внимание: длинный контекст дёшево, инференс быстрый.
MTP
Multi-Token Prediction, обученная на нескольких шага вперёд: ускоряет генерацию. Как ускорение влияет на качество, мы разбирали в статье про MTP.
Нативный vision-энкодер
Понимание изображений и видео от STEM-диаграмм до многочасовых записей. Модель - vision-language: текст, изображения и видео в одном контексте.
reasoning_effort: xhigh / medium / low
xhigh по умолчанию для сложных задач, low - под скорость и стоимость. В многошаговых задачах low не всегда быстрее: ошибки и повторы съедают выигрыш.
preserve_thinking включён по умолчанию
Контекст рассуждений сохраняется между ходами диалога. Ключевая фича надёжности для многошаговых агентов.
Все квантизации в день релиза
GGUF, FP8, NVFP4, MLX: от GPU Nvidia и AMD до Apple silicon. Совместимость с vLLM, SGLang, TokenSpeed, Hugging Face Transformers.
Бенчмарки: кодирование и агенты
Из официальной карточки модели Qwen. Базовые модели перевычитаны вендором на том же harness (Claude Code, temp 1.0, top_p 0.95, 256K контекст).
| Бенчмарк | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Opus 4.6 Max |
|---|---|---|---|---|
| Terminal Bench 2.1 | 73.0 | 63.4 | 64.0 | 78.2 |
| SWE-bench Pro | 61.7 | 53.5 | 57.6 | 53.4 |
| DeepSWE 1.1 | 42.2 | 13.3 | 14.2 | - |
| QwenSWEBench (avg@3) | 79.0 | 49.3 | 59.2 | 63.8 |
| NL2Repo-Bench | 42.3 | 36.2 | 41.1 | 47.6 |
| CoWorkBench | 70.7 | 61.0 | 65.1 | 68.2 |
| JobBench | 33.4 | 21.8 | 27.6 | - |
| Agents' Last Exam (Pass@1 / Score) | 20.4 / 42.9 | 10.6 / 27.3 | 13.2 / 33.6 | - |
| LiveCodeBench v6 | 90.3 | 83.9 | 89.6 | 88.8 |
| GPQA Diamond | 89.2 | 87.8 | 90.3 | 91.3 |
| HLE | 30.8 | 24.0 | 34.7 | 40.0 |
| IFBench | 79.5 | 69.1 | 79.1 | 62.5 |
Читайте цифры правильно
Все значения - официальные, из карточки модели Qwen3.8-27B. QwenSWEBench и CoWorkBench - внутренние бенчмарки Alibaba. Сравнение с абсолютным топом (Claude Fable 5, GPT-5.6 Sol, Opus 4.8) вендор намеренно не ведёт: позиционирование - компактная модель для локального инференса. Перед выбором модели мы прогоняем собственный eval на ваших задачах - так же, как в случае с Gemma 4 12B, где официальные цифры разошлись с нашим контуром.
Где Opus 4.6 Max, а где нет
Против Opus 4.6 Max, ближайшего проприетарного ориентира в таблице вендора, Qwen3.8-27B выигрывает на прикладных агентных задачах:
- SWE-bench Pro: 61.7 против 53.4. Dense-модель на 27B опережает проприетарную frontier-модель на реальных инженерных задачах.
- OSWorld-Verified: 84.3 против 72.7. Computer use: модель работает с десктопной средой, приложениями, файлами.
- SWE-MM: 38.6 против 27.1 - мультимодальное программирование по скриншотам и визуальным спецификациям.
- CoWorkBench: 70.7 против 68.2, IFBench: 79.5 против 62.5, LiveCodeBench v6: 90.3 против 88.8.
Позади - общий интеллект и длинные сессии в терминале: HLE 30.8 против 40.0, GPQA Diamond 89.2 против 91.3, Terminal Bench 2.1 73.0 против 78.2, NL2Repo-Bench 42.3 против 47.6.
Инженерная интерпретация: для задач формата "агент с tool-use в вашей среде" (скриншоты, документы, терминал, browser) 27B-модель закрывает Opus-класс при цене инференса на порядок ниже. Для задач с глубоким абстрактным рассуждением (уровень HLE) она пока уступает и frontier-моделям, и Opus 4.6 Max. В продакшене это решается не выбором "одной лучшей модели", а маршрутизацией запросов: тяжёлые случаи - на большую модель, рутину - на 27B.
Бенчмарки: мультимодальность и computer use
| Бенчмарк | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Opus 4.6 Max |
|---|---|---|---|---|
| OSWorld-Verified | 84.3 | 63.9 | 73.3 | 72.7 |
| WebArena-Verified | 64.8 | 48.8 | 55.3 | - |
| AndroidWorld | 81.9 | 70.3 | 81.0 | 62.0 |
| SWE-MM | 38.6 | 25.7 | 30.0 | 27.1 |
| ClawEval-MM (Pass@3 / avg) | 57.4 / 56.9 | 42.6 / 50.4 | 57.4 / 60.1 | 52.5 / 54.7 |
| OmniDocBench 1.5 | 91.1 | 89.4 | 91.4 | 86.6 |
| MathVision | 90.0 | 85.1 | 90.3 | 65.5 |
| RealWorldQA | 85.9 | 84.1 | 86.9 | 73.9 |
Режим мышления и контроль стоимости
Qwen3.8-27B работает по умолчанию в thinking-режиме: сначала модель генерирует рассуждения, потом ответ. Мышление можно выключить на уровне запроса, глубину задаёт reasoning_effort:
- xhigh (по умолчанию) - сложные задачи, требующие тщательного анализа;
- medium - баланс точности и скорости;
- low - задержкочувствительные сценарии, оптимизация под стоимость.
Рекомендуемые параметры сэмплинга: в thinking-режиме - temperature 1.0, top_p 0.95, top_k 20; без мышления - temperature 0.7, top_p 0.80, presence_penalty 1.5.
Нестандартное предупреждение от вендора: в многошаговых агентных задачах снижение reasoning_effort не всегда сокращает общее время. Быстрый ход за ходом даёт поверхностный анализ, ошибки и повторы, итоговая задержка и расход токенов растут. В production мы держим профили effort по типам задач: xhigh для длинных агентных цепочек, low для классификации, извлечения и простых операций. Это один из главных рычагов себестоимости инференса на том же железе.
Железо для локального развёртывания
Ориентир по весам модели; KV-кэш и активации добавляются сверху в зависимости от контекста и параллельности.
| Точность | VRAM (веса), ориентир | Рабочая конфигурация |
|---|---|---|
| BF16 / FP16 | ~54 GB | 1 x H100 80 GB или 2 x RTX 5090 32 GB; vLLM или SGLang |
| FP8 / NVFP4 | ~28-30 GB | 1 x RTX PRO 6000 96 GB с запасом под длинный контекст или 1 x H100 |
| Q4 (GGUF) | ~16-18 GB | 1 x RTX 4090 / 5090 24-32 GB на llama.cpp или Ollama - для пилота |
Что это значит для частной LLM
Три вещи делают Qwen3.8-27B интересной для закрытого контура.
Мультимодальные агенты без отдельного стека. Модель, которая видит изображения и видео, работает со скриншотами SCADA, чертежами, фото продукции, видеозаписями с камер объекта - вместе с tool-use через MCP. Для RAG по технической документации с таблицами, схемами и сканами это прямой апгрейд: документопонимание OmniDocBench 91.1 выше, чем у Opus 4.6 Max (86.6).
Длинные сессии. 262K нативного контекста (хостинговая версия Qwen Cloud анонсирована с 1M) хватает для многошаговых задач, где агент накапливает логи, файлы и промежуточные результаты, не теряя нити. preserve_thinking по умолчанию убирает деградацию качества на повторных ходах.
Управляемая стоимость. Профили reasoning_effort и безмыслящие low-запросы для рутинных операций позволяют на одном сервере закрыть шире круг задач, а расход токенов зависит от профиля, а не только от промпта.
Ограничения те же, что у любого открытого класса 27B: абстрактное рассуждение (HLE 30.8 против 40.0 у Opus 4.6 Max) и длинные сессии в терминале пока позади. Поэтому мы не рекомендуем модель по пресс-релизу: сначала собственный eval на ваших документах и сценариях, потом архитектура. Развёртываем модель на GPU заказчика - vLLM/SGLang, квантизация под VRAM, мониторинг Prometheus/Grafana/DCGM, интеграция с RAG и MCP - от пилота до промышленной эксплуатации.
Готовы поднять Qwen3.8-27B в вашем контуре?
Расскажите о задачах и имеющемся железе: соберём eval на ваших сценариях и предложим архитектуру частной LLM - модель, квантизацию, inference-стек и мониторинг.