Исследования
17 августа 2026 · 12 мин чтения · AI Platforms

Qwen3.8-27B: бенчмарки уровня Opus 4.6 Max в dense-модели на 27B

14 августа 2026 Alibaba выпустила компактную версию поколения Qwen3.8: плотная модель с нативным пониманием изображений и видео, контекст 262K и управление глубиной мышления в трёх уровнях. Разбираем архитектуру, официальные бенчмарки и то, что это значит для частной LLM в закрытом контуре.

  • Qwen3.8-27B
  • local LLM
  • open weights
  • agentic coding
  • multimodal
  • computer use
  • on-premise AI
  • vLLM

Что произошло

3 августа 2026 Alibaba выпустила флагман поколения, Qwen3.8-Max: MoE-модель на 2,4 трлн параметров (95B активных) с контекстом в 1 млн токенов. Чуть больше недели спустя, 14 августа, команда опубликовала Qwen3.8-27B, компактную версию того же поколения: плотную модель без MoE-экспертов, рассчитанную на развёртывание на рабочих станциях и средних серверх.

Почему релиз важен для локальных LLM:

  • Шаг, а не патч. Между Qwen3.6-27B (май 2026) и Qwen3.8-27B агентное кодирование выросло с 13.3 до 42.2 на DeepSWE 1.1, а computer use - с 63.9 до 84.3 на OSWorld-Verified. Это не итерация, а смена класса.
  • Первая мультимодальная компактная Qwen. Встроенный vision-энкодер принимает изображения и видео, в том числе многочасовые: скриншоты, чертежи, документы, записи с камер. Для мультимодальных агентных сценариев не нужен отдельный стек.
  • Управление мышлением. Три уровня reasoning_effort (xhigh / medium / low) - прямой инструмент контроля соотношения цена/качество в production, о котором мы писали в разборе MTP-ускорения.

Ключевые цифры

27B
dense-параметров, без MoE-экспертов
262K -> 1M
нативный контекст; до 1M в хостинговой версии Qwen Cloud
84.3
OSWorld-Verified: computer use (у Opus 4.6 Max - 72.7)
61.7
SWE-bench Pro (у Opus 4.6 Max - 53.4)
3
уровня глубины мышления: xhigh / medium / low

Архитектура: что внутри

Gated DeltaNet + Gated Attention

Гибридная раскладка 16 x (3 x DeltaNet-FFN -> 1 x Attention-FFN): 64 слоя, скрытое 5120. Три слоя из четырёх - линейное внимание: длинный контекст дёшево, инференс быстрый.

MTP

Multi-Token Prediction, обученная на нескольких шага вперёд: ускоряет генерацию. Как ускорение влияет на качество, мы разбирали в статье про MTP.

Нативный vision-энкодер

Понимание изображений и видео от STEM-диаграмм до многочасовых записей. Модель - vision-language: текст, изображения и видео в одном контексте.

reasoning_effort: xhigh / medium / low

xhigh по умолчанию для сложных задач, low - под скорость и стоимость. В многошаговых задачах low не всегда быстрее: ошибки и повторы съедают выигрыш.

preserve_thinking включён по умолчанию

Контекст рассуждений сохраняется между ходами диалога. Ключевая фича надёжности для многошаговых агентов.

Все квантизации в день релиза

GGUF, FP8, NVFP4, MLX: от GPU Nvidia и AMD до Apple silicon. Совместимость с vLLM, SGLang, TokenSpeed, Hugging Face Transformers.

Официальные данные

Бенчмарки: кодирование и агенты

Из официальной карточки модели Qwen. Базовые модели перевычитаны вендором на том же harness (Claude Code, temp 1.0, top_p 0.95, 256K контекст).

БенчмаркQwen3.8-27BQwen3.6-27BQwen3.7-PlusOpus 4.6 Max
Terminal Bench 2.1 73.0 63.4 64.0 78.2
SWE-bench Pro 61.7 53.5 57.6 53.4
DeepSWE 1.1 42.2 13.3 14.2 -
QwenSWEBench (avg@3) 79.0 49.3 59.2 63.8
NL2Repo-Bench 42.3 36.2 41.1 47.6
CoWorkBench 70.7 61.0 65.1 68.2
JobBench 33.4 21.8 27.6 -
Agents' Last Exam (Pass@1 / Score) 20.4 / 42.9 10.6 / 27.3 13.2 / 33.6 -
LiveCodeBench v6 90.3 83.9 89.6 88.8
GPQA Diamond 89.2 87.8 90.3 91.3
HLE 30.8 24.0 34.7 40.0
IFBench 79.5 69.1 79.1 62.5

Читайте цифры правильно

Все значения - официальные, из карточки модели Qwen3.8-27B. QwenSWEBench и CoWorkBench - внутренние бенчмарки Alibaba. Сравнение с абсолютным топом (Claude Fable 5, GPT-5.6 Sol, Opus 4.8) вендор намеренно не ведёт: позиционирование - компактная модель для локального инференса. Перед выбором модели мы прогоняем собственный eval на ваших задачах - так же, как в случае с Gemma 4 12B, где официальные цифры разошлись с нашим контуром.

Где Opus 4.6 Max, а где нет

Против Opus 4.6 Max, ближайшего проприетарного ориентира в таблице вендора, Qwen3.8-27B выигрывает на прикладных агентных задачах:

  • SWE-bench Pro: 61.7 против 53.4. Dense-модель на 27B опережает проприетарную frontier-модель на реальных инженерных задачах.
  • OSWorld-Verified: 84.3 против 72.7. Computer use: модель работает с десктопной средой, приложениями, файлами.
  • SWE-MM: 38.6 против 27.1 - мультимодальное программирование по скриншотам и визуальным спецификациям.
  • CoWorkBench: 70.7 против 68.2, IFBench: 79.5 против 62.5, LiveCodeBench v6: 90.3 против 88.8.

Позади - общий интеллект и длинные сессии в терминале: HLE 30.8 против 40.0, GPQA Diamond 89.2 против 91.3, Terminal Bench 2.1 73.0 против 78.2, NL2Repo-Bench 42.3 против 47.6.

Инженерная интерпретация: для задач формата "агент с tool-use в вашей среде" (скриншоты, документы, терминал, browser) 27B-модель закрывает Opus-класс при цене инференса на порядок ниже. Для задач с глубоким абстрактным рассуждением (уровень HLE) она пока уступает и frontier-моделям, и Opus 4.6 Max. В продакшене это решается не выбором "одной лучшей модели", а маршрутизацией запросов: тяжёлые случаи - на большую модель, рутину - на 27B.

Официальные данные

Бенчмарки: мультимодальность и computer use

БенчмаркQwen3.8-27BQwen3.6-27BQwen3.7-PlusOpus 4.6 Max
OSWorld-Verified 84.3 63.9 73.3 72.7
WebArena-Verified 64.8 48.8 55.3 -
AndroidWorld 81.9 70.3 81.0 62.0
SWE-MM 38.6 25.7 30.0 27.1
ClawEval-MM (Pass@3 / avg) 57.4 / 56.9 42.6 / 50.4 57.4 / 60.1 52.5 / 54.7
OmniDocBench 1.5 91.1 89.4 91.4 86.6
MathVision 90.0 85.1 90.3 65.5
RealWorldQA 85.9 84.1 86.9 73.9

Режим мышления и контроль стоимости

Qwen3.8-27B работает по умолчанию в thinking-режиме: сначала модель генерирует рассуждения, потом ответ. Мышление можно выключить на уровне запроса, глубину задаёт reasoning_effort:

  • xhigh (по умолчанию) - сложные задачи, требующие тщательного анализа;
  • medium - баланс точности и скорости;
  • low - задержкочувствительные сценарии, оптимизация под стоимость.

Рекомендуемые параметры сэмплинга: в thinking-режиме - temperature 1.0, top_p 0.95, top_k 20; без мышления - temperature 0.7, top_p 0.80, presence_penalty 1.5.

Нестандартное предупреждение от вендора: в многошаговых агентных задачах снижение reasoning_effort не всегда сокращает общее время. Быстрый ход за ходом даёт поверхностный анализ, ошибки и повторы, итоговая задержка и расход токенов растут. В production мы держим профили effort по типам задач: xhigh для длинных агентных цепочек, low для классификации, извлечения и простых операций. Это один из главных рычагов себестоимости инференса на том же железе.

Железо для локального развёртывания

Ориентир по весам модели; KV-кэш и активации добавляются сверху в зависимости от контекста и параллельности.

ТочностьVRAM (веса), ориентирРабочая конфигурация
BF16 / FP16 ~54 GB 1 x H100 80 GB или 2 x RTX 5090 32 GB; vLLM или SGLang
FP8 / NVFP4 ~28-30 GB 1 x RTX PRO 6000 96 GB с запасом под длинный контекст или 1 x H100
Q4 (GGUF) ~16-18 GB 1 x RTX 4090 / 5090 24-32 GB на llama.cpp или Ollama - для пилота

Что это значит для частной LLM

Три вещи делают Qwen3.8-27B интересной для закрытого контура.

Мультимодальные агенты без отдельного стека. Модель, которая видит изображения и видео, работает со скриншотами SCADA, чертежами, фото продукции, видеозаписями с камер объекта - вместе с tool-use через MCP. Для RAG по технической документации с таблицами, схемами и сканами это прямой апгрейд: документопонимание OmniDocBench 91.1 выше, чем у Opus 4.6 Max (86.6).

Длинные сессии. 262K нативного контекста (хостинговая версия Qwen Cloud анонсирована с 1M) хватает для многошаговых задач, где агент накапливает логи, файлы и промежуточные результаты, не теряя нити. preserve_thinking по умолчанию убирает деградацию качества на повторных ходах.

Управляемая стоимость. Профили reasoning_effort и безмыслящие low-запросы для рутинных операций позволяют на одном сервере закрыть шире круг задач, а расход токенов зависит от профиля, а не только от промпта.

Ограничения те же, что у любого открытого класса 27B: абстрактное рассуждение (HLE 30.8 против 40.0 у Opus 4.6 Max) и длинные сессии в терминале пока позади. Поэтому мы не рекомендуем модель по пресс-релизу: сначала собственный eval на ваших документах и сценариях, потом архитектура. Развёртываем модель на GPU заказчика - vLLM/SGLang, квантизация под VRAM, мониторинг Prometheus/Grafana/DCGM, интеграция с RAG и MCP - от пилота до промышленной эксплуатации.

Готовы поднять Qwen3.8-27B в вашем контуре?

Расскажите о задачах и имеющемся железе: соберём eval на ваших сценариях и предложим архитектуру частной LLM - модель, квантизацию, inference-стек и мониторинг.