
Qwen3.8-27B с Unsloth: запустите, квантуйте или дообучите её локально
- obsidianНОВИНКАQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 за 1 млн токенов · 18 tok/s
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaНОВИНКАMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
- grokxAI: Grok 4.52026-07-0856Интеллект72Кодинг
- tencentTencent: Hy32026-07-0642Интеллект59Кодинг
Да — Unsloth запускает Qwen3.8 27B, и это самый быстрый способ получить новую модель Alibaba под лицензией Apache-2.0 на свой собственный GPU. Весь ответ в одной строке: откройте Unsloth Studio, найдите «Qwen3.8 27B», выберите UD-Q4_K_XL (17.9GB) на карте объёмом 24 ГБ и общайтесь меньше чем через минуту. В основе этого клика — три вещи, которые Unsloth выпустила в ту же неделю, когда вышли веса (13–14 августа 2026 года): unsloth/Qwen3.8-27B-GGUF — пакет на основе квантования Unsloth Dynamic V3.0 (preview), полная поддержка в Unsloth Studio и Desktop, а также v0.1.800-beta — релиз с экспортом в GGUF, определением imatrix и улучшениями размещения в VRAM. Unsloth также дообучает модель: по заявлению компании, обучение в 2 раза быстрее и требует на 70% меньше VRAM. Qwen3.8 27B — это плотная визуально-языковая модель с 27 миллиардами параметров, чьё гибридное внимание использует полный механизм внимания только в 16 из 64 слоёв, поэтому 4-битный файл помещается на карты, на которые большинство 27B-моделей не помещаются.
По поводу источников: факты о модели официальны, взяты из карточки модели Qwen3.8 27B на Hugging Face, проверено 15 августа 2026 года. Поддержка Unsloth, размеры квантов, требования к VRAM и команды установки взяты из примечаний к выпуску и документации Unsloth, в тот же день. Цена API актуальна из каталога OrcaRouter, в тот же день. Утверждения Unsloth о «2× быстрее, на 70% меньше VRAM» и «безусловно самая сильная модель для своего размера» являются заявлениями вендора и не были независимо воспроизведены.
Что означает «Qwen3.8 + Unsloth»: четыре разные вещи
Unsloth — это четыре разные вещи, а результаты поиска по ключевым словам их смешивают. Понимать, какая из них вам нужна, — это половина настройки:
• unsloth/Qwen3.8-27B-GGUF — квантованные файлы весов на Hugging Face: 21 квантованная версия плюс проектор для изображений. Собрано с помощью Dynamic V3.0 (предварительная версия), а не более старой Dynamic 2.0 (которая была анонсирована 24 апреля 2025 года и предшествует этой модели). Это вариант «скачать файл», который можно использовать в любой сборке llama.cpp.
• Unsloth Studio — браузерное приложение, которое можно установить или запустить из Hugging Face Space. Ищите в каталоге моделей, нажимайте на квант, общайтесь с инструментами. Никакой ручной настройки шаблона или параметров инференса.
• Unsloth Desktop — локальное GUI-приложение для macOS, Windows и Linux, объединяющее Studio и обучение. Именно здесь выполняется тонкая настройка, которая «в 2 раза быстрее и использует на 70% меньше VRAM».
• Библиотека unsloth для Python — from unsloth import FastLanguageModel, API тонкой настройки QLoRA, используемый в блокнотах и скриптах.
В примечаниях к выпуску Unsloth v0.1.800-beta под названием «Release Qwen3.8 27B» говорится, что Qwen3.8 27B и Qwen3.8-2.4T-A95B с 2,4 трлн параметров «теперь можно запускать локально в Unsloth», что 27B «работает на 17 ГБ ОЗУ с помощью Unsloth Dynamic GGUF», и что «вы также можете дообучать Qwen3.8 27B в Unsloth». Этот же выпуск добавляет NVFP4-кванты, проверяет место на диске перед экспортом GGUF, определяет настоящую поддержку imatrix в GGUF в Studio и ускоряет инференс на GGUF до 10% с настраиваемым лимитом VRAM.

Выбирай квант по VRAM, а не по наитию
Таблица памяти Unsloth учитывает суммарную оперативную память плюс видеопамять (или унифицированную память), и это официальная рекомендация. Для 4-битной Qwen3.8 27B требуется 17–19 ГБ; реалистичный минимум для комфортной 4-битной конфигурации — 24 ГБ RTX 4090, RTX 5080 или Mac с 24 ГБ унифицированной памяти. Три варианта, которые подходят почти всем:
• 12GB → UD-IQ2_XXS объёмом 9.0GB — единственный файл, помещающийся целиком; будьте готовы к заметной потере качества. Делайте этот выбор осознанно.
• 16GB → UD-Q3_K_XL объемом 13.4GB — лучший 3-битный файл по версии собственного пикера Unsloth.
• 24GB → UD-Q4_K_XL (17.9GB) — рекомендуемый 4-битный файл и ответ по умолчанию из этой статьи.
• 48–64GB → UD-Q8_K_XL at 31.5GB — почти без потерь на рабочей станции или в конфигурации с двумя GPU.
Полная лестница, из списка файлов unsloth/Qwen3.8-27B-GGUF и документации Unsloth, обе проверены 15 августа 2026 года: UD-Q8_K_XL 31.5GB, UD-Q6_K_XL 25.9GB, UD-Q5_K_XL 20.2GB, UD-Q4_K_XL 17.9GB, UD-Q3_K_XL 13.4GB, UD-Q2_K_XL 10.7GB, UD-IQ3_XXS 11.9GB, UD-IQ2_M 10.3GB, UD-IQ2_XXS 9.0GB. Стандартные K-кванты (Q4_K_M 17.1GB, Q8_0 29.0GB) тоже присутствуют, и в комплект входит визуальный проектор (mmproj-BF16, 931MB), так что изображения и видео работают, если его загрузить. Unsloth называет всю лестницу «Dynamic V3.0 (preview)» — новее, чем Dynamic 2.0, которую вы увидите в более старых статьях; она была создана для моделей, выпущенных более чем на год раньше.

Запустите это с Unsloth за три минуты.
Путь в один клик: на macOS или Linux выполните `curl -fsSL https://unsloth.ai/install.sh | sh`, затем запустите `unsloth studio -p 8888` и откройте `http://127.0.0.1:8888`. На Windows — `irm https://unsloth.ai/install.ps1 | iex`. Если вам вообще не нужна установка, Studio от Unsloth также опубликовано как Hugging Face Space: откройте его в браузере, найдите «Qwen3.8 27B» и выберите квант в зависимости от объёма вашей памяти. Studio автоматически настраивает параметры сэмплирования и шаблон чата, выгружает данные в RAM при нехватке VRAM и определяет конфигурации с несколькими GPU — часть «без конфигурации» реальна, и это самый быстрый способ запустить модель этой недели.
Путь, основанный на файлах: если вы уже используете llama.cpp, скачайте один квант и запустите его напрямую. Это собственные команды Unsloth, проверенные по их документации:
hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"
./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
Эти значения сэмплинга — рекомендуемые настройки режима мышления из карточки модели. На карте с 16 ГБ замените glob для `--include` на `*UD-Q3_K_XL*` и добавьте `--mmproj`, указывающий на `mmproj-BF16.gguf` из пакета, если нужна поддержка зрения. Одна загвоздка: `llama.cpp` должен быть свежей сборкой — файл регистрирует новую архитектуру `qwen35`, и всё, что старше недели релиза, отказывается его загружать.
Тонкая настройка с Unsloth
Дообучение — это то, где Unsloth зарабатывает свою репутацию: библиотека утверждает, что обучение в 2 раза быстрее и требует на 70% меньше VRAM по сравнению со стандартными Transformers + PEFT, что и делает QLoRA на 27B возможным на одной потребительской видеокарте. Точка входа для дообучения — это обычный unsloth/Qwen3.8-27B репозиторий (safetensors, страница файлов 28B), а не пакет GGUF. Стандартный шаблон Unsloth QLoRA, применённый к этой модели:
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)
model = FastLanguageModel.get_peft_model(model, r=16)
затем стандартный цикл trl.SFTTrainer на вашем датасете. Этот фрагмент — стандартный паттерн QLoRA из документации Unsloth — утверждения о показателях обучения принадлежат самому Unsloth, и я их не воспроизводил — и здесь применимы две оговорки: ядра Unsloth патчат слои текстового трансформера, поэтому планируйте обрабатывать визуальный энкодер отдельно, и держите пакет unsloth на текущем релизе, потому что этой архитектуре всего несколько дней, и несоответствие версий приводит к громким ошибкам.
Что Unsloth Studio берёт на себя
Запуск GGUF вручную — это лавирование между размером контекста, оффоадом в RAM и вызовом инструментов. Studio сводит это к настройкам по умолчанию: он определяет размер контекста исходя из реально свободной памяти, выгружает простаивающие модели зрения, чтобы освободить VRAM для чата или обучения, определяет конфигурации с несколькими GPU и из коробки настраивает веб-поиск, выполнение кода и подключения агентов (Claude Code, Codex, MCP). Релиз v0.1.800-beta также подтянул то, что болело на практике: экспорт GGUF теперь проверяет место на диске перед началом длительного слияния, а не падает на середине; Studio определяет, действительно ли экспортируемый GGUF поддерживает imatrix (чтобы вы не тратили прогон впустую); а защитные механизмы памяти больше не резервируют GPU-память с избытком. Для модели, которой всего три дня, "no-config" делает реальную работу.
Локальный бесплатный вариант против платного API: честная экономика
Основное различие между Unsloth и API — не качество, а то, кому принадлежит оборудование. Unsloth — это бесплатный путь: нулевая предельная стоимость за токен, ничего не покидает вашу машину, нет лимитов на запросы и полный контроль над весами. В абсолютном выражении это не бесплатно: вы предоставляете GPU и электроэнергию, а 2-битный файл на карте на 12 ГБ — это урезанный опыт. Qwen3.8 27B — плотная модель с поддержкой зрения, поэтому в 4-битном формате это 17,9 ГБ весов без учёта контекста; машина — это плата за вход.
API-доступ существует потому, что веса распространяются под лицензией Apache-2.0, поэтому любой может разместить их с почти нулевыми маржинальными издержками. Qwen3.8 27B сегодня есть в каталоге OrcaRouter по цене $0.33 за миллион входных и $2.40 за миллион выходных токенов — это модель, размещённая на нашей собственной инфраструктуре, без вендорской наценки, с контекстным окном на 262K токенов и поддержкой ввода текста, изображений и видео. Поскольку веса открыты, существует также бесплатный тариф с ограничением частоты запросов, который взимает $0 за запрос. Показательный месяц с 10 миллионами токенов при 70% доле входных токенов обойдётся примерно в $9.51 на платном тарифе. Если у вас уже есть видеокарта на 24 ГБ, локальный запуск выгоднее по стоимости; если же нет — аренда токенов по такой цене выгоднее, чем покупка видеокарты для побочного проекта, а бесплатный тариф — честный способ протестировать модель, прежде чем вкладываться в какое-либо оборудование.

Когда Unsloth — неправильный ответ
Unsloth Studio и пакет GGUF — правильный выбор для одной машины. Они — неправильный выбор, когда:
• У вас есть видеокарта Blackwell RTX 50-й серии. Кванты unsloth/Qwen3.8-27B-NVFP4 примерно в 1,5 раза быстрее, чем BF16, в том же объёме VRAM, и используют FP8 KV-кэш для более длинного контекста. Этот путь проходит через vLLM или SGLang, а не через GGUF и не через Studio.
• Вам нужно полное нативное окно на 262K или расширение YaRN на 1M в продакшене. Плотная модель зрения при длинном контексте тяжела; подбор контекста Unsloth с радостью запустит для вас более короткий вариант, но серверный стек с правильным управлением KV-кэшем лучше локального приложения.
• Вы обслуживаете много пользователей. Unsloth — это локальное приложение и библиотека для тонкой настройки, а не мультитенантный сервер. Для конкурентности, автоматического масштабирования и гарантий доступности вам нужен хостируемый endpoint.
• У вас вообще нет GPU. Честный ответ: 2-битная модель 27B на карте с 12 ГБ заметно хуже, чем та же модель, запущенная корректно. Сначала воспользуйтесь бесплатным API-тарифом; если этого достаточно, покупайте железо, когда вариант использования будет подтверждён.
• Вы хотите дообучить визуальную часть. Ускорения Unsloth нацелены на текстовые слои трансформера; полное мультимодальное дообучение требует другого стека.
Суть
Qwen3.8 27B с Unsloth — решённая задача с этой недели: установите Studio, выберите UD-Q4_K_XL для карты на 24 ГБ (UD-Q3_K_XL для 16 ГБ, UD-IQ2_XXS для 12 ГБ), и модель работает без конфигурации и без оплаты за токен. Путь тонкой настройки реален, и заявления Unsloth о скорости — причина, по которой QLoRA для 27B реализуема на одной карте. Имейте в виду: лестница квантизации — это Dynamic V3.0 (превью), а не Dynamic 2.0, который описывают старые статьи; держите llama.cpp актуальным; а если у вас нет своего железа, те же веса доступны через API за $0.33/$2.40 с бесплатным тарифом с лимитом запросов — так что нет причин запускать 2-битный файл, который вас не устраивает. Локальный запуск — это бесплатный путь, и впервые в этом классе весов он также является простым.
