Hero-карточка с заголовком «Qwen3.8-27B with Unsloth», подзаголовком «запускайте, квантуйте или дообучайте её локально», значком окна терминала и чипами «UD-Q4_K_XL 17.9GB» и «Studio no-config».
Guides & Insights

Qwen3.8-27B с Unsloth: запустите, квантуйте или дообучите её локально

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Да — Unsloth запускает Qwen3.8 27B, и это самый быстрый способ получить новую модель Ali​baba под лицензией Apache-2.0 на свой собственный GPU. Весь ответ в одной строке: откройте Unsloth Studio, найдите «Qwen3.8 27B», выберите UD-Q4_K_XL (17.9GB) на карте объёмом 24 ГБ и общайтесь меньше чем через минуту. В основе этого клика — три вещи, которые Unsloth выпустила в ту же неделю, когда вышли веса (13–14 августа 2026 года): unsloth/Qwen3.8-27B-GGUF — пакет на основе квантования Unsloth Dynamic V3.0 (preview), полная поддержка в Unsloth Studio и Desktop, а также v0.1.800-beta — релиз с экспортом в GGUF, определением imatrix и улучшениями размещения в VRAM. Unsloth также дообучает модель: по заявлению компании, обучение в 2 раза быстрее и требует на 70% меньше VRAM. Qwen3.8 27B — это плотная визуально-языковая модель с 27 миллиардами параметров, чьё гибридное внимание использует полный механизм внимания только в 16 из 64 слоёв, поэтому 4-битный файл помещается на карты, на которые большинство 27B-моделей не помещаются.

По поводу источников: факты о модели официальны, взяты из карточки модели Qwen3.8 27B на Hugging Face, проверено 15 августа 2026 года. Поддержка Unsloth, размеры квантов, требования к VRAM и команды установки взяты из примечаний к выпуску и документации Unsloth, в тот же день. Цена API актуальна из каталога OrcaRouter, в тот же день. Утверждения Unsloth о «2× быстрее, на 70% меньше VRAM» и «безусловно самая сильная модель для своего размера» являются заявлениями вендора и не были независимо воспроизведены.

Что означает «Qwen3.8 + Unsloth»: четыре разные вещи

Unsloth — это четыре разные вещи, а результаты поиска по ключевым словам их смешивают. Понимать, какая из них вам нужна, — это половина настройки:

unsloth/Qwen3.8-27B-GGUF — квантованные файлы весов на Hugging Face: 21 квантованная версия плюс проектор для изображений. Собрано с помощью Dynamic V3.0 (предварительная версия), а не более старой Dynamic 2.0 (которая была анонсирована 24 апреля 2025 года и предшествует этой модели). Это вариант «скачать файл», который можно использовать в любой сборке llama.cpp.

Unsloth Studio — браузерное приложение, которое можно установить или запустить из Hugging Face Space. Ищите в каталоге моделей, нажимайте на квант, общайтесь с инструментами. Никакой ручной настройки шаблона или параметров инференса.

Unsloth Desktop — локальное GUI-приложение для macOS, Windows и Linux, объединяющее Studio и обучение. Именно здесь выполняется тонкая настройка, которая «в 2 раза быстрее и использует на 70% меньше VRAM».

Библиотека unsloth для Python — from unsloth import FastLanguageModel, API тонкой настройки QLoRA, используемый в блокнотах и скриптах.

В примечаниях к выпуску Unsloth v0.1.800-beta под названием «Release Qwen3.8 27B» говорится, что Qwen3.8 27B и Qwen3.8-2.4T-A95B с 2,4 трлн параметров «теперь можно запускать локально в Unsloth», что 27B «работает на 17 ГБ ОЗУ с помощью Unsloth Dynamic GGUF», и что «вы также можете дообучать Qwen3.8 27B в Unsloth». Этот же выпуск добавляет NVFP4-кванты, проверяет место на диске перед экспортом GGUF, определяет настоящую поддержку imatrix в GGUF в Studio и ускоряет инференс на GGUF до 10% с настраиваемым лимитом VRAM.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

Выбирай квант по VRAM, а не по наитию

Таблица памяти Unsloth учитывает суммарную оперативную память плюс видеопамять (или унифицированную память), и это официальная рекомендация. Для 4-битной Qwen3.8 27B требуется 17–19 ГБ; реалистичный минимум для комфортной 4-битной конфигурации — 24 ГБ RTX 4090, RTX 5080 или Mac с 24 ГБ унифицированной памяти. Три варианта, которые подходят почти всем:

12GB → UD-IQ2_XXS объёмом 9.0GB — единственный файл, помещающийся целиком; будьте готовы к заметной потере качества. Делайте этот выбор осознанно.

16GB → UD-Q3_K_XL объемом 13.4GB — лучший 3-битный файл по версии собственного пикера Unsloth.

24GB → UD-Q4_K_XL (17.9GB) — рекомендуемый 4-битный файл и ответ по умолчанию из этой статьи.

48–64GB → UD-Q8_K_XL at 31.5GB — почти без потерь на рабочей станции или в конфигурации с двумя GPU.

Полная лестница, из списка файлов unsloth/Qwen3.8-27B-GGUF и документации Unsloth, обе проверены 15 августа 2026 года: UD-Q8_K_XL 31.5GB, UD-Q6_K_XL 25.9GB, UD-Q5_K_XL 20.2GB, UD-Q4_K_XL 17.9GB, UD-Q3_K_XL 13.4GB, UD-Q2_K_XL 10.7GB, UD-IQ3_XXS 11.9GB, UD-IQ2_M 10.3GB, UD-IQ2_XXS 9.0GB. Стандартные K-кванты (Q4_K_M 17.1GB, Q8_0 29.0GB) тоже присутствуют, и в комплект входит визуальный проектор (mmproj-BF16, 931MB), так что изображения и видео работают, если его загрузить. Unsloth называет всю лестницу «Dynamic V3.0 (preview)» — новее, чем Dynamic 2.0, которую вы увидите в более старых статьях; она была создана для моделей, выпущенных более чем на год раньше.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

Запустите это с Unsloth за три минуты.

Путь в один клик: на macOS или Linux выполните `curl -fsSL https://unsloth.ai/install.sh | sh`, затем запустите `unsloth studio -p 8888` и откройте `http://127.0.0.1:8888`. На Windows — `irm https://unsloth.ai/install.ps1 | iex`. Если вам вообще не нужна установка, Studio от Unsloth также опубликовано как Hugging Face Space: откройте его в браузере, найдите «Qwen3.8 27B» и выберите квант в зависимости от объёма вашей памяти. Studio автоматически настраивает параметры сэмплирования и шаблон чата, выгружает данные в RAM при нехватке VRAM и определяет конфигурации с несколькими GPU — часть «без конфигурации» реальна, и это самый быстрый способ запустить модель этой недели.

Путь, основанный на файлах: если вы уже используете llama.cpp, скачайте один квант и запустите его напрямую. Это собственные команды Unsloth, проверенные по их документации:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Эти значения сэмплинга — рекомендуемые настройки режима мышления из карточки модели. На карте с 16 ГБ замените glob для `--include` на `*UD-Q3_K_XL*` и добавьте `--mmproj`, указывающий на `mmproj-BF16.gguf` из пакета, если нужна поддержка зрения. Одна загвоздка: `llama.cpp` должен быть свежей сборкой — файл регистрирует новую архитектуру `qwen35`, и всё, что старше недели релиза, отказывается его загружать.

Тонкая настройка с Unsloth

Дообучение — это то, где Unsloth зарабатывает свою репутацию: библиотека утверждает, что обучение в 2 раза быстрее и требует на 70% меньше VRAM по сравнению со стандартными Transformers + PEFT, что и делает QLoRA на 27B возможным на одной потребительской видеокарте. Точка входа для дообучения — это обычный unsloth/Qwen3.8-27B репозиторий (safetensors, страница файлов 28B), а не пакет GGUF. Стандартный шаблон Unsloth QLoRA, применённый к этой модели:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

затем стандартный цикл trl.SFTTrainer на вашем датасете. Этот фрагмент — стандартный паттерн QLoRA из документации Unsloth — утверждения о показателях обучения принадлежат самому Unsloth, и я их не воспроизводил — и здесь применимы две оговорки: ядра Unsloth патчат слои текстового трансформера, поэтому планируйте обрабатывать визуальный энкодер отдельно, и держите пакет unsloth на текущем релизе, потому что этой архитектуре всего несколько дней, и несоответствие версий приводит к громким ошибкам.

Что Unsloth Studio берёт на себя

Запуск GGUF вручную — это лавирование между размером контекста, оффоадом в RAM и вызовом инструментов. Studio сводит это к настройкам по умолчанию: он определяет размер контекста исходя из реально свободной памяти, выгружает простаивающие модели зрения, чтобы освободить VRAM для чата или обучения, определяет конфигурации с несколькими GPU и из коробки настраивает веб-поиск, выполнение кода и подключения агентов (Claude Code, Codex, MCP). Релиз v0.1.800-beta также подтянул то, что болело на практике: экспорт GGUF теперь проверяет место на диске перед началом длительного слияния, а не падает на середине; Studio определяет, действительно ли экспортируемый GGUF поддерживает imatrix (чтобы вы не тратили прогон впустую); а защитные механизмы памяти больше не резервируют GPU-память с избытком. Для модели, которой всего три дня, "no-config" делает реальную работу.

Локальный бесплатный вариант против платного API: честная экономика

Основное различие между Unsloth и API — не качество, а то, кому принадлежит оборудование. Unsloth — это бесплатный путь: нулевая предельная стоимость за токен, ничего не покидает вашу машину, нет лимитов на запросы и полный контроль над весами. В абсолютном выражении это не бесплатно: вы предоставляете GPU и электроэнергию, а 2-битный файл на карте на 12 ГБ — это урезанный опыт. Qwen3.8 27B — плотная модель с поддержкой зрения, поэтому в 4-битном формате это 17,9 ГБ весов без учёта контекста; машина — это плата за вход.

API-доступ существует потому, что веса распространяются под лицензией Apache-2.0, поэтому любой может разместить их с почти нулевыми маржинальными издержками. Qwen3.8 27B сегодня есть в каталоге OrcaRouter по цене $0.33 за миллион входных и $2.40 за миллион выходных токенов — это модель, размещённая на нашей собственной инфраструктуре, без вендорской наценки, с контекстным окном на 262K токенов и поддержкой ввода текста, изображений и видео. Поскольку веса открыты, существует также бесплатный тариф с ограничением частоты запросов, который взимает $0 за запрос. Показательный месяц с 10 миллионами токенов при 70% доле входных токенов обойдётся примерно в $9.51 на платном тарифе. Если у вас уже есть видеокарта на 24 ГБ, локальный запуск выгоднее по стоимости; если же нет — аренда токенов по такой цене выгоднее, чем покупка видеокарты для побочного проекта, а бесплатный тариф — честный способ протестировать модель, прежде чем вкладываться в какое-либо оборудование.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Когда Unsloth — неправильный ответ

Unsloth Studio и пакет GGUF — правильный выбор для одной машины. Они — неправильный выбор, когда:

У вас есть видеокарта Blackwell RTX 50-й серии. Кванты unsloth/Qwen3.8-27B-NVFP4 примерно в 1,5 раза быстрее, чем BF16, в том же объёме VRAM, и используют FP8 KV-кэш для более длинного контекста. Этот путь проходит через vLLM или SGLang, а не через GGUF и не через Studio.

Вам нужно полное нативное окно на 262K или расширение YaRN на 1M в продакшене. Плотная модель зрения при длинном контексте тяжела; подбор контекста Unsloth с радостью запустит для вас более короткий вариант, но серверный стек с правильным управлением KV-кэшем лучше локального приложения.

Вы обслуживаете много пользователей. Unsloth — это локальное приложение и библиотека для тонкой настройки, а не мультитенантный сервер. Для конкурентности, автоматического масштабирования и гарантий доступности вам нужен хостируемый endpoint.

У вас вообще нет GPU. Честный ответ: 2-битная модель 27B на карте с 12 ГБ заметно хуже, чем та же модель, запущенная корректно. Сначала воспользуйтесь бесплатным API-тарифом; если этого достаточно, покупайте железо, когда вариант использования будет подтверждён.

Вы хотите дообучить визуальную часть. Ускорения Unsloth нацелены на текстовые слои трансформера; полное мультимодальное дообучение требует другого стека.

Суть

Qwen3.8 27B с Unsloth — решённая задача с этой недели: установите Studio, выберите UD-Q4_K_XL для карты на 24 ГБ (UD-Q3_K_XL для 16 ГБ, UD-IQ2_XXS для 12 ГБ), и модель работает без конфигурации и без оплаты за токен. Путь тонкой настройки реален, и заявления Unsloth о скорости — причина, по которой QLoRA для 27B реализуема на одной карте. Имейте в виду: лестница квантизации — это Dynamic V3.0 (превью), а не Dynamic 2.0, который описывают старые статьи; держите llama.cpp актуальным; а если у вас нет своего железа, те же веса доступны через API за $0.33/$2.40 с бесплатным тарифом с лимитом запросов — так что нет причин запускать 2-битный файл, который вас не устраивает. Локальный запуск — это бесплатный путь, и впервые в этом классе весов он также является простым.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

Свяжитесь с нами

Присоединяйтесь к сообществу

DiscordEmailXGitHubYouTube