Um cartão de título hero exibindo Qwen3.8-27B com Unsloth, com o subtítulo 'execute, quantize ou faça fine-tuning localmente', um ícone de janela de terminal e chips exibindo 'UD-Q4_K_XL 17.9GB' e 'Studio no-config'.
Guides & Insights

Qwen3.8-27B com Unsloth: Execute, Quantize ou Faça Fine-Tuning Localmente

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Sim — o Unsloth executa o Qwen3.8 27B, e é a forma mais rápida de colocar o novo modelo Apache-2.0 da Ali​baba na sua própria GPU. Toda a resposta numa linha: abra o Unsloth Studio, procure por "Qwen3.8 27B", escolha UD-Q4_K_XL (17.9GB) numa placa de 24GB e converse em menos de um minuto. Por trás desse clique, o Unsloth lançou três coisas na mesma semana em que os pesos foram divulgados (13–14 de agosto de 2026): o pacote unsloth/Qwen3.8-27B-GGUF baseado na quantização Unsloth Dynamic V3.0 (preview), suporte total no Unsloth Studio e Desktop, e a versão v0.1.800-beta com exportação GGUF, deteção de imatrix e melhorias de ajuste à VRAM. Também faz fine-tuning do modelo — o Unsloth afirma um treino 2× mais rápido com 70% menos VRAM. O Qwen3.8 27B é um modelo denso de visão-linguagem com 27 mil milhões de parâmetros cuja atenção híbrida mantém apenas 16 das 64 camadas em atenção total, razão pela qual um ficheiro de 4 bits cabe em placas onde a maioria dos modelos de 27B não cabe.

Sobre fontes: os fatos do modelo são oficiais, da ficha técnica do modelo Qwen3.8 27B no Hugging Face, verificados em 15 de agosto de 2026. O suporte do Unsloth, os tamanhos de quantização, os requisitos de VRAM e os comandos de instalação vêm das notas de versão e da documentação do Unsloth, no mesmo dia. O preço da API é ao vivo do catálogo do OrcaRouter, no mesmo dia. As afirmações do Unsloth de "2× mais rápido, 70% menos VRAM" e "de longe o modelo mais forte para seu tamanho" são alegações do fornecedor, não reproduzidas de forma independente.

O que "Qwen3.8 + Unsloth" significa: quatro coisas diferentes.

Unsloth consiste em quatro coisas separadas, e os resultados de pesquisa por palavras-chave as misturam. Saber qual delas você precisa é metade da configuração:

unsloth/Qwen3.8-27B-GGUF — os arquivos de pesos quantizados no Hugging Face, 21 quants mais um projetor de visão. Construído com Dynamic V3.0 (preview), não com o Dynamic 2.0 mais antigo (que foi anunciado em 24 de abril de 2025 e antecede este modelo). Esta é a rota de "baixar um arquivo", utilizável a partir de qualquer build do llama.cpp.

Unsloth Studio — o aplicativo de navegador que você instala ou executa a partir de um Hugging Face Space. Pesquise o hub de modelos, clique em um quant, converse com ferramentas. Sem configuração manual de template ou parâmetros de inferência.

Unsloth Desktop — o aplicativo GUI local para macOS, Windows e Linux que engloba o Studio e o treinamento. É aqui que acontece o fine-tuning "2× mais rápido com 70% menos VRAM".

A biblioteca Python unsloth — from unsloth import FastLanguageModel, a API de fine-tuning QLoRA usada em notebooks e scripts.

As notas de versão do Unsloth para v0.1.800-beta, intituladas {{1}}"Lançamento do Qwen3.8 27B"{{/1}}, dizem que o Qwen3.8 27B e o Qwen3.8-2.4T-A95B, de 2,4T de parâmetros, {{2}}"agora podem ser executados localmente no Unsloth"{{/2}}, que o 27B {{3}}"roda com 17GB de RAM via Unsloth Dynamic GGUFs"{{/3}} e que {{4}}"você também pode fazer fine-tuning do Qwen3.8 27B no Unsloth"{{/4}}. A mesma versão adiciona quantizações NVFP4, verifica o espaço em disco antes de exportações GGUF, detecta suporte real a imatrix GGUF no Studio e torna a inferência até 10% mais rápida em GGUF com um limite de VRAM ajustável.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

Escolha seu quant pela VRAM, não pelo achismo.

A tabela de memória da Unsloth considera a RAM total mais a VRAM (ou memória unificada), e é a orientação oficial. Um Qwen3.8 27B em 4 bits precisa de 17–19 GB; uma RTX 4090 de 24 GB, uma RTX 5080 ou um Mac com memória unificada de 24 GB é o mínimo realista para uma configuração confortável em 4 bits. As três opções que atendem quase todo mundo:

12GB → UD-IQ2_XXS a 9,0GB — o único arquivo que cabe inteiro; espere uma perda visível de qualidade. Faça essa escolha conscientemente.

16GB → UD-Q3_K_XL com 13.4GB — o melhor arquivo de 3 bits, segundo o próprio seletor da Unsloth.

24GB → UD-Q4_K_XL at 17.9GB — o arquivo 4-bit recomendado e a resposta padrão deste artigo.

48–64GB → UD-Q8_K_XL em 31.5GB — quase sem perdas em uma workstation ou configuração com GPU dupla.

A escada completa, da lista de arquivos unsloth/Qwen3.8-27B-GGUF e da documentação do Unsloth, ambas verificadas em 15 de agosto de 2026: UD-Q8_K_XL 31,5 GB, UD-Q6_K_XL 25,9 GB, UD-Q5_K_XL 20,2 GB, UD-Q4_K_XL 17,9 GB, UD-Q3_K_XL 13,4 GB, UD-Q2_K_XL 10,7 GB, UD-IQ3_XXS 11,9 GB, UD-IQ2_M 10,3 GB, UD-IQ2_XXS 9,0 GB. Os K-quants padrão (Q4_K_M 17,1 GB, Q8_0 29,0 GB) também estão lá, e o pacote inclui um projetor de visão (mmproj-BF16, 931 MB) para que imagens e vídeos funcionem se você o carregar. O Unsloth chama toda a escada de "Dynamic V3.0 (preview)" — mais novo que o Dynamic 2.0 que você verá em publicações mais antigas, que foi construído para modelos lançados mais de um ano antes.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

Rode com Unsloth em três minutos

A rota de um clique: no macOS ou Linux, `curl -fsSL https://unsloth.ai/install.sh | sh`, depois `unsloth studio -p 8888` e abra `http://127.0.0.1:8888`. No Windows, `irm https://unsloth.ai/install.ps1 | iex`. Se você quiser zero instalação, o Studio da Unsloth também é publicado como um Hugging Face Space — abra-o no navegador, pesquise "Qwen3.8 27B" e escolha uma quantização conforme a memória que você tem. O Studio ajusta automaticamente os parâmetros de amostragem e o template de chat, descarrega para a RAM quando a VRAM fica escassa e detecta configurações multi-GPU — a parte "sem configuração" é real, e é a maneira mais rápida de estar rodando o modelo desta semana.

A rota que prioriza arquivos, se você já usa llama.cpp: baixe um quant e execute-o diretamente. Estes são os próprios comandos da Unsloth, verificados de acordo com a documentação deles:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Esses valores de amostragem são as configurações recomendadas de modo de raciocínio do model card. Troque o glob --include por *UD-Q3_K_XL* em uma placa de 16GB, e adicione --mmproj apontando para o mmproj-BF16.gguf do pacote se precisar de visão. Um detalhe: o llama.cpp deve ser uma compilação atual — o arquivo registra a nova arquitetura qwen35, e qualquer coisa anterior à semana de lançamento se recusa a carregá-lo.

Ajuste-o finamente com Unsloth

É no fine-tuning que a Unsloth ganha sua reputação: a biblioteca afirma treinamento 2× mais rápido com 70% menos VRAM em comparação com o Transformers + PEFT padrão, o que torna o QLoRA em um modelo de 27B viável em uma única GPU de consumo. O ponto de entrada do fine-tuning é o simples unsloth/Qwen3.8-27B repositório (safetensors, página de arquivos 28B) em vez do pacote GGUF. O padrão QLoRA usual da Unsloth, aplicado a este modelo:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

então um loop padrão de `trl.SFTTrainer` no seu conjunto de dados. Esse trecho é o padrão QLoRA padrão da documentação do Unsloth — as alegações de benchmark de treinamento são do próprio Unsloth e não algo que eu reproduzi — e duas ressalvas se aplicam: os kernels do Unsloth aplicam patch nas camadas de transformer de texto, então planeje lidar com o codificador de visão separadamente, e mantenha o pacote unsloth na versão atual porque essa arquitetura tem dias de vida e incompatibilidades de versão falham ruidosamente.

O que o Unsloth Studio resolve por você

Rodar um GGUF manualmente significa equilibrar o tamanho do contexto, a descarga de RAM e a chamada de ferramentas. O Studio reduz isso a padrões: ele dimensiona o contexto com base na memória realmente livre, descarrega modelos de visão ociosos para liberar VRAM para chat ou treinamento, detecta layouts multi-GPU e conecta pesquisa na web, execução de código e conexões de agentes (Claude Code, Codex, MCP) de fábrica. A versão v0.1.800-beta também ajustou as partes que incomodam na prática: as exportações de GGUF agora verificam o espaço em disco antes de iniciar uma mesclagem longa, em vez de falhar no meio; o Studio detecta se o GGUF que está exportando realmente suporta imatrix (para você não desperdiçar uma execução); e as salvaguardas de memória não reservam mais memória GPU em excesso. Para um modelo de três dias, o "no-config" está fazendo um trabalho real.

Local gratuito vs API paga: a economia honesta

A diferença central entre Unsloth e uma API não é a qualidade — é quem é dono do hardware. Unsloth é o caminho gratuito: custo marginal zero por token, nada sai da sua máquina, sem limites de requisições e controle total dos pesos. Não é gratuito em termos absolutos: você fornece a GPU e a eletricidade, e um arquivo de 2 bits em uma placa de 12 GB é uma experiência comprometida. O Qwen3.8 27B é denso e capaz de visão, portanto um arquivo de 4 bits corresponde a 17,9 GB de pesos antes do contexto; a máquina é o preço de entrada.

A rota de API existe porque os pesos são Apache-2.0, então qualquer pessoa pode hospedá-los a um custo marginal quase zero. Qwen3.8 27B está no catálogo da OrcaRouter hoje por $0.33 por milhão de tokens de entrada e $2.40 por milhão de tokens de saída, o modelo auto-hospedado em nossa própria infraestrutura — sem repasse de preço de fornecedor — com uma janela de contexto de 262 mil tokens e entrada de texto, imagem e vídeo. Como os pesos são abertos, há também um nível gratuito com limite de taxa que cobra $0 por requisição. Um mês representativo de 10 milhões de tokens com uma parcela de 70% de entrada custa cerca de $9.51 no plano pago. Se você já possui uma placa de 24GB, a opção local vence em custo; se não possui, alugar tokens a essa taxa é melhor do que comprar uma placa para um projeto paralelo, e o nível gratuito é a maneira honesta de testar o modelo antes de se comprometer com qualquer hardware.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Quando Unsloth é a resposta errada

Unsloth Studio e o pacote GGUF são a escolha certa para uma única máquina. Eles são a escolha errada quando:

Você possui uma placa Blackwell da série RTX 50. As versões quantizadas unsloth/Qwen3.8-27B-NVFP4 são aproximadamente 1.5× mais rápidas que BF16 na mesma VRAM e usam um cache KV FP8 para contexto mais longo. Esse caminho passa por vLLM ou SGLang, não por GGUF e nem pelo Studio.

Você precisa da janela nativa completa de 262K ou da extensão YaRN de 1M em produção. Um modelo de visão denso em contexto longo é pesado; o dimensionamento de contexto do Unsloth rodará de bom grado com um contexto mais curto para você, mas uma stack de serving com gerenciamento adequado de KV supera um aplicativo local.

Você está servindo muitos usuários. O Unsloth é um aplicativo local e uma biblioteca de fine-tuning, não um servidor multi-tenant. Para concorrência, autoscaling e garantias de disponibilidade, você quer um endpoint hospedado.

Você não tem nenhuma GPU. Uma resposta honesta: um 27B de 2 bits em uma placa de 12GB é visivelmente pior do que o mesmo modelo servido corretamente. Use primeiro o nível gratuito da API; se for bom o suficiente, compre hardware quando o caso de uso estiver comprovado.

Você quer fazer fine-tuning do lado da visão. As acelerações do Unsloth têm como alvo as camadas do transformer de texto; um fine-tuning multimodal completo precisa de uma stack diferente.

Conclusão

Qwen3.8 27B com Unsloth é um problema resolvido a partir desta semana: instale o Studio, escolha UD-Q4_K_XL para uma placa de 24GB (UD-Q3_K_XL para 16GB, UD-IQ2_XXS para 12GB), e o modelo roda sem configuração e sem cobrança por token. O caminho de fine-tuning é real e as alegações de velocidade da Unsloth são a razão pela qual o QLoRA de 27B é prático em uma única placa. Saiba que a escada de quantização é Dynamic V3.0 (preview), não a Dynamic 2.0 que artigos antigos descrevem; mantenha o llama.cpp atualizado; e se você não possui o hardware, os mesmos pesos são uma API de $0.33/$2.40 com um nível gratuito com limite de requisições — então não há razão para rodar um arquivo de 2 bits com o qual você não está satisfeito. Local é a rota gratuita e, pela primeira vez nesta classe de peso, também é a rota fácil.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube