Um cartão de título hero exibindo Qwen3.8-27B com Unsloth, com o subtítulo 'execute, quantize ou faça fine-tuning localmente', um ícone de janela de terminal e chips exibindo 'UD-Q4_K_XL 17.9GB' e 'Studio no-config'.
Guides & Insights

Qwen3.8-27B com Unsloth: Execute, Quantize ou Faça Fine-Tuning Localmente

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Sim — o Unsloth executa o Qwen3.8 27B, e é a forma mais rápida de colocar o novo modelo Apache-2.0 da Ali​baba na sua própria GPU. Toda a resposta numa linha: abra o Unsloth Studio, procure por "Qwen3.8 27B", escolha UD-Q4_K_XL (17.9GB) numa placa de 24GB e converse em menos de um minuto. Por trás desse clique, o Unsloth lançou três coisas na mesma semana em que os pesos foram divulgados (13–14 de agosto de 2026): o pacote unsloth/Qwen3.8-27B-GGUF baseado na quantização Unsloth Dynamic V3.0 (preview), suporte total no Unsloth Studio e Desktop, e a versão v0.1.800-beta com exportação GGUF, deteção de imatrix e melhorias de ajuste à VRAM. Também faz fine-tuning do modelo — o Unsloth afirma um treino 2× mais rápido com 70% menos VRAM. O Qwen3.8 27B é um modelo denso de visão-linguagem com 27 mil milhões de parâmetros cuja atenção híbrida mantém apenas 16 das 64 camadas em atenção total, razão pela qual um ficheiro de 4 bits cabe em placas onde a maioria dos modelos de 27B não cabe.

Sobre fontes: os fatos do modelo são oficiais, da ficha técnica do modelo Qwen3.8 27B no Hugging Face, verificados em 15 de agosto de 2026. O suporte do Unsloth, os tamanhos de quantização, os requisitos de VRAM e os comandos de instalação vêm das notas de versão e da documentação do Unsloth, no mesmo dia. O preço da API é ao vivo do catálogo do OrcaRouter, no mesmo dia. As afirmações do Unsloth de "2× mais rápido, 70% menos VRAM" e "de longe o modelo mais forte para seu tamanho" são alegações do fornecedor, não reproduzidas de forma independente.

O que "Qwen3.8 + Unsloth" significa: quatro coisas diferentes.

Unsloth consiste em quatro coisas separadas, e os resultados de pesquisa por palavras-chave as misturam. Saber qual delas você precisa é metade da configuração:

• unsloth/Qwen3.8-27B-GGUF — os arquivos de pesos quantizados no Hugging Face, 21 quants mais um projetor de visão. Construído com Dynamic V3.0 (preview), não com o Dynamic 2.0 mais antigo (que foi anunciado em 24 de abril de 2025 e antecede este modelo). Esta é a rota de "baixar um arquivo", utilizável a partir de qualquer build do llama.cpp.

• Unsloth Studio — o aplicativo de navegador que você instala ou executa a partir de um Hugging Face Space. Pesquise o hub de modelos, clique em um quant, converse com ferramentas. Sem configuração manual de template ou parâmetros de inferência.

• Unsloth Desktop — o aplicativo GUI local para macOS, Windows e Linux que engloba o Studio e o treinamento. É aqui que acontece o fine-tuning "2× mais rápido com 70% menos VRAM".

• A biblioteca Python unsloth — from unsloth import FastLanguageModel, a API de fine-tuning QLoRA usada em notebooks e scripts.

As notas de versão do Unsloth para v0.1.800-beta, intituladas {{1}}"Lançamento do Qwen3.8 27B"{{/1}}, dizem que o Qwen3.8 27B e o Qwen3.8-2.4T-A95B, de 2,4T de parâmetros, {{2}}"agora podem ser executados localmente no Unsloth"{{/2}}, que o 27B {{3}}"roda com 17GB de RAM via Unsloth Dynamic GGUFs"{{/3}} e que {{4}}"você também pode fazer fine-tuning do Qwen3.8 27B no Unsloth"{{/4}}. A mesma versão adiciona quantizações NVFP4, verifica o espaço em disco antes de exportações GGUF, detecta suporte real a imatrix GGUF no Studio e torna a inferência até 10% mais rápida em GGUF com um limite de VRAM ajustável.

A card titled 'Three routes to Qwen3.8-27B with Unsloth' with three columns: Run - Studio one-click or GGUF file via llama.cpp; Quantize - Dynamic V3.0 preview, 2-bit to 8-bit, UD-Q4_K_XL 17.9GB recommended; Fine-tune - QLoRA, 2x faster with 70% less VRAM.

Escolha seu quant pela VRAM, não pelo achismo.

A tabela de memória da Unsloth considera a RAM total mais a VRAM (ou memória unificada), e é a orientação oficial. Um Qwen3.8 27B em 4 bits precisa de 17–19 GB; uma RTX 4090 de 24 GB, uma RTX 5080 ou um Mac com memória unificada de 24 GB é o mínimo realista para uma configuração confortável em 4 bits. As três opções que atendem quase todo mundo:

• 12GB → UD-IQ2_XXS a 9,0GB — o único arquivo que cabe inteiro; espere uma perda visível de qualidade. Faça essa escolha conscientemente.

• 16GB → UD-Q3_K_XL com 13.4GB — o melhor arquivo de 3 bits, segundo o próprio seletor da Unsloth.

• 24GB → UD-Q4_K_XL at 17.9GB — o arquivo 4-bit recomendado e a resposta padrão deste artigo.

• 48–64GB → UD-Q8_K_XL em 31.5GB — quase sem perdas em uma workstation ou configuração com GPU dupla.

A escada completa, da lista de arquivos unsloth/Qwen3.8-27B-GGUF e da documentação do Unsloth, ambas verificadas em 15 de agosto de 2026: UD-Q8_K_XL 31,5 GB, UD-Q6_K_XL 25,9 GB, UD-Q5_K_XL 20,2 GB, UD-Q4_K_XL 17,9 GB, UD-Q3_K_XL 13,4 GB, UD-Q2_K_XL 10,7 GB, UD-IQ3_XXS 11,9 GB, UD-IQ2_M 10,3 GB, UD-IQ2_XXS 9,0 GB. Os K-quants padrão (Q4_K_M 17,1 GB, Q8_0 29,0 GB) também estão lá, e o pacote inclui um projetor de visão (mmproj-BF16, 931 MB) para que imagens e vídeos funcionem se você o carregar. O Unsloth chama toda a escada de "Dynamic V3.0 (preview)" — mais novo que o Dynamic 2.0 que você verá em publicações mais antigas, que foi construído para modelos lançados mais de um ano antes.

A VRAM picker card for Qwen3.8-27B with Unsloth, listing the official memory ladder: 2-bit 11-13GB, 3-bit 13-16GB, 4-bit 17-19GB, 6-bit 24GB, 8-bit 31GB, BF16 56GB, with UD-Q4_K_XL 17.9GB highlighted as the pick for 24GB cards, UD-Q3_K_XL 13.4GB for 16GB, and UD-IQ2_XXS 9.0GB for 12GB.

Rode com Unsloth em três minutos

A rota de um clique: no macOS ou Linux, `curl -fsSL https://unsloth.ai/install.sh | sh`, depois `unsloth studio -p 8888` e abra `http://127.0.0.1:8888`. No Windows, `irm https://unsloth.ai/install.ps1 | iex`. Se você quiser zero instalação, o Studio da Unsloth também é publicado como um Hugging Face Space — abra-o no navegador, pesquise "Qwen3.8 27B" e escolha uma quantização conforme a memória que você tem. O Studio ajusta automaticamente os parâmetros de amostragem e o template de chat, descarrega para a RAM quando a VRAM fica escassa e detecta configurações multi-GPU — a parte "sem configuração" é real, e é a maneira mais rápida de estar rodando o modelo desta semana.

A rota que prioriza arquivos, se você já usa llama.cpp: baixe um quant e execute-o diretamente. Estes são os próprios comandos da Unsloth, verificados de acordo com a documentação deles:

hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"

./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Esses valores de amostragem são as configurações recomendadas de modo de raciocínio do model card. Troque o glob --include por *UD-Q3_K_XL* em uma placa de 16GB, e adicione --mmproj apontando para o mmproj-BF16.gguf do pacote se precisar de visão. Um detalhe: o llama.cpp deve ser uma compilação atual — o arquivo registra a nova arquitetura qwen35, e qualquer coisa anterior à semana de lançamento se recusa a carregá-lo.

Ajuste-o finamente com Unsloth

É no fine-tuning que a Unsloth ganha sua reputação: a biblioteca afirma treinamento 2× mais rápido com 70% menos VRAM em comparação com o Transformers + PEFT padrão, o que torna o QLoRA em um modelo de 27B viável em uma única GPU de consumo. O ponto de entrada do fine-tuning é o simples unsloth/Qwen3.8-27B repositório (safetensors, página de arquivos 28B) em vez do pacote GGUF. O padrão QLoRA usual da Unsloth, aplicado a este modelo:

from unsloth import FastLanguageModel

model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)

model = FastLanguageModel.get_peft_model(model, r=16)

então um loop padrão de `trl.SFTTrainer` no seu conjunto de dados. Esse trecho é o padrão QLoRA padrão da documentação do Unsloth — as alegações de benchmark de treinamento são do próprio Unsloth e não algo que eu reproduzi — e duas ressalvas se aplicam: os kernels do Unsloth aplicam patch nas camadas de transformer de texto, então planeje lidar com o codificador de visão separadamente, e mantenha o pacote unsloth na versão atual porque essa arquitetura tem dias de vida e incompatibilidades de versão falham ruidosamente.

O que o Unsloth Studio resolve por você

Rodar um GGUF manualmente significa equilibrar o tamanho do contexto, a descarga de RAM e a chamada de ferramentas. O Studio reduz isso a padrões: ele dimensiona o contexto com base na memória realmente livre, descarrega modelos de visão ociosos para liberar VRAM para chat ou treinamento, detecta layouts multi-GPU e conecta pesquisa na web, execução de código e conexões de agentes (Claude Code, Codex, MCP) de fábrica. A versão v0.1.800-beta também ajustou as partes que incomodam na prática: as exportações de GGUF agora verificam o espaço em disco antes de iniciar uma mesclagem longa, em vez de falhar no meio; o Studio detecta se o GGUF que está exportando realmente suporta imatrix (para você não desperdiçar uma execução); e as salvaguardas de memória não reservam mais memória GPU em excesso. Para um modelo de três dias, o "no-config" está fazendo um trabalho real.

Local gratuito vs API paga: a economia honesta

A diferença central entre Unsloth e uma API não é a qualidade — é quem é dono do hardware. Unsloth é o caminho gratuito: custo marginal zero por token, nada sai da sua máquina, sem limites de requisições e controle total dos pesos. Não é gratuito em termos absolutos: você fornece a GPU e a eletricidade, e um arquivo de 2 bits em uma placa de 12 GB é uma experiência comprometida. O Qwen3.8 27B é denso e capaz de visão, portanto um arquivo de 4 bits corresponde a 17,9 GB de pesos antes do contexto; a máquina é o preço de entrada.

A rota de API existe porque os pesos são Apache-2.0, então qualquer pessoa pode hospedá-los a um custo marginal quase zero. Qwen3.8 27B está no catálogo da OrcaRouter hoje por $0.33 por milhão de tokens de entrada e $2.40 por milhão de tokens de saída, o modelo auto-hospedado em nossa própria infraestrutura — sem repasse de preço de fornecedor — com uma janela de contexto de 262 mil tokens e entrada de texto, imagem e vídeo. Como os pesos são abertos, há também um nível gratuito com limite de taxa que cobra $0 por requisição. Um mês representativo de 10 milhões de tokens com uma parcela de 70% de entrada custa cerca de $9.51 no plano pago. Se você já possui uma placa de 24GB, a opção local vence em custo; se não possui, alugar tokens a essa taxa é melhor do que comprar uma placa para um projeto paralelo, e o nível gratuito é a maneira honesta de testar o modelo antes de se comprometer com qualquer hardware.

A cost comparison card titled 'Local free vs API paid', with the left column 'Unsloth local' listing zero marginal cost, 17.9GB weights for 4-bit, you supply the GPU, and the right column 'Qwen3.8-27B API' listing 0.33 dollars per million input, 2.40 dollars per million output, a free rate-limited tier, and about 9.51 dollars for a 10-million-token month.

Quando Unsloth é a resposta errada

Unsloth Studio e o pacote GGUF são a escolha certa para uma única máquina. Eles são a escolha errada quando:

• Você possui uma placa Blackwell da série RTX 50. As versões quantizadas unsloth/Qwen3.8-27B-NVFP4 são aproximadamente 1.5× mais rápidas que BF16 na mesma VRAM e usam um cache KV FP8 para contexto mais longo. Esse caminho passa por vLLM ou SGLang, não por GGUF e nem pelo Studio.

• Você precisa da janela nativa completa de 262K ou da extensão YaRN de 1M em produção. Um modelo de visão denso em contexto longo é pesado; o dimensionamento de contexto do Unsloth rodará de bom grado com um contexto mais curto para você, mas uma stack de serving com gerenciamento adequado de KV supera um aplicativo local.

• Você está servindo muitos usuários. O Unsloth é um aplicativo local e uma biblioteca de fine-tuning, não um servidor multi-tenant. Para concorrência, autoscaling e garantias de disponibilidade, você quer um endpoint hospedado.

• Você não tem nenhuma GPU. Uma resposta honesta: um 27B de 2 bits em uma placa de 12GB é visivelmente pior do que o mesmo modelo servido corretamente. Use primeiro o nível gratuito da API; se for bom o suficiente, compre hardware quando o caso de uso estiver comprovado.

• Você quer fazer fine-tuning do lado da visão. As acelerações do Unsloth têm como alvo as camadas do transformer de texto; um fine-tuning multimodal completo precisa de uma stack diferente.

Conclusão

Qwen3.8 27B com Unsloth é um problema resolvido a partir desta semana: instale o Studio, escolha UD-Q4_K_XL para uma placa de 24GB (UD-Q3_K_XL para 16GB, UD-IQ2_XXS para 12GB), e o modelo roda sem configuração e sem cobrança por token. O caminho de fine-tuning é real e as alegações de velocidade da Unsloth são a razão pela qual o QLoRA de 27B é prático em uma única placa. Saiba que a escada de quantização é Dynamic V3.0 (preview), não a Dynamic 2.0 que artigos antigos descrevem; mantenha o llama.cpp atualizado; e se você não possui o hardware, os mesmos pesos são uma API de $0.33/$2.40 com um nível gratuito com limite de requisições — então não há razão para rodar um arquivo de 2 bits com o qual você não está satisfeito. Local é a rota gratuita e, pela primeira vez nesta classe de peso, também é a rota fácil.