
Qwen3.8-27B com Unsloth: Execute, Quantize ou Faça Fine-Tuning Localmente
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 por 1M de tokens · 18 tok/s
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1335 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenNOVOQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 2341 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
Sim — o Unsloth executa o Qwen3.8 27B, e é a forma mais rápida de colocar o novo modelo Apache-2.0 da Alibaba na sua própria GPU. Toda a resposta numa linha: abra o Unsloth Studio, procure por "Qwen3.8 27B", escolha UD-Q4_K_XL (17.9GB) numa placa de 24GB e converse em menos de um minuto. Por trás desse clique, o Unsloth lançou três coisas na mesma semana em que os pesos foram divulgados (13–14 de agosto de 2026): o pacote unsloth/Qwen3.8-27B-GGUF baseado na quantização Unsloth Dynamic V3.0 (preview), suporte total no Unsloth Studio e Desktop, e a versão v0.1.800-beta com exportação GGUF, deteção de imatrix e melhorias de ajuste à VRAM. Também faz fine-tuning do modelo — o Unsloth afirma um treino 2× mais rápido com 70% menos VRAM. O Qwen3.8 27B é um modelo denso de visão-linguagem com 27 mil milhões de parâmetros cuja atenção híbrida mantém apenas 16 das 64 camadas em atenção total, razão pela qual um ficheiro de 4 bits cabe em placas onde a maioria dos modelos de 27B não cabe.
Sobre fontes: os fatos do modelo são oficiais, da ficha técnica do modelo Qwen3.8 27B no Hugging Face, verificados em 15 de agosto de 2026. O suporte do Unsloth, os tamanhos de quantização, os requisitos de VRAM e os comandos de instalação vêm das notas de versão e da documentação do Unsloth, no mesmo dia. O preço da API é ao vivo do catálogo do OrcaRouter, no mesmo dia. As afirmações do Unsloth de "2× mais rápido, 70% menos VRAM" e "de longe o modelo mais forte para seu tamanho" são alegações do fornecedor, não reproduzidas de forma independente.
O que "Qwen3.8 + Unsloth" significa: quatro coisas diferentes.
Unsloth consiste em quatro coisas separadas, e os resultados de pesquisa por palavras-chave as misturam. Saber qual delas você precisa é metade da configuração:
• unsloth/Qwen3.8-27B-GGUF — os arquivos de pesos quantizados no Hugging Face, 21 quants mais um projetor de visão. Construído com Dynamic V3.0 (preview), não com o Dynamic 2.0 mais antigo (que foi anunciado em 24 de abril de 2025 e antecede este modelo). Esta é a rota de "baixar um arquivo", utilizável a partir de qualquer build do llama.cpp.
• Unsloth Studio — o aplicativo de navegador que você instala ou executa a partir de um Hugging Face Space. Pesquise o hub de modelos, clique em um quant, converse com ferramentas. Sem configuração manual de template ou parâmetros de inferência.
• Unsloth Desktop — o aplicativo GUI local para macOS, Windows e Linux que engloba o Studio e o treinamento. É aqui que acontece o fine-tuning "2× mais rápido com 70% menos VRAM".
• A biblioteca Python unsloth — from unsloth import FastLanguageModel, a API de fine-tuning QLoRA usada em notebooks e scripts.
As notas de versão do Unsloth para v0.1.800-beta, intituladas {{1}}"Lançamento do Qwen3.8 27B"{{/1}}, dizem que o Qwen3.8 27B e o Qwen3.8-2.4T-A95B, de 2,4T de parâmetros, {{2}}"agora podem ser executados localmente no Unsloth"{{/2}}, que o 27B {{3}}"roda com 17GB de RAM via Unsloth Dynamic GGUFs"{{/3}} e que {{4}}"você também pode fazer fine-tuning do Qwen3.8 27B no Unsloth"{{/4}}. A mesma versão adiciona quantizações NVFP4, verifica o espaço em disco antes de exportações GGUF, detecta suporte real a imatrix GGUF no Studio e torna a inferência até 10% mais rápida em GGUF com um limite de VRAM ajustável.

Escolha seu quant pela VRAM, não pelo achismo.
A tabela de memória da Unsloth considera a RAM total mais a VRAM (ou memória unificada), e é a orientação oficial. Um Qwen3.8 27B em 4 bits precisa de 17–19 GB; uma RTX 4090 de 24 GB, uma RTX 5080 ou um Mac com memória unificada de 24 GB é o mínimo realista para uma configuração confortável em 4 bits. As três opções que atendem quase todo mundo:
• 12GB → UD-IQ2_XXS a 9,0GB — o único arquivo que cabe inteiro; espere uma perda visível de qualidade. Faça essa escolha conscientemente.
• 16GB → UD-Q3_K_XL com 13.4GB — o melhor arquivo de 3 bits, segundo o próprio seletor da Unsloth.
• 24GB → UD-Q4_K_XL at 17.9GB — o arquivo 4-bit recomendado e a resposta padrão deste artigo.
• 48–64GB → UD-Q8_K_XL em 31.5GB — quase sem perdas em uma workstation ou configuração com GPU dupla.
A escada completa, da lista de arquivos unsloth/Qwen3.8-27B-GGUF e da documentação do Unsloth, ambas verificadas em 15 de agosto de 2026: UD-Q8_K_XL 31,5 GB, UD-Q6_K_XL 25,9 GB, UD-Q5_K_XL 20,2 GB, UD-Q4_K_XL 17,9 GB, UD-Q3_K_XL 13,4 GB, UD-Q2_K_XL 10,7 GB, UD-IQ3_XXS 11,9 GB, UD-IQ2_M 10,3 GB, UD-IQ2_XXS 9,0 GB. Os K-quants padrão (Q4_K_M 17,1 GB, Q8_0 29,0 GB) também estão lá, e o pacote inclui um projetor de visão (mmproj-BF16, 931 MB) para que imagens e vídeos funcionem se você o carregar. O Unsloth chama toda a escada de "Dynamic V3.0 (preview)" — mais novo que o Dynamic 2.0 que você verá em publicações mais antigas, que foi construído para modelos lançados mais de um ano antes.

Rode com Unsloth em três minutos
A rota de um clique: no macOS ou Linux, `curl -fsSL https://unsloth.ai/install.sh | sh`, depois `unsloth studio -p 8888` e abra `http://127.0.0.1:8888`. No Windows, `irm https://unsloth.ai/install.ps1 | iex`. Se você quiser zero instalação, o Studio da Unsloth também é publicado como um Hugging Face Space — abra-o no navegador, pesquise "Qwen3.8 27B" e escolha uma quantização conforme a memória que você tem. O Studio ajusta automaticamente os parâmetros de amostragem e o template de chat, descarrega para a RAM quando a VRAM fica escassa e detecta configurações multi-GPU — a parte "sem configuração" é real, e é a maneira mais rápida de estar rodando o modelo desta semana.
A rota que prioriza arquivos, se você já usa llama.cpp: baixe um quant e execute-o diretamente. Estes são os próprios comandos da Unsloth, verificados de acordo com a documentação deles:
hf download unsloth/Qwen3.8-27B-GGUF --local-dir unsloth/Qwen3.8-27B-GGUF --include "*UD-Q4_K_XL*"
./llama.cpp/llama-cli --model unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q4_K_XL.gguf --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0
Esses valores de amostragem são as configurações recomendadas de modo de raciocínio do model card. Troque o glob --include por *UD-Q3_K_XL* em uma placa de 16GB, e adicione --mmproj apontando para o mmproj-BF16.gguf do pacote se precisar de visão. Um detalhe: o llama.cpp deve ser uma compilação atual — o arquivo registra a nova arquitetura qwen35, e qualquer coisa anterior à semana de lançamento se recusa a carregá-lo.
Ajuste-o finamente com Unsloth
É no fine-tuning que a Unsloth ganha sua reputação: a biblioteca afirma treinamento 2× mais rápido com 70% menos VRAM em comparação com o Transformers + PEFT padrão, o que torna o QLoRA em um modelo de 27B viável em uma única GPU de consumo. O ponto de entrada do fine-tuning é o simples unsloth/Qwen3.8-27B repositório (safetensors, página de arquivos 28B) em vez do pacote GGUF. O padrão QLoRA usual da Unsloth, aplicado a este modelo:
from unsloth import FastLanguageModel
model, tokenizer = FastLanguageModel.from_pretrained("unsloth/Qwen3.8-27B", max_seq_length=8192, load_in_4bit=True)
model = FastLanguageModel.get_peft_model(model, r=16)
então um loop padrão de `trl.SFTTrainer` no seu conjunto de dados. Esse trecho é o padrão QLoRA padrão da documentação do Unsloth — as alegações de benchmark de treinamento são do próprio Unsloth e não algo que eu reproduzi — e duas ressalvas se aplicam: os kernels do Unsloth aplicam patch nas camadas de transformer de texto, então planeje lidar com o codificador de visão separadamente, e mantenha o pacote unsloth na versão atual porque essa arquitetura tem dias de vida e incompatibilidades de versão falham ruidosamente.
O que o Unsloth Studio resolve por você
Rodar um GGUF manualmente significa equilibrar o tamanho do contexto, a descarga de RAM e a chamada de ferramentas. O Studio reduz isso a padrões: ele dimensiona o contexto com base na memória realmente livre, descarrega modelos de visão ociosos para liberar VRAM para chat ou treinamento, detecta layouts multi-GPU e conecta pesquisa na web, execução de código e conexões de agentes (Claude Code, Codex, MCP) de fábrica. A versão v0.1.800-beta também ajustou as partes que incomodam na prática: as exportações de GGUF agora verificam o espaço em disco antes de iniciar uma mesclagem longa, em vez de falhar no meio; o Studio detecta se o GGUF que está exportando realmente suporta imatrix (para você não desperdiçar uma execução); e as salvaguardas de memória não reservam mais memória GPU em excesso. Para um modelo de três dias, o "no-config" está fazendo um trabalho real.
Local gratuito vs API paga: a economia honesta
A diferença central entre Unsloth e uma API não é a qualidade — é quem é dono do hardware. Unsloth é o caminho gratuito: custo marginal zero por token, nada sai da sua máquina, sem limites de requisições e controle total dos pesos. Não é gratuito em termos absolutos: você fornece a GPU e a eletricidade, e um arquivo de 2 bits em uma placa de 12 GB é uma experiência comprometida. O Qwen3.8 27B é denso e capaz de visão, portanto um arquivo de 4 bits corresponde a 17,9 GB de pesos antes do contexto; a máquina é o preço de entrada.
A rota de API existe porque os pesos são Apache-2.0, então qualquer pessoa pode hospedá-los a um custo marginal quase zero. Qwen3.8 27B está no catálogo da OrcaRouter hoje por $0.33 por milhão de tokens de entrada e $2.40 por milhão de tokens de saída, o modelo auto-hospedado em nossa própria infraestrutura — sem repasse de preço de fornecedor — com uma janela de contexto de 262 mil tokens e entrada de texto, imagem e vídeo. Como os pesos são abertos, há também um nível gratuito com limite de taxa que cobra $0 por requisição. Um mês representativo de 10 milhões de tokens com uma parcela de 70% de entrada custa cerca de $9.51 no plano pago. Se você já possui uma placa de 24GB, a opção local vence em custo; se não possui, alugar tokens a essa taxa é melhor do que comprar uma placa para um projeto paralelo, e o nível gratuito é a maneira honesta de testar o modelo antes de se comprometer com qualquer hardware.

Quando Unsloth é a resposta errada
Unsloth Studio e o pacote GGUF são a escolha certa para uma única máquina. Eles são a escolha errada quando:
• Você possui uma placa Blackwell da série RTX 50. As versões quantizadas unsloth/Qwen3.8-27B-NVFP4 são aproximadamente 1.5× mais rápidas que BF16 na mesma VRAM e usam um cache KV FP8 para contexto mais longo. Esse caminho passa por vLLM ou SGLang, não por GGUF e nem pelo Studio.
• Você precisa da janela nativa completa de 262K ou da extensão YaRN de 1M em produção. Um modelo de visão denso em contexto longo é pesado; o dimensionamento de contexto do Unsloth rodará de bom grado com um contexto mais curto para você, mas uma stack de serving com gerenciamento adequado de KV supera um aplicativo local.
• Você está servindo muitos usuários. O Unsloth é um aplicativo local e uma biblioteca de fine-tuning, não um servidor multi-tenant. Para concorrência, autoscaling e garantias de disponibilidade, você quer um endpoint hospedado.
• Você não tem nenhuma GPU. Uma resposta honesta: um 27B de 2 bits em uma placa de 12GB é visivelmente pior do que o mesmo modelo servido corretamente. Use primeiro o nível gratuito da API; se for bom o suficiente, compre hardware quando o caso de uso estiver comprovado.
• Você quer fazer fine-tuning do lado da visão. As acelerações do Unsloth têm como alvo as camadas do transformer de texto; um fine-tuning multimodal completo precisa de uma stack diferente.
Conclusão
Qwen3.8 27B com Unsloth é um problema resolvido a partir desta semana: instale o Studio, escolha UD-Q4_K_XL para uma placa de 24GB (UD-Q3_K_XL para 16GB, UD-IQ2_XXS para 12GB), e o modelo roda sem configuração e sem cobrança por token. O caminho de fine-tuning é real e as alegações de velocidade da Unsloth são a razão pela qual o QLoRA de 27B é prático em uma única placa. Saiba que a escada de quantização é Dynamic V3.0 (preview), não a Dynamic 2.0 que artigos antigos descrevem; mantenha o llama.cpp atualizado; e se você não possui o hardware, os mesmos pesos são uma API de $0.33/$2.40 com um nível gratuito com limite de requisições — então não há razão para rodar um arquivo de 2 bits com o qual você não está satisfeito. Local é a rota gratuita e, pela primeira vez nesta classe de peso, também é a rota fácil.
