
Qwen3.8-27B no Hugging Face: o repositório oficial, o que tem dentro e como baixá-lo
- obsidianNOVOQwen3.8 27B Uncensored (Aggressive)2026-08-15$0.40 / $4.21 por 1M de tokens · 22 tok/s
- qwenNOVOQwen: Qwen3.8 27B (free)2026-08-1349 tok/s
- deepseekNOVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligência69Código
- grokNOVOSpaceXAI: Grok 4.62026-08-1261Inteligência77Código
- metaNOVOMeta: Muse Spark 1.22026-08-0557Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligência72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens · 284 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligência78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligência69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligência49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligência71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligência76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligência71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligência77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligência77Código
- grokxAI: Grok 4.52026-07-0856Inteligência72Código
- tencentTencent: Hy32026-07-0642Inteligência59Código
Qwen3.8 27B está no Hugging Face em Qwen/Qwen3.8-27B, publicado pela organização Qwen em 14 de agosto de 2026 sob a licença Apache 2.0. O repositório contém 55,6 GB de safetensors BF16 distribuídos em 18 shards, além do tokenizador, template de chat e configuração que o acompanham — download gratuito, uso comercial livre e sem taxa por token. Duas coisas confundem as pessoas: o repositório oficial traz apenas safetensors, enquanto as quantizações GGUF que rodam em GPUs de consumo ficam em repositórios comunitários separados; e repositórios imitadores apareceram antes do lançamento, então somente a cópia da organização Qwen é legítima. Este artigo é o passo a passo do download: o que há no repositório, as três formas de obtê-lo e como verificar se você baixou os pesos genuínos.
Os fatos rápidos, verificados em 15 de agosto de 2026
• Repositório — Qwen/Qwen3.8-27B no Hugging Face, publicado pela organização Qwen; espelhado em Qwen/Qwen3.8-27B no ModelScope.
• Lançado — os pesos foram disponibilizados em 14 de agosto de 2026; a cobertura com indicação de fuso horário também cita 13 de agosto, e artigos de pré-lançamento da semana anterior os relatavam como pendentes.
• Licença — Apache 2.0: baixe, modifique e redistribua, uso comercial incluído.
• Tamanho — 55,57 GB de safetensors em 18 shards (2,1–3,99 GB cada); a página do repositório arredonda o total para 55,6 GB.
• Modelo — 27B parâmetros densos (28B contando o codificador de visão), 64 camadas, tamanho oculto 5.120, vocabulário 248.320.
• Attention — híbrido: 48 camadas Gated DeltaNet (atenção linear) contra 16 camadas completas de Gated Attention, treinado com predição multi-token — a divisão 3:1 é a razão pela qual 262.144 tokens de contexto nativo rodam em um 27B.
• Contexto — 262.144 tokens nativamente, expansível para 1.000.000 via escalonamento YaRN RoPE.
• Entrada — imagem e vídeo nativos junto com texto; retorna texto.
• Signal — 91.917 downloads no contador móvel de 30 dias da ficha do modelo, verificado em 15 de agosto de 2026.
Todas as figuras acima vêm da página do modelo Hugging Face, da árvore do repositório e da configuração do Qwen3.8 27B, consultados em 15 de agosto de 2026. As alegações de benchmark no cartão (SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3) são relatadas pela Alibaba; até o momento, nenhum laboratório independente as reproduziu.
Por que baixar: a questão local versus API
Pesos abertos são a única categoria de modelo em que o custo marginal de processar um token é o custo da sua eletricidade. Sem taxa de licença, sem preço por token, sem limite de requisições, e nada sai da sua máquina. Qwen3.8 27B é Apache 2.0, então essa liberdade é permanente: a Alibaba não pode retirar os pesos, relicenciá-los ou cobrar por eles.
A contrapartida é hardware e configuração. Os pesos BF16 completos exigem uma GPU de classe 80 GB em precisão nativa, e 55.6 GB é um download considerável. Se você quiser avaliar o modelo antes de se comprometer com isso, o caminho da API é mais rápido: Qwen3.8 27B é servido no OrcaRouter ao preço da Qwen de $0.33 por milhão de tokens de entrada e $2.40 por milhão de tokens de saída, repassado sem margem — e o OrcaRouter também oferece uma camada gratuita com limite de requisições para o mesmo modelo, então um teste de fumaça com custo zero não precisa de download algum. Mas a API é uma conveniência, não uma dependência — os pesos são o produto, e eles são gratuitos.
O que está realmente no repositório
O repositório não se resume a pesos. É um pacote completo e executável: 18 shards mais os arquivos de metadados de que Transformers, vLLM e SGLang precisam. Percorrendo-o de cima a baixo:
• model-00001-of-00018.safetensors … model-00018-of-00018.safetensors — os pesos, 2,1–3,99 GB por shard, 55,57 GB no total.
• model.safetensors.index.json — mapeia cada tensor para o seu shard; é o que um carregador lê primeiro.
• config.json — a arquitetura: 64 camadas, tamanho oculto 5,120, vocabulário 248,320 e o layout Gated DeltaNet / Gated Attention.
• tokenizer.json (12.8 MB), tokenizer_config.json, vocab.json (6.72 MB), merges.txt (3.35 MB) — o tokenizer.
• chat_template.jinja — o template de chat, incluindo o bloco de raciocínio; o llama.cpp precisa que ele seja passado como um template jinja, caso contrário o modelo responde com tags de pensamento.
• preprocessor_config.json e video_preprocessor_config.json — pré-processamento de imagem e vídeo.
• crc32.txt — checksums por shard; verifique um download usando este arquivo e uma transferência corrompida deixa de ser um mistério.
• README.md (a ficha do modelo de 65 kB), LICENSE (Apache 2.0), generation_config.json, .gitattributes (marca os arquivos de peso como Git LFS).

Uma consequência desse layout é relevante para o problema do repositório falso abaixo. Uma cópia genuína deste repositório é pesada e completa. Um repositório provisório com "Qwen3.8" no nome e nada além de um README não é um download que falhou — é um repositório diferente e vazio.
Como baixá-lo — três maneiras
Método um, huggingface-cli, é o caminho mais limpo. O modelo é público, então não é necessário fazer login; isso baixa todos os 18 shards e os metadados para uma pasta:
huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B
Para uma transferência de 55,6 GB, o hf_transfer backend vale a pena instalar — ele paraleliza o download e geralmente reduz o tempo drasticamente:
pip install hf_transfer
HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B
Método dois, git clone, fornece o repositório como uma cópia de trabalho com histórico. Requer Git LFS:
git lfs install
git clone https://huggingface.co/Qwen/Qwen3.8-27B
Método três, o navegador — abra a aba Arquivos e baixe os shards individualmente. Só faz sentido quando você precisa de um arquivo (por exemplo, apenas config.json para inspecionar a arquitetura). Para o repositório completo, são 18 downloads manuais mais uma verificação de checksum; use uma CLI.

Quais arquivos você deve realmente baixar
O repositório oficial é BF16 safetensors — precisão total, 55,6 GB — o artefato certo se você tiver uma GPU da classe de 80 GB, ou quiser fazer a quantização por conta própria mais tarde. Não há GGUF oficial. As versões GGUF que as pessoas realmente executam em placas de consumo são lançamentos da comunidade: o Hugging Face lista 303 modelos quantizados construídos a partir desta base (verificado em 15 de agosto de 2026), e aqueles para os quais os runbooks apontam são as versões unsloth e lmstudio-community. A escada aproximada:
• BF16 safetensors — 55.6 GB, requer uma GPU de classe 80 GB em precisão nativa.
• GGUF Q8_0 — aproximadamente 29 GB, cabe em uma placa de 48 GB.
• GGUF Q4_K_M — aproximadamente 17 GB, a escolha padrão para placas de 24 GB.
• GGUF 2-bit — cerca de 9 GB, mal cabe em placas de 12 GB com perda visível de qualidade.
Se você quiser recursos de visão em uma build GGUF, também precisa do arquivo mmproj separado para o codificador de visão, documentado em cada card da comunidade. Para o detalhamento completo de quantização e runtime — incluindo a ressalva do chat-template do llama.cpp — nosso runbook sobre a execução local do Qwen3.8 27B tem os detalhes.
Como distinguir o repositório real dos falsos
Antes de os pesos serem lançados, a busca no Hugging Face estava cheia de repositórios "Qwen3.8" sem arquivos de peso — cards de placeholder e forks criados para pegar quem procurava cedo. Alguns ainda estão no ar. A lista de verificação:
• Verifique o publicador, não o nome.O repositório genuíno está sob a organização Qwen: Qwen/Qwen3.8-27B. Um repositório chamado Qwen3.8 27B em qualquer outra conta não é o lançamento oficial, por mais profissional que pareça.
• Use a coleção oficial. Qwen mantém huggingface.co/collections/Qwen/qwen38; todos os repositórios nela são deles.
• Verifique o campo de licença. O cartão real diz Apache 2.0.
• Verifique o tamanho e o formato. O repositório real tem 18 shards safetensors totalizando aproximadamente 55,6 GB, um arquivo de checksum crc32.txt e um README de 65 kB. Zero arquivos de peso significa um repositório vazio, não um download corrompido.
• Trate a contagem de downloads como um sinal, não como prova. O repositório genuíno ultrapassou 91.000 downloads em um dia, o que mostra para onde todos os outros estão apontando. Mas uma versão falsa também pode ser baixada; o editor é a garantia.
Após o download, verifique a integridade: confira o CRC32 de cada shard em relação ao crc32.txt, ou carregue o modelo com Transformers e confirme se o state dict carrega sem avisos. Isso detecta tanto uma transferência corrompida quanto um modelo errado reempacotado.
Quando baixar é a jogada errada
Baixar 55.6 GB não é a escolha certa para todos, e a versão honesta deste artigo diz isso claramente.
Você só quer avaliar o modelo. A rota de API é mais rápida — um teste estruturado custa centavos e leva minutos, não um download e uma tarde de configuração.
Você não tem uma GPU próxima de 80 GB.O download BF16 é o artefato errado para você. Escolha uma quantização GGUF ou a API.
Você precisa de benchmarks verificados. Cada número de destaque para Qwen3.8 27B é informado pela Alibaba em 15 de agosto de 2026. Se sua decisão depende de números que um laboratório independente reproduziu, espere por eles — os pesos ainda estarão aqui.
Você está construindo sobre um modelo com poucos dias. Os pesos foram lançados em 14 de agosto. A página do modelo OrcaRouter, lida hoje, mostra uma taxa de erro de 33,3% nos últimos sete dias e latência de primeiro token p50 de 225 ms — um modelo recém-lançado sob carga inicial, portanto trate a telemetria inicial como provisória. Quem auto-hospeda deve fixar o commit baixado e manter um fallback; usuários de API devem manter uma regra de failover como o mesmo seguro.

Você quer um contrato de suporte. O Apache 2.0 é permissivo, mas uma licença não é um SLA. Se sua carga de trabalho precisa de suporte do fornecedor, seguir pela API hospedada é a opção mais segura.
O resultado final
O verdadeiro Qwen3.8 27B está no Hugging Face em Qwen/Qwen3.8-27B, Apache 2.0, lançado em 14 de agosto de 2026, 55,6 GB de safetensors BF16 em 18 shards. Baixe-o com huggingface-cli ou git clone, verifique se o publicador é a organização Qwen, e você detém um 27B de pesos abertos de última geração que ninguém pode tirar de você ou cobrar por ele. Se isso é mais comprometimento do que o seu caso de uso exige, o mesmo modelo está a apenas alguns centavos pela API. Os pesos são o que importa, no entanto — e eles são gratuitos.
