Um cartão de título para o guia de download do Qwen3.8-27B no Hugging Face, mostrando o caminho do repositório Qwen/Qwen3.8-27B, um selo de licença Apache 2.0 e as tags BF16, 55,6 GB e 18 fragmentos safetensors.
Guides & Insights

Qwen3.8-27B no Hugging Face: o repositório oficial, o que tem dentro e como baixá-lo

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Qwen3.8 27B está no Hugging Face em Qwen/Qwen3.8-27B, publicado pela organização Qwe​n em 14 de agosto de 2026 sob a licença Apache 2.0. O repositório contém 55,6 GB de safetensors BF16 distribuídos em 18 shards, além do tokenizador, template de chat e configuração que o acompanham — download gratuito, uso comercial livre e sem taxa por token. Duas coisas confundem as pessoas: o repositório oficial traz apenas safetensors, enquanto as quantizações GGUF que rodam em GPUs de consumo ficam em repositórios comunitários separados; e repositórios imitadores apareceram antes do lançamento, então somente a cópia da organização Qwe​n é legítima. Este artigo é o passo a passo do download: o que há no repositório, as três formas de obtê-lo e como verificar se você baixou os pesos genuínos.

Os fatos rápidos, verificados em 15 de agosto de 2026

RepositórioQwen/Qwen3.8-27B no Hugging Face, publicado pela organização Qwen; espelhado em Qwen/Qwen3.8-27B no ModelScope.

Lançado — os pesos foram disponibilizados em 14 de agosto de 2026; a cobertura com indicação de fuso horário também cita 13 de agosto, e artigos de pré-lançamento da semana anterior os relatavam como pendentes.

Licença — Apache 2.0: baixe, modifique e redistribua, uso comercial incluído.

Tamanho — 55,57 GB de safetensors em 18 shards (2,1–3,99 GB cada); a página do repositório arredonda o total para 55,6 GB.

Modelo — 27B parâmetros densos (28B contando o codificador de visão), 64 camadas, tamanho oculto 5.120, vocabulário 248.320.

Attention — híbrido: 48 camadas Gated DeltaNet (atenção linear) contra 16 camadas completas de Gated Attention, treinado com predição multi-token — a divisão 3:1 é a razão pela qual 262.144 tokens de contexto nativo rodam em um 27B.

Contexto — 262.144 tokens nativamente, expansível para 1.000.000 via escalonamento YaRN RoPE.

Entrada — imagem e vídeo nativos junto com texto; retorna texto.

Signal — 91.917 downloads no contador móvel de 30 dias da ficha do modelo, verificado em 15 de agosto de 2026.

Todas as figuras acima vêm da página do modelo Hugging Face, da árvore do repositório e da configuração do Qwen3.8 27B, consultados em 15 de agosto de 2026. As alegações de benchmark no cartão (SWE-bench Pro 61.7, LiveCodeBench v6 90.3, OSWorld-Verified 84.3) são relatadas pela Alibaba; até o momento, nenhum laboratório independente as reproduziu.

Por que baixar: a questão local versus API

Pesos abertos são a única categoria de modelo em que o custo marginal de processar um token é o custo da sua eletricidade. Sem taxa de licença, sem preço por token, sem limite de requisições, e nada sai da sua máquina. Qwen3.8 27B é Apache 2.0, então essa liberdade é permanente: a Alibaba não pode retirar os pesos, relicenciá-los ou cobrar por eles.

A contrapartida é hardware e configuração. Os pesos BF16 completos exigem uma GPU de classe 80 GB em precisão nativa, e 55.6 GB é um download considerável. Se você quiser avaliar o modelo antes de se comprometer com isso, o caminho da API é mais rápido: Qwen3.8 27B é servido no OrcaRouter ao preço da Qwe​n de $0.33 por milhão de tokens de entrada e $2.40 por milhão de tokens de saída, repassado sem margem — e o OrcaRouter também oferece uma camada gratuita com limite de requisições para o mesmo modelo, então um teste de fumaça com custo zero não precisa de download algum. Mas a API é uma conveniência, não uma dependência — os pesos são o produto, e eles são gratuitos.

O que está realmente no repositório

O repositório não se resume a pesos. É um pacote completo e executável: 18 shards mais os arquivos de metadados de que Transformers, vLLM e SGLang precisam. Percorrendo-o de cima a baixo:

model-00001-of-00018.safetensors … model-00018-of-00018.safetensors — os pesos, 2,1–3,99 GB por shard, 55,57 GB no total.

model.safetensors.index.json — mapeia cada tensor para o seu shard; é o que um carregador lê primeiro.

config.json — a arquitetura: 64 camadas, tamanho oculto 5,120, vocabulário 248,320 e o layout Gated DeltaNet / Gated Attention.

tokenizer.json (12.8 MB), tokenizer_config.json, vocab.json (6.72 MB), merges.txt (3.35 MB) — o tokenizer.

chat_template.jinja — o template de chat, incluindo o bloco de raciocínio; o llama.cpp precisa que ele seja passado como um template jinja, caso contrário o modelo responde com tags de pensamento.

preprocessor_config.json e video_preprocessor_config.json — pré-processamento de imagem e vídeo.

crc32.txt — checksums por shard; verifique um download usando este arquivo e uma transferência corrompida deixa de ser um mistério.

README.md (a ficha do modelo de 65 kB), LICENSE (Apache 2.0), generation_config.json, .gitattributes (marca os arquivos de peso como Git LFS).

A repository file-table card for Qwen/Qwen3.8-27B: 18 safetensors weight shards at 2.1 to 3.99 GB each totalling 55.57 GB, plus the index, config, tokenizer files, chat template, checksum file, model card, and license with their sizes.

Uma consequência desse layout é relevante para o problema do repositório falso abaixo. Uma cópia genuína deste repositório é pesada e completa. Um repositório provisório com "Qwen3.8" no nome e nada além de um README não é um download que falhou — é um repositório diferente e vazio.

Como baixá-lo — três maneiras

Método um, huggingface-cli, é o caminho mais limpo. O modelo é público, então não é necessário fazer login; isso baixa todos os 18 shards e os metadados para uma pasta:

huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B

Para uma transferência de 55,6 GB, o hf_transfer backend vale a pena instalar — ele paraleliza o download e geralmente reduz o tempo drasticamente:

pip install hf_transfer

HF_HUB_ENABLE_HF_TRANSFER=1 huggingface-cli download Qwen/Qwen3.8-27B --local-dir Qwen3.8-27B

Método dois, git clone, fornece o repositório como uma cópia de trabalho com histórico. Requer Git LFS:

git lfs install

git clone https://huggingface.co/Qwen/Qwen3.8-27B

Método três, o navegador — abra a aba Arquivos e baixe os shards individualmente. Só faz sentido quando você precisa de um arquivo (por exemplo, apenas config.json para inspecionar a arquitetura). Para o repositório completo, são 18 downloads manuais mais uma verificação de checksum; use uma CLI.

A download-command card showing the three ways to fetch Qwen/Qwen3.8-27B: the recommended huggingface-cli download with --local-dir, the hf_transfer speed-up one-liner, and a git clone with Git LFS installed.

Quais arquivos você deve realmente baixar

O repositório oficial é BF16 safetensors — precisão total, 55,6 GB — o artefato certo se você tiver uma GPU da classe de 80 GB, ou quiser fazer a quantização por conta própria mais tarde. Não há GGUF oficial. As versões GGUF que as pessoas realmente executam em placas de consumo são lançamentos da comunidade: o Hugging Face lista 303 modelos quantizados construídos a partir desta base (verificado em 15 de agosto de 2026), e aqueles para os quais os runbooks apontam são as versões unsloth e lmstudio-community. A escada aproximada:

BF16 safetensors — 55.6 GB, requer uma GPU de classe 80 GB em precisão nativa.

GGUF Q8_0 — aproximadamente 29 GB, cabe em uma placa de 48 GB.

GGUF Q4_K_M — aproximadamente 17 GB, a escolha padrão para placas de 24 GB.

GGUF 2-bit — cerca de 9 GB, mal cabe em placas de 12 GB com perda visível de qualidade.

Se você quiser recursos de visão em uma build GGUF, também precisa do arquivo mmproj separado para o codificador de visão, documentado em cada card da comunidade. Para o detalhamento completo de quantização e runtime — incluindo a ressalva do chat-template do llama.cpp — nosso runbook sobre a execução local do Qwen3.8 27B tem os detalhes.

Como distinguir o repositório real dos falsos

Antes de os pesos serem lançados, a busca no Hugging Face estava cheia de repositórios "Qwen3.8" sem arquivos de peso — cards de placeholder e forks criados para pegar quem procurava cedo. Alguns ainda estão no ar. A lista de verificação:

Verifique o publicador, não o nome.O repositório genuíno está sob a organização Qwen: Qwen/Qwen3.8-27B. Um repositório chamado Qwen3.8 27B em qualquer outra conta não é o lançamento oficial, por mais profissional que pareça.

Use a coleção oficial. Qwen mantém huggingface.co/collections/Qwen/qwen38; todos os repositórios nela são deles.

Verifique o campo de licença. O cartão real diz Apache 2.0.

Verifique o tamanho e o formato. O repositório real tem 18 shards safetensors totalizando aproximadamente 55,6 GB, um arquivo de checksum crc32.txt e um README de 65 kB. Zero arquivos de peso significa um repositório vazio, não um download corrompido.

Trate a contagem de downloads como um sinal, não como prova. O repositório genuíno ultrapassou 91.000 downloads em um dia, o que mostra para onde todos os outros estão apontando. Mas uma versão falsa também pode ser baixada; o editor é a garantia.

Após o download, verifique a integridade: confira o CRC32 de cada shard em relação ao crc32.txt, ou carregue o modelo com Transformers e confirme se o state dict carrega sem avisos. Isso detecta tanto uma transferência corrompida quanto um modelo errado reempacotado.

Quando baixar é a jogada errada

Baixar 55.6 GB não é a escolha certa para todos, e a versão honesta deste artigo diz isso claramente.

Você só quer avaliar o modelo. A rota de API é mais rápida — um teste estruturado custa centavos e leva minutos, não um download e uma tarde de configuração.

Você não tem uma GPU próxima de 80 GB.O download BF16 é o artefato errado para você. Escolha uma quantização GGUF ou a API.

Você precisa de benchmarks verificados. Cada número de destaque para Qwen3.8 27B é informado pela Ali​baba em 15 de agosto de 2026. Se sua decisão depende de números que um laboratório independente reproduziu, espere por eles — os pesos ainda estarão aqui.

Você está construindo sobre um modelo com poucos dias. Os pesos foram lançados em 14 de agosto. A página do modelo OrcaRouter, lida hoje, mostra uma taxa de erro de 33,3% nos últimos sete dias e latência de primeiro token p50 de 225 ms — um modelo recém-lançado sob carga inicial, portanto trate a telemetria inicial como provisória. Quem auto-hospeda deve fixar o commit baixado e manter um fallback; usuários de API devem manter uma regra de failover como o mesmo seguro.

The OrcaRouter model page for Qwen3.8 27B at qwen/qwen3.8-27b, showing the by-Qwen vendor label, vision-tools-JSON capability badges, a 262K-token context window, text-image-and-video input, and p50 first-token latency of 225 ms.

Você quer um contrato de suporte. O Apache 2.0 é permissivo, mas uma licença não é um SLA. Se sua carga de trabalho precisa de suporte do fornecedor, seguir pela API hospedada é a opção mais segura.

O resultado final

O verdadeiro Qwen3.8 27B está no Hugging Face em Qwen/Qwen3.8-27B, Apache 2.0, lançado em 14 de agosto de 2026, 55,6 GB de safetensors BF16 em 18 shards. Baixe-o com huggingface-cli ou git clone, verifique se o publicador é a organização Qwen, e você detém um 27B de pesos abertos de última geração que ninguém pode tirar de você ou cobrar por ele. Se isso é mais comprometimento do que o seu caso de uso exige, o mesmo modelo está a apenas alguns centavos pela API. Os pesos são o que importa, no entanto — e eles são gratuitos.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube