Cartão de destaque para o artigo 'Qwen3.8-Flash-Next-Uncensored: Run the Abliterated MoE on llama.cpp and Apple Silicon', mostrando o título, o subtítulo 'GGUF + native MLX - up to 262K context' e três chips de especificações: 'Gated on Hugging Face', '13 GGUF quants' e '6-bit MLX build'.
Guides & Insights

Qwen3.8-Flash-Next-Uncensored: Execute o MoE Abliterado no llama.cpp e Apple Silicon

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Antes de baixar qualquer coisa: Qwen3.8-Flash-Next-Uncensored não é Qwen3.8-27B-Uncensored. Eles compartilham um nome de família e uma técnica de abliteração, mas são modelos diferentes de versões de pesos diferentes, e toda postagem anterior de "Qw​en uncensored" neste blog é sobre a 27B. O assunto aqui é o par que a OrcaRouter publicou no Hugging Face em 26 de agosto de 2026 — orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF e orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX — versões abliteradas do Qwen3.8-Flash-Next, modelo roteado de mistura de especialistas da Alibaba com 176B armazenados / 6B ativos, que antecipa a arquitetura Qwen4. Anunciamos o lançamento como "GGUF + MLX nativo, com até 262K de contexto", voltado para pesquisadores de segurança, red teams e blue teams. Este runbook foi escrito a partir de nossos próprios model cards: o que a remoção de recusas faz dentro de um MoE roteado, quanto custa em memória a alegação de 262K de contexto, como servir ambas as linhas de arquivos e onde a linha de pesquisa se encontra. Se você chegou querendo o primer sobre abliteração ou a matemática de quantização da 27B, as postagens anteriores desta série cobrem isso.

Scoreboard card for Qwen3.8-Flash-Next-Uncensored with six rows: base model Qwen3.8-Flash-Next (Qwen4 preview), access gated (HF login + terms), GGUF quants 13 (IQ2_XXS to Q5_K_M), vision mmproj F16 projector, MLX build 4/6/8-bit, context 262,144 tokens (YaRN to 1M); footer reads 'OrcaRouter model-card data, August 2026 - not independently audited.'

Primeiro, o portão

Ambos os repositórios têm acesso restrito no Hugging Face (gated: auto). Nenhum download de arquivos é permitido até que você esteja conectado e tenha aceitado os termos do repositório em cada um deles — os repositórios GGUF e MLX possuem cada um sua própria restrição. Essa é a diferença mais prática em relação a uma linha GGUF sem restrição: o ingênuo comando de uma linha "basta hf download" falha com um erro de autenticação antes de baixar um único byte. O fluxo é:

• Faça login no Hugging Face (ou crie uma conta) e instale o huggingface_hub, depois execute hf auth login uma vez para que seu token fique salvo em disco.

• Abra orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF no navegador, aceite os termos e repita o processo para orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX.

• A partir daí, o download hf com seu token autenticado funciona como qualquer outro repositório. Cada quant que você baixa, e os pesos MLX, é um artefato de pesquisa sob Apache-2.0 — a mesma licença do modelo base — e a barreira faz parte do acordo: ler os termos é o primeiro passo para usar o modelo.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF repository on Hugging Face, showing the gated access banner ('You need to agree to share your contact information to access this model'), the tags abliterated/uncensored/qwen4/Mixture of Experts/llama.cpp/vision-language/mmproj, and the Apache 2.0 licence.

O que a abliteration faz a uma MoE roteada

A técnica é a edição de pesos no estilo Arditi que já abordamos neste blog; a parte interessante é o que ela faz especificamente com essa arquitetura. No denso 27B, eram 131 matrizes residuais. No Qwen3.8-Flash-Next-Uncensored, o cartão do modelo MLX registra abliteração aplicada a 149 tensores de escrita residual, e os componentes que fazem deste modelo o que ele é — o roteador MoE, a tabela de embeddings n-gram de 51B, a torre de visão — foram explicitamente nunca tocados.

Esse "nunca tocado" é toda a história para um modelo roteado. Cada token ativa 10 de 512 especialistas; nenhum especialista, isoladamente, é dono da recusa. O comportamento de recusa reside no fluxo residual que compõe a saída final, que é precisamente a direção removida pela ortogonalização. Assim, o roteador continua roteando os mesmos especialistas, a tabela n-gram continua produzindo os mesmos embeddings, e o que muda é o que o modelo diz depois que a projeção de saída é executada. As verificações publicadas na ficha do modelo GGUF situam essa mudança como: recusa a prompts prejudiciais caindo de 64–100% na base para aproximadamente 0–3,3% nesta compilação, recusa excessiva benigna próxima de 0%, e capacidade dentro de ±2 pontos da base nas verificações estilo MMLU-Pro / GSM8K / CMMLU. Esses são os números da própria ficha, autorrelatados e não reproduzidos de forma independente.

A cabeça MTP: presente em MLX, removida em GGUF

Qwen3.8-Flash-Next vem com uma cabeça especulativa de previsão de múltiplos tokens de ~4B, e as duas compilações discordam quanto a ela. O repositório GGUF a exclui — a ficha técnica é explícita ao afirmar que esses arquivos não incluem a cabeça de rascunho especulativo MTP — porque o suporte a qwen4exp do llama.cpp ainda não implementa MTP, então a cabeça seria peso morto no arquivo. A compilação MLX a mantém, então no Apple Silicon você ainda obtém decodificação especulativa. A consequência prática, corroborada por profissionais que executam o modelo base: a via llama.cpp GGUF roda sem decodificação especulativa hoje, enquanto uma configuração SGLang com MTP mais que dobra a decodificação na mesma classe de hardware. Se o llama.cpp algum dia implementar MTP para qwen4exp, a linha GGUF ganha um aumento de velocidade grátis — mas não compre hardware esperando isso esta semana.

A afirmação sobre o contexto de 262K, e quanto custa a cache KV.

O contexto nativo é de 262.144 tokens (extensível via YaRN até 1M), e a restrição que realmente pesa é a memória. A boa notícia é que a arquitetura mantém o cache KV pequeno: das 48 camadas, 36 usam atenção linear Gated DeltaNet, que comprime o histórico em um estado recorrente de tamanho fixo, e apenas as 12 camadas de atenção completa carregam um cache KV convencional, que cresce com o comprimento da sequência.

Dois pontos de dados medidos pela comunidade, ambos no modelo base, se aplicam diretamente. Uma implantação GGUF com 4× RTX 3090 relatou passar de 65K para 131K de contexto com apenas ~0.78 GB adicionais de KV por placa, e um único DGX Spark rodou um contexto completo de 262K com um arquivo da classe Q4, mantendo o modelo residente em ~76.9 GB do seu pool de 128 GB ao fixar a tabela de n-gramas na CPU e mapeá-la via mmap a partir do NVMe. A linha de orçamento do próprio card do modelo GGUF é total = tamanho do arquivo + cache KV + o mmproj de ~0.9 GB. A conclusão para a escolha da quantização: em 262K o cache KV é um item de linha real, mas os pesos são o item dominante, então a mesma lógica de priorizar a VRAM do guia do GGUF 27B se aplica — a diferença aqui são os próprios tamanhos de arquivo, que vão de IQ2_XXS com aproximadamente 52 GB a Q5_K_M com aproximadamente 125 GB.

A linha GGUF: 13 quants, arquivos divididos, mmproj e um build de llama.cpp

O repositório GGUF oferece 13 níveis de quantização — IQ2_XXS, IQ2_M, IQ3_XXS, IQ3_M, IQ4_XS, Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, Q4_K_S, Q4_K_M, Q5_K_S, Q5_K_M — com os quantizados IQ construídos a partir de uma matriz de importância em texto de calibração em inglês, chinês e código. Cada quantizado é composto por várias partes, dividido com llama-gguf-split, então baixe o conjunto completo para um quantizado e aponte o carregador para a parte ...-00001-of-000NN.gguf. Não há níveis Q6_K, Q8_0 ou F16, e o motivo é estrutural, não econômico: a tabela de embeddings de n-gramas (PLE) é um tensor grande demais para satisfazer o limite de 50 GB por arquivo do Hugging Face em 6 bits ou mais, e um único tensor GGUF não pode ser dividido entre arquivos — portanto, a linha chega ao máximo em Q5_K_M.

O outro arquivo que você não deve pular é o mmproj-...-F16.gguf, com cerca de 0,9 GB: este é um modelo de visão-linguagem, e o llama.cpp precisa do projetor para qualquer entrada de imagem. O Qwen3.8-Flash-Next é multimodal, e esta compilação também é — a abliteração não afeta a torre de visão.

O suporte a llama.cpp ainda não está na linha principal. O id da arquitetura é qwen4exp, e as builds padrão falham com "unknown architecture 'qwen4_exp'"; você precisa de uma build do PR #27742 (branch qwen4exp/qwen3.8-flash-next), compilada com os alvos llama-cli, llama-mtmd-cli, llama-server e llama-gguf-split. A partir daí, o formato de serviço é o servidor llama.cpp usual com flags específicas do Qwen, usando o nome de quantização dos arquivos de parte:

llama-server -m Qwen3.8-Flash-Next-Uncensored-Q4_K_M-00001-of-00003.gguf --jinja --mmproj mmproj-Qwen3.8-Flash-Next-Uncensored-F16.gguf -c 8192 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0

Defina -c para qualquer contexto que você consiga acomodar; o exemplo da ficha técnica começa em 8192. O raciocínio está ativado por padrão e é retornado em reasoning_content, e a chamada de ferramentas funciona por meio do endpoint compatível com OpenAI. Os valores de amostragem acima são a recomendação da ficha técnica do modelo; profissionais que usam o modelo base utilizam temp 0.7 / top-p 0.80 / top-k 20 com penalidade de presença de 1,5 no modo de instrução sem raciocínio, e ajustam a profundidade do raciocínio com --chat-template-kwargs {"reasoning_effort":"medium"}.

A build do MLX no Apple Silicon

O repositório MLX é o caminho nativo para Apple Silicon: mesmos pesos, mesma remoção de recusas, runtime nativo em Metal. Ele oferece 4 bits como padrão (~163 GB), a versão anunciada de 6 bits (~192 GB) e uma camada de 8 bits (~221 GB), e como os especialistas 3D fundidos e a tabela n-gram são mantidos em precisão maior do que o rótulo nominal, a precisão efetiva fica bem acima do 4 bits uniforme — a ficha lista cerca de 7,85 bits efetivos por peso para o rótulo "4 bits". É por isso que os tamanhos do repositório parecem grandes: a tabela n-gram não é compactada da mesma forma que os quantizadores da comunidade a compactam.

The orcarouter/Qwen3.8-Flash-Next-Uncensored-MLX repository on Hugging Face, showing the gated access banner, the tags Mixture of Experts/vision-language/function-calling/reasoning/mtp/ai-red-team, licence apache-2.0, and the card line 'An abliterated (refusal-removed) MLX build (4/6/8-bit) of Qwen's Qwen3.8-Flash-Next for Apple Silicon'.

O hardware é a restrição limitante. O MLX roda apenas em Apple Silicon (Metal), e você precisa de memória unificada para os pesos — a linha do cartão do modelo é "um Mac com memória unificada suficiente para os pesos de 163 GB (ex.: M-series Ultra)". Trate o nível de 4 bits como uma máquina da classe de 192 GB e a compilação de 6 bits como da classe de 256 GB. As tags do cartão registram o conjunto completo de recursos — qwen4_exp, MoE, MTP, function calling, visão-linguagem — e ele é conduzido via mlx-vlm para entrada de imagens. A cabeça especulativa MTP está incluída aqui, o que é a vantagem silenciosa da compilação MLX sobre a linha GGUF.

O caminho da visão, para aqueles que o utilizam.

Como este é um modelo de visão-linguagem, o caminho multimodal faz parte do runbook em vez de ser um extra. No llama.cpp, a entrada de imagens exige tanto o projetor mmproj quanto uma compilação que inclua llama-mtmd-cli / llama-server. No MLX, você o conduz com mlx-vlm em vez do driver mlx-lm somente texto. Para red teams, o caminho de visão é onde mora o trabalho interessante de avaliação: salvaguardas multimodais, injeção de prompt transportada em uma imagem, OCR em capturas de tela dos seus próprios sistemas e imagens adversariais voltadas para o pipeline inteiro. Como a abliteration cobre o modelo completo e deixa a torre de visão intacta, uma imagem que teria disparado uma recusa na cabeça de texto simplesmente chega a um modelo sem comportamento de recusa para atingir. O cartão GGUF diz que visão e chamada de ferramentas em várias rodadas foram verificados nesta compilação; nenhuma suíte de avaliação de visão separada é publicada.

Para que serve isto, e onde fica o limite.

Este build existe para uma classe de trabalho: avaliar o que um modelo com recusas removidas pode fazer, a serviço da compreensão e defesa de sistemas. Para um red team, isso significa testar suas próprias salvaguardas contra um modelo que não vai recusar educadamente — resistência a prompt-injection, cenários de exfiltração, abuso de uso de ferramentas e a lacuna entre "o modelo base recusa" e "o modelo realmente não consegue fazer isso". Essa lacuna é todo o valor de pesquisa de um build abliterado: ele revela o que a camada de recusa estava escondendo, que é a diferença entre segurança por política e segurança por capacidade. Para um blue team, os mesmos pesos são a linha de base plausível do adversário: se um ator hostil pode baixar e executar isso, suas defesas precisam se sustentar contra um modelo que responde em vez de se esquivar. Avaliações construídas sobre ele são um limite inferior do que um modelo personalizado e nunca alinhado poderia fazer — trate-as assim, não como um teto.

Seja claro sobre o que remover recusas muda e não muda. Isso muda o comportamento de saída — o modelo não recusa mais — e não muda a capacidade. Nenhum conhecimento novo, nenhuma habilidade nova, nenhum poder computacional novo; o mesmo treinamento, os mesmos limites sobre o que o modelo pode realmente produzir. Um modelo abliterado não pode criar malware que era incapaz de criar antes; ele simplesmente responde em vez de se esquivar, e suas saídas não são mais verdadeiras por serem mais permissivas. A faixa de capacidade de ±2 pontos do card e o colapso dos números de recusa são o mesmo fato visto de dois lados.

É no acordo do repositório de acesso restrito que a linha é traçada, e ele não é texto padronizado. Uso legítimo: avaliar seus próprios sistemas, pesquisa pública de vulnerabilidades em modelos, construir avaliações de detecção e defesa, estudar mecanismos de recusa. Não legítimo: implantar isto como um assistente voltado ao usuário, gerar malware funcional ou exploits contra sistemas que você não possui ou para os quais não tem autorização para testar, fraude, material bélico. A licença Apache-2.0 e a legislação aplicável são o piso; o portão é o acordo explícito de finalidade de pesquisa acima disso. Se o seu caso de uso é "colocar um chatbot no ar para os usuários", este não é o seu modelo — e isso é por design, não por descuido.

Como obter a baseline servida

Estes pesos são somente locais de propósito: os payloads de sondagem de um red team nunca devem transitar por uma API de terceiros, e o ponto é o self-hosting. Quando você quer a baseline censurada e servida para comparação — o Qwen3.8-Flash da Alibaba a US$ 0,16 por milhão de entrada e US$ 0,47 por milhão de saída — o OrcaRouter a roteia pelo preço de tabela do provedor com margem de 0% e failover automático, para que um harness de avaliação possa alternar entre a base hospedada e seu build local não censurado com uma única chave e sem segundo contrato. Os pesos abertos do Qwen3.8-Flash-Next ainda não estão no nosso catálogo; quando um runtime que roteamos os carregar, eles entram nessa mesma configuração de chave única e preço de tabela.

Comece aqui

Decida qual linha corresponde ao seu hardware e, em seguida, leia o gate relevante. Em um Mac com memória unificada de 128 GB ou mais, a compilação MLX oferece MTP e visão em um só lugar — aceite os termos do repositório MLX, baixe os pesos de 4 bits ou 6 bits e execute-os com o mlx-vlm. Em NVIDIA, AMD ou uma máquina com CPU, compile o llama.cpp a partir do PR #27742, aceite os termos do repositório GGUF, baixe uma quantização que caiba e não se esqueça do arquivo mmproj. Em ambos os casos, os números de recusa e a faixa de capacidades são do próprio repositório, publicados na ficha e não reproduzidos até o momento em que escrevo — a forma honesta de lê-los é como a medição que o fornecedor fez da própria edição, não como uma auditoria independente. O gate, a licença e a fronteira de segurança acima são o mesmo texto sob três ângulos: este é um instrumento de pesquisa e é liberado sob essa condição.

Todos os cinco builds Flash-Next — BF16, GGUF, MLX, FP8 e NVFP4 — estão reunidos na coleção Qwen3.8-Flash-Next-Uncensored no Hugging Face.

Não confundir com a família 27B: Qwen3.8-27B-Uncensored é um modelo diferente, abliterado de uma base diferente, com sua própria coleção e seus próprios runbooks. Mesma técnica, pesos diferentes.

Estes pesos são exclusivamente locais por design. Para servir como referência hospedada contra a qual medir a versão abliterada, o Qwen3.8-Flash é servido no OrcaRouter a preço de tabela do provedor com margem de 0% — o modelo padrão, com o alinhamento de segurança intacto.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube