
GPT-6 Sol vs Muse Spark 1.2: Um Deles Tem Orelhas
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
Coloque GPT-6 Sol e Muse Spark 1.2 lado a lado e as colunas de preço são apenas diferentes, enquanto as colunas de modalidade não chegam nem perto. O Muse Spark 1.2 aceita texto, imagem, vídeo, arquivo e áudio. O GPT-6 Sol aceita texto, imagem e arquivo. Áudio e vídeo são a diferença, e não são um detalhe insignificante: eles separam um modelo que pode receber uma gravação de reunião de um que precisa receber uma transcrição dela. O GPT-6 Sol, o nível intermediário daquela geração, foi lançado em 22 de setembro de 2026; o Muse Spark 1.2, checkpoint atual da Meta na família Muse Spark, foi lançado em 5 de agosto de 2026 como uma atualização drop-in para o Muse Spark 1.1 no mesmo nível Standard e com preço idêntico.
Esse último ponto importa para a forma como esta página deve ser lida. O Muse Spark 1.2 não é uma nova geração e não deve ser descrito como tal — a própria descrição da Meta é a de um checkpoint atualizado com desempenho ligeiramente superior, oferecido a preços inalterados. Portanto, a pergunta interessante não é o que a 1.2 acrescenta em relação à 1.1. É o que a família Muse Spark tem que a família GPT-6 não tem, e se você precisa disso.
As duas fichas técnicas, sobre as dimensões que diferem
• Modalidades de entrada — GPT-6 Sol: texto, imagem e arquivo vs. Muse Spark 1.2: texto, imagem, vídeo, arquivo e áudio
• Saída — ambos somente texto
• Preço de entrada — GPT-6 Sol $2,00 por milhão vs Muse Spark 1.2 $1,25 por milhão
• Preço de saída — GPT-6 Sol US$ 10,00 por milhão vs Muse Spark 1.2 US$ 4,25 por milhão
• Entrada em cache — GPT-6 Sol $0 por milhão vs Muse Spark 1.2 $0,15 por milhão
• Janela de contexto — 1.050.000 tokens vs 1.048.576 tokens, efetivamente o mesmo
• Etapa de solicitação longa — GPT-6 Sol reajusta o preço da solicitação inteira acima de 272.000 tokens de entrada para US$ 4,00 / US$ 15,00, vs. Muse Spark 1.2, que não tem etapa em seu card
• GPQA Diamond — GPT-6 Sol 96,1 vs Muse Spark 1.2 90,4
• O Último Exame da Humanidade — GPT-6 Sol 47,9 vs Muse Spark 1.2 45,5
• Recall de contexto longo — GPT-6 Sol 83.7 vs Muse Spark 1.2 79.0
• tau-banking — GPT-6 Sol não publicado nesta revisão vs Muse Spark 1.2 34.8
• Pesos — ambos fechados, somente API
A linha de requisições longas está fazendo um trabalho silencioso nessa lista. O Muse Spark 1.2 não tem cláusula de reprecificação de contexto longo em seu cartão publicado, então seu $1,25 / $4,25 se mantém em toda a janela. O preço manchete do GPT-6 Sol não: após 272.000 tokens de entrada, a requisição inteira passa para $4,00 / $15,00. Em um prompt de contexto completo, a comparação de saída, portanto, não é dez dólares contra $4,25, mas sim quinze contra $4,25 — três vezes e meia, não dois e um terço.
E a diferença nos benchmarks é menor do que a diferença de preço sugere. O GPQA Diamond, 96,1 contra 90,4, é mais ou menos a variação que você esperaria de duas configurações diferentes de esforço de raciocínio, e não de uma diferença de capacidade; e no Humanity's Last Exam os dois ficam em 47,9 e 45,5, o que representa 2,4 pontos numa escala de cem pontos. O Muse Spark 1.2 é o modelo mais barato e o leitor mais amplamente capaz; o GPT-6 Sol está à frente nos números de raciocínio, mas não pela margem que o preço implica. Nenhuma das colunas domina, e é isso que faz com que a escolha valha a pena ser feita de forma deliberada.

O que a entrada de áudio e vídeo realmente muda
Um modelo que aceita áudio pode receber uma gravação em vez de uma transcrição. Isso parece uma conveniência e, na verdade, é uma mudança no que é possível: a transcrição é uma etapa com perdas que descarta tom, sobreposição, risadas e a diferença entre uma pergunta e uma afirmação quando lidas apenas a partir do texto. Um modelo que ouve o arquivo diretamente vê tudo isso. O mesmo argumento se aplica a vídeo, em que a descrição quadro a quadro perde a noção de tempo e um modelo que ingere o clipe não.
A resposta do GPT-6 Sol é um pipeline, não uma modalidade — transcreva ou legende primeiro, depois passe o texto. Essa é uma arquitetura perfeitamente viável e, para muitas cargas de trabalho, é a melhor, porque uma transcrição é inspecionável, pode ser armazenada em cache e é barata de guardar. Ela é pior exatamente quando o áudio ou o movimento é o sinal: revisão de qualidade de call center, registro de mídia, qualquer coisa em que a hesitação de um falante carregue o significado.
A posição da Meta sobre isso vale a pena ser lida com atenção, porque a tag de áudio não é decoração. O Muse Spark 1.2 é listado com áudio entre suas capacidades, ao lado de visão, ferramentas, JSON e raciocínio, e a Meta lançou a família como sua linha multimodal, enquanto o menor Muse Glimmer foi destilado de um modelo professor Muse Spark. Se você está escolhendo entre esses dois com base na superfície de entrada, a escolha não é entre uma ficha técnica um pouco mais ampla e uma um pouco mais restrita. Trata-se de escolher entre ter a modalidade e construir um pipeline para aproximá-la.
Onde os dois se separam genuinamente
A separação mais clara é o uso agêntico de ferramentas contra um serviço simulado, e é o único ponto em que os números estão suficientemente distantes para que se possa agir. Muse Spark 1.2 registra 34,8 no tau-banking e apenas 7,1 na revisão mais recente do Terminal-Bench 4.0 — ambas são medições de terceiros e ambas descrevem a mesma fraqueza por dois ângulos. Um modelo que interpreta bem uma reunião e depois calcula errado o saldo de um cliente quando lhe pedem para chamar uma API não é um modelo ruim; é um modelo com uma tarefa claramente delimitada.
Faça a mesma verificação no GPT-6 Sol e o quadro é consistente, mas mais escasso. Seu recall de contexto longo está em 83.7, o SciCode em 57.6 e seu Terminal-Bench 4.0 em 43.9, todos de terceiros. Seus números de codificação e de agente de terminal na revisão v2.1 estão simplesmente ausentes, e a ausência de um número não é um número baixo — quem preenche essa célula com uma estimativa está inventando.
Uma assimetria que vale a pena nomear antes que os números sejam comparados com demasiada avidez. O Muse Spark 1.2 traz uma suíte completa de benchmarks do fornecedor, da Meta, ao lado do conjunto de terceiros, e a própria análise de lançamento da Artificial Analysis o colocou em 54 no Intelligence Index, em sua configuração de raciocínio xhigh, três pontos acima do Muse Spark 1.1. O GPT-6 Sol fica em 47,6 no mesmo índice em nosso catálogo. Esses dois valores não podem ser subtraídos: vêm de configurações diferentes, medidas em momentos diferentes, e um índice revisado entre eles não é o mesmo instrumento. As afirmações comparativas honestas são as de benchmark único acima, em que ambos os modelos apresentam um número do mesmo avaliador. Quando um modelo tem mais números publicados, ele sempre parecerá mais bem documentado do que um que tem menos, e, neste par, grande parte dessa diferença diz respeito a quem reporta, e não ao que os modelos conseguem fazer.

Servindo dois modelos que se comportam de maneira diferente sob carga
Ambos estão no OrcaRouter, com uma única chave, e o par é uma divisão roteada natural, e não uma escolha entre um ou outro. Envie o tráfego multimodal — as gravações, os clipes, os pacotes de documentos com anexos digitalizados — para o Muse Spark 1.2 a $1.25 / $4.25 sem queda abrupta em contexto longo. Envie o tráfego com uso intenso de raciocínio e agêntico para o GPT-6 Sol e aceite a tarifa mais alta para as requisições em que a resposta precisa resistir ao escrutínio. Por meio de um único endpoint, essa divisão é uma regra de roteamento, não duas integrações.
Um número do lado do serviço contradiz a lógica de preço. O Muse Spark 1.2 é medido em cerca de 420 tokens de saída por segundo em nossa janela móvel de sete dias, contra aproximadamente 244 do GPT-6 Sol — o modelo da Meta é mais barato e mais rápido em nossas rotas. A latência segue o caminho oposto no primeiro token: um tempo até o primeiro token p50 de cerca de 5,2 segundos para o Muse Spark 1.2, contra aproximadamente 6,8 para o GPT-6 Sol na mesma janela, então o modelo mais barato também começa a responder mais cedo. Ambas são medições móveis em infraestrutura compartilhada, e não um benchmark controlado, e ambas mudam entre leituras.
O failover automático merece seu lugar em um pipeline misto como este. Quando uma requisição pode chegar como áudio e sair como texto por uma rota, ou como uma etapa de transcrição obrigatória por outra, o modo de falha com que você se preocupa é um provedor que aceita a requisição e então empaca no upload da mídia — uma segunda rota configurada transforma isso em uma nova tentativa, em vez de uma tarefa que alguém precisa notar e executar novamente. Nosso catálogo repassa os preços de tabela dos provedores sem alteração, então, se a Meta alterar a linha de $4,25, ou adicionar uma cláusula de contexto longo ao cartão do Muse Spark, como outros fornecedores já fizeram, a mudança chega até você no dia em que acontece, em vez de depois que um revendedor percebe.

A decisão, em termos simples
Se a sua entrada for uma gravação ou um clipe e o timing ou o tom fizerem parte do significado, use o Muse Spark 1.2. Não existe nenhuma configuração do GPT-6 Sol que alcance essa capacidade através da API, e não há preço pelo qual o pipeline substituto se torne equivalente. Se a sua entrada for texto e imagens e a saída for executada, as métricas de raciocínio do GPT-6 Sol estão à frente e o seu perfil de uso de ferramentas é o mais seguro — as pontuações de tau-banking e Terminal-Bench 4.0 do Muse Spark 1.2 são o sinal mais alto em qualquer das fichas, e apontam para longe do trabalho agêntico.
E observe o que o Muse Spark 1.2 não é: uma nova geração. Ele é o checkpoint atual da Meta de uma família existente, um substituto direto do 1.1 com preço inalterado, o que torna a decisão de atualização gratuita e a comparação com o GPT-6 Sol uma questão à parte. Do outro lado, o GPT-6 Sol já foi substituído pelo GPT-6.1 Sol com as mesmas tarifas de contexto curto, com entrada em cache reduzida pela metade de US$ 0,20 para US$ 0,10, e a própria página de modelos da OpenAI agora direciona os leitores para ele. Se o motivo de você estar ponderando Sol em vez de Muse Spark é a integração de oito dias, isso se mantém. Se for capacidade, verifique o sucessor primeiro.
Comparados neste artigo2
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
