Um cartão de referência gerado para o Meta Muse Image, mostrando o nome do modelo, a linha superior 'Meta Superintelligence Labs — post de lançamento datado de 7 de julho de 2026' e três fatos retirados das próprias páginas da Meta: disponibilizado na Model API da Meta sob o identificador muse-image-1.0, um valor fixo de US$ 0,01 por imagem gerada com grounding de busca incluído, e pesos proprietários, com o Muse Glimmer como o caminho de pesos abertos da mesma família. O logotipo da OrcaRouter está composto no canto inferior direito.
Engineering & Research

Meta Muse Image: o modelo, a API e a imagem a $0.01 fixo

Autor

Gideon Frost

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Se você pesquisou o nome desambiguado e chegou até aqui, a resposta curta é esta: Meta Muse Image é o modelo agêntico de geração e edição de imagens da Meta, é proprietário em vez de pesos abertos, e você o acessa por meio da própria Model API da Meta sob o identificador muse-image-1.0 a um preço fixo de $0,01 por imagem gerada, com o grounding de busca incluído nesse preço. Essa é toda a resposta à pergunta que a busca faz, e tudo abaixo é a referência para isso — o que o modelo faz, como chegar até ele, qual é de fato a unidade de cobrança, o que a Meta documenta sobre proveniência e onde a documentação termina.

Duas coisas sobre a justificativa desta página merecem ser ditas com clareza, porque esta família já foi anunciada mais de uma vez e uma segunda peça de anúncio seria uma duplicata da cobertura que já publicamos. Esta é a página de referência canônica para o nome: o destino que um leitor alcança depois de pesquisá-lo. Sua justificativa é a demanda permanente que medimos em dados próprios em 29 de setembro de 2026 — os leitores digitam a forma desambiguada deste nome em três grafias, na casa das centenas de impressões, em uma posição que ocupamos por acaso, devido a outras páginas, e não por termos escrito uma página com o formato desta, e converte a quase nada porque nada do que publicamos tem o formato de uma referência. Essa medição é um fato sobre o que as pessoas digitam, e nada mais; não diz nada sobre a qualidade ou a popularidade do modelo no mundo. E a âncora datável é usada aqui como um fato para datar o modelo, não como um evento a ser noticiado: o post de lançamento da Meta para Muse Image e Muse Video traz a data de 7 de julho de 2026 e descreve o modelo como "disponível hoje" nas superfícies de consumo da Meta nessa data, então 7 de julho de 2026 é a data de lançamento da qual esta página parte. Todos os números abaixo foram lidos das próprias páginas da Meta em 29 de setembro de 2026, a menos que a frase diga o contrário.

O que o Muse Image realmente é

A própria descrição de uma linha da Meta é o ponto de partida, porque ela faz um trabalho real, e não marketing: o Muse Image é “uma geração de imagens agêntica, fundamentada por busca e com preço pensado para volumes de produção a US$ 0,01/imagem”. Na página do modelo da Meta, a superfície de capacidades é dividida em quatro modos de funcionamento — geração de imagens, edição precisa, composição ancorada e refinamento em múltiplos turnos —, e a documentação para desenvolvedores resume a mesma coisa em uma frase: “O Muse Image gera e edita imagens a partir de uma conversa.”

A alegação que a distingue, nas palavras da Meta, é que o Muse Image "é um modelo de imagem que raciocina antes de renderizar". O post de lançamento da Meta torna isso concreto, e não apenas teórico: "Em vez de mapear diretamente prompts para imagens, o Muse Image opera como um agente: ele invoca ferramentas de busca e de programação para melhorar a precisão, autorrefina suas próprias gerações e melhora ao escalar a computação em tempo de teste." Na prática, isso significa que o modelo planeja antes de desenhar, busca referências ao vivo na web quando um prompt envolve fatos do mundo real, e escreve e executa código quando a precisão importa — o caminho que a Meta descreve para gráficos precisos e códigos QR — e então verifica o resultado antes de retorná-lo.

As três capacidades que a Meta nomeia primeiro são aquelas com base nas quais se deve avaliá-lo, e estão enunciadas na própria frase da Meta: o Muse Image "segue instruções fielmente, edita com precisão e compõe a partir de múltiplas referências". A alegação sobre edição é a mais incisiva das três, porque é uma alegação sobre contenção e não sobre resultados: a página do modelo da Meta diz que o modelo "foi concebido para alterar exatamente o que você especifica e deixar todo o resto intacto", e suporta refinamento iterativo ao longo de turnos em vez de edições de uma só vez. A composição é onde reside o modo "composição ancorada" — ancorar "toda uma série de gerações num pequeno conjunto de imagens de referência para que a personagem, o estilo e o cenário se mantenham consistentes de uma imagem para a seguinte", que é a capacidade que importa se estiver produzindo um catálogo ou um conjunto de anúncios em vez de uma única imagem. Tomadas em conjunto, estas são as alegações que separam um modelo de imagem com o qual se gera daquele sobre o qual se constrói um pipeline, e são alegações do fornecedor: a Meta não publica nenhum benchmark independente de seguimento de instruções ou fidelidade de edição para este modelo.

O enquadramento agêntico não diz respeito apenas a ferramentas. A Meta documenta o Muse Image como formando par com Muse Spark, o seu modelo de raciocínio, para que "os dois modelos partilhem ferramentas e planeiem em conjunto para uma poderosa geração de media agêntica" — o exemplo documentado sendo resultados com várias partes, como GIFs animados, páginas com imagens incorporadas e pequenos jogos interativos. Se estiver a construir algo que misture imagens geradas com texto ou código gerados, esse emparelhamento é a parte do design que vale a pena compreender, e é a razão pela qual o modelo é servido na mesma API e com a mesma autenticação do Muse Spark, em vez de num endpoint de imagem separado com as suas próprias credenciais.

Como você chama isso: a superfície da API

Muse Image is reached through Meta's Model API, and the developer documentation is specific about the shape of that call. The model identifier is muse-image-1.0, passed as the model field on every request. Requests go to the base URL https://api.meta.ai/v1 with a bearer token — the documentation notes that it uses the same base URL and auth as Muse Spark — and there are two image endpoints plus a conversational one:

• Gerar — POST /v1/images/generations, prompt de texto na entrada, imagem na saída.

• Editar — POST /v1/images/edits, prompt mais imagens de entrada, para trabalho de imagem para imagem.

• Refine ao longo dos turnos — POST /v1/responses, a Responses API, que é como funciona o fluxo multi-turno documentado.

Nos endpoints de imagens, os parâmetros documentados são poucos e vale a pena memorizá-los, porque é aí que o custo e o formato de saída são decididos. n aceita de 1 a 10 e, por predefinição, é 1. size aceita uma string "WxH", como 1792x1024, e a documentação é explícita de que, nesses endpoints, ele "define apenas a proporção, não os pixels exatos" — não o leia como uma garantia de resolução. response_format é b64_json por predefinição ou url, e output_format é webp por predefinição, com png e jpeg disponíveis. O comportamento agêntico é alternável: os endpoints de imagens aceitam uma extensão tool_enablement que abrange enable_image_search, enable_web_search e enable_shell, e um reasoning_strength de high (o valor predefinido) ou low. Reduzir o raciocínio é a alavanca para o custo e a latência, e é a primeira coisa em que vale a pena fazer testes A/B nos seus próprios prompts, em vez de aceitar pela fé.

Na API Responses, os mesmos controles ficam dentro de um image_generation objeto de ferramenta em tools, com pesquisa de imagens, pesquisa na web e shell todos habilitados por padrão, e o array de saída retorna em uma ordem fixa: um item de raciocínio que resume o que o modelo planejou e consultou, um item de mensagem, depois um image_generation_call item por imagem. A própria imagem está no campo result desse item como base64, e seu id é documentado como um handle assinado que você passa de volta para continuar editando a mesma imagem em um turno posterior. Esse handle é o mecanismo por trás do refinamento em múltiplos turnos — é assim que você evita reenviar uma imagem para alterar um detalhe dela. Ambos os endpoints de imagens também aceitam stream: true, emitindo image_generation.completed para geração e image_edit.completed para edições. A Model API é documentada como compatível drop-in com o SDK da OpenAI, o SDK da Anthropic e CLIs de agentes compatíveis com a OpenAI, então uma chamada de imagem existente é uma mudança na string do modelo e não uma reescrita.

Uma ressalva que deve constar na referência, e não em uma nota de rodapé: a Meta não publicou limites de taxa para o Muse Image que pudéssemos ler. A página de limites de taxa no próprio site de desenvolvedores da Meta retornou apenas uma estrutura vazia, sem nenhum número, assim como a página de preços. Se a taxa de transferência for importante para o seu design, essa é uma incógnita que você descobrirá pela API, e não pela documentação.

A screenshot of Meta's developer documentation for Muse Image, section headed One-off generation, showing the OpenAI-compatible images endpoints: POST /v1/images/generations for text-to-image and POST /v1/images/edits for image-to-image and editing, with the note that the OpenAI SDK uploads input images as multipart form data and that the base URL is https://api.meta.ai/v1.

O preço e a unidade em que está cotado

Um centavo por imagem. Esse valor é lido na própria página do modelo Muse Image da Meta, que lista o modelo em uma tabela de preços com busca fundamentada (grounding) e raciocínio ambos marcados como incluídos e o preço indicado como $0.01/imagem; a documentação para desenvolvedores reitera: "o Muse Image é cobrado a uma tarifa fixa de $0.01 por imagem gerada". A unidade é a imagem, não o token — a documentação diz isso diretamente ("o Muse Image não é precificado por token") — e isso importa porque APIs de imagem que informam uso em tokens geralmente são cobradas em tokens. O Muse Image retorna um bloco de uso com contagens de tokens de entrada e de saída, e essas contagens são apenas informativas.

Três detalhes de cobrança decorrem da unidade. Primeiro, n é um multiplicador: uma solicitação que retorna dez imagens é cobrada por dez imagens, então o 1–10 parâmetro é tanto um controle de gastos quanto uma conveniência. Segundo, falhas não são cobradas — imagens que falham ao gerar ou que são removidas pela filtragem de segurança antes de serem retornadas não são contadas. Terceiro, a fundamentação de busca está dentro do preço por imagem em vez de um item de linha separado; a documentação da Meta afirma que é "parte do preço por imagem, portanto não acarreta uma cobrança separada de fundamentação de busca." Esse último ponto é o que torna a tarifa significativa para trabalho agêntico: um modelo que pesquisa na web antes de renderizar pode gerar várias chamadas de ferramenta por trás de uma única saída, e a Meta está afirmando que as chamadas de ferramenta não são cobradas separadamente da imagem.

Não conseguimos corroborar o número a partir de uma tabela de preços, e vale a pena dizer isso em vez de omitir. Todas as URLs de preços no domínio de desenvolvedor da Meta que acessamos retornaram apenas uma estrutura de página, sem qualquer valor em dólares, então a página do modelo e a documentação de geração de imagens são os dois lugares em que esse número existe como uma afirmação legível. Se você precisa de uma segunda fonte para compras, não há nenhuma no site da Meta hoje.

A screenshot of the Pricing section of Meta's developer documentation for Muse Image, stating that Muse Image is billed at a flat $0.01 per generated image, that the price is the same whether reasoning_strength is set to high or the model uses tools during generation, that a request returning n images is billed for n images, that only successfully returned images are counted, and that built-in web and image search is part of the per-image price with no separate search-grounding charge.

O que um centavo compra na prática é uma mudança de decisão, e não um desconto. A formulação da própria Meta na página do modelo é que o modelo "permite executar cargas de trabalho que os preços de ponta antes colocavam fora de alcance" — geração de variações de anúncios, imagens de catálogo e personalização por usuário — e, a essa taxa, cem mil imagens saem por cerca de US$ 1.000. Se você está comparando essa taxa com os modelos de imagem premium que talvez já pague, o movimento útil é testar ambos com seus próprios prompts e sua própria avaliação, e um centavo por imagem é o que torna essa comparação barata o suficiente para realmente ser feita.

Proveniência: o que o Content Seal resolve e o que não resolve

A Meta traz, com este modelo, um sistema invisível de marca d'água e o documenta com precisão suficiente para valer a pena citar: “O Muse Image inclui o Content Seal, nosso sistema invisível de marca d'água. Imagens criadas pelo Muse Image no app Meta AI e em meta.ai carregam um sinal oculto de proveniência que permanece intacto — mesmo quando passam por recorte, compressão, redimensionamento ou captura de tela.” A Meta diz que planeja estender o Content Seal para vídeos e apresenta uma prévia de uma ferramenta de detecção que permite verificar se uma imagem carrega a marca.

Leia o escopo dessa frase com atenção, porque ele é mais restrito do que parece à primeira vista. O sinal de proveniência é descrito como sendo carregado por imagens criadas no app Meta AI e em meta.ai — as superfícies voltadas ao consumidor —, e a página do modelo da Meta e a documentação da API não dizem nada sobre se imagens geradas pela Model API carregam a mesma marca. Não conseguimos encontrar nenhuma declaração em nenhum dos sentidos, então trate o Content Seal como um recurso de proveniência das superfícies voltadas ao consumidor e não presuma que ele acompanha um arquivo gerado pela API até ter testado a saída da sua própria conta. Independentemente disso, o único teste do detector que relatamos veio da Reuters, que constatou que ele não conseguiu verificar a maioria das imagens com marca d'água após o recorte; essa constatação e seu número são abordados em nosso explicador deste modelo, que é a página a ser lida para o argumento de proveniência, e não esta.

Onde é executado

A declaração de disponibilidade da própria Meta, no post de lançamento: o Muse Image "está disponível hoje no app Meta AI e em meta.ai, no Instagram Stories nos EUA e no WhatsApp em países limitados, e chegará em breve ao Facebook". Essas são palavras da Meta, e as superfícies são produtos da própria Meta — não há lista de espera, código de convite nem cadastro separado para nenhuma delas. Do lado do desenvolvedor, o modelo é servido por meio da Model API, que é para o que servem o identificador e os endpoints acima. A página do modelo da Meta também lista plataformas de inferência de terceiros entre as formas de executá-lo; não as nomeamos aqui, e nada nesta página deve ser lido como uma afirmação sobre termos ou tarifas em qualquer superfície que não seja a própria API da Meta.

A Meta não publicou uma data para quando o Muse Image chegou à Model API, e a documentação para desenvolvedores da Meta não indica nenhuma. A única data com que esta página trabalha é a data de lançamento do próprio modelo, 7 de julho de 2026, estabelecida a partir da linha de data do próprio post de anúncio da Meta. Se você está datando a superfície da API e não o modelo, diga o que a Meta diz: nada.

Pesos abertos ou proprietário? Proprietário — e a família tem ambos

Esta é a pergunta que os leitores mais frequentemente erram nesta família, então vale a pena respondê-la diretamente. Muse Image é proprietário. A documentação para desenvolvedores da Meta traça a linha explicitamente: os modelos que você chama pela Model API — Muse Spark, Muse Image, Muse Voice Transcribe e SAM — são servidos, e "Muse Glimmer segue um caminho diferente: você baixa os pesos abertos e o executa no seu próprio hardware em vez de chamá-lo pela Model API", sob uma licença permissiva Apache 2.0. Muse Glimmer é o caminho de pesos abertos nesta família, e é um modelo diferente: um modelo multimodal destilado do Muse Spark, não um lançamento aberto do Muse Image. Nada na página da Meta para o Muse Image declara uma licença ou oferece pesos, porque não há pesos para oferecer. Se a auto-hospedagem for um requisito obrigatório, o Muse Glimmer é o modelo a avaliar; se você quer o modelo de imagem descrito aqui, você chama a API da Meta e paga por imagem.

A generated scoreboard for Meta Muse Image listing six reference facts read from Meta's own pages: price $0.01 per image, billing unit the image rather than the token, search grounding included with no separate charge, Model API identifier muse-image-1.0, weights proprietary, and no rate limit published.

O que a Meta alega que ranqueia, rotulado como alegação da Meta

A postagem de lançamento da Meta afirma: "O Muse Image ocupa o 2º lugar na Arena para texto para imagem, edição de imagem única e edição de múltiplas imagens, conforme medido por rankings Elo de preferência humana no momento da redação." Duas coisas sobre essa frase importam e ambas vêm das próprias palavras da Meta. É um ranking relatado pelo fornecedor, não uma pontuação independente, e é uma posição no Elo de preferência humana em vez de um resultado de benchmark em um harness fixo — uma distinção que faz uma diferença real quando a lacuna entre as duas primeiras posições é menor que a margem de uma classificação Elo construída sobre um número limitado de votos. Os gráficos que a Meta publica junto com a alegação são datados de "5 de julho de 2026", e a própria alegação é qualificada como "no momento da redação", então é um instantâneo de um placar ao vivo citado por uma parte com interesse nele, não uma posição consolidada.

A mesma publicação inclui uma figura de escalonamento que a Meta rotula para você: o gráfico que mostra a qualidade subindo com o raciocínio tem a legenda "Elo a partir de ablação interna". Essa é uma medição interna do fornecedor, e não é comparável a um ranking de terceiros. O argumento da Meta é que a qualidade melhora com a computação em tempo de teste em uma relação aproximadamente log-linear e que raciocínio e uso de ferramentas se potencializam quando combinados — uma ablação interna, declarada como tal.

Existem posições independentes para este modelo, em rankings que não são da Meta, e nós as reportamos: nosso texto explicativo traz os rankings de imagens da Artificial Analysis e as posições na arena com seus números, e as duas páginas de confrontos colocam esses números ao lado de rivais nomeados. Se você quer o panorama independente em vez do do fornecedor, é aí que deve ler. Esta página não reimprime esses números, e um deles precisa ser lido com cuidado de qualquer forma, porque a Artificial Analysis só classifica modelos de imagem que oferecem uma API chamável — então uma posição independente sobre o Muse Image é uma declaração sobre o Model API, não sobre o aplicativo Meta AI.

O que a documentação não responde

Uma página de referência só é útil se disser onde o registro termina, então aqui está o que não conseguimos estabelecer a partir da Meta em 29 de setembro de 2026. Não há limite de requisições publicado para o Muse Image. Não há perfil de latência publicado, nem taxa de sucesso, nem avaliação independente do loop agêntico sob tráfego de produção — o preço por imagem está documentado, mas o envelope operacional não. Não há benchmark de seguimento de instruções ou de fidelidade de edição por terceiros independentes, e a Meta não publica nenhum número desse tipo por conta própria; o gráfico de benchmark na página do modelo da Meta não contém números legíveis. Não há declaração de licença, porque o modelo não está licenciado para download. E a data em que o Muse Image passou a estar disponível para chamada na Model API não é declarada em lugar nenhum da documentação da Meta. Nenhuma dessas ausências é motivo para evitar o modelo — uma imagem de um centavo com grounding de busca incluído já vale a pena ser testada só por isso — mas cada uma delas é motivo para medir em vez de presumir antes que um pipeline dependa dele.

O veredito para um desenvolvedor

Vale a pena avaliar o Meta Muse Image se o seu problema é volume: imagens de catálogo, variantes de anúncios, personalização por usuário, qualquer coisa em que o preço por imagem de ponta era o que inviabilizava o projeto. O preço unitário está documentado, a unidade é inequívoca, falhas não são cobradas, e o grounding de busca está dentro da tarifa em vez de ser cobrado à parte, o que é incomum o bastante neste mercado para ser o principal destaque. Não vale a pena adotá-lo às cegas, porque tudo além do preço — vazão, latência, com que confiabilidade o loop agêntico se completa com os seus prompts, se a sinalização de proveniência acompanha a saída da API — não está documentado, e a própria alegação de ranking do fornecedor é uma colocação de preferência humana citada num momento específico, e não um resultado medido. A forma honesta de decidir aqui é um experimento de um centavo contra o modelo de imagem que você já usa, nos seus próprios prompts, com o modo de falha barato e um fallback comprovado por trás. Para saber o que este modelo é, como ele é chamado e quanto custa, esta página é a referência; para saber se ele deve estar na sua stack, os números que você mesmo gera são os únicos que contam.