Ett genererat referenskort för Meta Muse Image som visar modellnamnet, överraden "Meta Superintelligence Labs — lanseringsinlägg daterat 7 juli 2026" och tre fakta hämtade från Metas egna sidor: tillhandahålls via Metas Model API under identifieraren muse-image-1.0, ett fast pris på $0.01 per genererad bild med sökförankring inkluderad, samt proprietära vikter med Muse Glimmer som vägen med öppna vikter i samma familj. OrcaRouter-logotypen är komponerad i nedre högra hörnet.
Engineering & Research

Meta Muse Image: Modellen, API:et och bilden med fast pris på $0.01

Författare

Gideon Frost

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Om du sökte på det disambiguerade namnet och hamnade här, är det korta svaret detta: Meta Muse Image är Metas agentiska modell för bildgenerering och bildredigering, den är proprietär snarare än öppna vikter, och du anropar den via Metas eget Model API under identifieraren muse-image-1.0 till ett fast pris på 0,01 USD per genererad bild, med sökförankring inkluderad i det priset. Det är hela svaret på frågan som sökningen ställer, och allt nedan är referensen för det – vad modellen gör, hur du når den, vad faktureringsenheten faktiskt är, vad Meta dokumenterar om proveniens, och var dokumentationen slutar.

Två saker om den här sidans berättigande är värda att säga rakt ut, eftersom den här familjen redan har tillkännagivits mer än en gång och en andra tillkännagivandeartikel skulle vara en dubblett av bevakning vi redan publicerar. Detta är den kanoniska referenssidan för namnet: destinationen en läsare når efter att ha sökt på det. Dess berättigande är en bestående efterfrågan som vi mätte i förstapartsdata den 29 september 2026 – läsare skriver den disambiguerade formen av detta namn i tre stavningar, i hundratals visningar, på en position som vi håller av en slump genom andra sidor snarare än genom att ha skrivit en sida formad som den här, och den konverterar nästan inget eftersom inget vi publicerar är format som en referens. Den mätningen är ett faktum om vad folk skriver och inget annat; den säger inget om modellens kvalitet eller popularitet i världen. Och det daterbara ankaret används här som ett faktum för att datera modellen, inte som en händelse att rapportera: Metas lanseringsinlägg för Muse Image och Muse Video har en datering den 7 juli 2026 och beskriver modellen som "tillgänglig idag" på Metas konsumentytor den dagen, så den 7 juli 2026 är lanseringsdatumet som den här sidan utgår från. Varje siffra nedan lästes från Metas egna sidor den 29 september 2026 om inte meningen säger något annat.

Vad Muse Image faktiskt är

Metas egen enradsbeskrivning är rätt ställe att börja, eftersom den gör verkligt arbete snarare än marknadsföring: Muse Image är "en agentisk bildgenerering, förankrad i sökning och prissatt för produktionsvolymer till $0.01/bild." På Metas modellsida delas funktionsytan upp i fyra arbetslägen – bildgenerering, exakt redigering, ankrad komposition och förfinning i flera turer – och utvecklardokumentationen komprimerar samma sak till en mening: "Muse Image genererar och redigerar bilder från en konversation."

Det utmärkande påståendet, med Metas egna ord, är att Muse Image "är en bildmodell som resonerar innan den renderar". Metas lanseringsinlägg gör detta konkret snarare än begreppsligt: "I stället för att direkt mappa prompter till bilder fungerar Muse Image som en agent: den anropar sök- och kodverktyg för att förbättra noggrannheten, förfinar sina egna genereringar och förbättras genom skalning av beräkningskapacitet vid testtid." I praktiken innebär det att modellen planerar innan den ritar, hämtar aktuella referenser från webben när en prompt berör fakta från verkligheten och skriver och kör kod när precision spelar roll — den väg Meta beskriver för korrekta diagram och QR-koder — och kontrollerar sedan resultatet innan den returnerar det.

De tre förmågor som Meta nämner först är de som man bör utvärdera den på, och de uttrycks i Metas egen mening: Muse Image "följer instruktioner troget, redigerar med precision och komponerar från flera referenser." Redigeringspåståendet är det skarpaste av de tre, eftersom det är ett påstående om återhållsamhet snarare än om utdata: Metas modellsida säger att modellen "är utformad för att ändra exakt det du anger och lämna allt annat orört" och stöder iterativ förfining över turer snarare än engångsredigeringar. Komposition är där läget "anchored composition" finns – att förankra "en hel serie genereringar i en liten uppsättning referensbilder så att karaktär, stil och miljö förblir konsekventa från en bild till nästa", vilket är förmågan som spelar roll om du tar fram en katalog eller en annonsserie i stället för en enda bild. Tillsammans är detta de påståenden som skiljer en bildmodell som du genererar med från en som du bygger en pipeline på, och de är leverantörspåståenden: Meta publicerar ingen oberoende benchmark för instruktionsföljning eller redigeringstrohet för den här modellen.

Den agentiska inramningen handlar inte bara om verktyg. Meta dokumenterar Muse Image som sammankopplad med Muse Spark, dess resonemangsmodell, så att "de två modellerna delar verktyg och planerar gemensamt för kraftfull agentisk mediegenerering" – det dokumenterade exemplet är flerdelad utdata som animerade GIF:ar, sidor med inbäddade bilder och små interaktiva spel. Om du bygger något som blandar genererad bild med genererad text eller kod är den sammankopplingen den del av designen som är värd att förstå, och det är anledningen till att modellen tillhandahålls via samma API och samma autentisering som Muse Spark i stället för via en separat bildendpoint med egna autentiseringsuppgifter.

Vad du kallar det: API-ytan

Muse Image is reached through Meta's Model API, and the developer documentation is specific about the shape of that call. The model identifier is muse-image-1.0, passed as the model field on every request. Requests go to the base URL https://api.meta.ai/v1 with a bearer token — the documentation notes that it uses the same base URL and auth as Muse Spark — and there are two image endpoints plus a conversational one:

• Generera — POST /v1/images/generations, textprompt in, bild ut.

• Redigera — POST /v1/images/edits, prompt plus indatabilder, för bild-till-bild-arbete.

• Förfina över flera turer — POST /v1/responses, Responses API, som är hur det dokumenterade flödet med flera turer fungerar.

På bildslutpunkterna är de dokumenterade parametrarna få och värda att memorera, eftersom det är där kostnaden och utdataformatet avgörs. n tar 1 till 10 och har standardvärdet 1. size tar en "WxH"-sträng som till exempel 1792x1024, och dokumentationen är tydlig med att den på dessa slutpunkter "endast anger bildförhållandet, inte exakta pixlar" – tolka det inte som en garanti för upplösning. response_format är b64_json som standard eller url, och output_format är webp som standard med png och jpeg tillgängliga. Det agentiska beteendet är växlingsbart: bildslutpunkterna tar en tool_enablement-utökning som omfattar enable_image_search, enable_web_search och enable_shell, och en reasoning_strength på high (standard) eller low. Att sänka resonemangsstyrkan är hävstången för kostnad och latens, och det är det första som är värt att A/B-testa på dina egna promptar i stället för att ta det på tro.

I Responses API finns samma kontroller inuti en image_generation-verktygsobjekt i tools, med bildsökning, webbsökning och shell alla aktiverade som standard, och utdataarrayen returneras i en fast ordning: ett resonemangsobjekt som sammanfattar vad modellen planerade och sökte upp, ett meddelandeobjekt, sedan ett image_generation_call-objekt per bild. Själva bilden finns i det objektets result-fält som base64, och dess id dokumenteras som ett signerat handtag som du skickar tillbaka för att fortsätta redigera samma bild i en senare tur. Det handtaget är mekanismen bakom förfining över flera turer – det är så du undviker att ladda upp en bild igen för att ändra en detalj i den. Båda bildslutpunkterna accepterar också stream: true, och sänder ut image_generation.completed för generering och image_edit.completed för redigeringar. Model API dokumenteras som drop-in-kompatibelt med OpenAI SDK, Anthropic SDK och OpenAI-kompatibla agent-CLI:er, så ett befintligt bildanrop är en ändring av modellsträngen snarare än en omskrivning.

En varning som hör hemma i referensen snarare än i en fotnot: Meta har inte publicerat några frekvensgränser för Muse Image som vi kunde läsa. Sidan om frekvensgränser på Metas egen utvecklarsajt returnerade ett skal utan några siffror, precis som prissidan. Om genomströmning spelar roll för din design är det en okänd faktor som du kommer att upptäcka från API:et snarare än från dokumentationen.

A screenshot of Meta's developer documentation for Muse Image, section headed One-off generation, showing the OpenAI-compatible images endpoints: POST /v1/images/generations for text-to-image and POST /v1/images/edits for image-to-image and editing, with the note that the OpenAI SDK uploads input images as multipart form data and that the base URL is https://api.meta.ai/v1.

Priset, och enheten det är prissatt i

En cent per bild. Siffran är hämtad från Metas egen modellsida för Muse Image, där modellen listas i en pristabell med både search grounding och reasoning markerade som inkluderade och priset angivet som $0.01/bild; utvecklardokumentationen upprepar det som "Muse Image faktureras med ett fast pris på $0.01 per genererad bild." Enheten är bilden, inte token – dokumentationen säger det rakt ut ("Muse Image prissätts inte per token") – och det spelar roll eftersom bild-API:er som rapporterar användning i token vanligtvis faktureras i token. Muse Image returnerar ett usage-block med antal input- och output-token, och dessa siffror är enbart informativa.

Tre faktureringsdetaljer följer av enheten. För det första: n är en multiplikator: en begäran som returnerar tio bilder faktureras för tio bilder, så 1–10parametern är lika mycket en utgiftskontroll som en bekvämlighet. För det andra: misslyckanden faktureras inte – bilder som inte kan genereras eller som tas bort av säkerhetsfiltrering innan de returneras räknas inte. För det tredje: sökförankring ingår i priset per bild i stället för som en separat radpost; Metas dokumentation anger att det "är en del av priset per bild, så det medför ingen separat avgift för sökförankring". Den sista punkten är den som gör prissättningen meningsfull för agentiskt arbete: en modell som söker på webben innan den renderar kan generera flera verktygsanrop bakom en enda utdata, och Meta säger att verktygsanropen inte faktureras separat från bilden.

Vi kunde inte styrka siffran mot någon prislista, och det är värt att säga i stället för att hoppa över. Varje pris-URL under Metas utvecklardomän som vi hämtade returnerade ett sidhölje utan några dollarbelopp, så modellsidan och dokumentationen för bildgenerering är de två platser där den här siffran finns i form av ett läsbart påstående. Om du behöver en andra källa för inköp finns det ingen på Metas webbplats i dag.

A screenshot of the Pricing section of Meta's developer documentation for Muse Image, stating that Muse Image is billed at a flat $0.01 per generated image, that the price is the same whether reasoning_strength is set to high or the model uses tools during generation, that a request returning n images is billed for n images, that only successfully returned images are counted, and that built-in web and image search is part of the per-image price with no separate search-grounding charge.

Vad en cent ger dig i praktiken är ett förändrat beslut snarare än en rabatt. Metas egen formulering på modellsidan är att modellen "låter dig köra arbetsbelastningar som frontier-prissättning tidigare satte utom räckhåll" – generering av annonsvarianter, katalogbilder och personalisering per användare – och i den här takten har hundra tusen bilder ett listpris på cirka 1 000 dollar. Om du väger den här taxan mot de premiumbildmodeller du kanske redan betalar för, är det användbara draget att köra båda på dina egna prompter och din egen utvärdering, och en cent per bild är vad som gör jämförelsen tillräckligt billig för att faktiskt genomföra den.

Proveniens: vad Content Seal avgör och inte avgör

Meta levererar ett osynligt vattenmärkningssystem med den här modellen och dokumenterar det tillräckligt precist för att vara värt att citera: ”Muse Image innehåller Content Seal, vårt osynliga vattenmärkningssystem. Bilder som skapas av Muse Image i Meta AI-appen och på meta.ai bär en dold härkomstsignal som förblir intakt – även när de beskärs, komprimeras, storleksändras eller skärmdumpas.” Meta säger att de planerar att utöka Content Seal till video och förhandsvisar ett detekteringsverktyg som låter dig kontrollera om en bild bär märket.

Läs omfånget i den meningen noggrant, för det är snävare än vad det först verkar. Provenienssignalen beskrivs bäras av bilder som skapats i Meta AI-appen och på meta.ai — konsumentytorna — och Metas modellsida och API-dokumentation säger ingenting om huruvida bilder som genererats via Model API bär samma märkning. Vi kunde inte hitta något uttalande i någon riktning, så behandla Content Seal som en proveniensfunktion för konsumentytor och utgå inte ifrån att den följer med en API-genererad fil förrän du har testat utdata från ditt eget konto. Oberoende av detta kom det enda test av detektorn som vi har rapporterat från Reuters, som fann att den inte kunde verifiera en majoritet av vattenmärkta bilder efter beskärning; det fyndet och dess siffra tas upp i vår förklarande artikel om den här modellen, som är sidan att läsa för proveniensargumentet snarare än den här.

Var den körs

Metas eget tillgänglighetsuttalande, från lanseringsinlägget: Muse Image "är tillgängligt idag i Meta AI-appen och på meta.ai, Instagram Stories i USA, och WhatsApp i ett begränsat antal länder, och kommer snart till Facebook." Det är Metas egna ord och ytorna är Metas egna produkter — det finns ingen väntelista, ingen inbjudningskod och ingen separat registrering för någon av dem. På utvecklarsidan levereras modellen via Model API, vilket är vad identifieraren och slutpunkterna ovan är till för. Metas modellsida listar också tredjepartsplattformar för inferens bland sätten att köra den; vi namnger dem inte här, och inget på den här sidan bör läsas som ett påstående om villkor eller priser på någon annan yta än Metas eget API.

Meta har inte publicerat något datum för när Muse Image kom till Model API, och Metas utvecklardokumentation anger inget. Det enda datum som den här sidan utgår från är lanseringsdatumet för själva modellen, den 7 juli 2026, fastställt utifrån datumraden i Metas eget tillkännagivandeinlägg. Om du daterar API-ytan snarare än modellen, säg vad Meta säger, vilket är ingenting.

Öppna vikter eller proprietärt? Proprietärt – och familjen har båda.

Detta är den fråga som läsarna oftast svarar fel på i den här familjen, så den är värd att besvara direkt. Muse Image är proprietär. Metas utvecklardokumentation drar explicit gränsen: modellerna som du anropar via Model API – Muse Spark, Muse Image, Muse Voice Transcribe och SAM – serveras, och "Muse Glimmer tar en annan väg: du laddar ner de öppna vikterna och kör den på din egen hårdvara i stället för att anropa den via Model API", under en tillåtande Apache 2.0-licens. Muse Glimmer är vägen med öppna vikter i den här familjen, och det är en annan modell: en multimodal modell destillerad från Muse Spark, inte en öppen utgåva av Muse Image. Inget på Metas sida för Muse Image anger någon licens eller erbjuder vikter, eftersom det inte finns några att erbjuda. Om självhostning är ett hårt krav är Muse Glimmer modellen att utvärdera; om du vill ha bildmodellen som beskrivs här anropar du Metas API och betalar per bild.

A generated scoreboard for Meta Muse Image listing six reference facts read from Meta's own pages: price $0.01 per image, billing unit the image rather than the token, search grounding included with no separate charge, Model API identifier muse-image-1.0, weights proprietary, and no rate limit published.

Vad Meta påstår sig ranka, märkt som Metas påstående

Metas lanseringsinlägg anger: "Muse Image innehar andraplatsen på Arena för text-till-bild, redigering av enskilda bilder och redigering av flera bilder mätt med Elo-rankningar för mänskliga preferenser vid tidpunkten för skrivandet." Två saker i den meningen är viktiga, och båda kommer från Metas egen formulering. Det är en leverantörsrapporterad rankning, inte en oberoende poäng, och det är en Elo-baserad placering för mänskliga preferenser snarare än ett benchmarkresultat i en fast testrigg – en distinktion som gör verklig skillnad när gapet mellan de två översta placeringarna är mindre än marginalen för en Elo-rankning byggd på ett begränsat antal röster. Diagrammen som Meta publicerar tillsammans med påståendet är daterade "per den 5 juli 2026", och själva påståendet är försett med förbehållet "vid tidpunkten för skrivandet", så det är en ögonblicksbild av en levande resultattavla citerad av en part med intresse i den, inte en fastställd placering.

Samma inlägg innehåller en skalningsfigur som Meta etiketterar åt dig: diagrammet som visar att kvaliteten ökar med resonemang har bildtexten "Elo från intern ablation." Det är ett leverantörsinternt mått, och det är inte jämförbart med en tredjepartsresultattavla. Metas argument är att kvaliteten förbättras med beräkningsresurser vid testtid i ett ungefärligt loglinjärt samband, och att resonemang och verktygsanvändning förstärker varandra när de kombineras — en intern ablation, beskriven som just en sådan.

Oberoende positioner för den här modellen finns, på tavlor som inte tillhör Meta, och vi har rapporterat dem: vår förklarande text innehåller Artificial Analysis bildtavlor och arena-positionerna med deras siffror, och de två matchup-sidorna ställer de siffrorna bredvid namngivna rivaler. Om du vill ha den oberoende bilden i stället för leverantörens, är det där du ska läsa den. Den här sidan återger inte dessa siffror, och en av dem måste ändå läsas noggrant, eftersom Artificial Analysis bara rangordnar bildmodeller som levereras med ett anropbart API — så en oberoende position för Muse Image är ett uttalande om Model API, inte om Meta AI-appen.

Vad dokumentationen inte besvarar

En referenssida är bara användbar om den anger var uppgifterna tar slut, så här är vad vi inte kunde fastställa från Meta den 29 september 2026. Det finns ingen publicerad frekvensbegränsning för Muse Image. Det finns ingen publicerad latensprofil, ingen framgångsgrad och ingen oberoende utvärdering av den agentiska loopen under produktionstrafik — priset per bild är dokumenterat, men det operativa spannet är det inte. Det finns ingen benchmark för instruktionsföljning eller redigeringstrohet från någon oberoende part, och Meta publicerar inget sådant nummer själva; benchmark-grafiken på Metas modellsida innehåller inga läsbara siffror. Det finns ingen licensangivelse, eftersom modellen inte är licensierad för nedladdning. Och datumet då Muse Image blev anropbar i Model API anges inte någonstans i Metas dokumentation. Ingen av dessa avsaknader är ett skäl att undvika modellen — en bild för en cent med inkluderad sökförankring är värd att testa enbart på den grunden — men var och en är ett skäl att mäta i stället för att anta innan en pipeline blir beroende av den.

Domen för en utvecklare

Meta Muse Image är värt att utvärdera om ditt problem är volym: katalogbilder, annonsvarianter, anpassning per användare, allt där priset per bild hos frontier-modellerna var det som dödade projektet. Enhetspriset är dokumenterat, enheten är entydig, misslyckanden faktureras inte, och sökförankring ingår i priset i stället för att faktureras vid sidan av, vilket är tillräckligt ovanligt på den här marknaden för att vara huvudnyheten. Det är inte värt att införa blint, eftersom allt bortom priset – genomströmning, latens, hur tillförlitligt den agentiska loopen sluter sig kring dina prompter, huruvida provenienssignalering följer med API-utdata – är odokumenterat, och leverantörens eget rankningspåstående är en placering i mänskliga preferenser citerad vid en tidpunkt snarare än ett uppmätt resultat. Den ärliga formen för ett beslut här är ett experiment för en cent mot den bildmodell du redan använder, med dina egna prompter, med den billiga felmoden och en beprövad reservlösning bakom. För vad den här modellen är, hur den anropas och vad den kostar är den här sidan referensen; för huruvida den bör finnas i din stack är siffrorna du själv tar fram de enda som räknas.