Hero-titelkort för mötet Muse Voice Transcribe vs Granite Speech 5.0 470M TurboCTC, som visar ett självhostat GPU-chip märkt 12 600 RTFx på ena sidan och en strömmande vågform märkt 20+ talare på den andra.
Guides & Insights

Muse Voice Transcribe mot Granite Speech 5.0 470M TurboCTC: GPU du äger eller API du mäter

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det mest användbara att veta om denna jämförelse är att Muse Voice Transcribe och Granite Speech 5.0 470M TurboCTC knappast är substitut. IBM släppte Granite Speech 5.0 470M TurboCTC den 25 augusti 2026 som en ASR-modell med 470 miljoner parametrar, Apache-2.0-licensierad, enbart engelska, byggd för självhosting — en encoder-only Conformer tränad med CTC som IBM säger transkriberar i över 12 600× realtid på en enda NVIDIA H200. Meta Superintelligence Labs släppte Muse Voice Transcribe den 1 september 2026 som en proprietär, hostad, strömmande ljudperceptionsmodell — 25 språk verifierade vid lanseringen, diarisering av 20+ talare, endpointing, 3,00 USD per 1 000 ljudminuter. Den ena vill ha din GPU; den andra vill ha din API-nyckel. Att jämföra deras huvudsakliga WER-siffror skulle helt missa poängen — den verkliga frågan är var transkriberingen tillåts ske, och vad varje modell kan göra när den väl kommer dit.

Två distributionsfilosofier

Granite Speech 5.0 470M TurboCTC är höjdpunkten inom open-weights edge-ASR-rörelsen. Med 470 miljoner parametrar ryms den bekvämt på en bärbar dator, en telefon eller en enda GPU; licensen är Apache-2.0 så du kan bädda in den i en kommersiell produkt; och IBM levererar en WebGPU-demo som kör transkribering live i en webbläsarflik utan någon server alls. Arkitekturen är medvetet avskalad – 16 Conformer-block, girig avkodning, ingen språkmodellsryggrad – eftersom hela designmålet är genomströmning på blygsam hårdvara. Muse Voice Transcribe är den motsatta satsningen: en stor proprietär modell du aldrig ser, serverad från Metas infrastruktur för 0,18 dollar per ljudtimme, med värdet levererat i funktioner snarare än i kisel. Om din begränsning är "inget ljud lämnar den här byggnaden" är valet redan gjort, och det är Granite. Om din begränsning är "jag vill ha den mest kapabla strömmande modellen och jag betalar per minut" är det Muse.

A generated two-column scoreboard titled 'Muse Voice Transcribe vs Granite Speech 5.0 470M TurboCTC — the scoreboard.' Left column Muse Voice Transcribe: Deployment hosted API only, License proprietary closed weights, WER 3.1% streaming (Meta-reported), Languages 25 verified code-switch, Diarization 20+ speakers, Endpointing built-in. Right column Granite Speech 5.0 470M TurboCTC: Deployment self-host 470M params, License Apache-2.0 open weights, WER 5.00% Open ASR (IBM-reported), Languages English only, Diarization none, Endpointing none. Footer reads 'Muse figures Meta-reported; Granite 12,600 RTFx and 5.00% WER IBM-reported, unreproduced.'

Hastighet betyder olika saker här.

Granites rubrik, 12 600 RTFx, är en genomströmningssiffra: en H200 som kör batchinferens tar sig igenom 12 600 sekunder ljud per sekund — tre och en halv timme ljud varje sekund. Det är det mått som betyder något för en callcenter-kö, ett mediaarkiv eller en batch-pipeline där du matar GPU:n kontinuerligt. Det är inte en latenssiffra, och single-stream interaktiv latens är inte där den här modellen utmärker sig. Muse Voice Transcribe är spegelbilden: dess 80-millisekunders chunk-bearbetning och adaptiva fördröjning är byggda för de första 300 millisekunderna efter att en talare pausar, inte för ihållande bulkgenomströmning. På det mått som var och en är designad för är båda starka; på den andres hemmaplan är båda utanför sitt element. Om du behöver transkribera en miljon timmar engelskt arkivljud, vinner Granites råa ekonomik med en storleksordning. Om du behöver en livekonversation med flera talare som omvandlas till märkt text medan det händer, är Muse den enda som överhuvudtaget erbjuder det.

Noggrannhet, ärligt märkt

• Granite Speech 5.0 470M TurboCTC — 5,00 % sammanlagd WER på Open ASR-ledartavlans offentliga engelska kortformstestset; IBMs egen körning av en officiell testmiljö, leverantörsrapporterad och ej reproducerad, enbart på engelskt ljud.

• Muse Voice Transcribe — 3,1 % strömmande WER, Metas påstående vid lanseringen med hänvisning till Artificial Analysis strömmande topplista; 3,6 % på första partiella transkript; även leverantörsrapporterat och ej reproducerat.

De två siffrorna är inte direkt jämförbara – olika korpusar, en engelskspråkig och offline, en flerspråkig och strömmande – vilket är exakt anledningen till att denna uppgörelse inte bör avgöras enbart på WER. Utifrån tillgängliga bevis är båda troliga men inte verifierade för respektive arbetsbelastningar. Vad som är strukturellt säkert är att Granites siffra endast omfattar engelska, medan Muses anspråk befinner sig i ett strömmande, kodväxlande sammanhang där Granite inte ens kan konkurrera.

A screenshot of the Meta AI Research announcement post for Muse Voice Transcribe (captured September 2, 2026), showing the headline 'Introducing Muse Voice Transcribe', the September 1, 2026 publication date, and an interactive real-time transcription demo at the top of the page.

Vad varje modell helt enkelt inte kan göra

Granite Speech 5.0 470M TurboCTC slopar allt som gör ett transkript användbart för ett produktteam. Den stödjer endast engelska. Den saknar talardiarisering – varje röst hamnar i en enda ström. Den genererar inte skiljetecken, versaler eller tidsstämplar, och CTC-designen offrar nyckelordsstyrning och talöversättning som tidigare Granite Speech-modeller hade. Det är inte kvalitetsluckor; det är arkitektoniska val, och de innebär att en produktionsstack byggd på Granite fortfarande behöver en skiljeteckensmodell, en diariserare och ett VAD-lager som skruvats på. Muse Voice Transcribe är där dessa funktioner bor i själva modellen: diarisering av 20+ talare och turendetektering strömmar ut tillsammans med orden, och språktäckningen med kodväxling mitt i meningar är något som Granite överhuvudtaget inte har något svar på. Den ärliga sammanfattningen: Granite är en taligenkänningsmotor som förutsätter att du bygger produkten; Muse är ett API utformat som en produkt som förutsätter att du vill ha transkript, talare och turgränser vid leverans.

Licens och äganderätt

Granite Speech 5.0 470M TurboCTC är Apache-2.0, och ett icke-kommersiellt syskon (granite-speech-5.0-470m-turboctc-nc, CC-BY-NC-SA-4.0) finns för forskningsbruk med något bättre 4,85 % WER tack vare extra träningsdata. Apache-2.0 innebär att du kan servera den, bädda in den, finjustera den och sälja en produkt runt den utan royalties och utan revisionsrisk. Muse Voice Transcribe är sluten och endast värdbaserad: inga vikter, ingen självhostning, ingen finjustering, och dina transkriptionsdata flödar genom Metas tjänst under Metas villkor. För reglerade branscher, eller alla team vars datapolicy förbjuder tredjepartsbehandling av ljud, avslutar det enda faktum jämförelsen innan riktmärkena börjar. För alla andra är "Apache-2.0 och egen GPU" och "proprietär och mätbaserad" helt enkelt olika riskprofiler, inte bättre och sämre.

A screenshot of the Hugging Face model page for ibm-granite/granite-speech-5.0-470m-turboctc showing the English-language and automatic-speech-recognition tags, a model summary describing a compact 470 million parameter English ASR model, the safetensors and Transformers tags, and the Open ASR leaderboard evaluation table.

Kostnadsfrågan

Granite på 12 600 RTFx gör matematiken för självhostad engelsk batch-audio nästan löjlig: en H200-timmes beräkning täcker över 12 000 timmar ljud, så tusen timmars transkribering kostar några få dollar i rå GPU-tid vid typiska hyrespriser — innan du räknar med stilleståndstid, teknikarbete och det saknade diariseringslagret. Muse Voice Transcribe fakturerar 0,18 USD per ljudtimme, vilket är billigt för ett streaming-API men inte billigt i jämförelse med en matad GPU. Den ärliga tumregeln: om ljudet är engelskt, förinspelat och du har volym, vinner ekonomin på att självhosta Granite. Om ljudet är live, med flera talare eller flerspråkigt, är Muse prissatt som en hanterad funktionstjänst — och 180 USD för tusen timmar av live-, diariserad och endpointad streaming är en liten summa jämfört med vad den stacken kostar att bygga själv.

Kör båda utan att stöka till.

Team som behöver båda profilerna – att self-hosta Granite för den engelska batch-linjen och att använda ett hanterat API för live-flerspråkiga konversationer – resulterar i två mycket olika integrationer. Den hostade delen är exakt den typ av arbetsbelastning som en routinggateway betjänar: en API-nyckel för många leverantörer, listpriser som skickas vidare med 0 % påslag, så att leverantörens siffra per minut är det du faktiskt debiteras, och automatisk failover om en leverantörs endpoint försämras. Den självhostade delen förblir din. Det finns inget behov av att dirigera Granite genom en gateway – den lever på din egen hårdvara – men den blandade stack som det innebär är precis den typ av sak som en plattform med ett enda API finns till för att hindra från att bli två parallella ingenjörsprojekt.

Vilken bör du välja

Om ditt jobb är engelsk transkribering i stor skala — arkiv, samtalsinspelningar, undertextspipelines — och du har en GPU att rikta mot det, är Granite Speech 5.0 470M TurboCTC det bättre ingenjörsbeslutet när det gäller kostnad, licens och kontroll, med förbehållet att du själv får bygga skiljeteckens-, diariserings- och strömningslagren. Om ditt jobb är live-, flerpersons- eller flerspråkiga konversationer — röstagenter, liveundertexter, mötesprodukter — erbjuder Muse Voice Transcribe funktioner som Granite inte har, till ett hanterat API-pris, med förbehållet att siffrorna är lanseringsdagspåståenden om stängda vikter. De är inte så mycket konkurrenter som svar på olika frågor, och de team som får detta rätt kommer ofta att köra båda.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube