
Codzienny brief AI, 19 września: Grok Voice Transcribe 2.0 startuje, a Meta udostępnia Muse deweloperom
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 jest już dostępny w Grok Voice API od 18 września 2026 r. w cenie 0,10 USD za godzinę audio w przypadku transkrypcji nagrań i 0,20 USD za godzinę w przypadku streamingu — takich samych stawek, jakie SpaceXAI pobierała za wersję 1.0. W tym samym tygodniu Meta udostępniła zewnętrznym deweloperom platformę konektorów Muse, pozwalając dowolnej usłudze udostępnić swoje istniejące API i sprawić, by agent Muse od Meta wywołał je w imieniu użytkownika. One wyglądają jak niepowiązane nagłówki od dwóch różnych firm o dwóch różnych produktach, a przez większość ostatnich dwóch lat takie by były. Odczytane razem, to ta sama historia: transkrypcja staje się wejściem, a walka przeniosła się na to, kto jest właścicielem wywołania, które ją konsumuje.
Zacznij od cen, bo to część, na której czytelnik może działać już dziś. Potem dokładność – prawdziwa, ale węższa, niż sugeruje narracja premiery. Na końcu materiał o Meta, bo to on będzie miał znaczenie za sześć miesięcy.
Jednolity cennik — co to oznacza, jeśli już płacisz za transkrypcję
Grok Voice Transcribe 2.0 kosztuje tyle samo co 1.0. Nie „zaczyna się od” tej samej ceny, nie jest to promocyjna stawka, która wygasa — jest identyczna: $0.10 za godzinę audio w trybie wsadowym i $0.20 za godzinę w trybie strumieniowym, co daje $1.67 i $3.33 za 1000 minut. Diaryzacja mówców, znaczniki czasu na poziomie słów z ocenami pewności, odwrotna normalizacja tekstu, usuwanie słów wypełniających i faworyzowanie kluczowych terminów są wliczone w tę cenę, a nie sprzedawane ponownie jako dodatki, co nie jest normą w tej kategorii.
Praktyczny efekt jest arytmetyczny, a nie dramatyczny. Zespół transkrybujący 5000 godzin nagrań audio z centrum kontaktowego miesięcznie płaci 500 USD za ścieżkę wsadową tak czy inaczej, a nowy model zwraca ten sam wolumen przy istotnie niższym odsetku błędów. Migracja w żaden sposób nie zmienia tego, ile się płaci, i właśnie dlatego łatwo ją uzasadnić: nie ma żadnej decyzji kosztowej do podjęcia, jest tylko decyzja jakościowa — a jakość wzrosła.
Istniejące integracje przechodzą na nową wersję, przekazując grok-voice-transcribe-2.0 jako parametr model w żądaniu do /v1/stt albo wybierając go w momencie otwierania sesji WebSocket do strumieniowania. Żadnych zmian w schemacie, żadnego nowego endpointu, żadnego ponownego kodowania w Twoim potoku audio. SpaceXAI na razie pozostawiło 1.0 jako domyślną wersję, więc integracja, która nigdy nie dotyka parametru model, nadal otrzymuje starą wersję, dopóki firma tego nie przełączy — co według jej zapowiedzi nastąpi w nadchodzących tygodniach, wraz z wycofaniem 1.0. Warto wykorzystać to okno świadomie: skieruj kopię cieniową swojego produkcyjnego audio na 2.0 i porównaj transkrypcje z tym, co wypuszczasz dzisiaj, bo gdy domyślna wersja się przełączy, będziesz ją uruchamiać niezależnie od tego, czy ją przetestowałeś, czy nie.
Pozostała część specyfikacji nie zmieniła się pod względem struktury i warto ją znać, jeśli określasz rozmiar wdrożenia, a nie tylko oceniasz dokładność: 12 formatów wejściowego audio od telefonicznego dźwięku 8 kHz aż do 48 kHz, do ośmiu niezależnych kanałów audio w jednym żądaniu, 100 kluczowych terminów na żądanie dla słownictwa domenowego, automatyczne wykrywanie języka z przełączaniem w trakcie nagrywania oraz odwrotna normalizacja tekstu w 25 językach, dzięki czemu wypowiadane daty, waluty, numery telefonów i adresy e-mail są zwracane w zapisie takim, jak zapisałby je człowiek. Limity usługi to 10 żądań na sekundę i 100 równoczesnych sesji strumieniowych na zespół, a usługa działa w jednym regionie — us-east-1 — co jest jedyną pozycją na specyfikacji, która powinna skłonić zespół produkcyjny do zastanowienia, ponieważ interfejs API mowy działający w jednym regionie to awaria w jednym regionie.
Gdzie faktycznie przesunęła się dokładność
Twierdzenie z premiery brzmi: „dwukrotnie większa dokładność”, a stojące za nim dane są bardziej szczegółowe i mniej jednolite niż to sformułowanie. Na tablicy AA-WER Streaming serwisu Artificial Analysis, która jest tu niezależnym pomiarem, te dwie wersje różnią się w następujący sposób:
• Dokładność końcowej transkrypcji — Grok Voice Transcribe 2.0 przy wskaźniku błędów słownych na poziomie 2,7% w porównaniu z Grok Voice Transcribe 1.0 na poziomie 3,9%; oba pomiary wykonano po zakończeniu wypowiedzi przez mówiącego
• Dokładność pierwszego częściowego transkryptu — 3,4% WER w porównaniu z 18,3%, co z dużą przewagą stanowi największą pojedynczą różnicę między obiema wersjami.
• Czas do końcowej transkrypcji — 0,49 sekundy wobec 0,37 sekundy, więc 2.0 jest w tym pomiarze wolniejszy, a nie szybszy
• Czas do pierwszego częściowego zamknięcia — 0,49 sekundy wobec 0,25 sekundy, ta sama transakcja w przeciwnym kierunku
Ta ostatnia para to najciekawsza rzecz na arkuszu. Grok Voice Transcribe 2.0 okupił swoją dokładność mniej więcej ćwiercią sekundy opóźnienia, w obu kierunkach. Dla agenta głosowego to realny koszt — to różnica między naturalną pauzą a pauzą, którą dzwoniący zauważy — a dla potoku przetwarzania wsadowego jest niewidoczny. Poprawa w zakresie pierwszego częściowego wyniku to ta, która zmienia to, co możesz zbudować, ponieważ częściowy transkrypt to tekst, nad którym agent może prowadzić rozumowanie, podczas gdy dzwoniący wciąż mówi. Przejście z 18,3% na 3,4% w tym wskaźniku to różnica między częściowym wynikiem będącym zgrubną wskazówką a częściowym wynikiem, który da się wykorzystać. Końcowy transkrypt schodzący z 3,9% na 2,7% to dobra poprawa, której żaden użytkownik nie zauważy.

SpaceXAI opublikowało również cztery wewnętrzne ewaluacje i warto je czytać, mając na uwadze tę etykietę — to własne liczby firmy dotyczące jej własnego audio, nieodtworzone niezależnie:
• Połączenia z obsługą klienta 8 kHz — 10,6% WER w wersji 1.0, spadek do 7,1% w wersji 2.0
• Rozmowy z Grok — spadek z 8,7% do 3,3%
• Dane uwierzytelniające podawane głosowo, czyli imiona i nazwiska, adresy e-mail oraz dane konta czytane na głos — spadek z 7,2% do 3,2%
• Krótkie frazy w 19 językach — z 20,6% do 6,8%
Wiersz 8 kHz to ten, na którym warto się zatrzymać. Dźwięk telefoniczny to najtrudniejsze typowe wejście w tej kategorii i to, które faktycznie ma większość nabywców z centrów kontaktowych, a spadek z 10,6% do 7,1% w tym wierszu znaczy dla tych nabywców więcej niż główna liczba z tablicy wyników.
Twierdzenie z tabeli wyników, odczytane uczciwie
SpaceXAI twierdzi, że model plasuje się na pierwszym miejscu wśród 32 modeli strumieniowych pod względem dokładności. Tablica Artificial Analysis rzeczywiście umieszcza go na pierwszym miejscu zarówno w rankingach transkrypcji końcowej, jak i pierwszej transkrypcji częściowej — ale na stronie tablicy przedstawiono 27 z 33 modeli, więc „32” to własne wyliczenie firmy, a ranking dotyczy zbioru, którego kształt czytelnik powinien rozumieć. AA-WER Streaming to ważona kombinacja trzech angielskojęzycznych zestawów: AA-AgentTalk w 50%, VoxPopuli w 25% i Earnings22 w 25%, łącznie około ośmiu godzin dźwięku, i jest silnie ukierunkowana na mowę konwersacyjną w stylu agenta. Nie mierzy akcentów, kodeków telefonicznych, słownictwa dziedzinowego ani wielokanałowego dźwięku z centrów obsługi telefonicznej w żaden uporządkowany sposób.
Nic z tego nie czyni tej liczby błędną. Czyni ją konkretną. Model, który prowadzi w angielskim rankingu ważonym rozmowami z agentami, jest właściwym wyborem dla angielskiego audio o profilu rozmów z agentami, a uczciwym powodem, by sądzić, że wynik dla 8 kHz to wewnętrzna ewaluacja dostawcy, a nie publiczny ranking. Nabywcy o innym profilu audio powinni testować na własnym audio, zamiast czytać ranking jako ogólny wyrok — co było prawdą przed tą premierą i będzie prawdą po następnej.

Meta udostępnia deweloperom konektory Muse
Drugą historią tygodnia jest historia Meta. Muse, osobisty agent, którego Meta uruchomiła 8 września na iOS, Androidzie, muse.ai i WhatsAppie, przyjmuje teraz łączniki firm trzecich: usługa udostępnia swoje API, a Muse dostarcza agenta, przeglądarkę i kontekst użytkownika, które zamieniają to API w coś, co człowiek może wywołać, po prostu o to prosząc. Meta ujęła to jako podział pracy — ty dostarczasz API, my wnosimy intencję i użytkownika. Pierwszymi wymienionymi łącznikami były Notion i narzędzie do notatek ze spotkań Granola, w dodatku do tych, które Meta udostępniła sama.
Warto być precyzyjnym co do tego, czym to jest, a czym nie jest. To nie jest otwarty protokół międzyagentowy. Zbudowanie konektora daje dystrybucję wewnątrz własnej bazy użytkowników Muse i nigdzie indziej; budowanie pod otwarty protokół daje zasięg we wszystkich kompatybilnych agentach, ale nie w konkretnej bazie użytkowników. Meta nie opublikowała również elementów, które deweloper musiałby uwzględnić w planowaniu — procesu zatwierdzania konektorów, technicznej powierzchni integracji, sposobu, w jaki Muse wybiera między dwoma nakładającymi się konektorami, ani tego, jak deweloper mierzy, czy konektor faktycznie przełożył się na jakiekolwiek użycie.
Nie ulega wątpliwości, jaki jest kierunek. Muse uruchamia agenta każdego użytkownika we własnej maszynie wirtualnej z własną przeglądarką i oddzielną warstwą kontroli przed działaniami wychodzącymi, a przechowuje tokeny zastępcze, a nie prawdziwe klucze API. Ta architektura ma sens tylko wtedy, gdy plan zakłada, że agent będzie wywoływał wiele rzeczy. API transkrypcji należą do rzeczy, które wywołuje agent, a Meta ma własne — Muse Voice Transcribe, model czasu rzeczywistego, który Meta udostępniła na początku września za 0,18 USD za godzinę audio. Platforma, która posiada zarówno agenta, jak i model mowy, ma oczywisty powód, by kierować własny ruch do własnego modelu, a deweloperzy budujący na konektorach powinni zakładać, że to jest ustawienie domyślne, chyba że coś sprawi, że nim nie będzie.

Co tak naprawdę powinien zrobić zespół wdrażający głos w tym miesiącu
Obie historie wskazują w tym samym kierunku. Dokładność rozpoznawania mowy zbiega się — trzy modele w odległości półtora punktu od siebie na tej samej tablicy wyników w ciągu trzech tygodni — a pozostałe czynniki różnicujące to cena, opóźnienie, licencja i to, kto kontroluje routing. To sprawia, że wybór tego, dokąd trafia wywołanie transkrypcji, ma większe konsekwencje niż wybór modelu, który na nie odpowiada, ponieważ w ciągu najbliższego roku będziesz chciał zmienić tę odpowiedź kilka razy.
To warstwa, w której działa OrcaRouter. Jeden klucz API obejmuje ponad 200 modeli za endpointami zgodnymi z OpenAI, z automatycznym przełączaniem awaryjnym między dostawcami, dzięki czemu zły dzień usługi mowy w jednym regionie przestaje być twoją awarią. Przekazujemy ceny katalogowe dostawców z 0% marży, co oznacza, że obniżka ceny u dostawcy lub nowa wersja modelu jest dostępna po naszej stronie tego samego dnia, zamiast czekać na ponowne ustalenie cen. A ponieważ każdy model objęty jest jedną umową, przeniesienie obciążenia transkrypcji z jednego modelu na inny to zmiana ciągu modelu, a nie drugi proces zakupowy.
Trzy konkretne działania na ten tydzień. Jeśli korzystasz z Grok Voice Transcribe 1.0, przetestuj teraz 2.0 w trybie shadow na własnym audio, dopóki 1.0 jest nadal domyślne i nadal kontrolujesz przełącznik. Jeśli oceniasz strumieniową mowę dla agenta, zmierz czas do pierwszego częściowego wyniku w ramach własnego budżetu opóźnień, zamiast ufać czyjejkolwiek tablicy wyników — ta ćwierć sekundy, którą ten model przeznaczył na dokładność, jest albo niczym, albo fatalna w skutkach, w zależności od tego, co twój agent robi z tekstem. A jeśli budujesz cokolwiek, do czego osobisty agent mógłby kiedyś sięgać, uważnie obserwuj program Muse connector, ponieważ argument dotyczący dystrybucji, jaki za sobą niesie, jest mocniejszy niż szczegół techniczny, z którym został wydany.
