Muse Spark 1.2 to model rozumowania Meta do złożonych zadań agentowych i obecny checkpoint z rodziny Muse Spark. Meta opisuje go jako zaktualizowany checkpoint w stosunku do Muse Spark 1.1, o nieco wyższej wydajności, dostępny na tym samym poziomie Standard w identycznej cenie — będący aktualizacją typu drop-in, a nie nowym poziomem. Przyjmuje niezwykle szeroką powierzchnię wejściową — tekst, obrazy, wideo, audio i dokumenty PDF — i zwraca tekst, rozumując natywnie w różnych modalnościach w oknie kontekstowym o wielkości 1 mln tokenów. Obsługuje konfigurowalny poziom rozumowania, natywne wywoływanie narzędzi oraz ustrukturyzowane wyniki, co czyni go dobrze dostosowanym do agentów multimodalnych, pogłębionych badań nad mieszanymi mediami oraz analiz długich kontekstów. Muse Spark 1.2 jest przeznaczony do obciążeń łączących dokumenty, zrzuty ekranu, nagrania i wideo z tekstem — od analizowania długich raportów i bibliotek medialnych po prowadzenie wieloetapowych potoków agentowych, które muszą rozumować na podstawie czegoś więcej niż tylko tekstu. Meta udostępnia również muse-spark-1.2-contributor, ten sam checkpoint na swoim poziomie Contributor.
Muse Spark 1.2 to model językowy stworzony przez Meta, udostępniany za pośrednictwem OrcaRouter. Akceptuje dane wejściowe w postaci tekstu, obrazów, wideo, plików i dźwięku, a generuje wyniki…
Na podstawie podanych faktów, Muse Spark 1.2 może przyjmować tekst, obraz, wideo, pliki i audio, a odpowiadać tekstem. Nadaje się zatem do zadań rozumienia multimodalnego, takich jak streszczanie, ekstrakcja, tłumaczenie treści audio i odpowiadanie na pytania dotyczące materiałów wizualnych lub audio. Okno kontekstu o długości 1 048 576 tokenów oznacza, że jako kontekst można wykorzystać obszerny materiał źródłowy. Model rozlicza wszystkie modalności wejściowe względem tego samego budżetu tokenów. W dostarczonych metadanych brak informacji o specjalnych możliwościach, takich jak wywoływanie narzędzi, wyjście strukturalizowane czy dostrajanie (fine-tuning). OrcaRouter udostępnia model przez standardowe API, więc można używać wszystkich funkcji dostępnych w API. W przypadku wszystkiego, czego nie obejmuje karta modelu, przetestuj model z własnymi promptami i danymi przed wdrożeniem do produkcji.
Najlepsze przypadki użycia wynikają z połączenia wejścia multimodalnego i dużego kontekstu. Możesz zadawać pytania dotyczące długiego wideo, streszczać nagrania audio, przeglądać obrazy wraz z tekstem pomocniczym lub pracować z załącznikami plików w tej samej rozmowie. Okno kontekstowe o długości 1 048 576 tokenów obsługuje również długie dokumenty i korpusy wieloplikowe. Użyj Muse Spark 1.2, gdy zadanie wymagałoby w innym przypadku wielu modeli lub wielu podzielonych wywołań. Jeśli dane wejściowe są głównie tekstowe i krótkie, tańszy model może zapewnić lepszą wartość. OrcaRouter rozlicza według stawek dostawcy, więc koszt jest proporcjonalny do wysyłanych tokenów. Aby utrzymać koszty pod kontrolą, filtruj wstępnie treść i wysyłaj tylko istotne fragmenty plików, obrazów lub nagrań audio. Ten model nie jest przeznaczony do generowania multimediów; jego wyjściem jest tekst.
Muse Spark 1.2 jest pozycjonowany jako model multimodalny o dużym kontekście. W przypadku krótkich zapytań tekstowych mniejszy model będzie zazwyczaj szybszy i tańszy. Podana cena $4.25 za 1M tokenów wyjściowych to stawka premium w porównaniu z wieloma lekkimi modelami tekstowymi, choć dokładne porównania zależą od alternatyw. W dostarczonych informacjach nie ma konkretnych limitów tokenów ani wyników benchmarków, więc decyzja zależy od złożoności zadania. Jeśli Twoja treść to zwykły tekst poniżej kilku tysięcy tokenów, użyj tańszego modelu. Jeśli Twoje zadanie obejmuje długie nagrania audio, wideo, obrazy lub pliki, obsługa wejścia multimodalnego i kontekst 1M mogą uzasadniać tę cenę. OrcaRouter umożliwia przełączanie modeli poprzez zmianę parametru „model", dzięki czemu możesz kierować proste zadania do tańszego modelu, a Muse Spark 1.2 rezerwować do trudniejszych zadań multimodalnych.
Model generuje tekst. Nie tworzy obrazów, wideo ani dźwięku. Przyjmuje te media jako dane wejściowe, ale odpowiedź jest uzupełnieniem tekstowym. W dostarczonych metadanych nie ma określonego limitu tokenów wyjściowych, ale standardowe ustawienia API, takie jak max_tokens, mogą ograniczyć długość odpowiedzi. Ponieważ nie podano danych porównawczych, twierdzenia o dokładności i możliwościach należy zweryfikować na własnych danych. Model może nie być w stanie przetworzyć bardzo długich materiałów wideo, jeśli ich reprezentacja przekracza okno kontekstowe wynoszące 1 048 576 tokenów. Nie ma również gwarancji, że będzie działać dobrze w zadaniach wykraczających poza oczekiwaną przestrzeń rozumienia multimodalnego. W przypadku korzystania z OrcaRouter, API zwraca błędy dla żądań, które przekraczają budżet kontekstowy lub naruszają ograniczenia wejściowe dostawcy.
Dostarczone fakty dotyczące modelu nie zawierają żadnych wyników benchmarków ani tabel ewaluacyjnych dla Muse Spark 1.2. Nie oznacza to, że model jest nietestowany; oznacza to, że metadane dostarczone dla tego wpisu w katalogu nie wymieniają tych liczb. Aby ocenić model, uruchom własne przykłady testowe i porównaj wyniki pod kątem metryk specyficznych dla zadania. OrcaRouter nie publikuje wyników benchmarków dla modeli stron trzecich w tym wpisie. Bez danych benchmarkowych czytelnicy powinni polegać na cechach jakościowych, takich jak kontekst okna 1 048 576 tokenów i obsługa wejścia multimodalnego. Wszelkie liczby dotyczące wydajności widziane gdzie indziej powinny pochodzić bezpośrednio od Meta lub z niezależnych ewaluacji. Fraza Muse Spark 1.2 nie powinna być tutaj kojarzona z konkretnymi twierdzeniami benchmarkowymi. Jeśli potrzebujesz ilościowej miary jakości, zaprojektuj mały zestaw ewaluacyjny pokrywający oczekiwane typy wejścia, w tym tekst, obraz, wideo, plik i audio. Zmierz dokładność zadania, spójność wyników i koszt. Brak opublikowanych benchmarków podkreśla również potrzebę testowania przed wdrożeniem produkcyjnym.
Okno kontekstu wynosi 1 048 576 tokenów. Jest to maksymalny rozmiar danych wejściowych, jaki model może obsłużyć w jednym wywołaniu, zgodnie z podanymi faktami. Token to jednostka przetwarzania tekstu; 1 048 576 tokenów to w przybliżeniu duża ilość danych tekstowych, chociaż dokładna liczba słów przypadających na token jest zmienna. Limit kontekstu dotyczy również treści pochodzących z danych wejściowych wideo, obrazów, plików i audio po ich konwersji na tokeny. Duży kontekst pozwala modelowi objąć cały dokument, długi zapis rozmowy lub wiele plików źródłowych bez dzielenia na fragmenty. Oznacza to również, że musisz mieć świadomość zużycia tokenów podczas przesyłania plików multimedialnych. Jeśli łączna liczba tokenów w żądaniu przekroczy okno kontekstu, wywołanie API zakończy się niepowodzeniem. Korzystaj z narzędzi OrcaRouter do zliczania tokenów lub z własnych szacunków, aby zmieścić się w limicie.
W dostarczonych metadanych nie zawarto żadnych wskaźników opóźnienia ani przepustowości. Rzeczywisty czas odpowiedzi zależy od kilku zmiennych: całkowitej długości danych wejściowych, liczby modalności, złożoności promptu oraz obciążenia po stronie dostawcy. Żądanie obejmujące wideo i audio może być wolniejsze niż żądanie wyłącznie tekstowe, ponieważ powiązane dane muszą zostać przetworzone przed wnioskowaniem. Długość wyniku również wpływa na czas odpowiedzi; wygenerowanie wielu tokenów trwa dłużej niż wygenerowanie kilku. Dla tego modelu nie zagwarantowano określonego poziomu szybkości ani dostępności. Aby uzyskać wiarygodne pomiary opóźnienia, przetestuj API przez OrcaRouter, używając reprezentatywnych żądań. Jeśli potrzebujesz bardzo niskiego opóźnienia dla prostych promptów, użyj mniejszego modelu. W przypadku przetwarzania multimodalnego długiego kontekstu opóźnienie będzie z natury wyższe ze względu na charakter obciążenia.
OrcaRouter rozlicza Muse Spark 1.2 w cenie $1.25 za 1,000,000 tokenów wejściowych i $4.25 za 1,000,000 tokenów wyjściowych. Te liczby pochodzą z podanych faktów i są przekazywane według stawki dostawcy z zerową marżą. Tokeny wejściowe to tokeny wysyłane przez klienta, w tym tekst, zawartość plików oraz reprezentacje obrazów, wideo lub audio. Tokeny wyjściowe to tokeny zwracane w wygenerowanym tekście. Całkowity koszt wywołania to zatem liczba tokenów wejściowych pomnożona przez $1.25/1M plus liczba tokenów wyjściowych pomnożona przez $4.25/1M. Ponieważ OrcaRouter nie dodaje marży, jest to stawka pozycyjna, której należy używać do planowania budżetu. Okno kontekstu wynosi 1,048,576 tokenów, więc pełne wejście kontekstowe kosztowałoby nieco więcej niż $1.25 przy stawce wejściowej. To oszacowanie zakłada dokładnie maksymalną liczbę tokenów wejściowych; rzeczywiste żądania są różne.
Tokeny wejściowe kosztują 1,25 USD za milion. Tokeny wyjściowe kosztują 4,25 USD za milion. Tokeny wyjściowe są droższe niż tokeny wejściowe, co jest typowe dla modeli generatywnych. W przypadku wielu zadań wynik to krótkie dokończenie, podczas gdy dane wejściowe zawierają dużą ilość materiału źródłowego. W takim przypadku koszt tokenów wejściowych dominuje. I odwrotnie, jeśli poprosisz o długi wygenerowany tekst, koszt wyjściowy może stać się znaczący. Ponieważ okno kontekstu wynosi 1 048 576 tokenów, możliwe jest wysłanie niemal tej liczby i poniesienie opłat za dane wejściowe. Możesz zmniejszyć koszt wejściowy, wysyłając tylko istotne fragmenty plików, ograniczając długość wideo lub audio oraz przycinając historię rozmowy. OrcaRouter nie dodaje marży, więc każda różnica w kosztach wynika z wolumenów użycia i dokonywanych wyborów.
Podane fakty nie zawierają żadnych informacji o cenach cache ani zniżkach dla Muse Spark 1.2. Niektórzy dostawcy oferują niższe ceny za wejściowe tokeny z cache, ale żadne takie kwoty nie są tu wymienione. Jeśli OrcaRouter lub Meta włączy buforowanie promptów dla tego modelu, dostępne ceny cache byłyby udokumentowane osobno. Bez tej dokumentacji należy zakładać, że każdy token wejściowy jest rozliczany w pełnej stawce 1,25 USD za milion. Nie planuj budżetu w oparciu o oszczędności z cache, dopóki nie potwierdzisz aktualnych warunków. Buforowanie zależy również od ponownego użycia promptów; żądania z unikalnymi lub bardzo zmiennymi danymi wejściowymi nie skorzystają z tej funkcji. Sprawdź stronę z cennikiem OrcaRouter lub skontaktuj się z pomocą techniczną, aby ustalić, czy ceny cache istnieją dla meta/muse-spark-1.2.
OrcaRouter informuje, że Muse Spark 1.2 jest rozliczany według stawki dostawcy z zerową marżą. Oznacza to, że cena za token, którą płacisz, odpowiada stawce podanej przez dostawcę: 1,25 USD za 1M tokenów wejściowych i 4,25 USD za 1M tokenów wyjściowych. OrcaRouter nie dolicza opłaty za token ani opłaty za usługę do tej stawki. Stawka z zerową marżą upraszcza prognozowanie kosztów, ponieważ pozycja na fakturze odpowiada cenie katalogowej modelu. Nie oznacza to, że nie ma podstawowej opłaty abonamentowej lub infrastrukturalnej, jeśli OrcaRouter pobiera taką opłatę za konto API; podane fakty dotyczą wyłącznie rozliczeń za token. Zawsze sprawdzaj swój plan OrcaRouter pod kątem kosztów stałych. Zerowa marża dotyczy stawki modelu i stanowi podstawę porównań kosztów z innymi modelami.
Aby wywołać Muse Spark 1.2 przez OrcaRouter, ustaw bazowy adres URL na https://api.orcarouter.ai/v1 i użyj identyfikatora modelu meta/muse-spark-1.2. Twój klient powinien wysłać żądanie zgodne z formatem uzupełniania czatu kompatybilnym z OpenAI. Dołącz swój klucz API OrcaRouter w nagłówku Authorization. Tablica messages może zawierać treść, którą chcesz przetworzyć. Dla wejścia multimodalnego format treści dla obrazu, wideo, pliku i audio zależy od schematu obsługiwanego przez OrcaRouter; interfejs kompatybilny z OpenAI zazwyczaj dopuszcza części treści. Dokładne nazwy pól są udokumentowane w dokumentacji API. Upewnij się, że całkowita liczba tokenów żądania mieści się w oknie kontekstu wynoszącym 1,048,576 tokenów. Jeśli używasz pakietu SDK OpenAI, ustaw odpowiednio parametry base_url i model.
OrcaRouter udostępnia API zgodne z OpenAI, więc standardowe parametry wnioskowania, takie jak temperature, top_p, max_tokens i sekwencje stop, mogą być dostępne. Ponieważ są to ogólne parametry API OpenAI, ich zachowanie jest zgodne ze specyfikacją API. Dostarczone fakty nie wymieniają parametrów specyficznych dla modelu Muse Spark 1.2. Możesz również przekazywać wiadomość systemową, wiadomości użytkownika i wiadomości asystenta jako część rozmowy. W przypadku danych multimodalnych format żądania powinien zawierać odpowiednie części content dla dołączonych multimediów. Nie ma gwarancji, że każdy parametr OpenAI jest obsługiwany przez każdego dostawcę, więc przetestuj każdy parametr podczas migracji. Użyj identyfikatora modelu meta/muse-spark-1.2 dokładnie. Jeśli parametr nie jest obsługiwany, OrcaRouter zwróci komunikat o błędzie; zweryfikuj to z dokumentacją API.
Aby zmigrować istniejącą integrację zgodną z OpenAI do OrcaRouter, zmień podstawowy adres URL ze swojego bieżącego punktu końcowego na https://api.orcarouter.ai/v1 i ustaw model na meta/muse-spark-1.2. Zachowaj tę samą strukturę wiadomości, jeśli używałeś standardowych OpenAI chat completions. Zastąp swój klucz API kluczem OrcaRouter. Jeśli Twoje istniejące żądania zawierają rozszerzenia specyficzne dla modelu, usuń je lub dostosuj na podstawie dokumentacji API OrcaRouter. Okno kontekstu wynosi 1,048,576 tokenów, co może być większe niż w przypadku poprzedniego modelu, dzięki czemu to samo żądanie zmieści się bez obcinania. Sprawdź formatowanie danych wejściowych dla obrazów, wideo, plików i audio, jeśli używałeś pól specyficznych dla dostawcy. Najpierw przetestuj na małym żądaniu. Ponieważ Muse Spark 1.2 generuje tekst, migracja jest prosta w przypadku narzędzi opartych na tekście.
Podane fakty dotyczące modelu nie zawierają postanowień dotyczących przetwarzania danych, ich przechowywania ani prywatności dla Muse Spark 1.2 lub OrcaRouter. Ogólnie rzecz biorąc, żądania są wysyłane do dostawcy modelu w celu wygenerowania odpowiedzi. OrcaRouter może przechowywać logi API lub dane dotyczące użytkowania na potrzeby operacyjne, jednak szczegółowa polityka nie jest tutaj opisana. Jeśli prywatność danych ma znaczenie, zapoznaj się z warunkami świadczenia usług i polityką prywatności OrcaRouter oraz potwierdź, czy warunki dostawcy Meta mają zastosowanie do treści, które wysyłasz. Nie zakładaj, że wejściowe wideo, audio lub pliki są automatycznie usuwane po wnioskowaniu. W przypadku danych poufnych rozważ ich anonimizację i lokalne wstępne przetwarzanie. Niniejsza sekcja nie powinna być traktowana jako porada prawna. Skontaktuj się z pomocą techniczną OrcaRouter, aby uzyskać aktualną umowę o przetwarzanie danych. Korzystanie z API stanowi zgodę na obowiązujące warunki.
Muse Spark 1.2 różni się od modeli językowych obsługujących wyłącznie tekst, ponieważ przyjmuje dane wejściowe w postaci obrazów, wideo, plików i audio. Model obsługujący wyłącznie tekst może przetwarzać tylko treści pisane. W przypadku zadań multimodalnych Muse Spark 1.2 eliminuje konieczność wyodrębniania i transkrypcji mediów przed wywołaniem LLM. Jego okno kontekstowe o pojemności 1 048 576 tokenów pozwala również na przechowywanie znacznie dłuższych danych wejściowych niż w przypadku wielu standardowych modeli. Z drugiej strony modele obsługujące wyłącznie tekst są często tańsze i mogą działać szybciej w przypadku zwykłego tekstu. Cena wyjściowa wynosząca $4.25 za milion tokenów jest wyższa niż w przypadku wielu lekkich modeli tekstowych. Jeśli Twój projekt opiera się wyłącznie na tekście i nie wymaga długiego kontekstu, model obsługujący wyłącznie tekst może być lepszym wyborem. Jeśli Twój przepływ pracy już wysyła obrazy, audio lub wideo, ten model oferuje ścieżkę pojedynczego wywołania.
Modele przeznaczone wyłącznie do dźwięku lub wyłącznie do obrazu specjalizują się zazwyczaj w jednej modalności i mogą generować etykiety, embeddingi lub transkrypcje. Muse Spark 1.2 łączy tekst, obraz, wideo, pliki i dźwięk w jednym interfejsie generowania tekstu. Może to uprościć potoki, które wcześniej wymagały połączenia transkrybera audio, generatora podpisów do obrazów i modelu LLM. Modele specjalistyczne mogą być jednak lepiej dostrojone do zadań takich jak rozpoznawanie mowy czy wykrywanie obiektów. Dla Muse Spark 1.2 nie podano wyników benchmarków, więc brak tu danych do porównania z modelami specjalistycznymi. Właściwy wybór zależy od tego, czy potrzebujesz ogólnego zrozumienia, czy dedykowanej dokładności. Do ogólnego wnioskowania w wielu modalnościach jeden model multimodalny może być łatwiejszy w utrzymaniu. W przypadku rygorystycznej dokładności produkcyjnej w jednym typie mediów przetestuj alternatywy specjalistyczne.
Jedyne podane ceny dla Muse Spark 1.2 to $1.25 za 1M tokenów wejściowych i $4.25 za 1M tokenów wyjściowych, rozliczane z zerową marżą przez OrcaRouter. Porównania z innymi modelami wymagałyby ich cenników, które nie są częścią tego wpisu. Ogólnie rzecz biorąc, modele multimodalne są droższe w uruchomieniu niż proste modele tekstowe, ponieważ przetwarzają bogatsze dane wejściowe. Okno kontekstowe 1,048,576 tokenów może zwiększyć koszt, jeśli wysyłasz duże ilości multimediów. W przypadku krótkiego promptu tekstowego koszt wejściowy jest bardzo mały. W przypadku żądania z kilkoma minutami wideo i długim wyjściem koszt będzie wyższy. Użyj stawek za token i oczekiwanej liczby tokenów, aby oszacować, czy alternatywny model byłby bardziej ekonomiczny. Ponieważ OrcaRouter nie dolicza marży, stawka dostawcy jest odpowiednim punktem odniesienia.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="meta/muse-spark-1.2",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortrepetition_penaltyresponse_formatstructured_outputstemperaturetool_choicetoolstop_ktop_p| Wejście / 1M tokenów | $1.25 |
| Wyjście / 1M tokenów | $4.25 |
| Odczyt cache / 1M | $0.150 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
O czym mówią programiści w tym tygodniu
GET /api/public/models/meta/muse-spark-1.2Otwórz @misc{orcarouter_muse_spark_1_2,
title = {Muse Spark 1.2 API},
author = {Meta},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/meta/muse-spark-1.2}
}Meta. (2026). Muse Spark 1.2 API. OrcaRouter. https://www.orcarouter.ai/models/meta/muse-spark-1.2