Muse Spark 1.1 to wielomodalny model rozumowania Meta, stworzony do zadań agentowych. Akceptuje niezwykle szeroki zakres danych wejściowych — tekst, obrazy, wideo, audio i dokumenty PDF — i zwraca tekst, rozumując natywnie w różnych modalnościach w ramach okna kontekstowego o wielkości 1M tokenów. Obsługuje konfigurowalny wysiłek rozumowania i natywne wywoływanie narzędzi, co czyni go dobrze dostosowanym do agentów wielomodalnych, dogłębnych badań nad mieszanymi mediami oraz analizy długiego kontekstu. Dzięki wydajnej inferencji i szerokiej powierzchni wejściowej, Muse Spark 1.1 jest przeznaczony do zadań łączących dokumenty, zrzuty ekranu, nagrania i wideo z tekstem — od analizowania długich raportów i bibliotek mediów po prowadzenie wieloetapowych potoków agentowych, które muszą rozumować nie tylko na podstawie tekstu.
Meta Muse Spark 1.1 to multimodalny duży model językowy od Meta, który może przetwarzać tekst, obrazy, wideo, pliki i dźwięk w jednym kontekście. Jego okno kontekstu wynosi 1 048 576 tokenów – mniej…
Główną siłą Muse Spark 1.1 jest zdolność do przetwarzania i wnioskowania na bardzo długim kontekście (1 048 576 tokenów), który obejmuje wiele typów mediów. Może analizować 500-stronicowy PDF z osadzonymi obrazami lub 2-godzinne wideo wraz z jego transkrypcją audio, za jednym razem. Eliminuje to potrzebę dzielenia na fragmenty (chunkingu) lub używania oddzielnych modeli. Model jest również zdolny do śledzenia szczegółowych instrukcji i wykonywania złożonych zadań wnioskowania, takich jak podsumowywanie, odpowiadanie na pytania i ekstrakcja encji w ramach wejść z mieszanych mediów.
Używaj Muse Spark 1.1, gdy Twoje zadanie rzeczywiście korzysta z dużego okna kontekstowego i wielu modalności wejściowych. Jeśli potrzebujesz tylko krótkiego generowania tekstu (np. 1000 tokenów) i nie potrzebujesz obrazów ani dźwięku, tańszy model tekstowy z mniejszym kontekstem jest bardziej opłacalny. Jednak w przypadku kompleksowego rozumienia multimodalnego – jak podsumowanie wideo z jego szczegółami wizualnymi i dźwiękiem – Muse Spark 1.1 może zmniejszyć złożoność systemu i opóźnienia poprzez uniknięcie wielu wywołań modeli.
Najlepsze przypadki użycia obejmują przegląd dokumentów prawnych z zeskanowanymi PDF-ami i nagraniami audio z zeznań, analizę dokumentacji medycznej łączącą obrazy i notatki, moderację treści wideo (analiza klatek i audio) oraz zrozumienie akademickich prac badawczych zawierających ryciny i tabele. Każdy scenariusz, w którym pojedynczy prompt musi objąć długie, heterogeniczne dane wejściowe, korzysta z tego modelu. Sprawdza się on również przy budowaniu multimodalnych potoków RAG, gdzie okno kontekstowe może pomieścić całe dokumenty wraz z odpowiednimi obrazami.
Model nie jest zoptymalizowany pod kątem bardzo szybkich odpowiedzi o niskim opóźnieniu – duże konteksty zwiększają czas przetwarzania. Nie obsługuje również strumieniowego wyjścia (w momencie pisania). W przypadku zadań wymagających interakcji w czasie rzeczywistym (np. chatboty) preferowane są mniejsze modele. Dodatkowo koszt na token jest wyższy niż w przypadku wielu modeli tekstowych, więc dla zadań czysto tekstowych może być to przesada. Wydajność modelu w zadaniach benchmarkowych nie została ujawniona; użytkownicy powinni ocenić ją na własnych danych.
Meta nie opublikowała publicznie wyników benchmarków dla Muse Spark 1.1. Użytkownikom zaleca się przeprowadzenie własnych ocen na reprezentatywnych zadaniach. Duży kontekst modelu i multimodalne dane wejściowe sugerują, że powinien on dobrze radzić sobie z rozumieniem dokumentów i wizualną odpowiedzią na pytania, ale w dostarczonych faktach nie istnieją żadne standaryzowane liczby. OrcaRouter nie dostarcza dodatkowych danych benchmarkingowych; wydajność jest taka, jak dostarczona przez Meta.
Przetwarzanie 1 048 576 tokenów danych multimodalnych jest kosztowne obliczeniowo. Opóźnienie zależy od długości wejścia, liczby obrazów lub klatek wideo oraz liczby tokenów wyjściowych. W przypadku bardzo długich kontekstów spodziewaj się minut, a nie sekund. OrcaRouter nie publikuje benchmarków opóźnień dla tego modelu. Użytkownicy powinni testować z realistycznymi obciążeniami, aby określić akceptowalne czasy odpowiedzi dla swojej aplikacji.
Głównym ograniczeniem jest brak publicznie dostępnych danych dotyczących wydajności, co utrudnia porównanie z alternatywnymi modelami bez przeprowadzenia niestandardowych testów. Model nie obsługuje również innych niż tekst trybów wyjściowych – nie może generować obrazów ani dźwięku. Dodatkowo kontekst 1M tokenów ma charakter teoretyczny; w rzeczywistych zastosowaniach dokładność może się pogarszać przy maksymalnej długości w przypadku niektórych zadań. Podobnie jak w przypadku wszystkich dużych modeli, wyniki mogą być niespójne w zależności od stylu promptu.
Ze względu na możliwość wystąpienia wysokiego opóźnienia podczas przetwarzania dużych, multimodalnych kontekstów, model ten nie jest zalecany do zastosowań czasu rzeczywistego, takich jak interaktywne chatboty czy transkrypcja na żywo. Lepiej nadaje się do przetwarzania wsadowego, analizy offline oraz przepływów pracy asynchronicznej, gdzie akceptowalny jest czas przetwarzania od kilku sekund do kilku minut. W przypadku potrzeby niskiego opóźnienia rozważ mniejsze, szybsze modele dostępne za pośrednictwem OrcaRouter.
Cena wynosi 1,25 USD za 1 milion tokenów wejściowych i 4,25 USD za 1 milion tokenów wyjściowych. Tokeny są liczone zgodnie z tokenizerem modelu; tokeny wejściowe obejmują cały tekst, tokeny obrazów (zazwyczaj 170 tokenów na obraz), klatki wideo, dźwięk i zawartość plików. Tokeny wyjściowe to wygenerowany tekst. OrcaRouter przekazuje stawkę dostawcy bez żadnej marży, więc koszt jest dokładnie taki, jak podano. Nie ma żadnych dodatkowych opłat platformowych.
Ponieważ model obsługuje do 1M tokenów wejściowych, pojedyncze wywołanie z długim dokumentem może kosztować 1,25 USD lub więcej tylko za same tokeny wejściowe. W przypadku krótkich danych wejściowych (np. kilka tysięcy tokenów) koszt jest znacznie niższy – około 0,0013 USD za 1000 tokenów wejściowych. Kompromis polega na tym, że w przypadku zadań wymagających jedynie małego kontekstu tańsze modele z niższymi stawkami na token są bardziej ekonomiczne. W przypadku zadań multimodalnych wymagających dużego kontekstu ten model może być bardziej opłacalny niż dzielenie pracy pomiędzy kilka modeli.
OrcaRouter nie oferuje obecnie buforowania ani rabatów ilościowych dla Muse Spark 1.1. Cennik oparty jest na modelu płatności za zużyte tokeny. Nie ma taryf warstwowych w zależności od wielkości użycia. Użytkownicy powinni monitorować swoje zużycie tokenów, zwłaszcza w przypadku dużych multimodalnych danych wejściowych, aby zarządzać kosztami. Polityka zerowej marży gwarantuje, że koszt dokładnie odzwierciedla cenę dostawcy bazowego.
Nie. OrcaRouter pobiera opłaty tylko za zużycie tokenów według stawki dostawcy z zerową marżą. Nie ma opłat za żądania, minimalnych miesięcznych opłat ani dodatkowych opłat za streaming (choć model obecnie nie obsługuje streamingu). Jedynym kosztem są tokeny wejściowe w cenie $1.25/1M i tokeny wyjściowe w cenie $4.25/1M. Użytkownicy są odpowiedzialni za wszelkie koszty związane z kodowaniem lub przesyłaniem multimediów do API (przepustowość sieci).
Użyj punktu końcowego uzupełnień czatu zgodnego z OpenAI. Ustaw base_url na https://api.orcarouter.ai/v1. W treści żądania ustaw model na "meta/muse-spark-1.1". Dołącz wiadomości w standardowym formacie OpenAI. W przypadku treści multimodalnych użyj wiadomości z rolą "user" i treścią jako tablicą części: text, image_url itp. Uwierzytelnianie odbywa się za pomocą klucza API dostarczonego przez OrcaRouter. Przykład w Pythonie z użyciem biblioteki openai: client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your-key').
API wspiera standardowe parametry: max_tokens (limit tokenów wyjściowych), temperature (0-2, domyślnie 1), top_p (0-1), frequency_penalty, presence_penalty, stop sequences oraz seed dla deterministycznych wyników. Model nie obsługuje obecnie streamingu ani wywoływania funkcji. Parametr n (liczba uzupełnień) również nie jest obsługiwany – tylko jedno uzupełnienie na żądanie. Limit okna kontekstowego wynosi 1,048,576 tokenów łącznie dla wejścia i wyjścia.
Jeśli obecnie korzystasz z innego dostawcy, zmień podstawowy URL na https://api.orcarouter.ai/v1, a nazwę modelu na "meta/muse-spark-1.1". Uzyskaj klucz API OrcaRouter z panelu. Format treści żądania jest identyczny z API OpenAI. Treści multimodalne (obrazy, filmy, pliki, audio) używają tego samego formatu co endpointy wizyjne OpenAI. Nie są wymagane żadne inne zmiany w kodzie. Przetestuj za pomocą małego żądania, aby potwierdzić tokenizację i koszty.
Obecnie Muse Spark 1.1 nie obsługuje strumieniowania. Żądania są synchroniczne; odpowiedź jest zwracana po zakończeniu generowania. W przypadku promptów o długim kontekście może to zająć znaczną ilość czasu. OrcaRouter może dodać obsługę strumieniowania w przyszłości, ale na razie dostępne jest tylko niestrumieniowe. Asynchroniczne przetwarzanie można osiągnąć, wysyłając żądania równolegle z poziomu aplikacji.
Muse Spark 1.1 oferuje okno kontekstowe o wielkości 1 048 576 tokenów, co plasuje go wśród największych dostępnych rozwiązań i stawia w konkurencji z modelami innych dostawców. Jako model multimodalny jest jednak zaprojektowany specjalnie do obsługi mieszanych danych wejściowych. Modele czysto tekstowe z dużym oknem kontekstowym mogą być tańsze za token w przypadku zadań wymagających wyłącznie tekstu. Podane fakty nie zawierają porównań benchmarkowych, dlatego użytkownicy powinni oceniać model na podstawie własnych potrzeb multimodalnych.
Mniejsze modele multimodalne (np. z kontekstem 128K) są szybsze i tańsze, ale nie mogą przetworzyć tak dużej ilości informacji w jednym wywołaniu. Muse Spark 1.1 poświęca szybkość i koszt na rzecz możliwości wczytywania całych dokumentów lub długich filmów. W przypadku zadań, które można podzielić na fragmenty, użycie mniejszego modelu może być bardziej efektywne. Właściwy wybór zależy od tego, czy Twoja aplikacja rzeczywiście wymaga jednorazowego przetwarzania bardzo dużych danych wejściowych.
Użyj modelu działającego wyłącznie na tekście, gdy twoje dane wejściowe nie zawierają obrazów, wideo ani audio. Modele tekstowe o porównywalnych rozmiarach kontekstu są często tańsze na token. Na przykład, jeśli twoje zadanie polega na podsumowaniu 1M-tokenowego dokumentu tekstowego bez elementów wizualnych, czysty model tekstowy kosztujący mniej niż $1.25/1M wejścia byłby bardziej opłacalny. Ceny Muse Spark 1.1 są konkurencyjne w przypadku zadań multimodalnych, ale nie dla czystego tekstu.
OrcaRouter zapewnia ujednolicony interfejs zgodny z OpenAI, podczas gdy bezpośrednie API Meta może używać własnego protokołu. OrcaRouter nie dodaje żadnej marży, więc koszt tokenów jest taki sam (zakładając, że Meta stosuje tę samą stawkę). OrcaRouter może oferować dodatkowe funkcje, takie jak zarządzanie kluczami API, śledzenie użycia i równoważenie obciążenia między dostawcami. Wybór zależy od tego, czy preferujesz spójną abstrakcję API dla wielu modeli.
Zgodne z OpenAI — zostań przy swoim SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="meta/muse-spark-1.1",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortrepetition_penaltyresponse_formatstructured_outputstemperaturetool_choicetoolstop_ktop_p| Wejście / 1M tokenów | $1.25 |
| Wyjście / 1M tokenów | $4.25 |
| Odczyt cache / 1M | $0.150 |
| Waluta | USD |
Szacunek na podstawie cennika
Tylko szacunek — rzeczywista liczba tokenów zależy od tokenizatora dostawcy.
GET /api/public/models/meta/muse-spark-1.1Otwórz @misc{orcarouter_muse_spark_1_1,
title = {Muse Spark 1.1 API},
author = {Meta},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/meta/muse-spark-1.1}
}Meta. (2026). Muse Spark 1.1 API. OrcaRouter. https://www.orcarouter.ai/models/meta/muse-spark-1.1