Muse Spark 1.1 adalah model penalaran multimodal milik Meta, yang dibangun untuk tugas-tugas agen. Model ini menerima rentang input yang luar biasa luas — teks, gambar, video, audio, dan dokumen PDF — dan mengembalikan teks, dengan penalaran secara native di seluruh modalitas dalam jendela konteks 1M-token. Model ini mendukung upaya penalaran yang dapat dikonfigurasi dan pemanggilan alat native, menjadikannya sangat cocok untuk agen multimodal, penelitian mendalam atas media campuran, dan analisis konteks panjang. Dengan inferensi yang efisien dan permukaan input yang luas, Muse Spark 1.1 menargetkan beban kerja yang menggabungkan dokumen, tangkapan layar, rekaman, dan video dengan teks — mulai dari menganalisis laporan panjang dan pustaka media hingga menjalankan pipeline agen multi-langkah yang harus bernalar lebih dari sekadar teks.
Meta Muse Spark 1.1 adalah model bahasa multimodal berskala besar dari Meta yang dapat memproses teks, gambar, video, file, dan audio dalam satu konteks. Jendela konteksnya adalah 1.048.576 token –…
Kekuatan utama Muse Spark 1.1 adalah kemampuannya untuk memproses dan bernalar melalui konteks yang sangat panjang (1,048,576 token) yang mencakup berbagai jenis media. Ia dapat menganalisis PDF sepanjang 500 halaman dengan gambar yang disematkan, atau video berdurasi 2 jam beserta transkrip audionya, dalam satu kali proses. Ini menghilangkan kebutuhan untuk chunking atau model terpisah. Model ini juga mampu mengikuti instruksi terperinci dan melakukan tugas penalaran yang kompleks seperti perangkuman, tanya jawab, dan ekstraksi entitas pada input media campuran.
Gunakan Muse Spark 1.1 saat tugas Anda benar-benar mendapat manfaat dari jendela konteks besar dan beberapa modalitas input. Jika Anda hanya perlu menghasilkan teks pendek (misalnya 1.000 token) tanpa gambar atau audio, model hanya-teks yang lebih murah dengan konteks lebih kecil lebih hemat biaya. Namun, untuk pemahaman multimodal ujung-ke-ujung – seperti merangkum video beserta detail visual dan audionya – Muse Spark 1.1 dapat mengurangi kompleksitas sistem dan latensi dengan menghindari beberapa panggilan model.
Kasus penggunaan terbaik termasuk tinjauan dokumen hukum dengan PDF hasil pindaian dan deposisi audio, analisis rekam medis yang menggabungkan gambar dan catatan, moderasi konten video (menganalisis bingkai dan audio), serta pemahaman makalah penelitian akademis dengan gambar dan tabel. Skenario apa pun di mana satu perintah harus mencakup input yang panjang dan heterogen akan mendapatkan manfaat dari model ini. Model ini juga bekerja dengan baik untuk membangun pipeline RAG multimodal di mana jendela konteks dapat menampung seluruh dokumen beserta gambar yang relevan.
Model ini tidak dioptimalkan untuk respons yang sangat cepat dan latensi rendah – konteks besar meningkatkan waktu pemrosesan. Model ini juga tidak mendukung output streaming (pada saat penulisan ini). Untuk tugas yang memerlukan interaksi waktu nyata (mis., chatbot), model yang lebih kecil lebih disukai. Selain itu, biaya per token lebih tinggi daripada banyak model teks saja, sehingga untuk tugas teks murni mungkin berlebihan. Kinerja model pada tugas benchmark belum diungkapkan; pengguna harus mengevaluasi pada data mereka sendiri.
Meta belum merilis skor benchmark secara publik untuk Muse Spark 1.1. Pengguna disarankan untuk menjalankan evaluasi mereka sendiri pada tugas-tugas yang representatif. Konteks besar model dan input multimodal menunjukkan bahwa model seharusnya bekerja dengan baik pada pemahaman dokumen dan QA visual, tetapi tidak ada angka standar yang ada dalam fakta yang disediakan. OrcaRouter tidak menyediakan data benchmarking tambahan; kinerja sesuai dengan yang diberikan oleh Meta.
Memproses 1.048.576 token data multimodal membutuhkan biaya komputasi yang tinggi. Latensi bergantung pada panjang input, jumlah gambar atau bingkai video, dan jumlah token output. Untuk konteks yang sangat panjang, harapkan waktu menit, bukan detik. OrcaRouter tidak mempublikasikan tolok ukur latensi untuk model ini. Pengguna harus menguji dengan beban kerja yang realistis untuk menentukan waktu respons yang dapat diterima untuk aplikasi mereka.
Keterbatasan utama adalah kurangnya data performa yang tersedia untuk umum, sehingga sulit untuk membandingkannya dengan model alternatif tanpa pengujian khusus. Model ini juga tidak mendukung modalitas keluaran selain teks – tidak dapat menghasilkan gambar atau audio. Selain itu, konteks token 1M bersifat teoretis; akurasi dunia nyata dapat menurun pada panjang maksimum untuk beberapa tugas. Seperti semua model besar, hasilnya bisa tidak konsisten di berbagai gaya petunjuk.
Karena potensi latensi tinggi saat memproses konteks multimodal besar, model ini tidak direkomendasikan untuk aplikasi real-time seperti chatbot interaktif atau transkripsi langsung. Ini lebih cocok untuk pemrosesan batch, analisis offline, dan alur kerja asinkron di mana waktu pemrosesan beberapa detik hingga menit dapat diterima. Untuk kebutuhan latensi rendah, pertimbangkan model yang lebih kecil dan lebih cepat yang tersedia melalui OrcaRouter.
Harga adalah $1.25 per 1 juta token input dan $4.25 per 1 juta token output. Token dihitung sesuai dengan tokenizer model; token input termasuk semua teks, token gambar (biasanya 170 token per gambar), bingkai video, audio, dan konten file. Token output adalah teks yang dihasilkan. OrcaRouter meneruskan tarif penyedia tanpa markup, sehingga biayanya tepat seperti angka-angka ini. Tidak ada biaya platform tambahan.
Karena model mendukung hingga 1M token input, satu panggilan dengan dokumen panjang dapat menghabiskan biaya $1.25 atau lebih hanya untuk token input. Untuk input pendek (mis., beberapa ribu token), biayanya jauh lebih rendah – sekitar $0.0013 untuk 1,000 token input. Tawar-menawarnya adalah bahwa untuk tugas yang hanya memerlukan konteks kecil, model yang lebih murah dengan tarif per token yang lebih rendah lebih ekonomis. Untuk tugas multimodal konteks besar, model ini mungkin lebih hemat biaya daripada membagi pekerjaan di beberapa model.
OrcaRouter saat ini tidak menawarkan caching atau diskon volume untuk Muse Spark 1.1. Penetapan harga bersifat pay-as-you-go per token. Tidak ada harga berjenjang berdasarkan volume penggunaan. Pengguna harus memantau konsumsi token mereka, terutama untuk input multimodal besar, untuk mengelola biaya. Kebijakan zero-markup memastikan bahwa biaya mencerminkan harga penyedia yang mendasarinya secara tepat.
Tidak. OrcaRouter hanya mengenakan biaya untuk konsumsi token pada tarif penyedia tanpa markup. Tidak ada biaya permintaan, tidak ada minimum bulanan, dan tidak ada biaya tambahan untuk streaming (meskipun model saat ini tidak mendukung streaming). Satu-satunya biaya adalah token masukan sebesar $1.25/1M dan token keluaran sebesar $4.25/1M. Pengguna bertanggung jawab atas segala biaya yang terkait dengan pengkodean atau transmisi media ke API (bandwidth jaringan).
Gunakan endpoint completions chat yang kompatibel dengan OpenAI. Setel base_url ke https://api.orcarouter.ai/v1. Dalam body permintaan, setel model ke "meta/muse-spark-1.1". Sertakan pesan dalam format OpenAI standar. Untuk konten multimodal, gunakan pesan dengan role "user" dan content sebagai array bagian: text, image_url, dll. Autentikasi dilakukan melalui API key yang disediakan oleh OrcaRouter. Contoh dalam Python menggunakan library openai: client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your-key').
API mendukung parameter standar: max_tokens (batas token output), temperature (0-2, default 1), top_p (0-1), frequency_penalty, presence_penalty, urutan penghentian (stop sequences), dan seed untuk output deterministik. Model saat ini tidak mendukung streaming atau pemanggilan fungsi. Parameter n (jumlah penyelesaian) juga tidak didukung – hanya satu penyelesaian per permintaan. Batas jendela konteks adalah 1.048.576 token total untuk input dan output digabungkan.
Jika saat ini Anda menggunakan penyedia lain, ubah URL dasar menjadi https://api.orcarouter.ai/v1 dan nama model menjadi "meta/muse-spark-1.1". Dapatkan kunci API OrcaRouter dari dasbor. Format isi permintaan identik dengan API OpenAI. Konten multimodal (gambar, video, file, audio) menggunakan format yang sama dengan titik akhir visi OpenAI. Tidak ada perubahan kode lain yang diperlukan. Uji dengan permintaan kecil untuk mengonfirmasi tokenisasi dan biaya.
Saat ini, Muse Spark 1.1 tidak mendukung streaming. Permintaan bersifat sinkron; respons dikembalikan setelah pembuatan selesai. Untuk prompt dengan konteks panjang, hal ini mungkin memakan waktu yang signifikan. OrcaRouter mungkin akan menambahkan dukungan streaming di masa mendatang, tetapi saat ini hanya non-streaming yang tersedia. Pemrosesan asinkron dapat dicapai dengan mengirimkan permintaan secara paralel dari aplikasi Anda.
Jendela konteks Muse Spark 1.1 yang terdiri dari 1,048,576 token termasuk yang terbesar yang tersedia, bersaing dengan model dari penyedia lain. Namun, sebagai model multimodal, ia dirancang khusus untuk menangani input campuran. Model konteks besar berbasis teks murni mungkin lebih murah per token untuk tugas yang hanya berupa teks. Fakta yang diberikan tidak menyebutkan perbandingan tolok ukur, sehingga pengguna harus mengevaluasi berdasarkan kebutuhan multimodal mereka sendiri.
Model multimodal yang lebih kecil (misalnya, dengan konteks 128K) lebih cepat dan lebih murah tetapi tidak dapat memproses informasi sebanyak itu dalam satu pemanggilan. Muse Spark 1.1 mengorbankan kecepatan dan biaya demi kemampuan untuk menyerap seluruh dokumen atau video panjang. Untuk tugas yang dapat dipecah, menggunakan model yang lebih kecil mungkin lebih efisien. Pilihan yang tepat tergantung pada apakah aplikasi Anda benar-benar memerlukan pemrosesan satu kali untuk input yang sangat besar.
Gunakan model teks-saja ketika input Anda tidak mengandung gambar, video, atau audio. Model teks-saja dengan ukuran konteks yang sebanding seringkali lebih murah per token. Misalnya, jika tugas Anda adalah meringkas dokumen teks 1M-token tanpa elemen visual, model teks murni dengan biaya kurang dari $1.25/1M input akan lebih hemat biaya. Harga Muse Spark 1.1 kompetitif untuk tugas multimodal, tetapi tidak untuk teks murni.
OrcaRouter menyediakan antarmuka yang kompatibel dengan OpenAI secara terpadu, sementara API langsung Meta mungkin menggunakan protokolnya sendiri. OrcaRouter tidak menambahkan markup, sehingga biaya token tetap sama (dengan asumsi Meta mengenakan tarif yang sama). OrcaRouter mungkin menawarkan fitur tambahan seperti manajemen kunci API, pelacakan penggunaan, dan penyeimbangan beban antar penyedia. Pilihan tergantung pada apakah Anda lebih suka abstraksi API yang konsisten di berbagai model.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="meta/muse-spark-1.1",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortrepetition_penaltyresponse_formatstructured_outputstemperaturetool_choicetoolstop_ktop_p| Input / 1M token | $1.25 |
| Output / 1M token | $4.25 |
| Baca cache / 1M | $0.150 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/meta/muse-spark-1.1Buka @misc{orcarouter_muse_spark_1_1,
title = {Muse Spark 1.1 API},
author = {Meta},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/meta/muse-spark-1.1}
}Meta. (2026). Muse Spark 1.1 API. OrcaRouter. https://www.orcarouter.ai/models/meta/muse-spark-1.1