
Meta Muse Spark 1.1 Review: Masih yang Tercepat, Tak Lagi yang Termurah
- metaBARUMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 per 1 juta token · 705 tok/s
- qwenBARUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1 juta token · 57 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 201 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicBARUAnthropic: Claude Opus 52026-07-2461Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2150Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1651Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1557Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0854Kecerdasan72Koding
- tencentTencent: Hy32026-07-0641Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1651Kecerdasan69Koding60Matematika
Selama empat minggu, alasan untuk Meta Muse Spark 1.1 hanyalah hitungan matematika. {{1}} $1,25 per juta token untuk input, $4,25 untuk output, untuk model multimodal asli yang menjalankan alat lebih baik daripada hampir semua model seharga sebanding. {{/1}} Lalu pada 5 Agustus 2026, Meta meluncurkan Muse Spark 1.2 bersama Muse Code — agen coding terminal pertamanya — dan menambahkan sesuatu yang tidak pernah dimiliki 1.1 pada model baru tersebut: tingkatan kontributor dengan harga $0,10 untuk input dan $0,20 untuk output. {{2}} Dua belas kali lebih murah untuk input, dua puluh satu kali lebih murah untuk output, sebagai imbalan jika Anda mengizinkan Meta melatih model menggunakan prompt Anda. {{/2}} Harga Muse Spark 1.1 tidak bergeser satu sen pun. Namun posisinya justru bergeser.
Itulah kerangka yang jujur untuk meninjau model ini sekarang. Muse Spark 1.1 belum ditinggalkan, belum diubah harganya, dan masih menjadi checkpoint penalaran Meta yang lebih cepat serta terdokumentasi lebih baik di antara dua checkpoint yang ada — tetapi ini bukan lagi cara termurah untuk menyewa model Meta, dan agen yang paling gencar didorong Meta tidak berjalan di atasnya. Tinjauan ini mencakup apa itu 1.1, apa yang secara terukur unggul, apa yang diubah oleh peluncuran Agustus, dan lingkup pekerjaan yang lebih sempit yang masih tepat menggunakannya. Jika angka berasal dari evaluasi Meta sendiri, kalimatnya menyebutkan demikian; jika berasal dari Artificial Analysis atau lalu lintas produksi, itu juga disebutkan.
Vonis cepat
• Apa itu — model penalaran multimodal bawaan (teks, gambar, video, PDF, dan audio sebagai input, teks sebagai output) dengan upaya penalaran yang dapat dikonfigurasi, dibuat untuk menjalankan alat dan mengoperasikan komputer. Bobot tertutup, disediakan oleh Meta.
• Harga — $1,25 input / $4,25 output per juta token, $0,15 saat cache hit. Tidak berubah sejak peluncuran, dan masih sekitar seperempat dari harga output GPT-5.6 Sol ($5/$30) serta seperenam dari Claude Opus 4.8 ($5/$25).
• Intelijen — 51 pada Artificial Analysis Intelligence Index, peringkat #22 dari 185 di kelasnya, dengan median kelas 32. Pengukuran independen, bukan klaim Meta.
• Kekuatan — penggunaan alat dan penalaran agen, plus kecepatan asli: 213,5 token keluaran per detik, yang menurut Artificial Analysis menempati peringkat #2 dari 185.
• Kelemahan — penalaran murni dan pengodean mentah berada di level menengah, pengingatan konteks panjang tidak mutakhir, dan terlalu bertele-tele: 94M token keluaran untuk menyelesaikan Intelligence Index dibandingkan median 65M.
• Peringatan baru — Muse Spark 1.2 kini mendapat skor tiga poin lebih tinggi dan, pada tingkat kontributornya, biayanya hanya seperdua puluh. Keunggulan 1.1 yang tersisa adalah latensi, dan itu besar.
Apa yang Meta rilis pada 5 Agustus — dan apa dampaknya terhadap 1.1
Muse Code adalah agen pengkodean berbasis terminal, saat ini masih dalam tahap beta, yang diinstal dari skrip shell satu baris di macOS dan Linux (belum ada versi Windows) dan berjalan sebagai muse biner. Ia menangani tugas rekayasa perangkat lunak secara menyeluruh di berbagai repositori besar: merencanakan perubahan, menulis kode, memvalidasi hasil. Daya tarik Meta adalah kohesi arsitektural — agen dan model dilatih bersama, bukan sekadar dirangkai menjadi satu — dan daftar fiturnya jelas menargetkan Claude Code dan Codex: agen latar belakang yang terus bekerja setelah Anda menutup terminal, resume dari log peristiwa, worktree paralel sub-agen, dan sandbox OS dengan persetujuan yang aktif secara default. Demo yang dipublikasikan Meta untuk itu adalah loop optimasi kernel GPU yang menjalankan lebih dari 1.000 panggilan alat selama hingga 24 jam di perangkat keras NVIDIA Hopper.
Muse Code menjalankan Muse Spark 1.2, bukan 1.1. Itu adalah konsekuensi praktis pertama bagi siapa pun yang membaca ulasan ini: jika Anda menginginkan agen Meta, Anda berada di checkpoint baru.
Konsekuensi kedua adalah harga, dan ini yang lebih menarik. Meta merilis 1.2 dengan dua ID model yang berbeda, bukan satu:
• Standard (muse-spark-1.2) — $1.25 input, $0.15 input cache, $4.25 output per juta token. Identik dengan Muse Spark 1.1. Meta berkomitmen bahwa prompt dan completion pada tingkat ini tidak digunakan untuk meningkatkan produknya.
• Kontributor (muse-spark-1.2-contributor) — $0,10 input, $0,002 input cache, $0,20 output. Sebagai imbalannya, Anda memberi Meta izin untuk melatih model masa depan pada prompt dan completion Anda.
• Muse Spark 1.1 — tidak ada tier kontributor. Harganya tetap standar, dan Meta tidak mengumumkan penghentian.
Cara Meta membingkai tier kontributor adalah bahwa tier tersebut "lebih dari 10 kali lebih murah daripada tier bayar-sesuai-pakai sekalipun," yang meremehkannya: kelipatan sebenarnya adalah 12,5× untuk input dan 21,25× untuk output, dengan input cache yang hampir gratis di $0,002. Itulah headline "harga murah" yang dihasilkan peluncuran tersebut, dan itu hanya berlaku untuk 1.2.

Kisah harga, ditulis ulang
Sebelum Anda menulis ulang anggaran Anda di sekitar token output $0,20, baca sisa ketentuan tingkat kontributor, karena itulah yang membuatnya murah. Batas kecepatan turun dari 3.000 permintaan per menit yang terdokumentasi pada tingkat standar menjadi 60 pada tingkat kontributor — batas yang memungkinkan pengembang bereksperimen di laptop dan melarang armada agen produksi. Dan pertukaran data bukanlah formalitas: perintah Anda dan hasil model Anda menjadi materi pelatihan. Bagi siapa pun yang menangani data pelanggan, sumber daya milik, atau apa pun yang berada di bawah kewajiban kerahasiaan, tingkat kontributor bukanlah versi yang lebih murah dari produk yang sama; itu adalah produk yang berbeda. Meta mengakui hal tersebut pada peluncuran yang sama dengan menambahkan opsi tanpa retensi data untuk pelanggan perusahaan pada jalur berbayar.
Jadi perbandingan yang jujur bukanlah "1.1 dengan $4.25 versus 1.2 dengan $0.20." Melainkan: dengan harga standar, kedua model memiliki biaya yang sama persis, dan 1.2 adalah yang mendapat skor lebih baik. Tingkatan $0.20 adalah penawaran yang nyata dan agresif, tetapi ditujukan untuk individu dan eksperimen, dan hanya tersedia pada model yang lebih baru.
Yang sebenarnya mendorong tagihan pada kedua model adalah caching, bukan tarif yang tertera. Ambil contoh satu langkah agen yang representatif: 60.000 token konteks repositori atau dokumen masuk, 3.000 token rencana-dan-jawaban keluar. Saat dingin, itu berarti $0,075 untuk input ditambah $0,013 untuk output — sekitar 8,8 sen, atau $88 untuk seribu langkah. Jaga prefiks konteks tetap stabil sehingga mendapatkan cache hit dengan tarif $0,15 per juta, dan biaya input turun drastis menjadi $0,009, sehingga langkah tersebut menjadi sekitar 2,2 sen dan seribu langkah menjadi $22. Selisih 75%, yang sepenuhnya dikendalikan oleh apakah framework agen Anda menggunakan ulang prefiks yang stabil atau membangun ulang prompt pada setiap giliran. Jika Anda hanya mengambil satu tindakan teknis setelah membaca ulasan ini, jadikan itu stabilitas cache-key, bukan pemilihan model.
Catatan struktural tentang tempat Anda menyewanya. Muse Spark 1.1 ada dalam katalog OrcaRouter dengan harga $1.25 dan $4.25 dengan cache read $0.15 — angka yang sama dengan yang dikenakan Meta, karena OrcaRouter menerapkan markup 0% dan meneruskan harga daftar penyedia secara langsung, sehingga perubahan harga vendor tiba di sini pada hari yang sama saat tiba di sana. Muse Spark 1.2 belum ada dalam katalog dan dilayani langsung oleh Meta. Hal ini penting untuk perbandingan yang mungkin akan Anda lakukan: GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5, dan Gemini 3.1 Pro semuanya berada di balik satu kunci dengan harga daftar, sehingga Anda dapat melakukan benchmarking terhadap Muse Spark 1.1 pada satu set evaluasi tanpa kontrak kedua, dan angka di spreadsheet Anda adalah angka yang ada di faktur.
Apa sebenarnya Muse Spark 1.1 itu
Muse Spark adalah lini penalaran andalan dari Meta Superintelligence Labs, grup yang didirikan Mark Zuckerberg di bawah Alexandr Wang. Ini menandai perubahan strategis: di mana model Llama Meta bersifat open-weight, keluarga Muse — Spark, plus generator Gambar dan Video — bersifat tertutup dan disampaikan sebagai produk dan API. Spark 1.0 hadir pada 8 April 2026; 1.1 menyusul pada 9 Juli bersamaan dengan pratinjau publik Meta Model API. Perubahan praktis bagi pengembang adalah Meta kini menjadi vendor API pihak pertama yang bersaing langsung dengan OpenAI dan Anthropic, bukan sekadar penerbit bobot — dan peluncuran agen pengkodean pada 5 Agustus adalah konfirmasi paling jelas dari hal tersebut sejauh ini.
Versi 1.1 merupakan lompatan substansial, bukan sekadar rilis pembaruan kecil. Pada Artificial Analysis, skornya naik delapan poin Intelligence Index dalam tiga bulan, dari 43 menjadi 51. Indeks coding-nya naik 12 poin menjadi 71, SciCode meningkat menjadi 58%, dan Humanity's Last Exam naik menjadi 45%. Meta mengatakan peningkatan terbesar terjadi pada penggunaan alat, penggunaan komputer, coding, dan pemahaman multimodal — konsisten dengan model yang disetel untuk bertindak, bukan sekadar menjawab.
Mengenai konteks, kebingungan sebelumnya telah mereda: Artificial Analysis dan OrcaRouter sama-sama mencantumkan jendela pada 1.048.576 token, dan Meta menggambarkan jendela yang secara aktif dipadatkan model. Meski demikian, menyimpan satu juta token tidak sama dengan mengingatnya kembali, dan skor pengambilan konteks panjang 1.1 sekitar 54,1 menunjukkan ingatannya biasa saja. Perlakukan jendela sebagai kapasitas, bukan jaminan.
Upaya penalaran: Seketika, Merenung, dan dial di bawahnya
Pada permukaan konsumen Meta, Muse Spark menampilkan dua mode bernama: Instant yang menjawab segera tanpa penalaran yang diperluas, seperti giliran obrolan standar; serta Contemplating yang menjalankan beberapa agen secara paralel menggunakan teknik "kompresi pemikiran" yang dipinjam dari pembelajaran penguatan, dan Meta memposisikannya melawan DeepMind Deep Think dan GPT-5.4 Pro untuk pekerjaan ilmiah dan analitis yang menuntut. Melalui API, kemampuan yang sama muncul sebagai parameter upaya penalaran yang dapat dikonfigurasi — Artificial Analysis menerbitkan skornya pada pengaturan xhigh model, yang paling mahal yang dieksposnya.
Perlakukan kenop itu sebagai tuas biaya, bukan penggeser kualitas. Penalaran agen paralel menghabiskan jauh lebih banyak token daripada proses tunggal, dan angka tolok ukur yang Anda baca dihasilkan dengan upaya maksimum. Gunakan tingkat rendah secara bawaan untuk panggilan rutin dan cadangkan upaya tinggi untuk kasus-kasus ketika jawaban pertama yang salah berbiaya mahal.
Bagaimana penilaiannya: kuat dengan alat, menengah tanpa alat.
Cara paling jelas untuk membaca Muse Spark 1.1 adalah dengan alat versus tanpa alat. Dengan alat, ia memimpin tes agen: MCP Atlas 88.1 berbanding Claude Opus 4.8 yang 82.2, JobBench 54.7 berbanding 48.4, Legal Agent Bench 20.0 berbanding Grok 4.5 yang 12.9, dan Humanity's Last Exam dengan alat 62.1 berbanding 57.9. Tanpa alat, ia biasa saja — Humanity's Last Exam biasa berada di sekitar 45, jauh di belakang Gemini 3.1 Pro yang kira-kira 77 pada tes yang sama.
Dalam hal presisi eksekusi, ia juga tertinggal di belakang para pemimpin: penggunaan komputer OSWorld-Verified 80,8 dibandingkan dengan 83,4 milik Opus 4.8, pengodean SWE-Bench Pro 61,5 dibandingkan 69,2, pengodean horizon panjang DeepSWE 1.1 53,3 dibandingkan 67,0 milik GPT-5.5, dan penalaran visual BabyVision 76,3 dibandingkan 83,6. Banyak dari angka-angka ini dilaporkan oleh vendor, beberapa dari evaluasi internal Meta sendiri, dan dijalankan pada harness yang berbeda — anggap saja sebagai indikasi arah dan uji ulang pada tugas Anda sendiri.

Gambaran independen dari Artificial Analysis lebih ringkas dan lebih bermanfaat. Indeks Intelijen 51, peringkat #22 dari 185, dibandingkan median kelas 32. Kecepatan 213,5 token keluaran per detik, peringkat #2 dari 185 — ini model yang benar-benar cepat. Peringkat harga #31, harga cache-hit $0,15 dengan diskon 88%. Verbositas 94M token keluaran untuk melewati indeks, dibandingkan median 65M, yang merupakan sumber sebagian besar tagihan sebenarnya. Total biaya untuk mengevaluasinya di seluruh suite: $548,07.
Satu peringatan yang perlu diperhatikan: Meta memasarkan input teks, gambar, video, audio, dan PDF, tetapi kartu spesifikasi teknis Artificial Analysis untuk 1.1 hanya mencatat teks dan gambar sebagai yang dievaluasi. Keduanya bisa benar — API menerima lebih banyak daripada yang diuji oleh kerangka tolok ukur — tetapi tidak seorang pun di luar Meta yang mempublikasikan hasil pada beban kerja video atau audio. Jika analisis media campuran adalah alasan Anda di sini, sisihkan waktu untuk memverifikasinya sendiri.
Haruskah Anda pindah ke 1.2? Jawaban latensi
Dalam hal coding, Meta mengatakan ya, dan angka-angkanya konsisten secara internal: Terminal-Bench 2.1 naik dari 76.2% menjadi 82.9%, DeepSWE v1.1 dari 53.0% menjadi 59.3%, dan benchmark coding internalnya dari 68.3% menjadi 70.6%. Ini adalah evaluasi yang dijalankan Meta, dinilai pass@1 atas lima percobaan dalam harness milik Meta sendiri — catatan standar berlaku, yaitu model-model pesaing dalam harness vendor sering kali kurang disetel. Secara independen, Artificial Analysis menempatkan Muse Spark 1.2 pada 54 di Intelligence Index, peringkat #13 dari 185, tiga poin di atas 1.1.
Yang Meta gunakan untuk membeli poin-poin tersebut adalah deliberasi, dan itu terlihat dalam setiap pengukuran waktu. Artificial Analysis mencatat waktu hingga token pertama sebesar 26.12 detik untuk 1.2 dibandingkan 2.90 detik untuk 1.1 — keduanya pada tingkat upaya penalaran tertinggi masing-masing model. Kecepatan keluaran turun dari 213.5 menjadi 165 token per detik. Verbositas naik sedikit, 95M dibandingkan 94M token, dan biaya menjalankan rangkaian benchmark yang identik naik dari $548.07 menjadi $637.85 dengan harga per token yang sama. Angka terakhir itu adalah pernyataan paling jelas tentang trade-off: daftar harga sama, 16% lebih banyak token yang terpakai, tiga poin indeks lebih banyak.
Baca angka 26 detik itu dengan saksama, karena mudah salah baca. Itu adalah pengukuran tolok ukur dengan upaya maksimal, dan API secara bawaan menggunakan pengaturan menengah. Sebagai titik acuan lalu lintas nyata, Muse Spark 1.1 di OrcaRouter — melayani upaya apa pun yang sebenarnya diminta pemanggil — menunjukkan p50 waktu hingga token pertama sebesar 1.84 detik dan p95 sebesar 6.00 detik selama seminggu lalu lintas produksi, dengan tingkat kesalahan nol. Latensi tolok ukur pada upaya maksimal dan latensi produksi pada upaya bawaan adalah besaran yang berbeda, dan selisihnya biasanya lebih dari satu tingkat magnitudo.
Jadi, keputusannya menjadi jelas berdasarkan bentuk beban kerja. Jika Anda menjalankan agen pengodean bervisi jangka panjang yang menyimpan repositori dalam konteks dan bekerja selama beberapa menit, 1.2 adalah model yang lebih baik dan penalti latensi terbayar pada tugas yang sejak awal tidak akan terasa instan. Jika Anda melayani sesuatu yang interaktif — antarmuka obrolan, putaran pemanggilan alat dengan manusia yang menunggu, SLO latensi yang diukur dalam hitungan detik — Muse Spark 1.1 tetap menjadi model yang lebih cocok dalam keluarga ini, dan peringkat kecepatannya bukanlah kesalahan pembulatan. Tidak ada apa pun tentang peluncuran Agustus yang mengubah hal itu.
Pengalaman pengembang dan batasan
API Model Meta tetap menjadi pratinjau publik, meskipun peluncuran Agustus lalu memperluas akses global dan menambahkan opsi tanpa retensi data untuk perusahaan. Meta menyediakan antarmuka bergaya OpenAI dan akses SDK, dan Spark telah tersedia bagi konsumen dalam mode "Thinking" Meta AI. Batas laju kini dipublikasikan, bukan lagi ditebak — 3.000 permintaan per menit terdokumentasi untuk tingkat standar — tetapi status pratinjau tetaplah status pratinjau, jadi siapkan rute cadangan untuk hari-hari ketika kapasitas terbatas. Failover otomatis antar penyedia adalah infrastruktur yang justru dibutuhkan oleh endpoint tingkat pratinjau, dan itulah sebabnya merutekan model pratinjau melalui gateway tidak memakan biaya apa pun dan memberi Anda jalur kedua.

Melalui OrcaRouter, ID modelnya adalah meta/muse-spark-1.1 dan keduanya /v1/chat/completions dan /v1/responses tersedia, sehingga klien OpenAI yang sudah ada hanya memerlukan URL dasar dan string model, tidak ada yang lain:
from openai import OpenAI
client = OpenAI(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")
response = client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "Rencanakan dan jalankan alat untuk memperbaiki masalah ini."}])
print(response.choices[0].message.content)
Di mana cocok — dan di mana tidak
Cocok untuk: otomatisasi penjalanan alat dan penggunaan komputer yang waktu responsnya terlihat oleh seseorang; penalaran yang peka biaya dalam skala besar pada data yang tidak dapat Anda serahkan ke set pelatihan; alur kerja yang mencampur teks dengan gambar, video, PDF, atau audio, dengan verifikasi Anda sendiri pada jalur media; dan tim yang menginginkan default yang cepat dan murah dengan model premium yang disimpan sebagai cadangan untuk langkah-langkah tersulit.
Kesesuaian yang lemah: akurasi coding teratas di papan peringkat dan rekayasa greenfield paling sulit, yang masih menjadi milik Claude Opus 4.8 dan GPT-5.6 Sol; masalah penalaran murni tanpa alat; tugas presisi visual yang dipimpin oleh Gemini 3.1 Pro; pekerjaan repositori jangka panjang, yang sekarang secara eksplisit menjadi tugas 1.2 dan Muse Code; dan apa pun yang membutuhkan token termurah yang mungkin dari Meta, karena tingkatan itu tidak ada di model ini.
FAQ
Apakah Muse Spark 1.1 masih tersedia sekarang setelah 1.2 dirilis?
Ya. Meta mengumumkan tidak ada penghentian dan tidak ada perubahan harga pada peluncuran 5 Agustus — 1.1 tetap berada di Meta Model API dengan harga $1.25 dan $4.25 per juta token, dan itu ada di katalog OrcaRouter dengan angka yang sama. Liputan peluncuran tersebut secara konsisten menggambarkannya sebagai kelanjutan dengan harga API yang berlaku. Meski demikian, perhatian rekayasa Meta telah terlihat berpindah: agen coding, tolok ukur baru, dan tingkatan murah semuanya terkait dengan 1.2.
Bisakah saya mendapatkan Muse Spark 1.1 di tingkat kontributor $0.10?
Tidak. Tingkatan kontributor adalah ID model terpisah pada checkpoint yang lebih baru, muse-spark-1.2-contributor. Tidak ada padanan 1.1, jadi token penalaran Meta termurah mengharuskan pindah versi — dan menerima batas 60 permintaan per menit plus izin bagi Meta untuk melatih pada prompt dan hasil Anda.
Haruskah saya meningkatkan ke Muse Spark 1.2?
Jika beban kerja Anda adalah pekerjaan agen berskala repositori atau pengodean yang berjalan lama, ya: skornya lebih tinggi baik pada evaluasi pengodean milik Meta sendiri maupun indeks independen Artificial Analysis, dengan harga standar yang sama. Jika beban kerja Anda interaktif atau sensitif terhadap latensi, tidak: 1.2 menukar kira-kira sembilan kali waktu hingga token pertama dan 23% kecepatan keluaran dengan tiga poin indeks, dan penalarannya tidak dapat dimatikan. Keduanya berada pada API yang sama, jadi peralihannya hanyalah string model — yang merupakan uji A/B termurah yang mungkin dan layak dijalankan pada lalu lintas Anda sendiri sebelum memutuskan.
Apakah Muse Spark 1.1 bersumber terbuka?
Tidak, dan itulah inti dari pernyataan tersebut. Berbeda dengan model Llama milik Meta, keluarga Muse memiliki bobot tertutup dan disediakan sebagai produk dan API. Tidak ada bobot di Hugging Face, tidak ada jalur self-hosting, dan tidak ada penyedia pihak ketiga — Meta adalah satu-satunya pihak yang menyajikan model ini, yang menjadikan lapisan routing dengan failover sebagai jawaban praktis terhadap risiko penyedia tunggal, bukan vendor kedua.
Vonis, satu versi kemudian
Muse Spark 1.1 adalah model agen multimodal yang cepat, murah, dan benar-benar multimodal, yang kuat dalam penggunaan alat dan sejujurnya berada di kelas menengah dalam pengodean serta penalaran murni. Tidak ada satu pun pengukuran tentangnya yang memburuk pada bulan Agustus. Yang berubah adalah bentuk keluarga model di sekitarnya: Meta kini memiliki model dengan skor lebih baik pada harga standar yang sama, tingkatan yang jauh lebih murah bagi pengembang yang bersedia menukar data mereka, serta produk agen yang tidak berjalan baik pada 1.1 maupun pada apa pun yang dapat Anda arahkan ke 1.1.
Yang tersisa adalah rekomendasi yang lebih sempit tetapi nyata. Jika Anda membutuhkan kualitas penalaran Meta pada kecepatan yang dapat diterima manusia — satu detik menuju token pertama dalam produksi, 213 token per detik setelahnya — 1.1 masih menjadi versi yang sebaiknya digunakan, dan tiga poin indeks yang ditambahkan 1.2 tidak sebanding dengan penantian sembilan kali lipat. Jika Anda tidak membutuhkan kecepatan itu, tidak ada lagi banyak alasan untuk bertahan. Bagaimanapun juga, ini hanyalah satu string model, jadi saran yang jujur adalah menjalankan keduanya pada set evaluasi Anda sendiri selama sehari dan biarkan anggaran latensi Anda yang memutuskan.
Dibandingkan dalam artikel ini4
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
