
MAI-Image-2.5-Pro vs Bernini-Diffusers-v2: #1 yang Terukur Melawan Taruhan Open-Weights yang Belum Terukur
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
Membandingkan MAI-Image-2.5-Pro dengan Bernini-Diffusers-v2sebenarnya bukan membandingkan dua model gambar. Ia membandingkan dua jawaban berbeda untuk pertanyaan yang sama — "bagaimana cara mendapatkan suntingan yang bagus dari gambar yang sudah ada?" — di mana satu sisi didukung 6.100 suara manusia dalam uji buta di balik peringkat #1 penyuntingannya, sementara sisi lainnya hanya memiliki README. MAI-Image-2.5-Pro, model gambar kelas kualitas Microsoft, memasuki pratinjau publik di Microsoft Foundry pada 23 Juli 2026 dan kini memuncaki Artificial Analysis Image Editing Arena. Bernini-Diffusers-v2, kerangka kerja generasi terpadu generasi kedua ByteDance, hadir di Hugging Face pada 13 Agustus 2026 sebagai bobot Apache-2.0 tanpa pengumuman dan tanpa tolok ukur kualitas gambar yang pernah dijalankan siapa pun di luar ByteDance. Setiap perbedaan praktis dalam pertarungan ini merupakan akibat dari dua fakta tersebut.
Satu yang Anda panggil, satu yang Anda jalankan.
• MAI-Image-2.5-Pro — model API yang dihosting dalam pratinjau publik di Azure AI Foundry dan MAI Playground. Proprieter, dihitung per token, tanpa fine-tuning, tanpa self-hosting. Anda mendapatkan endpoint dan membayar per token; Microsoft yang menjalankan infrastrukturnya.
• Bernini-Diffusers-v2 — Bobot Apache-2.0 yang Anda unduh dari Hugging Face dan jalankan sendiri. Tumpukannya adalah perencana semantik Qwen2.5-VL-7B yang menggerakkan perender DiT berbasis Wan2.2, dan rekomendasi perangkat keras di README adalah GPU kelas Hopper (H100/H800/H200) dengan Python 3.11.2 / PyTorch 2.5.1+cu124. Anda yang menyediakan kluster.
Itulah aturan keputusannya dalam satu kalimat: jika organisasi Anda ingin memiliki stack-nya sendiri, Bernini adalah sebuah opsi; jika organisasi Anda menginginkan invoice dan SLA, hanya MAI-Image-2.5-Pro yang masih layak dipertimbangkan. Keduanya tidak dapat saling menggantikan.
Kesenjangan bukti adalah judul utama yang sebenarnya.
Kedua model berada di sisi yang berlawanan dari masalah kualitas terbesar dalam AI gambar: mengukur keluaran. Keterampilan pengeditan MAI-Image-2.5-Pro dinilai secara independen — Peringkat No. 1 di Artificial Analysis Image Editing Arena dengan Elo 1.272 dari ~6.100 perbandingan buta, unggul dari Reve 2.1, GPT Image 2, dan saudaranya sendiri, MAI-Image-2.5. Peringkat text-to-image-nya berada di posisi ketujuh dengan Elo 1.292, yang menjadi penyeimbang yang jujur: ia adalah editor spesialis, bukan pemimpin dari kanvas kosong. Angka-angka itu dapat diaudit oleh siapa saja yang memiliki peramban.
Bernini-Diffusers-v2 tidak memiliki skor publik yang setara. Kartu model melaporkan EditVerse 8.02, OpenVE 3.96, OpenS2V 63.83, dan VBench 84.46 — semuanya dilaporkan vendor, dan semuanya metrik sisi video. Tidak ada apa pun di kartu yang akan dikenali pembeli gambar sebagai hasil papan peringkat teks-ke-gambar atau pengeditan gambar. Kartu tersebut memang mengklaim bahwa Bernini mencapai "tingkat pertama" dari model komersial tertutup dalam arena pairwise buta internal ByteDance — yang persis merupakan jenis penilaian mandiri vendor yang perlu pemeriksaan independen sebelum berarti apa pun.
• MAI-Image-2.5-Pro: Elo editing 1.272 (independen, ~6.100 suara); Elo text-to-image 1.292 (independen, ~11.500 suara)
• Bernini-Diffusers-v2: tidak ada benchmark gambar publik; hanya metrik sisi video, dilaporkan vendor

Dua teori pengeditan yang berbeda
Kedua model dibangun di sekitar gagasan bahwa pengeditan tidak seharusnya berarti menghasilkan ulang adegan. Namun, keduanya mencapai hal tersebut dengan cara yang berbeda.
MAI-Image-2.5-Pro adalah jargon Microsoft untuk "editan presisi dan bedah dengan konsistensi": ubah satu objek, perbarui teks di dalam gambar, bersihkan keburaman gerak, dan pertahankan semua elemen lain — identitas subjek, pencahayaan, tekstur — tetap stabil. Konsistensi itulah mekanisme di balik klaim konsistensi karakter multi-gambar sebesar 94% (dilaporkan vendor, belum diverifikasi). Tujuan produknya adalah model yang melakukan edit terbatas dan berhenti di situ.
Bernini-Diffusers-v2 adalah pipeline plan-then-render: perencana Qwen2.5-VL menguraikan instruksi menjadi langkah-langkah semantik — ubah cuaca, ganti gaya, sisipkan objek, pertahankan subjek — dan renderer menggambar hasilnya. Desain ini ditujukan untuk instruksi multi-langkah yang kompleks, dan bobot yang sama mencakup tugas text-to-image, image-to-image, dan video (t2i, i2i, t2v, v2v, rv2v, r2v). Luasnya cakupan itu adalah kelebihannya; biaya yang belum terukur adalah bahwa perencana 7B merupakan hambatan nyata untuk suntingan yang sangat halus, dan tidak ada seorang pun di luar ByteDance yang mengukur seberapa baik ia menanganinya.

Perenderan teks, medan pertempuran yang praktis
Teks dalam gambar adalah tempat editor gambar modern membuktikan nilainya, dan di sini asimetrinya sangat mencolok. Kemampuan utama MAI-Image-2.5-Pro adalah rendering teks yang presisi — Microsoft mengklaim akurasi 96,8% pada bahasa Inggris, Mandarin, Jepang, Korea, dan Spanyol (dilaporkan vendor; dokumen yang sama membatasi output hingga sekitar satu megapiksel, jadi anggap angka tersebut sebagai indikasi arah). Bernini-Diffusers-v2 tidak mengumumkan akurasi rendering teks sama sekali. Untuk alur kerja yang menghasilkan iklan yang dilokalkan, kemasan, atau apa pun yang berisi kata yang terbaca, satu kandidat menawarkan klaim yang terukur dan yang lainnya menawarkan tidak ada apa-apa.
Biaya, dan bentuk tagihannya
• MAI-Image-2.5-Pro — $5 per juta token input teks, $8 per juta token input gambar, $106 per juta token output gambar. Biaya per gambar tidak dipublikasikan; konversi Artificial Analysis memperkirakan gambar 1024×1024 sekitar $108,50 per 1.000. Harga pratinjau, dapat berubah saat GA.
• Bernini-Diffusers-v2 — bobotnya gratis, tetapi self-hosting berarti memerlukan perangkat keras kelas H100 (atau sewa cloud), operasi untuk menjaganya tetap berjalan, dan penskalaan Anda sendiri. Ekonominya membalik model API: mahal untuk sepuluh gambar sehari, murah untuk volume besar.
Bagi sebagian besar tim, penyampaian yang jujur adalah: total biaya kepemilikan Bernini hanya menguntungkan jika Anda sudah menjalankan armada GPU dan beban kerjanya besar serta stabil. Jika tidak, API terukur dengan tarif premium adalah kegagalan yang lebih murah.

Apa yang dapat dan tidak dapat dilakukan router di sini
Tidak ada satu pun model yang dapat dirutekan melalui OrcaRouter saat ini, dengan alasan yang bertolak belakang: MAI-Image-2.5-Pro berada di balik pratinjau langsung Microsoft Foundry, dan Bernini-Diffusers-v2 sama sekali bukan endpoint — melainkan bobot. Ini penting sebagai prinsip dalam perbandingan ini: pola router hanya berlaku untuk separuh perbandingan yang merupakan API yang dapat dipanggil. Ketika MAI-Image-2.5-Pro tersedia melalui API pihak ketiga yang dapat dipanggil, cara mengadopsinya tanpa mempertaruhkan jalur produksi pada kode pratinjau adalah dengan merutekan sebagian lalu lintas ke model tersebut, dengan model yang sudah terbukti sebagai failover otomatis — di OrcaRouter, itu berarti satu endpoint, harga penyedia diteruskan dengan markup 0%, dan fallback yang menangkap apa pun yang tidak terlihat oleh papan peringkat yang minim suara. Sisi bobot terbuka tidak memiliki padanan: Anda harus menjalankan tumpukan Bernini sendiri, atau Anda tidak menggunakannya sama sekali.
Putusan
MAI-Image-2.5-Pro adalah editor hosted premium, terukur, dan unggul: peringkat #1 di papan pengeditan independen, klaim rendering teks yang nyata, dan harga yang sepadan. Bernini-Diffusers-v2 adalah pipeline open-weights yang gratis, luas, belum terbukti dalam gambar, dan juga bisa video — sangat menarik jika Anda self-host, dan benar-benar tidak bisa diberi skor sampai seseorang menjalankan evaluasi gambar publik. Jika alur kerja Anda membutuhkan API yang dapat dipanggil dan angka yang bisa Anda pertahankan, pilihannya adalah MAI-Image-2.5-Pro atau salah satu editor hosted lain yang ia kalahkan. Jika alur kerja Anda membutuhkan kepemilikan dan Anda dapat menjalankan perangkat kerasnya, Bernini-Diffusers-v2 layak diuji — tetapi belilah sebagai taruhan pada potensi yang belum terukur, bukan sebagai pesaing untuk #1 yang sudah terukur.
