
GPT-Image-2.5 vs LLaDA-Image: API $30 per Juta Token Melawan Model Difusi 6B Gratis
- openaiBARUOpenAI: GPT-6 Astra2026-09-0455Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0247Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0247Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0157Kecerdasan82Koding
- AlibabaBARUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiBARUZ.ai: GLM 5.3 Flash2026-08-2646Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1849Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1541Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1251Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0547Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0347Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2140Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Kecerdasan49Koding
Tanyakan berapa seharusnya biaya pembuatan gambar, dan dua laboratorium membangun dua jawaban yang berlawanan hanya dalam selang seminggu. Pada 8 September 2026, OpenAI merilis GPT-Image-2.5 — model di balik ChatGPT Images 2.5, yang dijual melalui API sebagai GPT-Image-2.5 Flare dan GPT-Image-2.5 Sunburst — dengan harga pada kartu token $8 per juta token input gambar dan $30 per juta token output gambar. Lima hari sebelumnya, pada 4 September, inclusionAI (laboratorium yang didukung Ant Group di balik keluarga bahasa LLaDA) secara diam-diam merilis LLaDA-Image, generator dan editor gambar diffusion-transformer dengan enam miliar parameter yang bobotnya dapat diunduh tanpa biaya. Yang satu adalah model gambar paling kuat secara komersial yang pernah OpenAI taruh di balik meteran token; yang lainnya adalah upaya untuk membuktikan bahwa model gambar yang kuat dapat dibangun dengan resep pelatihan terbuka dan diberikan secara gratis. Membandingkan keduanya bukanlah sekadar pertarungan langsung, melainkan keputusan tentang definisi biaya mana yang sebenarnya Anda bayarkan.
Hampir setiap angka di sisi GPT-Image-2.5 dilaporkan oleh vendor dan belum ada satu pun yang memiliki pemeriksaan independen: OpenAI mengatakan Flare mengurangi latensi hingga 50% dibandingkan GPT-Image-2 dan bahwa pengujian pihak ketiga oleh perusahaan agen Manus mengukur generasi 2–4× lebih cepat, tetapi per 9 September 2026, tidak ada model GPT-Image-2.5 yang memiliki entri di papan peringkat gambar Artificial Analysis. Angka utama LLaDA-Image sama-sama belum direproduksi — inclusionAI melaporkan 53.53 Inggris / 53.38 Tionghoa pada Qwen-Image-Bench, pertama di antara model bobot terbuka saat rilis — dan karena model ini tidak memiliki API yang dihosting, model ini tidak dapat muncul di papan peringkat khusus API sama sekali. Kedua sisi perbandingan ini bertumpu pada klaim pembuatnya sendiri, yang perlu diingat selama membaca sisa tulisan ini.
Dua model yang nyaris berbagi kategori
GPT-Image-2.5 adalah model gambar tertutup yang di-hosting dalam garis keturunan yang sama dengan ChatGPT Images 2.0 dari April 2026. Model ini multimodal pada sisi input dan menghasilkan gambar yang menurut OpenAI lebih tajam dalam detail halus, lebih alami dalam pencahayaan dan tekstur, serta lebih stabil dalam pengeditan multi-giliran — endpoint Sunburst ada khusus untuk pekerjaan produksi yang intensif pengeditan di mana generasi yang lebih lambat dapat diterima sebagai ganti kontrol instruksi yang lebih ketat, sementara Flare adalah default cepat untuk generasi volume tinggi. Output mencapai hingga 2048×2048 dan 3840×2160, latar belakang transparan didukung, dan setiap output membawa metadata provenans C2PA plus tanda air tak terlihat.
LLaDA-Image adalah rilis terbuka bergaya riset yang dibangun di atas taruhan yang sama sekali berbeda. Jika GPT-Image-2.5 dilayani oleh infrastruktur OpenAI, LLaDA-Image adalah seperangkat bobot yang Anda jalankan sendiri: transformer difusi (DiT) dengan 6 miliar parameter di sisi pembangkitan — catatan model mencatat sekitar 7 miliar parameter setelah sisi bahasa dihitung — dipasangkan dengan LLaDA 2.0-mini, model bahasa difusi mixture-of-experts dengan total 16B / 1B aktif, sebagai sisi "pemahaman" yang mengubah prompt teks atau instruksi penyuntingan menjadi sinyal yang diikuti DiT. Klaim yang tidak biasa dalam laporan arXiv (2609.03796) adalah resep pelatihannya: lebih dari 90% dari sekitar 220 juta sampel kumulatif pra-pelatihan dan pelatihan menengah hanya berupa gambar, dengan model visi-bahasa yang dibekukan mengekstrak semantik dari gambar tanpa label sebagai sinyal pengondisian diri, sehingga model "belajar menggambar terlebih dahulu, lalu menaati." Resolusi progresif membawa pelatihan dari 256×256 melalui 512×512 hingga penyetelan halus 1024×1024, diikuti oleh pelatihan campuran teks-ke-gambar dan penyuntingan, serta distilasi beberapa langkah TwinFlow yang menghasilkan varian LLaDA-Image-Turbo.
Untuk apa masing-masing sebenarnya mahir.
Pitch GPT-Image-2.5 adalah presisi dan kontrol dengan kualitas komersial. Pengumuman OpenAI menekankan ketepatan referensi — menjaga seseorang, hewan peliharaan, atau produk tetap dikenali saat Anda mengubah latar atau gaya — serta penyuntingan yang hanya mengubah apa yang Anda minta untuk diubah, berkelanjutan di banyak putaran penyuntingan dalam satu percakapan. Rendering teks di dalam gambar disebutkan secara spesifik, termasuk penghapusan karakter Cina yang kacau yang membelenggu model gambar sebelumnya. Itulah tepatnya kemampuan yang dibutuhkan berulang kali oleh tim produk, merek, atau periklanan.
Tawaran LLaDA-Image adalah satu set bobot tunggal yang melakukan generasi dwibahasa dan pengeditan berbasis instruksi dengan resep terbuka. inclusionAI melaporkan rendering teks asli bahasa Mandarin dan Inggris, jalur pengeditan yang menyuntikkan gambar referensi melalui desain jalur ganda yang dimaksudkan untuk mempertahankan konten yang tidak dimodifikasi, dan — pada Qwen-Image-Bench — skor bobot terbuka tertinggi pada saat rilis. Peringatan jujur dari rilis tersebut adalah bahwa kualitas pengeditan perseptual masih tertinggal dari editor khusus dan penghitungan objek tetap lemah. Ini adalah model terbuka generalis, bukan produk komersial jadi.

Papan skor ini sengaja bukanlah kontes kualitas gambar — kedua model tersebut tidak pernah diperlihatkan evaluasi yang sama. Yang ditunjukkannya adalah ke mana uang dan kontrol mengalir.
Harga satu gambar adalah angka yang tidak akan diberikan oleh pihak mana pun kepadamu.
OpenAI menerbitkan kartu tarif token untuk GPT-Image-2.5 yang identik dengan milik GPT-Image-2: $8 per juta token input gambar, $30 per juta token output gambar, input gambar yang di-cache sebesar $2, dan token teks ditagih terpisah sebesar $5 per juta. Yang tidak dipublikasikannya adalah berapa banyak token yang dikonsumsi oleh sebuah gambar, yang berarti tidak ada harga resmi per gambar dan tidak ada kalkulator biaya. Pada harga yang dicantumkan AA untuk pendahulunya di papan peringkatnya — sekitar $211 per 1.000 gambar untuk GPT Image 2 pada kualitas "high" — flagship yang ditagih berdasarkan token adalah alat yang mahal pada volume besar, tetapi angka tersebut untuk GPT-Image-2, bukan 2.5, dan biaya per gambar untuk model baru ini sejatinya tidak diketahui di luar OpenAI.
LLaDA-Image memiliki masalah kejujuran yang sebaliknya. Bobotnya gratis dan kartu modelnya bertanda Apache-2.0, tetapi harga sebenarnya adalah infrastrukturnya: sebuah transformer difusi 6B membutuhkan GPU yang serius untuk varian Base 50-langkah, dan checkpoint FP8 (sekitar 49 GB dalam tata letak diffusers) adalah opsi yang praktis bagi kebanyakan pengguna. Distilasi 2–4 langkah dari LLaDA-Image-Turbo adalah konsesi terhadap kenyataan tersebut. Perkakas komunitas bergerak cepat — sebuah pull request SGLang menambahkan dukungan teks-ke-gambar, penyuntingan, sequence-parallel, dan FP8, serta paket RebelAI ComfyUI mendukung inferensi lokal terkuantisasi INT8 dan GGUF — tetapi "model gratis" tetap berarti "Andalah penyedia hostingnya." Bagi tim yang sudah menjalankan kapasitas GPU, biaya marginal LLaDA-Image mendekati nol; bagi yang lain, biaya keseluruhan untuk menyajikannya dapat melebihi tagihan API berdasarkan penggunaan begitu Anda menghitung waktu rekayasa.
Jalan yang jujur jika Anda menginginkan keduanya.
Bagi sebagian besar tim, ini bukanlah pilihan salah satu/atau. Pipeline produksi dapat menggunakan API yang di-hosting seperti GPT-Image-2.5 untuk pekerjaan yang menghadap pelanggan, padat penyuntingan, dan tidak boleh gagal, serta menyimpan model terbuka seperti LLaDA-Image untuk eksperimen, pekerjaan batch offline, dan apa pun yang tidak dapat mengirim prompt ke pihak ketiga. Pemisahan seperti ini persis merupakan bentuk masalah yang menjadi tujuan lapisan perutean dibuat — satu API yang menjangkau model-model hosting yang benar-benar Anda gunakan, harga daftar penyedia diteruskan tanpa markup, sehingga mencoba model open-weight melalui rute yang di-hosting nantinya sama biayanya dengan langsung ke penyedia tersebut. Hingga 9 September 2026, tidak ada satu pun model tersebut dalam katalog OrcaRouter: GPT-Image-2.5 saat ini hanya tersedia melalui API OpenAI (generasi sebelumnya, GPT-Image-2, sudah dirutekan), dan LLaDA-Image hanya berbobot tanpa inferensi yang di-hosting. Maksud desain tersebut tetap berlaku terlepas dari katalog saat ini.

Di atas yang mana sebaiknya Anda membangun?
Jika pekerjaan Anda adalah pembuatan gambar komersial di mana edit yang gagal dapat merusak hubungan dengan klien — bidikan produk, kreatif kampanye, citra yang konsisten terhadap referensi, sesi edit multi-putaran yang panjang — GPT-Image-2.5 adalah model yang seluruh desainnya menyasar pekerjaan tersebut, dan endpoint Sunburst adalah alasan untuk memberikan perhatian bahkan sebelum skor independen ada. Risikonya adalah ketidakjelasan harga per gambar dan fakta bahwa setiap klaim kualitas berasal dari OpenAI sendiri. Jika pekerjaan Anda adalah riset, eksperimen bervolume tinggi, generasi dwibahasa Mandarin-Inggris, atau apa pun yang harus berjalan di lingkungan Anda sendiri atau pada data Anda sendiri, LLaDA-Image adalah rilis yang lebih menarik — bobot terbuka yang sesungguhnya dengan resep yang dipublikasikan, dengan konsekuensi menjadi infrastruktur Anda sendiri dan hidup dengan skor yang belum direproduksi. Kedua model berjarak satu minggu dalam perilisan dan sangat berbeda dalam model operasionalnya; pilihan yang tepat adalah yang mana pun yang sesuai dengan biaya yang benar-benar mampu Anda bayar.

