
Union Alpha vs Gemini 3.8 Flash: Satu Punya Skor, yang Lainnya Punya Klaim
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Union Alpha dan Gemini 3.8 Flash adalah pitch yang sama yang disampaikan pada dua tingkat pembuktian yang sama sekali berbeda. Operator Union Alpha mendeskripsikannya sebagai memiliki "performa tingkat terdepan di berbagai tugas serbaguna" dan tidak menerbitkan tolok ukur, jumlah parameter, lisensi, maupun nama. Gemini 3.8 Flash dirilis dengan tabel evaluasi bertanggal, Artificial Analysis Intelligence Index, angka biaya per tugas dari penguji independen, dan jadwal harga terdokumentasi yang berlaku hingga 2027. Jika Anda memilih di antara keduanya berdasarkan apa pun selain harga, Anda memilih antara angka yang dapat Anda periksa dan kalimat yang tidak bisa.
Berdampingan, sebelum pertengkaran
• Jendela konteks — Union Alpha 262,144 token vs Gemini 3.8 Flash 1,048,576 token.
• Output maks — 131,072 token vs 65,536 token. Union Alpha menang dalam hal ini, dan ini satu-satunya sumbu struktural di mana ia menang.
• Input — teks dan gambar pada keduanya, tetapi Gemini 3.8 Flash juga menerima video, audio, dan file.
• Harga — Union Alpha $0 selama pratinjaunya vs Gemini 3.8 Flash $0,75/juta input, $3,75/juta output, $0,075/juta input yang di-cache, berlipat ganda menjadi $1,50/$7,50 pada 1 Januari 2027.
• Kontrol penalaran — tidak ada yang diekspos pada Union Alpha vs tingkat berpikir pada Gemini 3.8 Flash yang secara langsung memengaruhi kualitas maupun biaya.
• Evaluasi yang dipublikasikan — tidak ada dari operator Union Alpha vs tabel lengkap bertanggal pada Gemini 3.8 Flash.
• Asal-usul — operator anonim, tanpa bobot vs rilis bertanggal dan silsilah terdokumentasi milik Gemini 3.8 Flash.

Apa yang sebenarnya dikatakan oleh angka-angka Gemini 3.8 Flash
Gemini 3.8 Flash diluncurkan pada 2 September 2026 — rilis Flash ketiga Google dalam sekitar enam minggu, yang memberi tahu Anda betapa sebagian besar cerita model ini adalah soal irama peluncuran ketimbang terobosan. Tabel evaluator yang dipublikasikan mencantumkan kredit untuk artificialanalysis.ai dan deepmind.google di antara keduanya, jadi bacalah sebagai campuran angka independen dan vendor, bukan audit pihak ketiga yang bersih.
• AA Coding — 76.3, yang merupakan skor coding yang benar-benar kuat.
• AA Intelligence — 41.2. Perhatikan bahwa Artificial Analysis secara terpisah melaporkan 59 pada Intelligence Index dengan upaya penalaran tinggi, jadi angkanya sangat berubah tergantung pengaturan upaya; sebutkan pengaturannya atau angkanya tidak bermakna.
• GPQA Diamond — 95.3, angka tunggal tertinggi dalam perbandingan ini dengan selisih yang jauh.
• HLE-Verified — 54,9, dengan Humanity's Last Exam biasa pada 47,8.
• Terminal-Bench 2.1 — 89,4 pada tabel Google sendiri, sedikit lebih unggul dari 89,1 milik Claude Opus 5.
• Recall konteks panjang — 81.3; SciCode 56.6; tau_banking 44.9.
Throughput yang diamati — 323 token keluaran per detik selama periode tujuh hari terkini, dengan tingkat kesalahan 0,63%, median waktu hingga token pertama 3,46 detik, dan 498,5 juta token lalu lintas terukur.
Kelemahannya terdokumentasi sama baiknya dengan kelebihannya. Pada Terminal-Bench 4.0, nilainya 19,1 berbanding 51,8 milik Claude Opus 5. Pada OSWorld 2.0, ia meraih 59,0% berbanding 75,4%. Pada GDPVal-AA v2, ia tertinggal di 1545 Elo berbanding 1824. Gemini 3.8 Flash unggul pada rentang pekerjaan tertentu dan anjlok pada evaluasi agen umum yang paling sulit — yang persis merupakan jenis pola yang bisa Anda lihat dari tabel yang dipublikasikan.
Trik harga yang menjebak orang
Google membiarkan harga per token tidak berubah dari Gemini 3.7 Flash. Tagihannya tetap saja naik.
Model ini bekerja lebih keras: lebih banyak langkah penalaran, lebih banyak panggilan alat secara iteratif. Pengujian independen oleh Artificial Analysis mengukur sekitar 30% lebih banyak token keluaran per tugas dan sekitar 40% biaya lebih tinggi per tugas dibandingkan 3.7 Flash. Pada penalaran tinggi, biayanya sekitar $0,58 per tugas; sedang berada di sekitar $0,41 dan rendah di sekitar $0,24.
Ini adalah hal paling berguna dalam perbandingan ini bagi siapa pun yang menyusun anggaran, dan hal ini berlaku jauh melampaui kedua model ini: harga satuan dan biaya per tugas adalah angka yang berbeda, dan hanya salah satunya yang muncul di halaman harga. Google tetap menyediakan 3.7 Flash sebagai opsi yang lebih murah, yang merupakan pengakuan tersirat atas pergeseran tersebut.
Apa yang Union Alpha tawarkan sebagai gantinya
Union Alpha muncul di katalog pihak ketiga pada 16 September 2026 dan berjalan di tier gratis OrcaRouter. Model ini anonim — tanpa lab, tanpa bobot, tanpa lisensi, tanpa knowledge cutoff — dan gratis untuk jendela yang dinyatakan sekitar satu minggu, dengan pembatasan laju, tanpa harga pasca-pratinjau yang diumumkan.
Endpoint-nya dapat diverifikasi bahkan ketika asal-usulnya tidak dapat diverifikasi: konteks 262.144 token, output maksimum 131.072 token, input teks dan gambar dengan output hanya teks, pemanggilan tool dan output JSON, temperature, top_p, max_tokens, dan tidak ada kontrol penalaran dalam bentuk apa pun. Pilihan tool secara efektif hanya mendukung "auto".
Ada tepat satu pengukuran independen. SMF Clearinghouse menjalankan 157 tes Official A dengan reasoning dimatikan dan mencetak skor 136/157 — 86,6%, nol kesalahan, peringkat kesepuluh dari dua puluh enam. Penalaran sempurna pada 30/30, tools 2/2, coding 26/30, matematika 24/30. Penulisan berada di 2/5.
Itu bukan hasil yang buruk. Hanya saja, itu memang bukan hasil yang bisa dibandingkan. Official A adalah rangkaian umum yang luas dengan 157 tes; AA Coding dan GPQA Diamond adalah instrumen berbeda yang mengukur hal-hal berbeda pada tingkat kesulitan yang berbeda. Menempatkan 136/157 di sebelah 95,3 pada GPQA Diamond lalu menyatakan pemenangnya justru akan menjadi jenis pencucian yang membuat angka vendor tidak berguna.


Perbandingan biaya yang tak seorang pun benar-benar bisa menuntaskan
Berikut adalah contoh yang dikerjakan, dan ini sengaja tidak lengkap.
Ambil sebuah tugas yang Anda jalankan seribu kali sebulan. Pada Gemini 3.8 Flash dengan penalaran tinggi, angka per tugas yang dipublikasikan sekitar $0,58 membuatnya menjadi kira-kira $580 sebulan. Itu adalah angka yang nyata dan dapat dipertahankan, yang dibangun dari konsumsi token yang terukur.
Di Union Alpha, seribu tugas yang sama itu hari ini berbiaya $0. Berapa biayanya dalam tiga minggu tidak diketahui, karena tidak ada harga pasca-pratinjau yang tersedia. Berapa biaya keandalannya juga tidak diketahui, karena model tersebut dibatasi laju, berjalan di satu endpoint tanpa penyedia cadangan, dan menjawab dengan HTTP 429 begitu Anda melewati batas yang belum dipublikasikan oleh siapa pun.
Jadi jawaban jujurnya adalah Union Alpha menang dalam satu-satunya perbandingan biaya yang tersedia dan kehilangan kemampuan untuk memperkirakannya. Untuk uji banding sekali pakai, itu tidak masalah. Untuk pos anggaran, itu bukan angka — itu harapan yang disertai URL.
Di mana masing-masing berada
Gemini 3.8 Flash cocok di mana pun Anda memerlukan dasar yang terukur: pekerjaan dokumen konteks panjang dengan masukan video atau audio, tugas pengodean ketika skor AA Coding 76,3 adalah instrumen yang relevan, dan beban kerja apa pun yang disertai anggaran, karena Anda dapat menghitung biayanya sebelum berkomitmen dan Anda tahu biaya itu berlipat ganda pada 1 Januari 2027.
Union Alpha cocok untuk slot eksploratif — mencoba model 256K dengan kemampuan visi yang batas keluarannya dua kali lipat Gemini, untuk pekerjaan di mana endpoint yang mendadak hilang tidak merugikan Anda.
Alasan untuk menjalankannya di belakang satu endpoint alih-alih dua integrasi adalah karena perbandingan ini akan berubah bentuk berulang kali. DSL routing memungkinkan Anda menggabungkan keduanya menjadi satu panggilan — Gemini 3.8 Flash sebagai jalur terukur, Union Alpha sebagai cabang eksperimental — alih-alih menetapkan secara hard-code keputusan yang akan ingin Anda tinjau kembali saat jendela gratis ditutup atau saat harga perkenalan Google berakhir. Tidak ada dari tanggal-tanggal itu yang jauh, dan keduanya akan mengubah perhitungan.
Apa yang bisa menyelesaikannya
Satu entri bertanggal untuk Union Alpha di papan peringkat yang juga memuat Gemini 3.8 Flash. Itulah satu-satunya bagian yang hilang. Sampai saat itu, posisi yang dapat dipertahankan bukanlah "Union Alpha sebaik Gemini 3.8 Flash" — melainkan "Union Alpha gratis selama seminggu dan belum ada yang mengukurnya terhadap apa pun yang diterbitkan Google." Itu dua kalimat yang sangat berbeda, dan hanya satu di antaranya yang saat ini benar.
Separuh pasangan yang telah diukur didokumentasikan di sini: halaman model Gemini 3.8 Flashmemuat tarif $0.75/$3.75, diskon 90% untuk input yang di-cache, dan batas keluaran 65.536 token yang menentukan pekerjaan laporan panjang.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
