
Ling-3.1-flash vs Gemini 3.8 Flash: Model Uji Coba 256K Melawan Model Live 1 Juta Token
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 219 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Tempatkan Ling-3.1-flash dan Gemini 3.8 Flash berdampingan, dan ketidakcocokannya bukan soal kecerdasan — melainkan soal status. Ling-3.1-flash, model mixture-of-experts milik Ant Group dengan ~560B parameter yang diumumkan pada 29 hingga 30 September 2026, adalah uji coba gratis dua minggu dengan konteks yang dilayani 256K, batas output 32.768 token, input hanya teks, serta tanpa bobot, lisensi, atau harga yang dipublikasikan. Gemini 3.8 Flash, model penalaran tingkat Flash milik Google yang dirilis pada 2 September 2026, adalah API ketersediaan umum dengan jendela penuh 1.048.576 token, output 65.536 token, input multimodal, dan daftar tarif publik. Di atas kertas, itu adalah perbandingan dua model; dalam praktiknya, itu adalah perbandingan antara model yang dapat Anda bangun hari ini dengan model yang hanya dapat Anda uji bulan ini.
Itu bukan alasan untuk mengabaikan Ling-3.1-flash. MoE 560B gratis dengan kecenderungan agentik layak mendapat dua minggu waktu evaluasi siapa pun. Tetapi itu mengubah untuk apa adu langsung dilakukan: bukan "mana yang harus saya jadikan standar," melainkan "apakah model uji coba itu cukup baik sehingga saya harus melakukan lindung nilai atas jawabannya lima belas hari dari sekarang." Itu pertanyaan yang berbeda, dan keduanya memiliki jawaban yang berbeda pada setiap sumbu di bawah ini.
Tiga hal yang menentukan hasilnya sebelum benchmark mana pun melakukannya
Sebagian besar perbandingan dimulai dengan skor. Yang ini seharusnya dimulai dengan ketersediaan, karena kesenjangan di sana bukan soal derajat.
• Harga — Ling-3.1-flash gratis selama masa uji coba dan sama sekali tidak memiliki kartu tarif pasca-uji coba yang dipublikasikan. Gemini 3.8 Flash tercantum pada $0,75 per juta token masukan dan $3,75 per juta token keluaran selama periode promosinya, kembali ke $1,50 / $7,50 pada 1 Januari 2027. Harga daftar yang dilaporkan vendor; keduanya dapat berubah.
• Konteks — Ling-3.1-flash melayani 262.144 token dalam uji coba, dengan 1.000.000 disebut sebagai target akhirnya. Gemini 3.8 Flash melayani 1.048.576 token penuh hari ini. Jika beban kerja Anda bergantung pada jendela sejuta token, hanya satu dari keduanya yang memilikinya sekarang.
• Bobot — Ling-3.1-flash tidak ada yang dipublikasikan: tidak ada repositori, tidak ada lisensi, tidak ada checkpoint, hanya niat yang dinyatakan untuk open-source setelah uji coba. Gemini 3.8 Flash tertutup dan akan selalu begitu, tetapi ini adalah API terkelola yang dapat Anda panggil tanpa ambiguitas hari ini.
Dibaca bersama, ketiganya menyampaikan satu poin: keunggulan utama model Ling bersifat promosional (gratis) atau prospektif (konteks 1M, bobot terbuka), sedangkan keunggulan model Gemini bersifat kontraktual. Asimetri itu merasuki semua yang menyusul.
Di mana model Ling benar-benar unggul
Dua tempat, dan keduanya nyata.
Yang pertama adalah biaya selama evaluasi. Uji coba gratis dua minggu pada model sebesar ini bukan gimmick pemasaran yang bisa diabaikan — ini cara termurah untuk mengetahui apakah mixture-of-experts 560B mampu menangani prompt Anda. Gemini 3.8 Flash, berapa pun harganya, tidak gratis, dan evaluasi serius dengan beberapa ribu panggilan membutuhkan uang sungguhan.
Yang kedua adalah lintasan keterbukaan. Ling-3.1-flash adalah penerus model yang memang merilis bobot berlisensi MIT, dan Ant telah menyatakan secara publik bahwa mereka juga berniat menjadikan model ini open-source. Jika itu terwujud dengan lisensi yang permisif, Anda mendapatkan sesuatu yang tidak akan pernah bisa ditawarkan Gemini 3.8 Flash: opsi untuk self-host, fine-tune, atau melakukan distilasi pada model dasar 560B. Jebakannya justru yang paling penting — Anda bertaruh pada sebuah janji, dan janji generasi sebelumnya ditepati dengan penundaan dua minggu, bukan jaminan.
Di mana Gemini 3.8 Flash tidak mendekati kekalahan
Singkirkan persidangan dan pertanyaan keterbukaan, dan perbandingan operasionalnya menjadi timpang ke arah Google.
• Input — Gemini 3.8 Flash menerima teks, gambar, video, berkas, dan audio. Ling-3.1-flash menerima teks dan mengembalikan teks. Untuk alur kerja dokumen, tangkapan layar, atau video, ini bukan soal preferensi, melainkan batas kemampuan.
• Batas keluaran — 65.536 token versus 32.768. Relevan begitu Anda menghasilkan laporan, file kode, atau keluaran terstruktur panjang dalam satu kali proses.
• Throughput — pengujian independen menempatkan kecepatan keluaran median Gemini 3.8 Flash di sekitar 249 token per detik, dengan telemetri tujuh hari milik OrcaRouter sendiri mengukur 552 token per detik pada p50 4,95 detik untuk token pertama. Hosting uji coba Ling-3.1-flash dilaporkan sekitar 63 token per detik. Model Gemini berada di kelas kecepatan yang berbeda.
• Kedalaman referensi — Gemini 3.8 Flash memiliki sekumpulan pengukuran independen yang mendukungnya; angka-angka Ling-3.1-flash semuanya berasal dari pihak pertama, pada endpoint yang benar-benar baru, dengan belum ada pihak ketiga yang menjalankannya ulang.
• Agen multimodal — apa pun yang harus membaca tangkapan layar, PDF, atau panggilan yang direkam adalah tugas Gemini karena konstruksinya, bukan karena kualitasnya.

Benchmark, dan mengapa kedua set itu sebenarnya tidak dapat dibandingkan
Angka yang dilaporkan vendor untuk Ling-3.1-flash adalah agregat 81,0 pada lima benchmark agen, dengan 40,4% pada Terminal-Bench 4.0, 55,9% pada SWE-Atlas, dan 65,35% pada HealthBench Professional; laporan Ant sendiri menambahkan 1.673 Elo pada GDPVal-AA v2.1 dan 75,16 pada FrontierSWE. Setiap angka itu adalah hasil pengukuran Ant. Tidak ada harness yang dipublikasikan dan, yang lebih penting lagi, tidak ada bobot yang bisa dipakai siapa pun untuk menjalankan ulang suite tersebut.
Gambaran Gemini 3.8 Flash berbeda jenis. Pada build Intelligence Index Artificial Analysis saat ini (v4.3.2), skornya adalah 40.9 pada upaya penalaran tinggi, 39.8 pada sedang, dan 33.5 pada rendah — dan perlu dicatat bahwa indeks tersebut baru-baru ini direvisi, sehingga angka yang diterbitkan tentang model ini pada awal musim gugur dihitung pada build yang berbeda dan tidak dapat dibandingkan secara langsung dengan angka-angka ini. Klaim Google sendiri untuk model ini mencakup 54.9 pada HLE-Verified dan hasil Terminal-Bench 2.1 yang kuat di kisaran 80-an tinggi. Angka independen dan vendor, berdampingan, keduanya sah, tidak dapat dipertukarkan satu sama lain.
Ada satu perbandingan silang yang bersih yang layak dilakukan, karena keduanya berada pada keluarga benchmark yang sama. Pada Terminal-Bench 4.0, angka vendor Ling-3.1-flash adalah 40.4%. Claude Sonnet 5.5 — model kelas menengah, bukan andalan — mencetak 70.6% pada versi yang sama. Baris tunggal itu adalah argumen terkuat untuk menolak membaca kartu Ant sebagai "frontier-adjacent": model ini kompetitif pada ukuran agentik yang dipilih Ant untuk ditonjolkan dan jelas tertinggal pada ukuran pengodean terminal di mana angka dari luar tersedia.

Bentuk praktis dari pilihan tersebut
Jika Anda perlu membangun sesuatu dalam dua minggu ke depan, jawabannya tidaklah tipis dan ini bukan celaan terhadap Ling-3.1-flash. Gemini 3.8 Flash adalah satu-satunya dari keduanya yang memberi Anda endpoint yang stabil, harga yang dipublikasikan, jendela satu juta token penuh, input multimodal, dan lisensi yang dapat Anda baca. Ini adalah model tingkat Flash yang siap produksi.
Ling-3.1-flash adalah target evaluasi. Nilainya saat ini adalah bahwa evaluasinya gratis dan modelnya menarik: MoE 560B dengan hanya ~25B aktif per token adalah taruhan pada sparsitas, dan Ant memposisikannya tepat untuk beban kerja agen, pencarian, dan otomatisasi kantor yang menjadi ajang kompetisi model kelas Flash. Menjalankan prompt Anda sendiri melaluinya selama jendela uji coba bermanfaat justru karena belum ada orang di luar Ant yang melakukannya — Anda akan termasuk yang pertama memiliki pendapat non-vendor.
Pohon keputusan yang masuk akal bulan ini: arahkan produksi ke Gemini 3.8 Flash, gunakan uji coba gratis untuk menjalankan Ling-3.1-flash terhadap prompt tersulit Anda, dan pertahankan pertanyaan open-weight sebagai percabangan yang sesungguhnya. Jika bobotnya tiba secara permisif dan harga berada di dekat tier Flash, Ling-3.1-flash menjadi opsi kedua yang sungguh-sungguh — opsi yang dapat Anda host sendiri, sesuatu yang tidak akan pernah bisa dilakukan Gemini. Jika bobotnya tiba dengan syarat, uji coba berakhir dan begitu pula perbandingannya.
Menjalankan keduanya dari satu kunci, dan berterus terang tentang apa yang hilang
Gemini 3.8 Flash tersedia di katalog OrcaRouter hari ini dengan ID model google/gemini-3.8-flash, dengan harga daftar Google sendiri tanpa markup — jadi ketika tarif promosi kembali pada Januari, harga yang Anda bayarkan di sini mengikutinya secara otomatis alih-alih memerlukan kontrak baru. DeepSeek-V4.1-Flash, model kelas Flash murah lainnya yang layak diukur dalam eksperimen yang sama, berada di katalog yang sama dengan harga daftar penyedianya, sehingga uji tiga arah model uji coba terhadap opsi kelas Flash yang mapan berjalan di balik satu kunci API dengan failover otomatis di antara keduanya.
Ling-3.1-flash tidak ada di katalog kami, dan pencarian terhadap API model publik kami mengembalikan status tidak ditemukan untuk model itu dan untuk generasi sebelumnya — jadi penyampaian yang jujur adalah bahwa uji coba tersebut berjalan di tempat ia berjalan, melalui antarmuka milik vendor sendiri dan platform inferensi pihak ketiga, dan kami tidak mengklaim menghostingnya. Itulah bagian dari perbandingan ini yang paling cepat bisa berubah: model dalam uji coba gratis dengan harga yang belum diumumkan justru merupakan hal yang akan masuk ke lapisan routing begitu Ant dan para host-nya menerbitkan rate card, dan pass-through tanpa markup berarti saat hal itu terjadi, harga di sini sama dengan harga di sana.
Jadi putusannya lebih sempit daripada yang disiratkan oleh jumlah parameter. Ling-3.1-flash adalah model yang lebih ambisius dan hasil penelitian yang lebih menarik; Gemini 3.8 Flash adalah model yang bisa Anda rilis. Sampai ada lisensi dan harga, itulah keseluruhan perbedaannya — dan itu bukan perbedaan yang bisa diselesaikan oleh satu baris benchmark.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
