Kartu judul hero yang dihasilkan bertuliskan 'Gemini 3.1 Pro vs Qwen3.8-27B', dengan subjudul 'Pratinjau tujuh bulan vs checkpoint yang dapat Anda unduh', dengan dua kartu: Gemini 3.1 Pro, dalam pratinjau sejak 19 Februari 2026, dengan harga $2,00 input dan $12,00 output per 1 juta token dan Artificial Analysis Intelligence Index 29,7, dibandingkan dengan Qwen3.8-27B, bobot terbuka sejak 14 Agustus 2026, dengan harga $0,50 input dan $3,00 output per 1 juta token dan indeks 33,7, dengan medali VS di antara keduanya dan logo OrcaRouter di kanan bawah. Catatan kaki: 'Artificial Analysis Intelligence Index v4.3.2, diambil 2026-09-23; harga adalah tarif daftar penyedia.'
Guides & Insights

Gemini 3.1 Pro vs Qwen3.8-27B: Pratinjau Tujuh Bulan vs Checkpoint yang Dapat Anda Unduh

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Pada 18 September 2026, pengguna di forum pengembang AI milik vendor sendiri mulai melaporkan bahwa Gemini 3.1 Pro telah lenyap dari pemilih model AI Studio — termasuk akun berbayar, meskipun cache dibersihkan dan jendela incognito digunakan. Utas yang meminta vendor menyatakan apakah itu "bug atau disengaja" masih aktif pada 21 September. Tidak ada pemberitahuan depresiasi, tidak ada jalur migrasi, dan tidak ada balasan staf. Sementara itu Qwen3.8-27B, yang dirilis open-source oleh lab tersebut pada 14 Agustus di bawah Apache 2.0, tidak dapat ditarik dari siapa pun yang telah mengunduhnya. Asimetri itulah — bukan kesenjangan benchmark, yang nyata tetapi moderat — yang sebenarnya menjadi penentu dalam pertarungan ini, dan itulah sebabnya kedua model tidak benar-benar bersaing untuk slot yang sama meskipun tabel perbandingan menempatkan keduanya berdampingan.

Berikut ini adu langsung pada angka-angka yang ada, dengan masing-masing diberi label: angka Artificial Analysis dari pengambilan pada 23 September 2026, kartu model milik Alibaba sendiri, postingan peluncuran Google, dan telemetri perutean kami sendiri, yang tetap dipisahkan sepanjang pembahasan. Jika tidak ada yang diukur, halaman ini menyatakannya alih-alih menebak.

Apa yang terjadi minggu ini, dan apa maknanya serta apa yang bukan maknanya

Laporan-laporan itu spesifik dan berasal dari forum milik Google sendiri, bukan dari blog pesaing. Sebuah utas berjudul "Gemini 3.1 Pro hilang dari AI Studio sejak 2026-09-18 — bug atau disengaja?" menggambarkan pengguna berbayar yang kehilangan model tersebut tanpa pengumuman apa pun, dukungan Google One menawarkan langkah-langkah pemecahan masalah yang tidak berkaitan, dan halaman status Google tidak menunjukkan adanya masalah. Utas kedua, "Model Gemini 3.1 Pro Preview tidak tersedia di AI Studio untuk membuat App", mengumpulkan keluhan yang sama, termasuk dari seorang pengguna yang asisten coding-nya telah dibangun di atas preview tersebut selama berbulan-bulan dan yang mengatakan Flash "membuat kode asal-asalan" pada basis kode mereka.

Tiga catatan jujur. Ini adalah penghilangan dari konsol pengembang, bukan gangguan API yang terkonfirmasi: Gemini 3.1 Pro masih terdaftar dan dapat dirutekan di katalog kami sendiri, tempat model ini memproses 94,7 juta token dalam tujuh hari terakhir. Ini dilaporkan pengguna — Google belum mengatakan apa pun, jadi tidak ada orang di luar Google yang dapat memisahkan "penghentian diam-diam" dari "masalah kapasitas" dari "bug konsol." Dan waktunya tidak menguntungkan mengingat model ini telah dalam pratinjau sejak 19 Februari 2026 — tujuh bulan, tanpa tanggal GA yang dipublikasikan, sementara Google merilis rangkaian model Flash di bawahnya. Secara terpisah, GitHub Copilot memensiunkan Gemini 3.1 Pro pada 1 September 2026 dengan pemberitahuan 30 hari, yang merupakan peristiwa berbeda dan tidak terkait, tetapi mengarah pada hal yang sama: endpoint pratinjau tanpa komitmen GA adalah dependensi yang pantas membuat Anda khawatir.

Satu angka dari sisi kami layak disandingkan dengan konteks itu, karena kami tidak dapat menjelaskannya dan lebih memilih untuk mengatakannya. Telemetri tujuh hari kami pada entri katalog Gemini 3.1 Pro menunjukkan tingkat kesalahan 80,5%; model-model di sekitarnya yang kami periksa pagi yang sama — Qwen3.8-Max, Claude Fable 5.1 — berada di 5,9% dan 6,9%. Kami tidak tahu apakah itu masalah yang sama dengan yang dilaporkan forum, minggu yang buruk bagi salah satu penyedia upstream, atau artefak instrumentasi. Anggap ini sebagai alasan untuk menjalankan canary sebelum Anda melakukan commit, bukan sebagai putusan terhadap model tersebut.

Penggaris yang sama, dua hasil yang berbeda

Inilah bagian yang paling sering salah dilakukan oleh halaman-halaman perbandingan, jadi penting untuk dilakukan dengan cermat. Artificial Analysis menilai kedua model ini pada Intelligence Index v4.3.2. Kami mengambil snapshot kedua halaman tersebut pada 23 September 2026, dan keduanya memuat revisi yang sama — jadi tidak seperti sebagian besar klaim indeks lintas model, yang ini berasal dari snapshot yang sama dan selisihnya nyata.

• Qwen3.8-27B (xhigh) — Indeks Kecerdasan 33,7

• Gemini 3.1 Pro Preview — Indeks Kecerdasan 29.7

Qwen memimpin dengan selisih empat poin pada tolok ukur saat ini. Pertanyaan yang lebih sulit adalah apa artinya, karena tolok ukurnya sendiri telah bergeser setidaknya tiga kali tahun ini. Pada Februari, Artificial Analysis menerbitkan artikel yang menyebut Gemini 3.1 Pro Preview "pemimpin baru di bidang AI," unggul empat poin dari Claude Opus 4.6, dan liputan pers saat itu melaporkan skor 57 pada apa yang kala itu Index v4.0. Pada v4.3.2, skornya 29.7. Artificial Analysis mengumumkan v4.3 pada 7 September 2026, empat hari setelah v4.2, dan revisi itu menukar Terminal-Bench 2.1 dengan Terminal-Bench 4.0 yang jauh lebih sulit dan terdiri atas 66 tugas serta menggantikan τ³-Banking dengan AutomationBench-AA. Kekuatan Gemini 3.1 Pro pada Februari terletak pada evaluasi yang dipensiunkan atau dibobot ulang oleh indeks baru. Jadi: bukan modelnya yang memburuk, melainkan ujiannya. Tetapi jika Anda memilih model hari ini, angka hari ini adalah angka yang benar-benar dapat Anda jadikan dasar tindakan, dan angka hari ini menguntungkan Qwen.

Di mana keduanya benar-benar berbeda

Skor agregat menyembunyikan bentuk perbedaannya, dan bentuk itulah bagian yang berguna. Setiap angka di bawah ini berasal dari pengambilan yang sama pada 23 September dari halaman v4.3.2 Artificial Analysis untuk kedua model, pada revisi yang sama.

• Penalaran dan pengetahuan — Gemini jelas unggul. GPQA Diamond 94,1 vs 90,5; Humanity's Last Exam 47,0 vs 33,9; SciCode 58,7 vs 46,6; CritPt 17,7 vs 5,4.

• Tugas pekerjaan dunia nyata — Qwen unggul, dan jauh. GDPval ternormalisasi 45,4% vs 13,8%.

• Perbankan dan transaksi agentik — Qwen unggul. τ-Banking 48,0 vs 21,4 milik Gemini.

• Penggunaan alat agentik pada tolok ukur umum — Gemini unggul di area yang tidak diukur untuk Qwen. τ²-Bench 95,6 untuk Gemini; tidak ada angka Qwen3.8-27B.

• Pekerjaan terminal — berdekatan, dan keduanya buruk pada benchmark baru. Terminal-Bench 2.1: Qwen 79,8, Gemini 73,8. Terminal-Bench 4.0: Qwen 5,6%, Gemini 4,0% — keduanya satu digit.

• Kalibrasi — perbedaan paling tajam di kedua halaman. Pada AA-Omniscience, Gemini mendapat skor 31,9 dengan akurasi 54,9% dan tingkat halusinasi 50,9%; Qwen mendapat skor −10,0 dengan akurasi 15,6% dan tingkat halusinasi 30,3%. Gemini lebih banyak tahu dan mengarang lebih dari separuh waktu; Qwen sering menolak menjawab dan berhalusinasi pada sekitar sepertiga dari hal yang dijawabnya.

• Konteks panjang — imbang pada recall konteks panjang, masing-masing 82,0. Pada recall konteks panjang multimodal, Qwen 21,7% vs Gemini 15,6%.

Bacalah entri "tidak diukur" sebagai apa adanya. Gemini tidak memiliki angka ternormalisasi GDPval-AA yang dipublikasikan untuk dibandingkan dengan 45,4% milik Qwen, dan Qwen tidak memiliki angka τ²-Bench, IFBench, Terminal-Bench Hard, atau ITBench-SRE untuk dibandingkan dengan 77,1, 53,8, dan 30,3 milik Gemini. Masing-masing kekosongan itu adalah tempat di mana tabel ringkasan akan diam-diam menobatkan pemenang.

A generated two-column scoreboard headed 'Gemini 3.1 Pro vs Qwen3.8-27B — the scoreboard', with the same six dimension labels in both columns. Gemini 3.1 Pro: AA Index 29.7, price per 1M $2.00 input and $12.00 output, context 1M tokens, output speed 116.5 tokens per second, open weights no (preview API), cost to run the index $1,310. Qwen3.8-27B: AA Index 33.7, price per 1M $0.50 input and $3.00 output, context 262K native, output speed 41.3 tokens per second, open weights yes (Apache 2.0), cost to run the index $1,336. Footer: 'Artificial Analysis Intelligence Index v4.3.2, captured 2026-09-23; prices are provider list rates.'

Divergensi yang menentukan anggaran: biaya yang sama untuk menjalankan indeks

Qwen3.8-27B jauh lebih murah per token. Berdasarkan angka pasar yang dipublikasikan Artificial Analysis, harganya $0,50 per juta input dan $3,00 per juta output dengan diskon cache 80% serta tarif campuran 7:2:1 sebesar $0,47. Gemini 3.1 Pro Preview seharga $2,00 dan $12,00 — empat kali harga input dan empat kali harga output — dengan diskon cache 90% dan tarif campuran $1,74.

Lalu angka yang tak seorang pun cetak: perhitungan Artificial Analysis sendiri menempatkan biaya menjalankan seluruh Intelligence Index pada $1.310,21 untuk Gemini 3.1 Pro Preview dan $1.335,92 untuk Qwen3.8-27B. Qwen tidak lebih murah untuk dijalankan. Ia justru sedikit lebih mahal, karena menghabiskan waktu lebih lama untuk sampai ke sana. Dari tagihan keluaran Qwen, $512,36 adalah token penalaran berbanding $82,51 untuk jawaban sebenarnya; sedangkan pada Gemini, $691,82 adalah penalaran berbanding $113,08 untuk jawaban. Harga per token hanyalah tarif, bukan tagihan.

Dua fakta harga lagi yang dihilangkan tabel perbandingan. Pertama, harga Gemini 3.1 Pro berjenjang berdasarkan ukuran masukan setiap permintaan: $2,00/$12,00 hingga 200K token masukan, lalu $4,00/$18,00 di atasnya, dengan pembacaan cache menjadi dua kali lipat dari $0,20 menjadi $0,40. Jendela konteks satu juta token itu nyata, tetapi 800.000 token terakhirnya berbiaya dua kali lipat. Kedua, entri katalog kami sendiri untuk Qwen3.8-27B — disajikan block-FP8, menara visi pada presisi penuh — mencantumkan $0,40 masukan dan $4,21 keluaran, yang lebih murah pada masukan dan lebih mahal pada keluaran daripada angka pasar di atas, dan sama sekali tidak menerbitkan tarif token cache. Penyedia berbeda, pembagian berbeda. Periksa tarif yang sebenarnya akan ditagihkan kepada Anda.

Kedua model dapat diakses melalui satu kunci OrcaRouter pada harga daftar penyedia dengan markup 0%, sehingga perubahan harga vendor sampai ke sisi kami pada hari yang sama, bukan setelah siklus penetapan harga ulang — hal ini lebih penting dari biasanya ketika salah satu dari keduanya memiliki batas tier yang berada di 200K token.

Latensi: token pertama tercepat dimiliki oleh model yang lebih lambat.

Ini adalah pasangan angka yang paling menyesatkan dalam keseluruhan perbandingan, dan justru inilah yang paling mungkin membuat pembaca mengambil tindakan yang salah.

• Waktu hingga chunk pertama — Qwen 4,04 detik vs Gemini 28,37 detik. Qwen tampak tujuh kali lebih cepat.

• Waktu hingga jawaban sebenarnya — Gemini 28,37 dtk vs Qwen 52,52 dtk. Gemini menang sekitar 1,8x, karena Qwen menghabiskan 48,48 detik untuk berpikir antara potongan pertama dan token jawaban pertama.

• Kecepatan keluaran — Gemini 116,5 token per detik vs Qwen 41,3. Gemini 2,8x lebih cepat setelah mulai menulis, dibandingkan median pembanding yang menurut Artificial Analysis berada di 95,4 token per detik. Halaman Qwen sendiri menyebutnya "lambat secara mencolok."

Jika produk Anda mengalirkan token pertama ke pengguna, latensi utama Qwen adalah kebohongan yang akan Anda katakan pada diri sendiri sekali. Jika produk Anda menunggu jawaban lengkap, Gemini adalah model yang lebih cepat. Kedua angka tersebut adalah pengukuran Artificial Analysis; keduanya diambil pada pengaturan effort xhigh Qwen, yang merupakan default kartu model.

Default tersebut menjadi keluhan yang masih hangat di kalangan praktisi, dan kartu model setengah mengakuinya. Qwen3.8-27B mengekspos parameter reasoning_effort dengan tiga tingkat — xhigh (default, "untuk tugas kompleks yang menuntut analisis menyeluruh"), medium, dan low. Tulisan-tulisan komunitas hingga September melaporkan bahwa xhigh menghasilkan fase berpikir yang sangat panjang dan merekomendasikan penurunan ke medium atau low serta pembatasan anggaran penalaran. Kartu milik Alibaba sendiri memperingatkan bahwa dalam kerja agen multi-turn, menurunkan upaya "tidak selalu mengurangi waktu penyelesaian tugas secara keseluruhan" — yang merupakan hal yang jujur untuk dikatakan oleh sebuah kartu model dan peringatan bahwa perbaikan yang tampak jelas tidak selalu menjadi solusinya.

Konteks: 1M vs 262K, dan apa yang sebenarnya muat

Gemini 3.1 Pro memiliki jendela konteks 1.000.000 token dengan keluaran maksimum 65.536 token. Qwen3.8-27B memiliki 262.144 token secara native, dapat diperluas hingga 1.000.000 dengan penskalaan YaRN, dengan anggaran terpisah yang direkomendasikan di dalamnya: konten penalaran hingga 262.144 dan respons akhir hingga 131.072.

Dua catatan kaki yang jujur. Tabel spesifikasi Artificial Analysis mencantumkan jendela Qwen sebagai 256.000, sementara teks FAQ-nya sendiri menyebut 260K dan kartu modelnya menyebut 262.144 — itu semua perbedaan pembulatan pada angka yang sama, tetapi kutiplah 262.144 karena itulah yang tertulis di kartu model. Dan perluasan ke 1M adalah teknik penskalaan, bukan hal yang sama dengan jendela sejuta token native: recall konteks panjang pada 1M dengan model yang diperluas YaRN bukanlah yang diukur oleh angka AA-LCR 82,0. Belum ada yang menerbitkan skor recall konteks 1M untuk Qwen3.8-27B. Perlakukan jendela Gemini sebagai jendela dengan perilaku yang terukur pada panjang penuh, dan jendela Qwen sebagai jendela yang harus Anda uji sendiri sebelum merancang berdasarkan jendela itu — dan ingat bahwa setelah 200K token masukan, harga Gemini menjadi dua kali lipat.

Kerja agentik dan pemanggilan alat

Di sinilah perbandingan ini benar-benar belum tuntas, dan di sinilah pemenang yang dibuat-buat akan mudah sekaligus keliru. Qwen3.8-27B memiliki skor agentik terukur yang tidak dimiliki Gemini, dan sebaliknya.

Argumen Qwen bertumpu pada angka independen yang kuat dan angka vendor yang kuat. Angka independennya adalah τ-Banking pada 48,0 versus 21,4 milik Gemini — lebih dari dua kali lipat, pada revisi yang sama, dalam benchmark tentang penggunaan alat multi-langkah di lingkungan perbankan. Angka vendornya adalah kartu model milik Alibaba sendiri, yang mencantumkan OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9, CoWorkBench 70,7, JobBench 33,4, dan Agents' Last Exam 20,4 Pass@1. Itu adalah evaluasi Alibaba, yang tidak dijalankan ulang oleh pihak lain, dan semuanya berada tepat di kategori-kategori yang hasil GDPval yang diukur secara independen (45,4% ternormalisasi vs 13,8%) mengarah ke arah yang sama.

Argumen Gemini adalah bahwa ia memiliki satu angka agentik absolut yang tinggi dalam perbandingan — τ²-Bench 95,6 — dan Qwen tidak memiliki skor τ²-Bench sama sekali. Ia juga memiliki IFBench 77,1 untuk mengikuti instruksi, satu lagi yang kosong di sisi Qwen. Dan ia memiliki rekam jejak produksi tujuh bulan yang tidak dimiliki oleh rilis open-weights berusia lima minggu.

Penentunya bukan skor, melainkan topologi Anda. Keunggulan agentik Qwen diukur pada tolok ukur ketika model beroperasi di dalam sistem perangkat lunak besar yang sudah ada dan tidak dirancangnya. Keunggulan Gemini diukur pada tolok ukur ketika model harus mengikuti instruksi secara tepat dalam jangka panjang. Itu keterampilan yang berbeda dan keduanya nyata.

A screenshot of the Artificial Analysis comparison page for Gemini 3.1 Pro Preview against Qwen3.8-27B, showing an Intelligence Index of 29.7 for Gemini 3.1 Pro Preview and 33.7 for Qwen3.8-27B on revision v4.3.2, with blended price rows of $1.74 and $0.47 per 1M tokens, cost per task of $1.01 and $0.67, cost to run the full Intelligence Index of $1,310 and $1,336, and the output-token breakdown beneath.

Pengodean

Pengodean terbagi dengan cara yang sama, itulah sebabnya "mana yang lebih baik dalam hal kode" tidak punya jawaban yang jelas di sini. Gemini memimpin di ujung komputasi ilmiah — SciCode 58,7 vs 46,6 — dan AA Coding Index-nya sebesar 68,8 di halaman katalog kami berada dalam kesalahan pembulatan dari 68,1 milik Qwen, jauh di dalam interval kepercayaan mana pun yang layak dikutip. Pada pekerjaan terminal agentik, keduanya berdekatan pada tolok ukur lama, Qwen 79,8 vs Gemini 73,8 pada Terminal-Bench 2.1, dan tak dapat dibedakan pada tolok ukur yang lebih baru, di mana keduanya merosot ke satu digit.

Kartu Alibaba mengklaim jauh lebih banyak — SWE-bench Pro 61,7, LiveCodeBench v6 90,3, QwenSWEBench 79,0 — tetapi angka-angka itu dilaporkan vendor, dan catatan kaki kartu tersebut menyebutkan bahwa SWE-bench Pro dan QwenSWEBench dijalankan dalam harness Claude Code, yang bukan harness yang akan digunakan untuk angka pesaing. Pernyataan yang aman adalah bahwa pada satu-satunya tolok ukur coding yang model kedua lab diukur oleh pihak ketiga, keduanya terpaut empat poin pada Terminal-Bench 2.1 dan 1,6 poin pada Terminal-Bench 4.0, dan keduanya buruk pada yang lebih sulit.

Bobot terbuka versus endpoint pratinjau

Inilah poros di mana keduanya sama sekali tidak dapat dibandingkan, dan inilah poros yang memiliki konsekuensi praktis paling besar.

Qwen3.8-27B berlisensi Apache 2.0, memiliki 27B parameter dense dan 64 lapisan, dengan hibrida linear attention Gated DeltaNet dan full attention pada rasio kira-kira 3:1 — desain yang membuat jendela 262K terjangkau untuk dilayani. Model ini berjalan. Saat dikuantisasi ke 4-bit, model ini muat dalam sekitar 17GB, yang setara dengan satu GPU konsumen; sebuah ekosistem kompresi lengkap tumbuh di sekitarnya dalam waktu lima minggu, dari Dynamic V3 quants milik Unsloth, termasuk build 1-bit yang menurut Unsloth berjalan di 8GB dengan sekitar 77% akurasi aslinya, hingga Ternary Bonsai 2 27B milik PrismML pada pertengahan September. Anda dapat melakukan fine-tuning, mengauditnya, dan menjalankannya di laptop dengan jaringan terputus.

Gemini 3.1 Pro adalah endpoint pratinjau tertutup, berusia tujuh bulan, tanpa tanggal GA, kartu model yang secara eksplisit memperingatkan bahwa pratinjau mungkin tidak memiliki stabilitas, ketersediaan, dan dukungan seperti rilis stabil, dan — per minggu ini — konsol pengembang yang tampaknya telah ditinggalkannya secara diam-diam. Anda tidak dapat mengunduhnya, Anda tidak dapat menyematkan versinya, dan Anda tidak dapat melakukan failover ke diri Anda sendiri.

Jika Anda menginginkan jawaban routing yang jujur alih-alih sebuah vonis: keberadaan checkpoint terbuka itulah yang membuat dependensi Gemini tetap bisa bertahan. Tempatkan Qwen3.8-27B di belakang jalur lokal atau self-hosted sebagai fallback, pertahankan Gemini 3.1 Pro di jalur utama untuk pekerjaan berat penalaran yang secara terukur memang lebih unggul, dan tempatkan keduanya di belakang satu endpoint dengan failover otomatis sehingga hilangnya secara diam-diam dari konsol orang lain menjadi insiden yang diserap lapisan routing Anda, bukan gangguan yang dilihat pengguna Anda. Itu bukan promosi untuk sebuah produk — itu satu-satunya konfigurasi yang membuat berita minggu ini tidak menghabiskan akhir pekan Anda.

Pilih Gemini 3.1 Pro jika

• Pekerjaan tersulit Anda adalah penalaran yang padat pengetahuan, bukan penggunaan alat jangka panjang — ini unggul pada GPQA Diamond 94,1 atas 90,5, Humanity's Last Exam 47,0 atas 33,9, SciCode 58,7 atas 46,6 dan CritPt 17,7 atas 5,4.

• Anda memerlukan masukan yang benar-benar panjang. Jendela satu juta token yang terukur, dengan perilaku recall yang diuji secara mendalam, mengalahkan jendela 262K yang diperluas dengan teknik — asalkan Anda dapat menerima harga yang berlipat ganda setelah melewati 200K token masukan.

• Waktu untuk menyelesaikan jawaban lebih penting daripada waktu untuk token pertama, dan Anda menginginkan 116,5 token per detik, bukan 41,3.

• Anda memerlukan multimodalitas yang luas saat ini: input audio, file, gambar, teks, dan video versus teks, gambar, dan video Qwen.

• Anda bersedia menerima risiko pratinjau, dan Anda memiliki cadangan yang Anda kendalikan.

Pilih Qwen3.8-27B jika

• Agen Anda beroperasi di dalam sistem besar yang sudah ada — τ-Banking 48,0 hingga 21,4 dan GDPval 45,4% hingga 13,8% yang dinormalisasi adalah dua keunggulan model tunggal terbesar di mana pun dalam perbandingan ini.

• Anda memerlukan jawaban yang jujur, bukan sekadar percaya diri. Tingkat halusinasi 30,3% dibandingkan 50,9% milik Gemini adalah jenis produk yang berbeda.

• Aturan lisensi atau residensi data menutup kemungkinan penggunaan API tertutup, atau Anda perlu melakukan fine-tuning pada data Anda sendiri.

• Anda menginginkan tagihan per token seperempat dari Gemini dan menerima bahwa Anda akan membelanjakan selisihnya untuk token berpikir — biaya menjalankan indeks sama di keduanya.

• Anda siap menyetel reasoning_effort turun dari xhigh default alih-alih mengirimkannya apa adanya.

Yang tidak dapat kami verifikasi

Untuk catatan, dan karena halaman perbandingan hanya sebaik bagian yang kosong di dalamnya: tidak ada evaluasi independen yang telah dipublikasikan untuk Qwen3.8-27B pada upaya penalaran yang dikurangi, sehingga pertukaran antara kecepatan dan kualitasnya pada sedang dan rendah belum terukur. Tidak ada skor recall konteks panjang untuk konfigurasi 1M yang diperluas dengan YaRN. Gemini 3.1 Pro tidak memiliki skor GDPval-AA ternormalisasi yang dipublikasikan, dan Qwen3.8-27B tidak memiliki skor untuk τ²-Bench, IFBench, atau ITBench-SRE. Dan tidak ada siapa pun — termasuk Google — yang menjelaskan mengapa Gemini 3.1 Pro keluar dari pemilih AI Studio pada 18 September. Kami akan memperbarui halaman ini ketika salah satu dari hal-hal tersebut berubah.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (obsidian/qwen3.8-27b), showing Vision, Tools, JSON and Reasoning badges, a 2026-08-15 catalogue date, a 262K-token context window, list pricing of $0.40 input and $4.21 output per 1M tokens with no cached-token rate published, a p50 time to first token of 3.92s and a p95 of 10.00s over seven days, 1023.1M tokens of traffic in the same window, and a description noting the model is served in block-FP8 with the vision tower kept at full precision.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari