Kartu hero yang dihasilkan berjudul 'GPT-6.1 Sol vs Qwen3.8-Max' dengan dua panel bersudut bulat: kiri 'GPT-6.1 Sol' mencantumkan 'OpenAI - dirilis 29 Sep 2026', '$2,00 masuk / $10,00 keluar per 1Jt', '$0,72 per tugas' dan 'AA Index 51,8'; kanan 'Qwen3.8-Max' mencantumkan 'Alibaba - dirilis 3 Agu 2026', '$2,00 masuk / $6,00 keluar per 1Jt', '$5,41 per tugas' dan 'AA Index 45,4'; di bawahnya pita 'Harga input sama. Tagihannya 7,5x lipat.'; footer 'Angka: Artificial Analysis v4.3.2.' dan logo OrcaRouter di kanan bawah.
Guides & Insights

GPT-6.1 Sol vs Qwen3.8-Max: Faktur, Bukan Daftar Harga

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ambil satu pekerjaan pemeliharaan repositori malam hari, jalankan sekali setiap malam selama sebulan, lalu gunakan GPT-6.1 Sol dan Qwen3.8-Max untuk mengerjakannya secara bergantian. Berdasarkan angka per tugas Artificial Analysis v4.3.2, GPT-6.1 Sol menghabiskan biaya $21,72 untuk tiga puluh malam itu dan Qwen3.8-Max menghabiskan biaya $162,27 — selisih $140,55 per bulan, sekitar $1.690 per tahun, untuk pekerjaan yang daftar harga per tokennya tertulis $2,00 untuk input dan $10,00 untuk output versus $2,00 untuk input dan $6,00 untuk output. Tarif per juta tokennya hanya berbeda dalam galat pembulatan pada input dan model Tiongkok itu 40% lebih murah pada output, namun tagihannya berbeda dengan faktor 7,5. Vendor merilis GPT-6.1 Sol pada 29 September 2026; Qwen3.8-Max telah aktif sejak 3 Agustus 2026.

Kesenjangan itu bukan trik harga dan bukan artefak tolok ukur — itulah seluruh isi yang hendak disampaikan perbandingan ini, dan itu berasal dari satu angka yang tidak ditunjukkan oleh kartu tarif mana pun kepada Anda.

Apa yang dimaksud dengan masing-masing model

GPT-6.1 Sol adalah andalan penalaran dan pengodean OpenAI saat ini, dirilis seminggu setelah GPT-6 Sol yang digantikannya, dengan harga daftar $2,00 / $10,00 yang sama, dengan tarif input cache $0,10 dan jendela konteks 1.050.000 token. Produk ini dijual untuk pekerjaan agentik: tag best-for pada kartu model kami sendiri berbunyi penalaran, pengodean, dan agentik, dan produk ini membawa skor kualitas tingkat teratas.

Qwen3.8-Max adalah model unggulan agentik milik Alibaba — model tertutup yang hanya tersedia melalui API, menerima input teks, gambar, dan video serta memiliki konteks 1.000.000 token. Berbeda dengan rilis Qwen yang lebih kecil, model ini tidak memiliki bobot yang dipublikasikan. Di Artificial Analysis, ia berada di 45,42 pada Intelligence Index, peringkat ke-17 dari 147 model, dengan indeks coding 76,2 yang menempati peringkat ke-9 di bidang tersebut. Ini bukan model yang lemah. Ia hanya mahal untuk dibiarkan berpikir.

Nomor yang tidak tercantum di kartu tarif

A generated two-column scoreboard titled 'GPT-6.1 Sol vs Qwen3.8-Max - the scoreboard'. Left column 'GPT-6.1 Sol': Output tokens 38,128, Reasoning tokens 25,190, Cost per task $0.72, AA Index 51.8, Time per task 640 s, Context 1.05M. Right column 'Qwen3.8-Max': Output tokens 107,730, Reasoning tokens 70,830, Cost per task $5.41, AA Index 45.4, Time per task 2,152 s, Context 1M. Footer: 'Both columns Artificial Analysis v4.3.2.' OrcaRouter logo bottom-right.

Artificial Analysis mencatat 107.730 token keluaran per tugas untuk Qwen3.8-Max, yang 70.830 di antaranya adalah token penalaran. GPT-6.1 Sol menghasilkan 38.128 token keluaran, 25.190 di antaranya token penalaran. Model China ini menulis 2,8 kali lebih banyak token untuk menjawab pertanyaan yang sama, dan menuliskannya dengan biaya 40% lebih rendah per token.

• Token output per tugas — 38.128 vs 107.730; Qwen menulis 2,8× lebih banyak

• Di antaranya penalaran — 25.190 vs 70.830

• Biaya per tugas — $0,724 vs $5,409; Qwen 7,5× lebih mahal

• Waktu per tugas — 640 dtk vs 2.152 dtk; sekitar 11 menit vs sekitar 36

• Waktu hingga token jawaban pertama — 332,0 dtk vs 55,1 dtk

• Intelligence Index — 51,83 vs 45,42

• Jendela konteks — 1.050.000 vs 1.000.000 token

• Input yang diterima — teks, gambar dan file vs teks, gambar dan video

Lakukan perkaliannya dan diskonnya hilang. Model yang mengeluarkan hampir tiga kali lipat token dengan tarif 40% lebih rendah tidak lebih murah — biayanya sekitar 1,7 kali lebih besar hanya untuk output, dan angka per tugas yang terukur menempatkan kelipatan sebenarnya di 7,5 setelah input, pembacaan cache, dan panjang jawaban produktif diperhitungkan.

Perhatikan baris keempat dan kelima, karena keduanya mengarah ke arah yang berlawanan dan bersama-sama menjelaskan apa itu Qwen3.8-Max. Ia mengembalikan token pertamanya dalam 55 detik, sementara GPT-6.1 Sol membutuhkan lima setengah menit, lalu menghabiskan tiga puluh enam menit untuk menyelesaikan tugas, sedangkan model OpenAI itu selesai dalam sebelas menit. Itu adalah model yang langsung mulai berbicara dan berpikir dengan sangat panjang. Untuk antarmuka chat dengan jawaban streaming, itu terbaca sebagai responsivitas. Untuk pekerjaan malam tanpa pengawasan, itu adalah waktu jam dinding yang juga Anda bayar.

Tiga bidang di mana Qwen3.8-Max benar-benar unggul

Kesenjangan indeks adalah 6,4 poin di seluruh suite, sebuah angka yang biasa dikutip seolah-olah seragam. Padahal tidak, dan ketidaksepakatan itu memberi pelajaran:

• GPQA Diamond — Qwen3.8-Max 0.9283 vs GPT-6.1 Sol tidak dipublikasikan pada pengujian ini

• GDPval — 1.671,4 vs 1.575,09

• Terminal-Bench 2.1 — 0,8876 vs tidak dipublikasikan pada eksekusi ini

• AutomationBench — 0,5619 vs 0,6487

• SciCode — tidak dipublikasikan dalam uji ini vs 0.5417 untuk GPT-6.1 Sol

• CritPT — 0.1771 vs 0.3171

Qwen3.8-Max menang pada pertanyaan sains tingkat pascasarjana dan sampel tugas pekerjaan, yang merupakan hasil nyata untuk model dari generasinya dan alasan indeks pengodeannya berada di peringkat ke-9 dari 138. Model ini kalah pada evaluasi yang lebih sulit yang mendekati riset — CritPT dengan selisih 14 poin — dan kalah pada AutomationBench dengan selisih 8,7, yaitu uji yang paling mirip dengan pekerjaan komputer tanpa pengawasan. Mana pun dari keduanya yang Anda anggap lebih penting untuk beban kerja Anda adalah keputusan sesungguhnya; angka utama 6,4 poin adalah rata-rata atas suatu ketidaksepakatan, bukan vonis.

Apa yang diberikan oleh token tambahan, dan apa yang tidak

Jejak penalaran yang panjang bukanlah pemborosan menurut definisinya. Model yang menghabiskan 70.830 token pertimbangan untuk tugas sulit sedang melakukan sesuatu yang mungkin dilewatkan oleh model yang lebih pendek, dan pada evaluasi tempat Qwen3.8-Max unggul, pertimbangan itu masuk akal sebagai penyebabnya. Mode kegagalannya adalah Anda membayarnya untuk setiap tugas, bukan hanya tugas yang sulit. Jumlah token penalaran merupakan properti kalibrasi model, bukan tingkat kesulitan pertanyaan, dan model yang terlalu banyak berpikir untuk ekstraksi satu baris akan menagih Anda untuk itu.

Cara untuk mengetahui tugas mana yang mana di antara tugas-tugas Anda adalah dengan berhenti memperlakukan pilihan model sebagai global. Hal ini membawa kita ke bagian yang merupakan perubahan konfigurasi.

Kartu model kami sendiri untuk GPT-6.1 Sol memuat angka-angka yang disajikan subjek: tarif $2.00 / $10.00, jendela konteks 1,050,000 token, p50 4,54 detik ke token pertama, dan blok indeks Artificial Analysis yang tersimpan di halaman yang sama dengan harga yang akan benar-benar dijadikan acuan perutean oleh aplikasi.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing a 1,050,000-token context window, 128K max output, text/image/file input with text output, the $2.00 input and $10.00 output per-million prices, a 4.54 s p50 time to first token and 284.2M tokens routed over seven days, above the OpenAI-compatible code sample and the supported-parameters list.

Satu kunci, satu meter, dua model

Kedua model dapat diakses melalui satu endpoint OrcaRouter — satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%. Kartu OrcaRouter untuk Qwen3.8-Max memuat tarif yang disajikan bersama jendela konteks 1.000.000 token, modalitas input teks/gambar/video, dan volume tujuh hari 101,4 juta token — angka yang menjadi acuan perutean aplikasi, di samping angka-angka yang diperdebatkan artikel. Penerusan itu penting secara khusus bagi Qwen3.8-Max, karena model yang ekonominya didominasi oleh volume token keluaran adalah model yang vendornya dapat mengubah harganya kapan saja, dan pengukur penerusan berarti perubahan tersebut mencapai faktur Anda pada hari Alibaba menerbitkannya, bukan menurut jadwal penjual kembali.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the $2.00 input and $6.00 output per-million prices, a 5.66 s p50 time to first token, 101.4M tokens over seven days, a 1,000,000-token context window and text/image/video input, above the OpenAI- and Anthropic-compatible code samples.

Penggunaan lapisan perutean yang lebih menarik di sini adalah DSL perutean, yang memungkinkan Anda menyusun beberapa model ke dalam satu panggilan alih-alih memilih satu model untuk seluruh aplikasi. Pisahkan tugas malam: model murah mengklasifikasikan dan mengekstraksi, GPT-6.1 Sol menangani langkah penalaran dan verifikasi, dan Qwen3.8-Max dicadangkan untuk tugas-tugas di mana pertimbangan panjangnya dan kekuatan sains sekelas GPQA-nya benar-benar mengubah jawaban. Failover otomatis menangani sisanya — jika penyedia menurun di tengah eksekusi, permintaan dipindahkan alih-alih menggagalkan batch.

Tak satu pun dari keduanya menjadi alasan untuk memilih sebuah model. Keduanya justru menjadi alasan mengapa Anda tidak perlu membuat pilihan itu sekali lalu hidup dengannya.

Panggilan, dan hal yang perlu diperhatikan

Bayar 7,5 kali lipat hanya ketika pertimbangan itu sepadan. Untuk pekerjaan malam serba guna, GPT-6.1 Sol dengan biaya $0,724 per tugas adalah default yang dapat dipertahankan, dan $1.690 per tahun itu nyata. Ketika tugasnya adalah sains berat atau penalaran okupasi dengan jawaban yang dapat diperiksa, nilai 0,9283 Qwen3.8-Max pada GPQA Diamond sepadan dengan token yang dikeluarkan — itulah hal spesifik yang lebih baik dilakukannya.

Hal yang perlu diperhatikan adalah apakah Alibaba akan menetapkan ulang harga. Model 2,8× token dengan harga $2.00/$6.00 diberi harga seolah-olah token adalah hal yang langka; perilaku model itu sendiri justru membuat token melimpah. Jika tarif output berubah secara material, aritmetika dalam artikel ini ikut berubah, dan meter pass-through akan menunjukkan hal itu kepada Anda pada hari yang sama saat perubahan itu terjadi.

Dibandingkan dalam artikel ini3

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari