Kartu judul yang dihasilkan berjudul "Union Alpha vs Qwen3.8 Flash" dengan subjudul "Terpaut satu poin pada satu-satunya tes yang menjalankan keduanya", di atas tiga kartu membulat bertuliskan "Official A: 136/157 vs 137/157", "Konteks: 262.144 vs 1.000.000 token", dan "Waktu ke token pertama: 10,00 s vs 6,62 s". Bagian footer berbunyi Official A menurut SMF Clearinghouse dengan latensi per OrcaRouter selama 7 hari terakhir.
Guides & Insights

Union Alpha vs Qwen3.8 Flash: Satu Poin Menentukan Segalanya

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Union Alpha dan Qwen3.8 Flash terpaut satu poin pada satu-satunya tes yang telah mengukur keduanya. Pada rangkaian SMF Clearinghouse Official A — 157 tes, penalaran dimatikan — Union Alpha mendapat skor 136 dan eksekusi lokal Qwen3.8-Flash-Next mendapat skor 137. Itu adalah hasil adu langsung terdekat yang dimiliki kedua model, dan itu juga angka paling menyesatkan dalam perbandingan ini, karena kedua entri tidak dijalankan dalam kondisi yang sama dan hanya salah satunya yang merupakan model yang benar-benar dapat Anda sewa saat ini.

Apa yang dapat dan tidak dapat disampaikan oleh selisih satu poin kepada Anda

Mulailah dari apa yang ia tetapkan. Union Alpha bukanlah bluff dalam arti sepele — rangkaian 157 tes yang luas tanpa kesalahan, penalaran sempurna (30/30), dan penggunaan alat yang sempurna (2/2) bukanlah sesuatu yang dihasilkan oleh endpoint kosong. Hasil coding-nya 26/30 dan matematikanya 24/30 menempatkannya di wilayah yang kredibel, dan skor menulisnya 2/5 menempatkannya jauh dari pekerjaan prosa serbaguna.

Sekarang peringatannya, yang menanggung beban.

Entri Qwen3.8 Flash adalah eksekusi lokal dari Qwen3.8-Flash-Next — checkpoint berbobot terbuka — bukan API Qwen3.8 Flash yang dihosting. Penyajian lokal berarti kuantisasi Anda sendiri, tumpukan inferensi Anda sendiri, parser pemanggilan alat Anda sendiri. Tidak satu pun dari itu dijamin cocok dengan apa yang dikembalikan oleh endpoint yang dihosting, dan orang-orang yang menjalankan pengujian menandai perbandingan tersebut sebagai tidak definitif justru karena alasan itu.

Satu suite bukanlah sebuah profil. Official A luas tetapi dangkal per kategori: tools berjumlah 2 tes. Kategori tool dengan dua tes yang mencetak 2/2 adalah pertanda baik, bukan bukti keandalan agentik, dan Union Alpha secara eksplisit diposisikan sebagai model agentik dan coding. Instrumen ini mengukur sesuatu yang berdekatan dengan klaim tersebut.

Dan satu poin itu sendiri berada di dalam noise dari suite 157 tes. Perlakukan 136 dan 137 sebagai "berada di band yang sama", bukan sebagai peringkat.

Berdampingan

• Jendela konteks — Union Alpha 262.144 token vs Qwen3.8 Flash 1.000.000 token yang dilayani (262.144 asli, diperluas melalui YaRN).

• Output maksimum — Union Alpha 131.072 token vs Qwen3.8 Flash 131.000 token. Praktis setara.

• Masukan — teks dan gambar di Union Alpha vs teks, gambar, dan video di Qwen3.8 Flash.

• Harga — $0 selama pratinjau Union Alpha vs Qwen3.8 Flash pada $0,150/juta input, $0,470/juta output, $0,018/juta baca cache, $0,230/juta tulis cache.

• Kontrol penalaran — tidak ada pada Union Alpha vs mode berpikir pada Qwen3.8 Flash yang aktif secara default dan dapat dinonaktifkan.

• Waktu hingga token pertama — Union Alpha 10,00 s p50 vs Qwen3.8 Flash 6,62 s p50, keduanya diukur pada endpoint kami selama jendela tujuh hari yang sama. Kecepatan decode mentah lebih berdekatan daripada yang disiratkan reputasinya: 170 token per detik versus 103.

• Asal-usul — operator anonim, tanpa bobot vs Alibaba/Qwen, dengan bobot Qwen3.8-Flash-Next yang dirilis sebagai sumber terbuka di Hugging Face dan ModelScope.

Generated two-column comparison scoreboard for Union Alpha and Qwen3.8 Flash. Union Alpha column: context window 262,144 tokens, max output 131,072 tokens, text and image input, $0 preview price, no published weights, 10.00 s p50 time to first token. Qwen3.8 Flash column: context window 1,000,000 tokens served, max output 131,000 tokens, text, image and video input, $0.150 input and $0.470 output per 1M tokens, Qwen3.8-Flash-Next weights open-sourced, 6.62 s p50 time to first token. Footer reads Official A per SMF Clearinghouse with latency and errors per OrcaRouter over the last 7 days.

Qwen3.8 Flash: taruhan pada efisiensi dengan 6B aktif

Qwen3.8 Flash diluncurkan pada 26 Agustus 2026 sebagai versi produksi dan terkelola dari checkpoint open-weight Qwen3.8-Flash-Next, yang dirilis Alibaba pada saat yang sama. Model ini adalah model mixture-of-experts dengan 125B parameter yang mengaktifkan sekitar 6B parameter per token, ditambah 51B parameter embedding N-gram, dibangun di atas attention hibrida yang menggabungkan Gated DeltaNet dengan pengindeks sparse-attention.

Pembingkaian vendor adalah tentang ekonomi pelatihan: Alibaba melaporkan biaya menjalankannya sekitar sepersembilan dari Qwen3.7-Plus, dengan klaim prefill hingga 7,6× lebih cepat dan decode hingga 4,9× lebih cepat pada beban kerja 1 juta token dengan cache hit tinggi. Itu adalah angka dari vendor dan belum direproduksi secara independen.

Tabel tolok ukurnya juga dilaporkan oleh vendor dan tidak direproduksi: SWE-bench Pro 62.5, DeepSWE v1.1 58.7, SWE-bench Multilingual 81.0, NL2Repo 48.1, CoWorkBench 73.9, JobBench 55.7, RealWorldQA 88.5, LVBench 76.6, AndroidWorld 84.5. Angka yang layak dikutip balik ke tim pemasaran adalah Humanity's Last Exam pada 35.9, yang berada di bawah 40.0 milik Claude Opus 4.6 dalam perbandingan yang sama.

Di halaman model kami sendiri, bagian benchmark publik masih tertulis "pending" — belum ada pihak ketiga yang menilainya. Yang kami punya adalah lalu lintas kami sendiri: waktu median hingga token pertama 6,62 detik, laju output 103 token per detik, dan tingkat kesalahan 4,5%. Tingkat kesalahan itu cukup tinggi untuk dicermati, dan angka semacam itu hanya muncul saat Anda mengukur endpoint live, bukan postingan peluncuran.

The OrcaRouter model page for Qwen3.8 Flash, showing a 1M-token context window, 131K max output, text plus image and video input, $0.15 per million input tokens and $0.47 per million output tokens, a p50 time to first token of 6.62 s, and 2,322.0M tokens of traffic over seven days.

Union Alpha: model tanpa pemilik

Union Alpha muncul di katalog pihak ketiga pada 16 September 2026 dan dilayani melalui tier gratis OrcaRouter. Ia tidak memiliki laboratorium bernama, tidak memiliki bobot, tidak memiliki lisensi, tidak memiliki jumlah parameter, dan tidak memiliki catatan arsitektur. Kolom penyedianya bertuliskan "Stealth".

Endpoint-nya, setidaknya, dapat dibaca: konteks 262.144 token, output maksimum 131.072 token, input teks dan gambar dengan output hanya teks, pemanggilan alat, output JSON, temperature, top_p, dan max_tokens, serta sama sekali tidak ada kontrol penalaran. Pilihan alat secara efektif hanya mengakui "auto". Jendela gratisnya telah digambarkan sekitar satu minggu, dibatasi laju, tanpa harga pasca-pratinjau yang diumumkan.

Klaim yang dinyatakan — "kinerja tingkat terdepan di berbagai tugas serbaguna yang luas" — dilaporkan oleh operator dan tidak diaudit. Hasil 136/157 Official A adalah satu-satunya pengukuran independen yang ada.

The OrcaRouter model page for Union Alpha (Free), listed under the stealth vendor, showing a FREE badge, a 262K-token context window, 131K max output, text and image input with text output, and pricing shown as Free and rate-limited with model usage at $0.

Kecepatan adalah titik di mana mereka tidak lagi terlihat sama.

Angka throughput utama tidak memisahkan keduanya seperti yang Anda perkirakan, dan alasannya layak untuk dipahami.

Berdasarkan telemetri perutean kami sendiri selama tujuh hari terakhir, Qwen3.8 Flash melakukan streaming pada 103 token keluaran per detik dengan p50 waktu hingga token pertama sebesar 6,62 detik dan tingkat galat 4,5%. Union Alpha, yang diukur dengan cara yang sama, melakukan streaming pada 170 token per detik. Dari segi kecepatan dekode mentah, model anonim tersebut adalah yang lebih cepat di antara keduanya.

Yang tidak dilakukannya adalah memulai. p50 dan p95 time-to-first-token Union Alpha sama-sama tertahan di 10,00 detik, yang berarti setidaknya separuh dari semua permintaan menunggu sepuluh detik atau lebih sebelum token pertama muncul, dan tingkat kesalahannya pada jendela waktu yang sama adalah 7,7% — sekitar 1,7 kali milik Qwen. Uji coba Official A dengan 157 tes yang diandalkan bagian-bagian sebelumnya memakan waktu 4,6 jam waktu nyata, dengan latensi median 91,9 detik dan rata-rata 104,8 detik per tes, dan empat tes mencapai batas waktu 300 detik milik harness. Penguji independen yang menjalankannya pada hari peluncuran melaporkan throughput yang jauh lebih rendah daripada yang ditunjukkan endpoint kami, yang memang seperti yang dapat Anda harapkan dari layanan yang masih menyerap beban hari pertama yang sangat besar.

Jadi, perbedaan praktisnya bukanlah kecepatan dekode. Melainkan waktu sampai token pertama dan keandalan. Union Alpha tidak dapat digunakan untuk hal apa pun yang interaktif — tanpa pelengkapan otomatis, tanpa bantuan inline, tanpa loop agen yang ketat — karena sepuluh detik keheningan tidak bisa dibedakan dari macet. Ini cocok untuk pekerjaan asinkron: pekerjaan batch semalaman, pemrosesan dokumen panjang, proses evaluasi offline yang berjalan saat tidak ada yang menunggu token pertama dan tingkat kegagalan 7,7% diserap oleh percobaan ulang.

Qwen3.8 Flash pada 103 token per detik dengan median waktu sampai token pertama 6,62 detik juga tidak cepat. Cara membingkai yang jujur adalah bahwa keduanya lambat, dan hanya salah satunya yang gagal kira-kira satu dari tiga belas permintaan.

Argumen efisiensi, dan siapa yang berhak mengajukannya

Alibaba mengajukan argumen biaya pelatihan: sepersembilan biaya Qwen3.7-Plus untuk dilatih, enam miliar parameter aktif per token, jadi murah untuk dilayani. Itu adalah klaim tentang model yang bobotnya ada dan asal-usulnya terdokumentasi.

Narasi efisiensi Union Alpha lebih tersirat daripada dinyatakan — model anonim 256K yang gratis untuk dipanggil. Gratis tidak sama dengan murah. Seseorang membayar untuk GPU-GPU itu, pratinjau ini memiliki akhir yang telah dinyatakan, dan pengakuan operator sendiri bahwa mereka menyetel untuk kecepatan menunjukkan bahwa ekonomi penyajiannya belum mapan. Model yang gratis selama seminggu dan tidak dapat diberi harga setelahnya memiliki argumen efisiensi yang kedaluwarsa bersama jendela waktunya.

Mencoba hal yang belum diketahui tanpa mempertaruhkannya

Alasan perbandingan khusus ini layak untuk diingat adalah karena ini merupakan tes termurah yang mungkin untuk model yang belum terbukti. Qwen3.8 Flash adalah kuantitas yang diketahui: vendor bernama, bobot terbuka, tolok ukur yang diterbitkan (jika bernuansa vendor), harga nyata per token sebesar $0.150/$0.470. Union Alpha adalah yang tidak diketahui, dengan harga nol, yang seluruh klaim kompetitifnya bertumpu pada satu hasil tes 157.

Daripada memilih, letakkan yang belum diketahui di balik aturan failover. OrcaRouter meneruskan harga daftar penyedia apa adanya dengan markup 0% dan mendukung failover otomatis antarp Penyedia, sehingga endpoint Union Alpha yang terkena batas laju atau hilang akan dialihkan ke model yang masih merespons, bukan muncul sebagai pekerjaan gagal pada pukul 3 pagi. Kedua model menggunakan kunci yang sama, jadi eksperimen ini hanya memerlukan perubahan konfigurasi, bukan integrasi kedua — dan tak satu pun harus menjadi keputusan yang perlu Anda pertahankan, karena Anda dapat mengubah perutean saat jendela gratis ditutup.

Vonis

Qwen3.8 Flash adalah model yang tepat untuk dijadikan fondasi. Enam miliar parameter aktif, bobot sejenis yang open source, jendela 1M token, input video, kecepatan 103 token per detik yang berfungsi, dan harga terpublikasi yang dapat Anda perkirakan. Tolok ukurnya dilaporkan vendor dan tingkat kesalahannya layak dipantau, tetapi ia dimiliki seseorang, dan orang itu sedang merilis.

Union Alpha adalah model yang harus diukur. Selisih satu poin pada Official A sungguh menarik — ini menunjukkan bahwa apa pun ini, ini bukan mainan — dan dengan $0 serta batas output 131K dan input visi, ini layak mendapat perhatian Anda selama seminggu. Tetapi selisih satu poin pada satu suite, yang dihasilkan oleh operator anonim dengan tingkat kesalahan 7,7%, adalah alasan untuk menyelidiki, bukan alasan untuk beralih.

Yang perlu diperhatikan adalah hal yang sama yang selama ini selalu menjadi penentu: sebuah nama. Ox Alpha, entri sebelumnya dalam seri ini, diungkap enam hari setelah muncul sebagai GLM-5.3-Flash milik Zhipu. Jika Union Alpha mendapatkannya, perbandingan tidak lagi soal poin dan mulai soal harga.

Besaran yang sudah diketahui telah diberi harga dan didokumentasikan: halaman model Qwen3.8 Flash menunjukkan tarif $0.150/$0.470, konteks yang dilayani 1M token dan batas keluaran 131K, dengan tolok ukur publik yang masih tertunda.