Kartu hero yang dihasilkan untuk Kolibri vs Qwen 3.8, berjudul 'Kolibri vs Qwen 3.8' dengan subbaris 'penyajian Jerman yang berdaulat melawan keluarga Tiongkok yang terbuka', ikon burung kolibri di sebelah kiri dan garis luar awan di sebelah kanan di kedua sisi pembatas tipis. Logo OrcaRouter berada di strip di bawah karya seni.
Guides & Insights

Kolibri vs Qwen 3.8: Model Jerman Kalah di Tabelnya Sendiri, dan Itulah Intinya

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Mulailah dengan kalimat yang paling banyak dilewatkan oleh liputan peluncuran Kolibri. Pada tabel benchmark yang diterbitkan Aleph Alpha dengan modelnya sendiri pada 3 Oktober 2026, model yang paling sering dijadikan pembanding bukan rival dari Eropa dan bukan rival dari Amerika. Model itu adalah Qwen3.8 27B, tier open-weight dari vendor tersebut untuk generasi itu, dirilis pada 13 Agustus 2026 — dan menurut angka Aleph Alpha sendiri, model itu menang. Qwen3.8 27B mencetak 80,2 pada rata-rata bahasa Inggris dan 79,9 pada rata-rata bahasa Jerman dari rangkaian evaluasi yang sama yang memberi Kolibri 75,5 dan 70,8. Model itu unggul pada GPQA Diamond, 89,2 berbanding 84,3. Unggul pada LiveCodeBench v6, 93,8 berbanding 85,9. Unggul pada SWE-Bench Verified, 72,6 berbanding 66,4, dan pada kedua benchmark konteks panjang, 76,9 berbanding 64,5 pada LongBench Pro serta 81,3 berbanding 68,3 pada AA-LCR. Model padat Tiongkok berparameter 27 miliar, yang dievaluasi oleh laboratorium Jerman, mengalahkan model andalan laboratorium tersebut berparameter 78 miliar di sebagian besar tabelnya sendiri. Itu bukan skandal. Itu fakta paling berguna dalam peluncuran ini, karena memaksa munculnya pertanyaan tentang untuk apa Kolibri sebenarnya digunakan.

Satu klarifikasi sebelum perbandingan ini berlanjut lebih jauh, karena "Qwen 3.8" merujuk pada sebuah keluarga, bukan satu model, dan perbedaannya penting di sini. Qwen3.8-Max adalah andalan hosted Alibaba, tersedia sejak 3 Agustus 2026 dengan jendela konteks 1 juta token pada $2,00 per juta token input dan $6,00 output. Qwen3.8-27B adalah tingkat open-weight, dirilis 13 Agustus 2026 dengan jendela 262.144 token. Qwen3.8-Flash adalah tingkat volume, dirilis 26 Agustus 2026 dengan jendela 1 juta token dan harga yang jauh lebih rendah. Dan Qwen3.8 biasa — diumumkan pada 19 Juli 2026 sebagai andalan open-weight berparameter 2,4 triliun — belum dirilis; ia ada sebagai halaman pelacakan katalog dan pengumuman. Semua yang di bawah ini membahas versi yang bobotnya dapat Anda unduh dan jalankan, yaitu 27B.

Di mana Kolibri sebenarnya menang, baca dari tabel yang sama

Baris-baris di mana Kolibri unggul atas Qwen3.8 27B tidak tersebar secara acak. Baris-baris itu mengelompok, dan kelompok itulah produknya.

• Abstensi — pada RGB Negative, Kolibri mencetak skor 85,6 berbanding 70,6. Saat konteks tidak memuat jawabannya, Kolibri jauh lebih sering menyatakannya.

• Pemanggilan alat di bawah kendala — pada τ²-bench telecom, 94,7 berbanding 82,5; pada suite vertikal pemasok otomotif, 99,0 berbanding 97,3.

• Konteks sangat panjang — pada SealQA tanpa distraktor di atas 24k token, 100,0 versus 94,4.

• Ekonomi penyajian untuk bahasa Jerman — tokenizer bilingual pada rata-rata 4,90 byte per token pada teks web berbahasa Jerman, dibandingkan 4,17 untuk keluarga Qwen3.5–3.8 dalam pengukuran Aleph Alpha sendiri. Token yang lebih sedikit per dokumen berbahasa Jerman adalah pengurangan biaya inferensi langsung yang muncul di faktur dan tidak muncul di baris benchmark mana pun.

Tiga dari empat hal itu berkaitan dengan perilaku, bukan kemampuan. Menahan diri, pemanggilan alat yang dibatasi, dan pengambilan konteks panjang yang berpijak pada sumber adalah hal yang Anda butuhkan dari model yang membaca materi organisasi Anda sendiri dan diharapkan mengakui ketika materi itu tidak menjawab pertanyaan. Aleph Alpha membangun seluruh rilis ini di seputar taruhan itu, dan tabel tersebut menunjukkan taruhan itu berhasil.

Generated two-column scoreboard for Kolibri and Qwen3.8 27B. Left column Kolibri: English average 75.5, German average 70.8, abstention 85.6, GPQA Diamond 84.3, SWE-Bench Verified 66.4, licence Apache 2.0. Right column Qwen3.8 27B: English average 80.2, German average 79.9, abstention 70.6, GPQA Diamond 89.2, SWE-Bench Verified 72.6, licence Apache 2.0. The footer reads 'Both columns from Aleph Alpha's published table, vendor harness; no independent reproduction.'

Baris-baris tempat Qwen3.8 27B menang berkaitan dengan keluasan: pengetahuan dalam kedua bahasa, pertanyaan sains tingkat pascasarjana, pemrograman kompetitif, rekayasa perangkat lunak tingkat repositori, pemahaman dokumen panjang. Jika kebutuhan Anda adalah model umum yang kuat dengan harga per token yang rendah dan bobot terbuka, Qwen3.8 27B adalah model yang lebih baik dan tabel tersebut menyatakannya dengan tinta dari vendor sendiri.

Pembacaan itu didukung oleh bukti, sedangkan pembacaan Kolibri tidak. Artificial Analysis telah mengukur Qwen3.8 27B secara independen, dalam konfigurasi penalaran Xhigh-nya, dan melaporkan Intelligence Index 34 di peringkat #1 dari 142 model dalam perbandingan tersebut, 45,4 token keluaran per detik, konteks 256.000 token, dan lisensi Apache 2.0. Catatan mereka tidak menyanjung dengan cara yang sudah akrab — sangat bertele-tele dengan 200 juta token yang dihasilkan selama evaluasi indeks dibandingkan median 82 juta, dan lambat — tetapi skornya sendiri adalah pengukuran pihak ketiga terhadap lawannya. Kolibri tidak memiliki halaman Artificial Analysis sama sekali. Jadi model terkuat dalam perbandingan ini telah diverifikasi secara independen dan yang lebih lemah hanya berdasarkan klaim vendor, yang merupakan kebalikan dari cara sebuah produk andalan Eropa generasi pertama biasanya dibingkai.

Dua jenis klaim rantai pasok, mengarah ke arah yang berlawanan

Kedua rilis ini adalah argumen tentang dari mana sebuah model berasal, dan argumen-argumen tersebut merupakan bayangan cermin satu sama lain.

Kasus Aleph Alpha adalah provenance sebagai fitur. Kolibri dilatih oleh tim Jerman di infrastruktur di Jerman dan Finlandia, di bawah hukum UE dan Jerman. Kartu tersebut mengungkapkan campuran pra-pelatihan — 20 triliun token dengan sekitar 62,5 persen bahasa Inggris, 23,9 persen bahasa Jerman, dan 13,6 persen kode — anggaran pelatihan menengah dan konteks panjang, komputasi persisnya 768 NVIDIA B200 di 96 node HGX selama 21 hari, dan perkiraan energi 9,5×10² MWh termasuk overhead pusat data. Dokumen ini merinci metode pelatihan hingga ke lapisan: transformer mixture-of-experts 50 lapis dengan pembagian 4:1 antara sliding-window dan grouped-query attention, Muon dan Exact Quantile Balancing pada 384 pakar dengan 1 shared dan 6 routed. Dua belas ribu kata pengungkapan yang dilampirkan pada unduhan 78 GB, dan posisi penandatangan yang dinyatakan pada Kode Praktik AI Tujuan Umum UE.

Kasus Alibaba berbeda secara mendasar: bukan “kami dapat mempertanggungjawabkan setiap keputusan” melainkan “ini bobotnya, ambillah”. Bobot terbuka berlisensi Apache pada skala dan kualitas yang menjadikan Qwen sebagai default efektif di seluruh dunia, kosakata 248.077 token yang mencakup jauh lebih dari seratus bahasa, dan ekosistem penyajian yang telah disetel di seputar checkpoint tersebut cukup lama sehingga hampir setiap stack inferensi mendukungnya langsung tanpa konfigurasi. Argumen kedaulatan di sana adalah tentang ketersediaan: tidak ada vendor yang dapat menarik kembali model itu, karena Anda sudah memiliki filenya.

Kedua klaim itu jujur dan keduanya menjawab kekhawatiran yang berbeda. Pembeli sektor publik di Baden-Württemberg khawatir tentang yurisdiksi dan kemampuan audit, dan Kolibri ditujukan untuk kekhawatiran itu. Kelompok riset di Nairobi atau São Paulo khawatir tentang model yang dibatasi di balik kartu kredit dalam mata uang yang tidak dapat mereka bayarkan, dan bobot Qwen terbuka ditujukan untuk kekhawatiran yang itu. Yang tidak jujur adalah berpura-pura bahwa salah satunya adalah perbandingan kemampuan, karena tabel kemampuan sudah memberikan jawabannya.

Screenshot of the Artificial Analysis model page for Qwen3.8 27B (Xhigh), marked 'Open weights model, Released August 2026', showing an Intelligence Index of 34 against a median of 8, a #1/142 intelligence rank, a #55/142 speed rank at 45 tokens per second against a 91-token median, input pricing $0.50 per million tokens against a $0.03 median and output pricing $3.00 against a $0.15 median, an average cost of $1.01 per task on the Intelligence Index, a verbosity rank of #22/142 having generated 200M tokens during the index evaluation against a median of 82M, a 256k-token context window, and the Apache 2.0 licence badge.

Kesenjangan lisensi itu nyata tetapi lebih sempit daripada kedengarannya.

Kolibri adalah Apache 2.0. Qwen3.8 27B adalah open weights berlisensi Apache. Keduanya hadir tanpa klausul tambahan penggunaan yang dapat diterima, tanpa ambang batas pengguna aktif bulanan, dan tanpa ketentuan komersial terpisah — yang menempatkan keduanya dalam kelompok kecil dan berarti tidak satu pun memerlukan tinjauan hukum sebelum penggunaan komersial.

Yang membedakan keduanya adalah segala hal yang menyusul setelah lisensi. Kolibri hadir dengan plugin vLLM dan paket parser dari vendor, image kontainer, empat tingkat upaya penalaran yang dapat dikonfigurasi melalui template chat, perilaku abstensi eksplisit, dan konfigurasi sampling yang direkomendasikan. Qwen3.8 27B hadir sebagai bobot yang sudah diketahui cara menyajikannya oleh Transformers, vLLM, dan SGLang, dengan format tool-calling yang sudah dimiliki ekosistem yang lebih luas selama berbulan-bulan untuk mengakomodasinya.

Perangkat keras deployment berbeda sepanjang garis yang sama. Bobot FP8 Kolibri memiliki jejak sekitar 78 GB dengan batas minimum dua kartu A100 80 GB, dua H100 SXM5, satu H200, satu B200, atau satu B300. Qwen3.8 27B dalam bfloat16 memiliki bobot sekitar 54 GB, yaitu satu akselerator 80 GB pada presisi penuh atau build terkuantisasi dengan jauh lebih sedikit. Model Jerman ini membutuhkan lebih banyak perangkat keras dan menghasilkan benchmark yang lebih rendah untuk itu. Itu hanya pertukaran yang buruk jika Anda memang membeli benchmark.

Apa yang ditunjukkan dan tidak ditunjukkan oleh label harga kepada Anda

Kolibri tidak memiliki harga, karena Aleph Alpha tidak menjual inferensi untuknya. Rilis ini berupa bobot, laporan teknis, dan kartu; tidak ada SKU yang dihosting. Angka biaya apa pun untuk Kolibri adalah perhitungan amortisasi perangkat keras yang Anda hitung sendiri.

Qwen3.8 memiliki harga publik dalam tiga tingkatan, dan tingkatan menengah adalah yang penting bagi tim yang membandingkan self-hosting dengan menyewa.

• Qwen3.8-Max — $2,00 per juta token masukan dan $6,00 keluaran, konteks 1 juta token, pembacaan cache $0,25, dirilis 3 Agustus 2026.

• Qwen3.8-27B — $0.33 input dan $2.40 output, konteks 262.144 token, dirilis 13 Agustus 2026. Ini adalah bobot terbuka, jadi harga ini adalah yang Anda bayar jika Anda lebih memilih untuk tidak menjalankannya.

• Qwen3.8-Flash — $0,15 untuk input dan $0,47 untuk output dengan jendela 1 juta token, dirilis 26 Agustus 2026.

Itu adalah harga daftar penyedia di OrcaRouter, diteruskan tanpa tambahan apa pun per token, yang merupakan properti berguna ketika pertanyaannya adalah apakah deployment yang di-host sendiri menguntungkan secara biaya: Anda dapat mengukur volume token nyata Anda pada tier hosted sebelum berkomitmen pada perangkat keras. Kami tidak menambahkan margin, jadi pemotongan harga vendor langsung berlaku di sisi kami pada hari yang sama. Ketiga tier Qwen3.8 dapat dirutekan hari ini pada satu kunci yang kompatibel dengan OpenAI dengan failover otomatis antar penyedia, dan Qwen3.8 yang akan datang dengan 2,4 triliun parameter memiliki halaman katalog yang menunggu bobotnya alih-alih placeholder yang berpura-pura melayaninya.

Kolibri tidak dapat dirutekan. Kami menelusuri katalog untuk setiap ejaan vendor dan model, dan ia tidak ada — jadi satu-satunya cara untuk memanggilnya adalah unduhan 78 GB. Jika Anda ingin tahu berapa biaya model Jerman untuk beban kerja Anda, jawabannya adalah satu rak dan satu orang yang bisa menjalankan vLLM, dan tidak ada pihak ketiga yang saat ini dapat memberi Anda penawaran lain.

Screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the 1M-token context badge, text, image and video input with text output, the Vision, Tools, JSON and Reasoning capability tags, a p50 time-to-first-token of 2.35 seconds, the attribution 'Public benchmarks by Qwen - 2026-08-03', the description as Alibaba's newest flagship in the Qwen line positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the pricing tiles $2.00 and $6.00, and the OpenAI-compatible and Anthropic-compatible base URLs at https://api.orcarouter.ai/v1 and https://api.orcarouter.ai.

Siapa yang harus membeli yang mana

Keputusan ini tidak ditentukan oleh kualitas, karena pertanyaan itu telah diselesaikan oleh tabel milik vendor sendiri yang menguntungkan Alibaba. Keputusan ini bergantung pada risiko mana yang Anda lindungi dengan asuransi.

• Pilih Kolibri jika kendala yang mengikat adalah yurisdiksi, dokumentasi asal-usul, atau kemampuan audit — jika Anda perlu mampu menjawab dari mana data pelatihan berasal, di mana komputasi dijalankan dan berdasarkan hukum mana, serta jika beban kerjanya adalah dokumen Jerman dan Inggris yang diproses di dalam perimeter Anda sendiri. Anda membayar premi kapabilitas untuk itu, dan premi tersebut terlihat di tabel di atas.

• Pilih Qwen3.8 27B jika batasan yang mengikat adalah kemampuan per dolar, luasnya cakupan bahasa, atau dukungan ekosistem. Model ini lebih kuat dalam evaluasi Aleph Alpha sendiri, berlisensi Apache, dapat dijalankan pada satu akselerator, dan tier hosted-nya mulai dari $0,33 per juta token masukan jika Anda lebih memilih untuk tidak menjalankannya sendiri sama sekali.

• Pertimbangkan keduanya dalam arsitektur yang sama jika beban kerja memiliki inti yang teregulasi dan pinggiran yang umum. Dokumen yang tidak boleh keluar dari gedung dikirim ke endpoint Kolibri yang dihosting sendiri; pekerjaan peringkasan, penerjemahan, dan kode dialihkan ke tier Qwen3.8 yang dirutekan dengan biaya sepertiga sen per seribu token. Satu kunci API, satu aturan perutean, harga daftar penyedia diteruskan apa adanya, dan failover ditangani untuk Anda — yang merupakan pengaturan jauh lebih berguna daripada memilih salah satu dari keduanya dan berpura-pura yang lain tidak ada.