Kartu judul bergaya diagram untuk 'Tiny Aya Base 32K vs Tiny Aya En-Thinker'. Dua kartu membulat berdampingan, dihubungkan dari kiri ke kanan oleh panah berlabel 'pasca-pelatihan'. Kartu kiri, 'Tiny Aya Base 32K', memuat baris 'dasar terlatih' dan 'tanpa templat chat'; kartu kanan, 'Tiny Aya En-Thinker', memuat 'pasca-terlatih' dan 'mode berpikir disertakan'. Baris di tengah di bawah keduanya berbunyi 'arsitektur 3.35B yang sama, jendela 32K yang sama'. Logo OrcaRouter ditempatkan di sudut kanan bawah.
Guides & Insights

Tiny Aya Base 32K vs Tiny Aya En-Thinker: Induk dan Anak, Bukan Rival

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dua repositori Hugging Face, masing-masing empat shard safetensors, dan ukuran shard-nya sama persis hingga byte — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K dan Tiny Aya En-Thinker bukan jawaban dua laboratorium terhadap pertanyaan yang sama. Mereka adalah arsitektur Cohere2 3.35B yang sama pada dua tahap berbeda, dan kartu model milik Cohere Labs sendiri menyatakannya dengan gamblang: checkpoint dasar "digunakan sebagai model dasar untuk Tiny Aya L2-Thinker dan Tiny Aya En-Thinker."

Itu membuat kerangka perbandingan head-to-head yang biasa menjadi keliru. Anda tidak memilih di antara dua model multibahasa 3B yang bersaing. Anda memilih antara titik awal dan titik akhir — dan pertanyaan yang menarik adalah apa yang sebenarnya diperoleh dari langkah pasca-pelatihan di antara keduanya, berapa biayanya, dan apakah salah satunya dapat digunakan untuk kebutuhan Anda mengingat keduanya berada di balik lisensi non-komersial yang sama dan tidak satu pun memiliki tolok ukur yang dipublikasikan.

Satu kalimat yang menentukan hubungan.

Biasanya sebuah karya "vs" harus menyimpulkan hubungan antara dua checkpoint dari arsitektur dan jumlah parameter. Di sini Anda tidak perlu melakukannya.

Kartu Tiny Aya Base 32K menyatakannya dengan jelas, dan layak dibaca dengan saksama karena posisi kalimatnya — bukan dalam catatan kaki, tetapi dalam ringkasan model, di antara deskripsi checkpoint dan kredit pengembang:

"Ini adalah model dasar pra-terlatih dan belum di-tuning dengan instruksi atau disejajarkan dengan preferensi. Checkpoint ini digunakan sebagai model dasar untuk Tiny Aya L2-Thinker dan Tiny Aya En-Thinker."

Apa yang membuat hal itu layak dijadikan satu paragraf adalah inkonsistensi yang dipaparkannya. Kartu En-Thinker sendiri tidak menyebutkan Base 32K. Baris penutupnya mengarahkan pembaca ke "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker" — dan tiny-aya-base adalah checkpoint Februari, yang didokumentasikan dengan konteks 8K, bukan varian 32K yang menyebut dirinya sebagai induk En-Thinker. En-Thinker mengklaim 32K pada kartunya sendiri. Sebuah model tidak dapat dilatih lanjut menjadi jendela yang empat kali lebih lebar daripada jendela yang digunakan saat dilatih awal. Jadi basis 8K tidak akan pernah menjadi jawabannya, dan klaim basis 32K sesuai dengan perhitungan, sementara rujukan En-Thinker sendiri tidak.

Penjelasan yang paling mungkin sebenarnya sederhana: Base 32K diunggah pada 8 September 2026, enam hari setelah para Thinkers, sehingga kartu En-Thinker ditulis sebelum induknya ada dan belum diperbarui sejak saat itu. Itu adalah kesimpulan dari stempel waktu, bukan pernyataan vendor — tetapi itu adalah penafsiran yang membutuhkan asumsi paling sedikit, dan itu berarti dokumen terbaru dalam keluarga ini adalah yang paling informatif.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-base-32K. The page is licence-gated, and the card summary states Model Size 3.35B and Context Length 32K (input + output), followed by the line 'This checkpoint is used as the base model for Tiny Aya L2-Thinker and Tiny Aya En-Thinker' and 'For the 8K release, see tiny-aya-base.' The tags row includes long-context and 46 languages, and the Inference Providers panel reads 'This model isn't deployed by any Inference Provider.'

Dimensi demi dimensi

Segala hal di bawah ini adalah apa yang dinyatakan kedua kartu, tanpa bagian yang duplikat — keduanya 3.35B, BF16, khusus teks, Cohere2ForCausalLM, CC-BY-NC-4.0, gated, dan belum di-benchmark.

• Tahap — Tiny Aya Base 32K adalah basis yang telah dilatih sebelumnya, "tidak disetel dengan instruksi atau disejajarkan dengan preferensi"; Tiny Aya En-Thinker dilatih lanjut pada data penalaran multibahasa dengan jejak penalaran bahasa Inggris.

• Template chat — Base 32K tidak menyertakan chat_template.jinja sama sekali; En-Thinker menyertakan satu, dan kartunya mencurahkan satu bagian penuh untuk menjelaskan cara merender giliran.

• Gaya prompt — contoh milik Base 32K sendiri adalah completion (prompt = "The capital of Spain is"); En-Thinker mengharapkan apply_chat_template() dengan daftar pesan.

• Mode penalaran — Base 32K tidak memiliki mode penalaran; En-Thinker adalah mode ganda, menambahkan /think secara default dan mengeluarkan jejak pemikiran dalam bahasa Inggris, atau /no_think dengan enable_thinking=False untuk jawaban langsung.

• Cakupan bahasa — Kartu Base 32K mengklaim pelatihan pada 70+ bahasa dan menyebutkan 67 bahasa secara eksplisit; En-Thinker mencakup "44 bahasa plus Inggris" dengan jejak penalaran bahasa Inggris, yang diperluas hingga 20+ bahasa lagi melalui data instruksi non-penalaran tambahan.

• Jejak arsitektur — identik. Empat ukuran shard yang sama, jumlah parameter yang sama, dan panjang file konfigurasi yang sama.

• Konteks — 32K input plus output pada kedua kartu. Keduanya tidak dapat diverifikasi: kedua konfigurasi berada di balik gerbang lisensi.

• Tolok ukur — tidak ada pada kedua kartu. Tidak ada evaluasi pihak ketiga untuk kedua model tersebut.

• Traksi — Base 32K menunjukkan nol unduhan dan satu suka; En-Thinker menunjukkan tujuh unduhan dan dua suka. Keduanya tidak muncul dalam katalog penyedia inferensi.

Apa yang diperoleh dari langkah pasca-pelatihan

Tiga hal, semuanya bersifat perilaku, bukan struktural.

Yang pertama adalah antarmuka yang dapat digunakan. Checkpoint tanpa template obrolan bukanlah model yang Anda beri perintah; ia adalah model yang Anda lanjutkan. Setiap percakapan yang Anda lakukan dengan Base 32K harus Anda serialisasi sendiri menjadi teks, dan kartunya memang menyatakan demikian: "prompt harus menggunakan text completion, bukan chat template. Post-training tambahan disarankan sebelum menerapkannya sebagai asisten percakapan." En-Thinker telah membuat keputusan itu untuk Anda, sampai ke susunan tokennya.

Yang kedua adalah penalaran sebagai saklar. Mode /think dan /no_think En-Thinker memungkinkan bobot yang sama untuk menghasilkan rantai pemikiran yang terlihat di antara tag thinking atau menjawab secara langsung, dan kartu tersebut mendokumentasikan penerusan blok pemikiran sebelumnya kembali ke dalam percakapan sebagai giliran asisten. Itu adalah artefak pasca-pelatihan — tidak ada apa pun dalam checkpoint dasar yang meresponsnya.

Yang ketiga adalah taruhan desain yang menjadi inti En-Thinker: bahwa penalaran terjadi dalam bahasa Inggris bahkan ketika pertanyaan dan jawabannya dalam bahasa lain. Kartu tersebut secara eksplisit menyatakan bahwa ini membedakannya dari Tiny Aya L2-Thinker, "yang berpikir dalam bahasa yang sama dengan perintah." Apakah merencanakan dalam bahasa bersumber daya tinggi dan menjawab dalam bahasa bersumber daya rendah benar-benar membantu adalah pertanyaan penelitian terbuka, dan En-Thinker ada untuk memungkinkan orang mengujinya, bukan untuk menyelesaikannya. Base 32K, yang tidak memiliki mode penalaran sama sekali, diam terhadap pertanyaan tersebut — justru itulah mengapa ia merupakan kontrol yang tepat bagi siapa pun yang mencoba menjawabnya.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-en-thinker, also licence-gated. The tags row reads Text Generation, Transformers, Safetensors, 46 languages, cohere2, aya, reasoning, tiny-aya, conversational and License: cc-by-nc-4.0, and the safetensors panel additionally shows a Chat template entry. The summary describes a 3.35 billion parameter multilingual reasoning model trained with English reasoning traces for 44 languages plus English, and the card lists Model Size 3.35B and Context Length 32K (input + output). The closing line points readers to tiny-aya-global, tiny-aya-base and tiny-aya-l2-thinker, and the sidebar shows 7 downloads last month and 'This model isn't deployed by any Inference Provider.'

Berapa biaya langkah pasca-pelatihan?

Jawaban yang jujur adalah tidak seorang pun dapat mengukurnya, karena kedua model tersebut belum pernah dievaluasi pada apa pun. Namun, kedua kartu tersebut bersama-sama memberi petunjuk tentang di mana letak trade-off-nya, dan itu bukan di tempat yang Anda perkirakan.

Ini bukan cakupan bahasa. Cakupan penalaran sempit En-Thinker yang hanya 44-plus bahasa Inggris adalah properti dari data pelatihan penalaran, dan kartu tersebut mengatakan cakupan meluas hingga 20+ bahasa lainnya "melalui data instruksi non-penalaran tambahan" — jadi model tersebut tetap menanganinya, hanya saja tanpa jalur berpikir. Ini juga bukan jendela konteks; keduanya mengklaim 32K.

Ini adalah keluasan perilaku. Kartu Base 32K mencantumkan "pra-pelatihan lanjutan, penyesuaian instruksi, dan riset tentang pemodelan bahasa multibahasa dan berkonteks panjang" sebagai penggunaan yang dimaksudkan, dengan generasi teks multibahasa, peringkasan, penerjemahan, dan adaptasi lintas bahasa semuanya disebut sebagai aplikasi hilir. Kartu En-Thinker lebih sempit: "tugas matematika, sains, dan penalaran umum, serta mengikuti instruksi dan generasi terbuka multibahasa." Checkpoint pasca-pelatihan bersifat opiniated dengan cara yang tidak dimiliki checkpoint dasar, dan keterbatasan yang ditandai kartu Base 32K — "tugas penalaran rantai pemikiran seperti matematika multibahasa relatif lebih lemah" — justru kelemahan yang hendak diperbaiki oleh pasca-pelatihan.

Jadi keluarga tersebut terbaca sebagai pembagian kerja, bukan persaingan. Basisnya luas dan belum selesai; En-Thinker sempit dan sudah selesai; dan teks pada kartu basisnya sendiri menyebutnya sebagaimana adanya — substrat tempat kedua Thinker dibentuk.

Lisensi adalah kendala yang sebenarnya mengikat.

Kedua model dilisensikan di bawah CC-BY-NC-4.0 dengan Kebijakan Penggunaan yang Dapat Diterima dari Cohere Labs yang diberlakukan di atasnya, keduanya berada di balik gerbang yang sama yang meminta Anda menyetujui syarat dan mendaftar sebelum file diunduh, dan keduanya mengarahkan pertanyaan komersial ke Cohere Sales.

Hal ini perlu dinyatakan sebelum perbandingan teknis apa pun, karena hal ini menentukan jawaban bagi sebagian besar pembaca. Jika rencananya adalah produk komersial, tidak ada satu pun checkpoint yang menjadi kandidat tanpa percakapan dengan Cohere, dan perilaku konteks panjang atau fleksibilitas mode penalaran sebanyak apa pun tidak mengubah hal itu. Jika penggunaan non-komersial memang layak — karya akademis, riset internal, kerangka benchmark, perbandingan dengan model Anda sendiri — lisensi menjadi tidak relevan dan pilihan teknis menjadi satu-satunya keputusan.

Keduanya belum pernah di-benchmark. Meski begitu, inilah cara memilihnya.

Ketidakhadiran angka-angka itu nyata dan tidak akan selesai hanya dengan membaca lebih cermat. Kedua kartu tidak membuat klaim kinerja apa pun, tidak ada papan peringkat yang mencantumkan salah satu model, dan tak satu pun memiliki penyedia inferensi di belakangnya — artinya tidak ada penyedia yang memublikasikan throughput atau harga yang biasanya menjadi pengganti tolok ukur. Yang bisa Anda lakukan adalah berfokus pada struktur, yang buktinya kuat.

• Pilih Tiny Aya Base 32K jika Anda akan melatih. Pretraining lanjutan, penyetelan instruksi, atau adaptasi domain di atas model multibahasa 3,35B adalah sesuai dengan keterangan pada kartu modelnya, dan memulai dari checkpoint dasar berarti Anda tidak berhadapan dengan pasca-pelatihan yang tidak Anda pilih. Jendela 32K juga mendukung riset konteks panjang yang tidak dapat dilakukan oleh model dasar Februari 8K.

• Pilih Tiny Aya En-Thinker jika Anda ingin meminta sesuatu hari ini. Itu adalah satu-satunya dari keduanya yang dapat bercakap-cakap, dan satu-satunya yang memiliki mode penalaran sama sekali.

• Pilih keduanya jika pertanyaannya lebih bersifat ilmiah daripada praktis. Pasangan ini adalah perbandingan terkontrol — arsitektur sama, ukuran sama, window sama, sebagian besar berbeda dalam apakah post-training dilakukan — untuk menanyakan apakah jejak penalaran bahasa Inggris meningkatkan jawaban multibahasa. Itulah pertanyaan yang En-Thinker dirilis untuk memungkinkan orang menggali, dan induknya sendiri adalah baseline yang paling bersih.

A two-column scoreboard titled 'Tiny Aya Base 32K vs Tiny Aya En-Thinker — the scoreboard'. Both columns use the same six labels. The 'Tiny Aya Base 32K' column reads 'Stage: Pretrained base', 'Chat template: none', 'Reasoning mode: none', 'Languages: 70+ claimed', 'Benchmarks: none published' and 'Providers: none'. The 'Tiny Aya En-Thinker' column reads 'Stage: Post-trained SFT', 'Chat template: included', 'Reasoning mode: thinking mode', 'Languages: 44 + English', 'Benchmarks: none published' and 'Providers: none'. A footer reads 'Both cards stated by Cohere Labs; neither model has any independent benchmark.' The OrcaRouter logo is composited in the bottom-right corner.

Satu catatan praktis tentang mengevaluasi keduanya: keduanya adalah checkpoint penelitian yang belum teruji tanpa riwayat deployment, dan unduhan BF16 6,7 GB ditambah waktu GPU adalah biaya nyata yang dikeluarkan untuk model yang belum pernah dijalankan secara independen. Menjalankan perbandingan itu melalui satu endpoint daripada menyiapkan bobot untuk setiap kandidat lebih murah — OrcaRouter membawa 195 model di balik satu API dengan markup 0% dari harga daftar penyedia dan failover otomatis antar penyedia, sehingga checkpoint penelitian yang hanya Anda uji tidak akan pernah berada di jalur produksi. Tiny Aya tidak ada di dalamnya dan kami tidak menghostingnya; intinya hanyalah bahwa model yang akan Anda uji terhadapnya sebagian besar ada di sana.

Apa yang akan menyelesaikan ini

Dua hal, dan keduanya murah bagi Cohere Labs untuk dipublikasikan dan mahal bagi siapa pun untuk diproduksi.

Yang pertama adalah sebuah benchmark — benchmark apa pun. Satu evaluasi penalaran multibahasa yang dijalankan pada kedua checkpoint akan mengubah seluruh keluarga model ini dari status "sekadar klaim di kartu" menjadi "terukur," dan itu akan langsung menjawab apakah desain berpikir dalam bahasa Inggris mengungguli model yang sama tanpa pasca-pelatihan, yang merupakan pertanyaan riset yang menjadi inti dari perilisan ini.

Yang kedua adalah konfigurasi. Klaim 32K pada kedua kartu tersebut tidak dapat diverifikasi selama repositori-repositorinya masih dibatasi aksesnya, dan perbedaan antara pelatihan awal dengan konteks panjang yang sesungguhnya dan perluasan penyandian posisi yang diterapkan pada checkpoint 8K sangat besar dalam praktiknya, meskipun keduanya menghasilkan model yang menerima token 32K. Membuka kedua file konfigurasi akan menutup celah tersebut dengan cara yang tidak dapat dilakukan oleh teks pemasaran mana pun.

Sampai saat itu, jawaban akurat untuk "Tiny Aya Base 32K atau Tiny Aya En-Thinker" adalah bahwa perbandingannya nyata tetapi kontesnya tidak. Bobot yang sama, jendela yang sama, lisensi yang sama, keheningan yang sama dari semua orang yang belum mengunduhnya — salah satunya hanya memiliki template obrolan dan tag berpikir, dan yang lainnya adalah apa yang ia dibuat darinya.