Kartu judul hero untuk 'Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite' dengan subjudul 'Gratis bukan berarti murah — pemain mapan masih menjadi pilihan aman' dan dua kartu statistik: Ling 3.0 Tiny (AA Index 23, sangat verbose, gratis hingga 14 Agu) dan Gemini 3.5 Flash-Lite (AA Index 36, ~490 tok/s, $0.30 / $2.50). Logo OrcaRouter dikompositkan di pojok kanan bawah.
Guides & Insights

Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite: Gratis Bukan Berarti Murah, dan Pemain Lama Masih Pilihan Aman

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

"Gratis" adalah kata paling mahal dalam kosakata pasar model, karena biasanya berarti seseorang akan membebani Anda dengan sesuatu selain harga yang tertera. Itulah jebakan yang tersembunyi di balik pertarungan antara Ling 3.0 Tiny, model penalaran MoE 7.9B-parameter baru dari Ant Group InclusionAI, dan Gemini 3.5 Flash-Lite, tingkat Ge​mini dari Go​ogle yang saat ini paling murah dan tercepat. Ling 3.0 Tiny gratis untuk dipanggil sekarang dan berharga $0.06 / $0.18 per juta token setelah promosi 14 Agustus — tetapi Artificial Analysis mengukurnya menghabiskan 210M token keluaran hanya untuk mendapatkan skor pada kelas 56 model, dibandingkan dengan median 63M, dan menandainya sebagai "sangat bertele-tele." Gemini 3.5 Flash-Lite berharga lima kali lipat per token, yaitu $0.30 / $2.50, namun ia memiliki Indeks Intelijen independen sebesar 36 — 13 poin di atas Ling 3.0 Tiny — dan kecepatan keluaran sekitar 490 token per detik. Label harga yang lebih murah, pembicara yang lebih cepat, dan skor yang lebih rendah semuanya adalah model yang sama. Itulah seluruh cerita perbandingan ini, dan seluruh alasan untuk berpikir dua kali sebelum Anda memilih pendatang baru hanya berdasarkan harga.

Kedua model berada di kelas budget, tetapi berada di titik yang berbeda dalam siklus hidupnya. Gemini 3.5 Flash-Lite adalah pemain mapan: dirilis pada 21 Juli 2026, diukur ulang secara terus-menerus oleh pihak ketiga, dan digunakan secara luas sebagai tingkat default untuk pekerjaan agentik bervolume tinggi dan sensitif terhadap latensi. Ling 3.0 Tiny baru berumur seminggu, dibanderol untuk menarik pengguna, dan dinilai tepat satu kali. Tulisan ini memisahkan apa sebenarnya masing-masing model, apa kata angka independen, dan mengapa harga "gratis" adalah angka yang paling tidak berguna dalam perbandingan ini.

Ling 3.0 Tiny, pendatang baru dengan meteran

Ling 3.0 Tiny launched on August 6, 2026 on commercial APIs with a quiet-listing pattern rather than a launch event. It is a mixture-of-experts model with 7.9B total parameters and roughly 1.3B active per token, a 256K-token context window (listed as 262K on the commercial listings and Artificial Analysis), up to 32K output tokens, native function calling, and prompt caching. Two modes switch per request: "Thinking," on by default, which spends output tokens on extended reasoning, and "Instant," which answers directly. It is text-in, text-out — no image, audio, or video input.

The pricing structure deserves precision, because "free" is doing a lot of work. It is listed as inclusionai/ling-3.0-tiny:free at $0 per million tokens on both sides; a second gateway runs it free until 8:00am PT on August 14, 2026, then applies its listed rate of $0.06 per million input and $0.18 per million output tokens, with cached input at $0.01. Artificial Analysis, which sampled the free tier, shows the $0.00 / $0.00 price on its live page. So the model is genuinely free right now, and genuinely metered a week from now.

Screenshot of the Artificial Analysis page for Ling 3.0 Tiny, showing an Intelligence Index of 23, price $0.00 / $0.00 on the free tier, a 210M-token verbosity read versus a 63M median, and output speed listed as N/A. REUSED from the what-is-ling-3-0-tiny explainer (audited).

Gemini 3.5 Flash-Lite, petahana

{{1}}Gemini 3.5 Flash-Lite adalah jawaban Go​ogle atas pertanyaan yang sama, ditempatkan satu tingkat di bawah lini Gemini 3.5.{{/1}} {{2}}Model ini multimodal secara native pada input — teks, gambar, video, audio, dan file — dengan output teks, jendela konteks 1M-token, hingga 64K token output, dan upaya penalaran yang dapat dikonfigurasi (minimal, rendah, lebih tinggi) sehingga sebuah pipeline dapat menyesuaikan kedalaman, dan biayanya, per permintaan.{{/2}} {{3}}Skor independennya merupakan lompatan generasi yang nyata: Artificial Analysis Intelligence Index 36, berperingkat #12 dari 151 model yang dilacak, naik dari 25 untuk Gemini 3.1 Flash-Lite.{{/3}} {{4}}Dari segi kecepatan, ini adalah model tercepat di seri 3.5 — Go​ogle menyebutkan 350 token output/detik saat peluncuran, dan halaman live AA telah mengukur sekitar 490 token/detik, menempati peringkat #2 di antara model yang dilacak.{{/4}} {{5}}Angka agentik yang dilaporkan vendor — 74,0% pada OSWorld-Verified, 54% pada Terminal-Bench 2.1, 72,2% pada tes pengambilan multi-jarum 128K — adalah milik Go​ogle sendiri dan bersifat indikatif, bukan kepastian mutlak, dan satu pertanyaan terbuka (computer-use tercantum sebagai bawaan di blog Go​ogle tetapi tidak didukung dalam dokumen API) layak diperiksa sebelum Anda bergantung padanya.{{/5}}

It juga, per token, tidak murah untuk kelasnya. Nama "Lite" menggambarkan posisi model dalam lini produk, bukan harga yang turun: Gemini 2.5 Flash-Lite adalah $0,10 / $0,40, 3.1 Flash-Lite adalah $0,25 / $1,50, dan 3.5 Flash-Lite adalah $0,30 / $2,50 per juta token, dengan input yang di-cache sebesar $0,03. Keunggulan efisiensi berasal dari kecepatan dan ekonomi token, dan pengukuran Artificial Analysis sendiri menunjukkan biaya nyata per tugas kira-kira dua kali lipat dari generasi ke generasi, sementara waktu per tugas berkurang setengahnya.

Papan skor independen, dibaca dalam konteks.

Jika kedua model ditempatkan pada indeks yang sama, perbedaannya sangat mencolok: Gemini 3.5 Flash-Lite di 36, Ling 3.0 Tiny di 23. Namun, perbandingan utama itu hanya setengah dari gambaran keseluruhan, karena kedua model tidak dinilai dalam bidang yang sama. AA menempatkan Ling 3.0 Tiny di peringkat #6 dari 56 dalam kelas model tiny-nya, dengan median kelas 8 — jauh di atas rata-rata untuk model seukurannya. Gemini 3.5 Flash-Lite berada di peringkat #12 dari 151 di seluruh bidang yang lebih luas yang dilacak. Yang satu adalah model tiny yang luar biasa; yang lainnya adalah model budget yang solid di kumpulan terbuka. Kedua pernyataan itu benar, dan keduanya memiliki arti yang berbeda. Ling 3.0 Tiny lebih bernilai untuk kelas ukurannya daripada Gemini 3.5 Flash-Lite untuk tingkatannya — dan Gemini 3.5 Flash-Lite tetap menjadi model yang lebih mumpuni dengan selisih yang jauh pada skala independen yang sama.

Comparison scoreboard for Ling 3.0 Tiny vs Gemini 3.5 Flash-Lite. Left column Ling 3.0 Tiny: AA 23, $0.06 / $0.18 after promo, 210M output tokens, text-only, 256K context, speed N/A (Vercel 264 tok/s). Right column Gemini 3.5 Flash-Lite: AA 36, $0.30 / $2.50, 43M output tokens, text + image + video + audio, 1M context, ~490 tok/s (AA). Footer: 'Both models per Artificial Analysis.' OrcaRouter logo composited bottom-right.

Dimensi, masing-masing satu baris:

• Skor independen — Ling 3.0 Tiny AA Index 23 (#6/56, median kelas 8) vs Gemini 3.5 Flash-Lite AA Index 36 (#12/151).

• Harga — Ling 3.0 Tiny $0.06 / $0.18 per 1M setelah promo gratis vs Gemini 3.5 Flash-Lite $0.30 / $2.50 per 1M (input cache $0.03).

• Verbositas — Ling 3.0 Tiny menghasilkan 210M token keluaran di seluruh proses indeks vs Gemini 3.5 Flash-Lite yang terukur tetapi tidak bertele-tele berdasarkan flag tersebut.

• Modalitas — Ling 3.0 Tiny hanya teks vs Gemini 3.5 Flash-Lite masukan teks, gambar, video, audio, dan file.

• Konteks — 256K pada Ling 3.0 Tiny vs 1M pada Gemini 3.5 Flash-Lite, dengan output maksimal 64K pada keduanya.

• {{1}}Kecepatan{{/1}} — {{KEEP}}Ling 3.0 Tiny{{/KEEP}} ~90–264 token/detik di berbagai endpoint yang telah memublikasikan angka vs {{KEEP}}Gemini 3.5 Flash-Lite{{/KEEP}} ~490 token/detik pada pengukuran langsung AA.

Baris kecepatan adalah yang paling mungkin berubah. Kecepatan keluaran Ling 3.0 Tiny benar-benar belum jelas: Artificial Analysis mencantumkannya sebagai N/A, sementara Vercel mengiklankan 264 token/detik. ~490 token/detik milik Gemini 3.5 Flash-Lite adalah pengukuran AA langsung yang diambil jauh setelah gejolak peluncurannya sendiri mereda. Untuk tingkatan yang sensitif terhadap latensi, itulah perbedaan antara sesuatu yang sudah pasti dan pertanyaan yang belum terjawab.

Ekonomi verbositas: mengapa gratis tidak murah

Inilah hitungan yang biasanya menentukan pertarungan ini. Jalankan tugas sarat penalaran yang sama — misalnya 4.000 token input, 2.000 token output — melalui kedua model setelah promo Ling 3.0 Tiny berakhir. Ling 3.0 Tiny menagih (4.000 × $0,06 + 2.000 × $0,18) / 1.000.000, sekitar $0,0006. Gemini 3.5 Flash-Lite menagih (4.000 × $0,30 + 2.000 × $2,50) / 1.000.000, sekitar $0,0062. Pada jumlah token yang identik, Ling 3.0 Tiny 10x lebih murah. Lalu tambahkan faktor verbositas: model penalaran yang mengeluarkan token berpikir sebagai output tidak menghasilkan jumlah token yang identik. Jika rasio verbositas 210M-versus-63M milik Ling 3.0 Tiny berlaku pada beban kerja Anda, biaya efektif per tugas kira-kira menjadi tiga kali lipat di sisi output, dan keunggulan 10x menyusut mendekati 3–4x. Masih lebih murah — tetapi tidak lagi gratis, dan tidak sekelas dengan kesan yang ditimbulkan angka 210M.

Framing yang jujur adalah bahwa kedua model bukanlah pengganti dengan kualitas yang sama. Skor 23 dari Ling 3.0 Tiny merupakan skor luar biasa untuk model aktif 1,3B; skor 36 dari Gemini 3.5 Flash-Lite berada di liga kemampuan yang berbeda, plus visi, plus konteks 1M, plus kecepatan yang mapan. Anda membayar untuk kesenjangan itu — lima kali lipat harga per token, dan lebih banyak per tugas setelah memperhitungkan perbedaan kecepatan — tetapi itu adalah kesenjangan kemampuan yang nyata, bukan sekadar pemasaran. Jika beban kerja Anda dapat bertahan dengan kualitas model yang lebih murah, Ling 3.0 Tiny adalah nilai yang lebih baik. Jika beban kerja Anda membutuhkan kemampuan itu, tidak ada keunggulan harga yang dapat menutup kesenjangan tersebut.

Tempat router membuktikan nilainya

Ini persis bentuk beban kerja di mana tier routing mengungguli komitmen model tunggal, dan fakta hosting berperan penting dalam cara Anda membangunnya. Gemini 3.5 Flash-Lite sudah live di OrcaRouter dengan harga daftar penyedianya — $0.30 masuk / $2.50 keluar per 1M, diteruskan dengan markup 0%, jadi angka di kartu tarif Google sama dengan angka di sisi kami, dan setiap penurunan harga di masa depan berlaku di hari yang sama. Ia berada di balik endpoint OpenAI-compatible yang sama seperti 200+ model lainnya, dengan failover otomatis antar penyedia untuk saat penyedia baseline menurun di tengah proses, dan DSL routing dapat mengirim prompt ke beberapa model dan menyimpan jawaban terbaik.

Ling 3.0 Tiny tidak ada di OrcaRouter; ia dilayani oleh endpoint-nya sendiri, gratis saat ini. Kombinasi itu justru memperkuat kasus routing, bukan melemahkannya. Gunakan jendela gratis untuk melakukan benchmark Ling 3.0 Tiny terhadap lalu lintas Anda sendiri sebelum dikenakan biaya. Lalu bangun jalur produksi di tier hosted — Gemini 3.5 Flash-Lite untuk panggilan yang membutuhkan visi, konteks panjang, atau profil kecepatan yang stabil, dengan lapisan routing bebas meningkat ke model yang lebih mahal untuk minoritas yang sulit. Tier gratis adalah eksperimen yang bagus dan ketergantungan yang rapuh; tier hosted adalah hal yang bisa Anda bangun produk di atasnya. Di OrcaRouter Anda dapat menjalankan keduanya dalam grafik yang sama — Ling 3.0 Tiny melalui endpoint langsung, Gemini 3.5 Flash-Lite melalui kunci — dan biarkan router memutuskan per permintaan.

Screenshot of the OrcaRouter model page for Gemini 3.5 Flash-Lite (google/gemini-3.5-flash-lite) showing $0.30 input / $2.50 output per 1M tokens, a 1M-token context, up to 64K max output, multimodal text + image + video + file + audio input, and a p50 time-to-first-token of 819ms over the last 7 days. Fresh Edge-headless capture, audited.

Vonis

Jika Anda memilih di antara keduanya dan tidak menggabungkannya, keputusannya sederhana untuk diungkapkan tetapi sulit untuk disukai. Ling 3.0 Tiny adalah tawaran yang lebih baik sekaligus model yang lebih lemah: tingkatan penalaran khusus teks yang baru berumur seminggu, dengan skor yang sangat baik untuk ukurannya, harga yang agresif, serta gambaran kecepatan dan verbositas yang belum tuntas — layak untuk segera dievaluasi melalui uji coba gratis, dan perlu diketahui bahwa layanan ini akan dihitung mulai 14 Agustus. Gemini 3.5 Flash-Lite adalah pilihan default produksi yang lebih aman: secara independen mencetak skor 13 poin lebih tinggi, multimodal, konteks 1M, lima kali lebih cepat berdasarkan pengukuran yang mapan, dan dibanderol dengan harga yang sesuai. Gratis tidaklah murah ketika model berbicara tiga kali lebih banyak untuk berpikir pada batas kapabilitas yang lebih rendah — dan pemain lama adalah pilihan aman karena suatu alasan.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube