
API LLM Gratis di 2026: Apa yang Benar-Benar Gratis, dan Apa yang Anda Bayar sebagai Gantinya
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Cari API LLM gratis dan Anda akan mendapat daftar. Tiga belas penyedia, lima belas penyedia, tabel logo, kolom centang hijau. Yang hampir tidak disebutkan oleh daftar-daftar tersebut adalah bagian yang menentukan apakah tingkatan gratis itu berguna bagi Anda: setiap API LLM gratis membebani Anda dengan sesuatu. Hanya saja bukan uang tunai.
Ada tiga mata uang. Anda membayar dengan data Anda, Anda membayar dengan batas atas Anda, atau Anda membayar dengan tier model Anda — dan biasanya ketiganya sekaligus. Tulisan ini membahas masing-masing dengan dokumentasi penyedia sendiri, bukan tabel dari pihak kedua, lalu menjawab pertanyaan yang dilewatkan daftar-daftar tersebut: apa yang terjadi ketika tier gratis habis.
Mata uang satu: data Anda
Ini adalah hal yang seharusnya menentukan jawaban bagi kebanyakan tim, dan ini pula yang paling banter hanya mendapat catatan kaki.
Halaman harga Gemini API Google secara luar biasa terus terang tentang hal ini. Untuk setiap model dengan tingkat gratis, halaman tersebut mencantumkan apa yang terjadi pada konten Anda. Pada tingkat gratis, kalimatnya berbunyi "Konten digunakan untuk meningkatkan produk kami." Pada tingkat berbayar dari model yang sama, kalimat yang sama berbunyi "Konten tidak digunakan untuk meningkatkan produk kami." Model yang sama, endpoint yang sama, kode yang sama — satu-satunya hal yang berubah adalah apakah Google boleh menyimpan apa yang Anda kirim.
Mistral bekerja dengan cara yang sama, tetapi dengan default yang berbeda. Di La Plateforme, data masukan dan keluaran digunakan untuk melatih model kecuali Anda memilih keluar, dan pengguna paket gratis dapat memilih keluar — itu adalah toggle di menu Privacy pada Admin Console, dan setelah dikonfirmasi, Mistral berhenti menggunakan masukan dan keluaran Anda untuk pelatihan. Paket Team dan Enterprise sama sekali tidak termasuk dalam kumpulan pelatihan.
Perbedaan itu lebih penting daripada kelihatannya. Banyak ringkasan yang akan Anda temukan menyatakan secara gamblang bahwa tingkat gratis Mistral mengharuskan Anda menerima pelatihan. Itu berlaku untuk kebijakan sebelumnya, dan tidak berlaku sekarang. Jika Anda mengevaluasi berdasarkan posting blog dari enam bulan lalu, Anda akan keliru dalam kedua arah — menganggap penyedia aman padahal tidak, atau mengesampingkan penyedia padahal sebuah kotak centang akan menyelesaikannya.
Aturan praktisnya: jika prompt berisi sesuatu yang Anda ragu untuk menempelkannya ke forum publik, paket gratis itu sebenarnya tidak gratis. Catatan pelanggan, kode internal, salinan produk yang belum dirilis, apa pun di bawah NDA — biaya paket gratis di sana adalah masalah tata kelola data yang diam-diam Anda ciptakan untuk ditemukan orang lain.

Mata uang dua: batas atas Anda.
Paket gratis diukur pada lebih banyak dimensi daripada yang diperkirakan orang, dan Anda akan terkena dimensi mana pun yang habis lebih dulu. Groq mempublikasikan batas paket gratisnya per model, dan bentuknya instruktif:
Bandingkan kedua baris model tersebut. Permintaan per menitnya sama, tetapi model yang lebih besar memberi Anda 1.000 permintaan per hari, bukan 14.400 — pengurangan empat belas kali lipat untuk peningkatan kapabilitas. Dan batas tersebut berlaku di tingkat organisasi, bukan per pengguna, sehingga pengembang kedua di akun yang sama tidak mendapatkan jatah sendiri; mereka memakai jatah Anda.
Batas harian adalah yang diam-diam membunuh proyek. 1.000 permintaan sehari terdengar banyak sampai Anda menempelkannya pada sesuatu yang nyata: fitur obrolan dengan 50 pengguna yang masing-masing 20 giliran sudah menghabiskan seluruh hari Anda. Pekerjaan batch malam hari yang mencoba ulang saat gagal dapat menghabiskan batas sebelum sarapan. Batas per menit bisa Anda siasati dengan antrean. Batas per hari tidak bisa — Anda hanya bisa menunggu tengah malam.
Angka yang perlu Anda tentukan sebelum membangun bukanlah "apakah ada tier gratis", melainkan "berapa anggaran permintaan per hari per pengguna, dan berapa banyak pengguna yang didukungnya?" Jika jawabannya di bawah seratus, Anda sedang membangun demo, dan Anda harus menyadari itu sejak awal.
Mata uang ketiga: tingkat model Anda
Biaya ketiga adalah hal yang menentukan apa yang sebenarnya bisa kamu bangun:model frontier tidak tersedia di tier gratis, dan kesenjangannya semakin melebar.
Tingkat gratis Google kini mencakup kelas Flash dan model embedding — Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash-Lite, Gemini 3.1 Flash-Lite, Gemini 2.5 Flash, Gemini 2.5 Flash-Lite dan Gemini 2.0 Flash. Jajaran Pro tidak termasuk di dalamnya. Itu adalah penyempitan yang disengaja: model seri Pro dipindahkan menjadi berbayar untuk akses API pada 2026, dan sejak saat itu tingkat gratis hanya mencakup Flash dan yang lebih rendah.
Ini bukan keluhan — model kelas Flash pada tahun 2026 memang sangat kuat, dan untuk klasifikasi, ekstraksi, perutean, peringkasan, serta sebagian besar pekerjaan retrieval-augmented, model-model tersebut adalah pilihan yang tepat, baik Anda membayar maupun tidak. Namun ini berarti tingkatan gratis tidak dapat menjawab pertanyaan yang paling ingin Anda dapatkan jawabannya selama evaluasi, yaitu "apakah model yang bagus dapat menyelesaikan kasus sulit saya?" Anda akan mengevaluasi model yang murah dan menyimpulkan ke atas, dan inferensi tersebut sering kali salah dalam kedua arah.
Yang benar-benar gratis per token
Ada satu kategori yang biasanya disebutkan dalam rangkuman dan jarang dipikirkan secara mendalam: model open-weight yang Anda jalankan sendiri. Unduh bobotnya, jalankan di perangkat keras Anda sendiri, dan biaya marjinal per token benar-benar nol. Tidak ada batas kecepatan, tidak ada batas harian, tidak ada klausul pelatihan, tidak ada tingkatan — Anda memiliki semuanya.
Yang Anda lakukan adalah memindahkan biaya dari satu baris ke baris penggajian. Seseorang harus menentukan ukuran GPU, memilih dan menyetel serving stack, menjaganya tetap di-patch, menangani panggilan pukul 3 pagi saat throughput runtuh, dan mengulangi semuanya ketika checkpoint yang lebih baik muncul dua bulan kemudian. Bagi tim yang sudah menjalankan infrastruktur, itu bisa menjadi opsi termurah dengan selisih besar pada volume. Bagi tim tiga orang yang meluncurkan produk, satu minggu kerja insinyur yang dihabiskan untuk plumbing inferensi lebih mahal daripada beberapa tahun tagihan API yang digantikannya.
Hosting mandiri adalah jawaban yang tepat ketika Anda memiliki volume, kebutuhan privasi yang tidak memungkinkan solusi lain, atau tim platform yang sudah ada. Ini adalah jawaban yang salah ketika yang sebenarnya Anda butuhkan adalah berhenti memikirkan inferensi.

Biaya yang tak pernah dicantumkan dalam tabel: tingkatan gratis tidak dapat dikomposisikan
Inilah mode kegagalan yang sebenarnya menghabiskan waktu tim, dan itu berasal dari terlalu mengikuti saran tingkat gratis.
Anda mengambil rute yang masuk akal. Tingkat gratis Google untuk pekerjaan kelas Flash. Tingkat gratis penyedia lain untuk inferensi open-weight yang cepat. Penyedia ketiga untuk ucapan. Masing-masing benar-benar gratis, masing-masing adalah keputusan yang baik secara individual. Enam minggu kemudian Anda memegang tiga kunci API, tiga SDK, tiga rezim batas laju, tiga hubungan penagihan dan tiga perilaku kegagalan yang berbeda — dan logika percobaan ulang Anda, observabilitas Anda, dan perhitungan biaya Anda harus memahami semuanya.
Lalu salah satu dari mereka berubah. Sebuah penyedia menyempitkan tier gratisnya — seperti yang terjadi ketika model kelas Pro berubah menjadi berbayar saja. Jalur fallback Anda tidak pernah diuji karena tidak pernah terpicu. Migrasi yang sedang Anda lakukan bukanlah perubahan konfigurasi; melainkan refactor dari lapisan yang Anda bangun untuk menutupi perbedaan-perbedaan tersebut, dan Anda melakukannya di bawah tekanan waktu karena hal itu sudah berada dalam produksi.
Tingkat gratis itu gratis. Lock-in yang Anda akumulasikan untuk mendapatkannya tidaklah gratis. Inilah alasan sebenarnya untuk peduli apakah lapisan akses Anda portabel: bukan ideologi tentang netralitas vendor, melainkan fakta bahwa tingkat gratis adalah bagian paling fluktuatif dari penawaran penyedia mana pun, dan membangun langsung di atas tiga di antaranya menjamin Anda akan memigrasikan sesuatu dalam setahun.
Apa yang sebenarnya harus dilakukan
Jika Anda sedang membuat prototipe dan datanya tidak sensitif — manfaatkan tier gratis dari vendor, dan manfaatkan tanpa rasa bersalah. Itu memang ada untuk hal ini. Tulis integrasi di balik satu antarmuka milik Anda sendiri sejak awal sehingga mengganti penyedia hanyalah perubahan konfigurasi, bukan refactor.
Jika data tersebut sensitif — jangan gunakan tier gratis yang melatih model pada input Anda. Bayarlah untuk tier di mana vendor secara kontraktual tidak melatih model pada input Anda (batas gratis-versus-berbayar Google dengan tegas menyatakan hal ini), matikan pelatihan jika penyedia mengizinkannya pada paket gratis, atau self-host. Tidak ada opsi keempat, dan menyadari hal ini setelah peluncuran jauh lebih mahal daripada tagihan API yang coba Anda hindari.
Jika Anda mengevaluasi model satu sama lain — tier gratis akan menyesatkan Anda, karena tidak berisi model yang akan Anda rilis. Evaluasi pada tier yang Anda rencanakan untuk dijalankan di produksi, pada prompt Anda sendiri. Biaya evaluasi yang benar hanya beberapa dolar; biaya salah memilih adalah satu kuartal.
Kalau Anda akan masuk ke produksipertanyaannya tidak lagi "apa yang gratis", melainkan "berapa biaya per token, dan apa yang terjadi jika penyedia ini mengalami gangguan." Keduanya adalah pertanyaan yang berbeda dengan jawaban yang berbeda, dan tier gratis tidak menjawab keduanya.
Di mana OrcaRouter cocok
OrcaRouter menjalankan serangkaian model AI gratis yang bergilir dan dapat dipanggil dengan tarif $0 per token, di samping kredit API gratis dari drop voucher terbuka, program mahasiswa, dan hackathon mitra. Membuat akun dan mengklaim tawaran terbuka tidak memerlukan metode pembayaran; jajaran model gratis berubah seiring hadirnya model open-weight dan model promosi baru, dan kredit promo dari voucher atau hackathon biasanya dapat digunakan di seluruh katalog daripada hanya terbatas pada model gratis.
Bagian yang penting untuk masalah yang dijelaskan di atas adalah apa yang terjadi selanjutnya. Semuanya berjalan melalui satu endpoint yang kompatibel dengan OpenAI, jadi model gratis yang Anda gunakan untuk membuat prototipe dan model frontier yang Anda gunakan untuk produksi adalah integrasi yang sama — perubahan string di kolom model, bukan migrasi. Saat tier gratis menyempit atau model tidak lagi didukung, Anda mengubah ID model. Saat Anda perlu membandingkan Gemini 3.6 Flash dengan DeepSeek V4 Flash pada prompt Anda sendiri, Anda dapat melakukannya tanpa mendaftar untuk hal baru apa pun.
Itulah tawaran jujur untuk sebuah router dalam artikel tentang API gratis: bukan bahwa kami lebih murah daripada gratis, tetapi bahwa tier gratis adalah hal paling fluktuatif yang bisa Anda jadikan landasan untuk membangun, dan biaya dari fluktuasi itulah yang layak dirancang untuk dihilangkan.

Versi singkatnya
API LLM gratis di tahun 2026 nyata, berguna, dan layak digunakan — untuk pembuatan prototipe, untuk beban kerja yang tidak sensitif, untuk pembelajaran, dan untuk sebagian besar tugas yang ditangani dengan sangat baik oleh model kelas Flash. Itu bukan strategi produksi, dan tidak gratis.
Sebelum Anda membangun di atasnya, dapatkan tiga jawaban tertulis dari dokumentasi penyedia itu sendiri, bukan dari ringkasan: apakah tier ini melatih model pada data saya, berapa batas permintaan per hari saya, dan apakah model yang benar-benar akan saya rilis tersedia di sini? Jika Anda bisa menjawab ketiganya dan masih menyukai tawarannya, ambil. Jika Anda tidak bisa menjawabnya, Anda belum menghitung harganya — Anda baru saja melihat angka nol dan berhenti membaca.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
