Kartu judul bertuliskan 'Jev: Model yang Menolak Menulis' dengan subjudul 'Model keputusan TypeSafe AI mengembalikan jawaban bertipe, bukan teks', tiga kartu berlabel untuk primitif Choice, Score, dan Noul, serta blok statistik yang menunjukkan 777 penilaian dalam waktu kurang dari 0,7 detik dengan biaya $0,042 per juta token masukan.
Guides & Insights

Jev Menolak Menulis Satu Kata Pun: Apa yang Dilakukan Model Keputusan TypeSafe AI, dan Apa yang Belum Diverifikasi oleh Siapa Pun

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Jev adalah model pertama dari TypeSafe AI yang mungkin dijumpai pembaca melalui tabel biaya, bukan kotak chat, karena memang tidak ada kotak chat. Diluncurkan pada 15 September 2026 oleh Diogo Almeida — salah satu penulis bersama makalah InstructGPT, karya yang membuat ChatGPT berperilaku seperti asisten — Jev sama sekali tidak menghasilkan teks. Model ini menerima sepotong state (email, baris log, tiket dukungan, blob JSON koordinat game) plus daftar pertanyaan bertipe, lalu mengembalikan jawaban bertipe: pilihan dari himpunan yang Anda sediakan, skor pada rubrik, atau probabilitas ya/tidak, masing-masing membawa nilai keyakinannya sendiri. Tanpa prosa, tanpa kode, tanpa penjelasan. Klaim jual TypeSafe adalah bahwa kesempitan ini justru produknya, karena hal itu memberi kecepatan dan harga yang tidak dapat ditandingi model generatif — 20 hingga 200 kali lebih cepat dan 40 hingga 400 kali lebih murah daripada "LLM yang sebanding" pada materi peluncuran perusahaan sendiri, dengan $0,042 per juta token masukan dan keluaran ditagih nol.

Angka paling berguna yang dipublikasikan dalam 48 jam pertama bukan salah satu dari itu. Angka itu berasal dari Every, yang kepala evaluasinya menjalankan Jev pada 27 artikel Every yang telah dipublikasikan plus 10 padanan bergaya AI, mengajukan 21 pertanyaan kepada seluruh 37 dokumen sekaligus: 777 penilaian dalam waktu kurang dari 0,7 detik, dengan biaya sekitar seperempat sen. Tes kedua, yang dijalankan oleh CEO Every, menguji 12 paragraf sintetis — enam bersih, enam dengan cacat yang sengaja ditanamkan — terhadap empat pemeriksaan tulisan. Jev menghasilkan median 0,35 detik per paragraf, dibandingkan 8,83 detik untuk Claude Fable 5.1 pada upaya tinggi: sekitar 25 kali lebih cepat dengan biaya sekitar 1/580 kalinya. Jev menangkap enam dari tujuh cacat yang ditanamkan. Claude Fable 5.1 menangkap ketujuhnya. Verdikt Every adalah "bagus tetapi tidak sempurna," dan itulah bacaan jujur satu baris tentang Jev dari satu-satunya tes independen yang dipublikasikan siapa pun sejauh ini — klaim kecepatan dan biaya bertahan setelah bersentuhan dengan pihak ketiga, klaim akurasi berada satu tingkat di bawah frontier, dan sampelnya cukup kecil sehingga tidak ada yang seharusnya menarik kesimpulan produksi darinya.

Catatan tentang jenis bukti yang digunakan artikel ini, karena tingkatannya sangat berjauhan untuk model yang begitu baru. Jev nyata dan dapat dipanggil: ada endpoint yang didokumentasikan, SDK Python, alias model, dan harga yang dipublikasikan. Peluncurannya diumumkan vendor, bukan bocor, dan tak ada yang menebak-nebak apakah model itu ada. Namun setiap klaim performa yang diunggulkan TypeSafe adalah milik TypeSafe sendiri, arsitekturnya belum dipublikasikan, bobotnya belum dirilis, dan dasbor tolok ukur di balik headline 20-200x adalah sekumpulan evaluasi alur kerja internal, bukan papan peringkat publik. Satu pihak luar telah mengujinya. Artikel ini menjaga angka vendor, angka independen, dan pertanyaan terbuka tetap terpisah secara jelas alih-alih merata-ratakannya menjadi konsensus yang tidak ada.

Apa yang sebenarnya dirilis TypeSafe

Jev adalah yang pertama dari apa yang disebut TypeSafe sebagai model System One — nama itu dipinjam dari separuh kognisi Daniel Kahneman yang cepat dan intuitif, sebagai lawan dari mode deliberatif yang lebih lambat yang ditiru chatbot. Kontras yang ditarik TypeSafe adalah dengan pola standar yang memaksa generator teks untuk mengeluarkan keluaran terstruktur lalu mengurai teks itu kembali menjadi sesuatu yang dapat dipercaya oleh kode. Jev melewati teks sepenuhnya. Dokumentasi TypeSafe sendiri menyatakan hal ini secara gamblang: "Model bahasa besar (LLM) dirancang untuk menghasilkan teks yang dibaca manusia. Ketika Anda memerlukan model untuk membuat penilaian yang akan dikonsumsi oleh kode Anda, hal itu menciptakan ketidakcocokan."

Permukaan keluaran terdiri dari tiga primitif, dan tidak ada yang lain. Setiap pertanyaan yang Anda ajukan harus merupakan salah satu dari itu:

• Pilihan — pilih satu opsi dari daftar yang Anda sediakan, mengembalikan opsi yang dipilih ditambah probabilitas untuk setiap kandidat dan tingkat keyakinan. Opsi dibatasi hingga 255 per bidang; di luar itu TypeSafe mendokumentasikan pola dua tahap untuk menilai kandidat secara independen lalu memilih.

• Skor — tempatkan state pada rubrik terurut, mengembalikan level, probabilitas per level, dan nilai keyakinan. Risiko churn pada skala 0-1 adalah contoh di dokumentasi.

• Noul — gabungan kata dari "no" dan "null" — klaim ya/tidak tunggal, yang mengembalikan probabilitas terkalibrasi bahwa klaim itu benar.

A capture of TypeSafe's own documentation introduction page, showing the sentence 'Jev is TypeSafe's flagship model and the first System One model', a table of the three primitives Choice, Score and Noul with what each returns, and the line that adding questions to a call barely changes the response time.

Sifat yang menarik bukanlah primitif mana pun, melainkan bagaimana semuanya dikomposisikan. Ketiganya dapat dicampur dalam satu panggilan API, dan setiap pertanyaan dievaluasi secara paralel terhadap satu pembacaan bersama dari state yang sama. Dokumentasi TypeSafe menyatakan bahwa menambahkan pertanyaan "nyaris tidak mengubah waktu respons," dan uji independen mendukungnya dalam praktik — 21 pertanyaan di 37 dokumen selesai dalam 0,7 detik yang sama. Itulah yang membuat harga per penilaian anjlok: Anda tidak membayar untuk generasi yang lebih panjang, Anda membayar untuk satu lintasan.

Amplop praktisnya, sebagaimana didokumentasikan dan sebagaimana dilaporkan oleh para pengguna awal: kira-kira anggaran permintaan 32.000 token, yang dijelaskan dalam dokumentasi TypeSafe sebagai sekitar 150.000 karakter bahasa Inggris; tidak ada masukan gambar atau audio saat peluncuran; dan bentuk permintaan serta respons yang bukan konvensi chat-completions OpenAI, sehingga untuk memanggilnya diperlukan klien khusus alih-alih sekadar menukar base-URL. Aksesnya berupa daftar tunggu early-access plus playground peramban, dengan code>jev-latest/code>

RLCD berarti terkalibrasi, bukan yang diutamakan.

TypeSafe melatih Jev dengan metode yang disebutnya RLCD — Reinforcement Learning for Calibrated Decisions, menurut dokumentasi perusahaan itu sendiri. Akronim ini masih cukup baru sehingga liputan awal memperluasnya secara tidak konsisten, jadi penting untuk memastikan apa yang sebenarnya dirujuknya, karena perbedaan itulah inti klaim penelitiannya.

RLHF mengoptimalkan keluaran yang disukai manusia. RLVR mengoptimalkan kebenaran yang dapat diverifikasi, yaitu jenis yang lulus kasus uji. RLCD mengoptimalkan kalibrasi: model yang mengatakan dirinya 70% yakin seharusnya benar sekitar 70% dari waktu. Itu adalah target yang berbeda dari sekadar benar, dan itulah sebabnya setiap jawaban Jev dikirim dengan distribusi probabilitas terlampir, bukan sekadar jawaban. Mode kegagalan yang dimaksudkan adalah model yang tahu kapan ia tidak tahu, sehingga kode Anda dapat memutuskan apa yang harus dilakukan tentangnya.

Apa yang Anda peroleh dari itu dalam praktik adalah permukaan kendali. Pola yang didokumentasikan adalah tiga pita keyakinan — bertindak otomatis di bagian atas, menandai atau mengonfirmasi di tengah, mengarahkan ke manusia di bagian bawah — dengan ambang batasnya berada di kode Anda, bukan di model. Apakah pita-pita itu jujur adalah pertanyaan empiris tentang data Anda, dan itu adalah pertanyaan yang secara eksplisit TypeSafe minta Anda jawab sendiri, dengan mencatat bahwa ambang batas keyakinan spesifik untuk kasus penggunaan dan harus diuji terhadap contoh berlabel Anda sendiri. Instruksi itu adalah kalimat terpenting dalam dokumentasi, dan alasan bagian berikutnya ada.

Angka-angka tersebut, diurutkan berdasarkan siapa yang menghasilkannya

Di sinilah sebagian besar liputan tentang Jev menjadi kabur, jadi penting untuk bersikap eksplisit tentang asal-usulnya. Berikut ini yang berasal dari vendor, yang berasal dari penguji independen, dan yang sama sekali tidak diketahui.

• Dilaporkan vendor, belum direproduksi — klaim utama soal kecepatan dan biaya. Latensi end-to-end 70-500 md dibandingkan 3-329 detik untuk panggilan LLM frontier; 20-200x lebih cepat dan 40-400x lebih murah; satu hasil alur kerja kasus terbaik yang diiklankan sebesar 193,6x lebih cepat dan 444,6x lebih murah. TypeSafe mengakui bahwa ini adalah angka kasus terbaik, bukan angka yang berlaku umum.

• Dilaporkan oleh vendor, dan dapat diperiksa di lembar harga — $0,042 per juta token input, yang setara dengan $42 per miliar, dengan output gratis. Alasan output gratis bersifat mekanis, bukan promosional: tidak ada decoding autoregresif yang perlu diukur, sehingga tidak ada token output yang perlu ditagih. Sebagai gambaran skala, materi peluncuran yang sama mencantumkan harga input frontier tipikal pada $0,20 hingga $10 per juta, dengan output sering kali sekitar lima kali harga input.

• Dilaporkan vendor, dari tolok ukur internal — dasbor alur kerja milik TypeSafe sendiri, 711 kasus di empat tugas, dengan jawaban referensi yang diturunkan dari penilaian rata-rata GPT-6 Astra dan Claude Fable 5.1, bukan dari kebenaran dasar. Pada dasbor itu, Jev secara agregat berada di 67,8% berbanding 74,1% untuk pembanding terbaik. Jika dirinci: insiden keamanan 61,7% berbanding 66,2% untuk Opus 5; observabilitas jejak agen 71,6% berbanding 76,6%; pemrosesan faktur 61,8% berbanding 79,1%; layanan pelanggan 76,0% berbanding 78,3%. Jev unggul di kolom biaya dan latensi pada bagan itu dan kalah di kolom akurasi. Dasbor itu sendiri mencatat kemungkinan bias harness, dan TypeSafe mengatakan pihaknya sengaja melewati papan peringkat publik demi evaluasi sekali jalan yang terkait dengan pembaruan produk.

• Diukur secara independen, sampel kecil — uji Every yang dijelaskan di atas: 777 penilaian dalam waktu kurang dari 0,7 detik dengan biaya sekitar seperempat sen; 1.709 penilaian di 11 eksperimen dengan total biaya kurang dari satu sen; sekitar 25x lebih cepat dan 1/580 biaya Claude Fable 5.1 pada tugas klasifikasi 12 petikan, tetapi melewatkan satu dari tujuh cacat yang ditanam yang ditangkap oleh pembanding. Kesimpulan Every sendiri adalah bahwa mereka menginginkan pemeriksaan akurasi yang jauh lebih menyeluruh sebelum menerapkannya ke produksi.

• Tidak diketahui — arsitekturnya. Tidak ada makalah saat peluncuran, tidak ada jumlah parameter, tidak ada pengungkapan komputasi pelatihan, tidak ada bobot. TypeSafe mengatakan detailnya masih "dirahasiakan untuk saat ini" dan makalah mungkin menyusul nanti.

A single-column scoreboard titled 'Jev - the scoreboard' listing six dimensions: latency 70-500 ms claimed, price $0.042 per million input with output free, accuracy 67.8% on the vendor dashboard, independent test 6 of 7 defects caught, context about 32K tokens with no image input, and weights not released.

Pola di seluruh tingkatan tersebut konsisten, dan itu bukan pola yang disiratkan oleh judul 200x. Setiap angka independen maupun dari vendor sepakat bahwa Jev jauh lebih murah dan jauh lebih cepat. Tidak ada angka di mana pun, termasuk milik TypeSafe sendiri, yang menunjukkan bahwa Jev lebih akurat daripada model-model frontier yang menjadi pembanding harganya. Di dasbor vendor sendiri, Jev berada di sekitar level model kelas menengah yang bagus. Perbandingan yang bertahan bukanlah "secerdas model frontier dengan harga seperseratusnya" — melainkan "mendekati penilaian model kelas menengah dengan biaya sepersekian sen per panggilan, cukup cepat untuk dijalankan pada setiap giliran."

Apa yang "zero hallucination" berarti dan tidak berarti

Materi peluncuran TypeSafe menyertakan bagan yang menunjukkan tingkat kesalahan pemanggilan alat 0% untuk Jev dibandingkan tingkat bukan nol untuk model pembanding, dan frasa "tahan halusinasi" melekat pada model tersebut. Keduanya benar dan keduanya lebih sempit daripada yang tersirat saat dibaca.

Jaminan itu bersifat struktural. Setiap kemungkinan jawaban dienumerasi sebelum model dijalankan — Anda menyediakan daftar pilihan, rubrik, atau klaim benar/salah — sehingga tidak ada ruang untuk mengeluarkan nilai di luar tipe yang dideklarasikan. Panggilan alat yang cacat bukanlah hal yang bisa dihasilkan Jev. Itu adalah properti rekayasa yang nyata, dan bagi siapa pun yang telah menghabiskan sepekan menulis logika coba ulang seputar kegagalan penguraian JSON, itu bernilai uang nyata.

Itu bukan klaim tentang benar atau tidak. Jawaban yang valid secara skema tetap bisa salah: Jev dapat dengan yakin mengarahkan keluhan penagihan ke antrean teknis, dan keluarannya akan sepenuhnya terbentuk dengan baik namun tidak berguna. Almeida sendiri telah mengatakan hal itu, mengakui bahwa mungkin saja untuk salah dengan penuh keyakinan. Cara yang berguna untuk menyikapi kedua fakta tersebut adalah bahwa Jev menghilangkan kelas kesalahan yang berasal dari pemformatan keluaran, dan sama sekali tidak melakukan apa pun terhadap kelas kesalahan yang berasal dari penilaian. Artinya, pertanyaan akurasi sepenuhnya adalah pertanyaan kalibrasi, dan kalibrasi justru merupakan hal yang harus Anda ukur sendiri.

Bagaimana cara menguji klaim kalibrasi pada data Anda sendiri

Kalibrasi adalah salah satu dari sedikit properti model yang dapat Anda periksa dengan benar menggunakan beberapa ratus contoh dan tanpa infrastruktur ML, dan itu adalah satu-satunya uji yang penting sebelum Jev menyentuh jalur produksi. Prosedurnya singkat.

Ambil beberapa ratus kasus yang sudah Anda miliki labelnya. Ajukan kepada Jev pertanyaan yang penting — keputusan perutean, skor risiko, pemeriksaan cacat — dan kelompokkan jawabannya berdasarkan tingkat keyakinan yang dilaporkannya. Lalu periksa apakah kelompok berkeyakinan 0,9 benar sekitar 90% dari waktu, kelompok 0,7 sekitar 70%, dan seterusnya. Model yang terkalibrasi dengan baik membentuk garis diagonal. Model yang hanya percaya diri akan mengelompokkan semuanya di atas 0,9 dan benar 70% dari waktu, dan itulah bentuk yang diam-diam merusak pipeline otomatis.

Tes yang sama memberi tahu Anda ambang batas mana yang harus digunakan. Jika bucket 0,9 benar-benar 90% akurat pada data Anda, Anda dapat mengotomatiskannya. Jika pita menengah Anda tidak jelas, Anda mengarahkannya ke manusia atau menyerahkannya ke model generatif dan membiarkan jalur mahal menangani ambiguitasnya. Pemisahan itu — model murah pada mayoritas yang yakin, model mahal pada sisa yang tidak pasti — adalah arsitektur yang sebenarnya diperjuangkan Jev, dan itulah alasan model paling baik dipahami sebagai komponen ketimbang pengganti.

Berapa biayanya, diuraikan tuntas

Harganya cukup sederhana untuk dipahami, yang jarang terjadi. Input $0,042 per juta token. Output gratis. Pada anggaran permintaan yang didokumentasikan sekitar 150.000 karakter, satu panggilan berukuran maksimum berbiaya jauh di bawah satu sen.

Dua angka yang dilaporkan memberi gambaran tentang skalanya. Seorang pengguna awal menjalankan sekitar 5.000 permintaan dengan biaya kira-kira $2. Demonstrasi Doom — Jev mengarahkan bot menggunakan deskripsi teks tentang status permainan alih-alih piksel mentah — berjalan pada sekitar 10 panggilan per detik dengan biaya sekitar $7 per jam. Dan 777 penilaian Every di 37 dokumen hanya sekitar seperempat sen, dan angka itulah yang membuat kasus penggunaan yang menarik menjadi jelas: pada harga tersebut, memeriksa setiap giliran dalam loop agen tidak lagi menjadi keputusan biaya dan menjadi default.

Itulah argumen sesungguhnya untuk Jev. Proses verifikasi per giliran — apakah pemanggilan alat ini bertentangan dengan yang sebelumnya, apakah keluaran ini konsisten dengan maksud yang dinyatakan pengguna, haruskah ini memunculkan tanda peringatan — selalu memungkinkan secara teknis dengan model frontier dan secara ekonomi tidak masuk akal dalam skala besar. Dengan $0,042 per juta token tanpa biaya keluaran, proses yang sama menjadi terjangkau pada setiap giliran. Nilainya di sini bukanlah bahwa Jev berpikir lebih baik daripada model frontier, karena memang tidak. Nilainya adalah bahwa ia berpikir cukup murah dan cepat untuk terus-menerus dikonsultasikan.

Perlu dinyatakan terus terang, karena ini pertanyaan berikutnya yang jelas: OrcaRouter tidak melayani Jev. Model TypeSafe adalah akses awal, dengan daftar tunggu, dan memakai bentuk permintaan sendiri, jadi siapa pun yang mengujinya harus melalui TypeSafe secara langsung. Tempat lapisan perutean benar-benar cocok adalah separuh alur kerja yang lain. Pola yang dituju oleh rancangan Jev adalah dua model, bukan satu — Jev membuat keputusan bertipe, dan model generatif menangani bagian yang membutuhkan prosa, kode, atau penjelasan. Separuh generatif itulah bagian yang dicakup OrcaRouter: 197 model di 15 penyedia di balik satu kunci yang kompatibel dengan OpenAI, pada harga daftar penyedia yang diteruskan dengan markup 0%, sehingga penurunan harga vendor langsung berlaku di sisi kami pada hari yang sama saat dirilis. Kedua separuh alur kerja berbentuk Jev dapat diuji tanpa kontrak kedua, dan ketika komponen keputusan belum terbukti, jalur failover-lah yang mencegah hasil kalibrasi yang buruk berubah menjadi insiden produksi.

A capture of the OrcaRouter models catalogue showing the header '197 models - 15 providers - one API key, one bill', an OpenAI-compatible chat-completions request example, and model cards for DeepSeek V4.1 Flash, OpenAI GPT-6 Astra and Google Gemini 3.8 Flash with their per-million-token input and output prices.

Di mana Jev tidak cocok

Keterbatasan-keterbatasannya dinyatakan dengan sangat jelas oleh vendor, yang membuat bagian ini mudah ditulis secara jujur. Jev tidak dapat menghasilkan teks bebas. Jev tidak dapat menulis kode. Jev tidak dapat mengobrol. Jev tidak memiliki antarmuka obrolan, tidak ada input gambar, dan anggaran konteks sekitar 32.000 token — satu orde magnitudo di bawah model konteks panjang yang dibandingkan dengannya dalam hal harga. Bidang pilihan dibatasi maksimal 255 opsi. Dan sifat "tanpa halusinasi", seperti di atas, lebih berkaitan dengan format keluaran daripada kebenaran.

Jaringan ini memiliki kecocokan yang cukup sempit. Baik: klasifikasi dan perutean bervolume tinggi, tahapan guardrail dan verifikasi, keputusan yang kritis terhadap latensi, penilaian kumpulan dokumen besar secara paralel, di mana pun jawaban yang benar benar-benar berupa pilihan, angka pada skala, atau boolean. Buruk: generasi terbuka dalam bentuk apa pun, penalaran konteks panjang, dialog multi-putaran, atau tugas apa pun yang jawaban benarnya berupa kalimat. Jika masalah Anda tidak dapat direduksi menjadi pertanyaan bertipe, Jev bukan cara yang lebih murah untuk menyelesaikannya — ini bukan cara untuk menyelesaikannya sama sekali.

Ada juga kritik yang wajar terhadap framing ini yang layak diteruskan. Menyebut Jev sebagai model terdepan meminjam kredibilitas yang belum diperoleh model itu: ia tidak dapat membuat kode, mengobrol, atau menulis satu kalimat, dan bagan perbandingan bersandar pada model-model terdepan sebagai baseline, sementara kolom akurasi menceritakan hal yang berbeda. Klaim yang lebih dapat dipertahankan, dan yang sebenarnya didukung bukti, adalah bahwa TypeSafe telah mendorong frontier kecepatan dan biaya untuk keputusan terstruktur jauh ke depan. Itu adalah pencapaian yang substansial. Itu berbeda dari membangun model yang menyaingi GPT-6 Astra atau Claude Fable 5.1.

Apa yang akan mengubah gambaran ini?

Tiga hal, dalam urutan kasar berdasarkan seberapa besar pengaruhnya.

• Makalah arsitektur yang diterbitkan atau bobot terbuka. Segala hal tentang bagaimana Jev mencapai kecepatannya saat ini adalah kotak hitam, dan klaim bahwa evaluasi paralel adalah mekanismenya — analogi yang ditarik Almeida adalah menggantikan komputasi sekuensial seperti cara transformer menggantikan jaringan rekuren — merupakan asersi, bukan hasil yang didemonstrasikan. Sampai desainnya diterbitkan, kecepatannya adalah fakta dan penjelasannya adalah pemasaran.

• Evaluasi independen kedua dengan sampel yang lebih besar. Tes Every adalah bukti terkuat yang tersedia dan mencakup 12 petikan tentang pertanyaan akurasi yang menentukan. Satu putaran independen lagi, pada beberapa ratus kasus berlabel, akan menentukan apakah melewatkan satu cacat dari tujuh adalah noise atau tingkat galat yang sebenarnya.

• Audit kalibrasi pada input yang realistis dan berantakan. Semua yang dipublikasikan sejauh ini menggunakan rangkaian uji yang bersih. Pertanyaan terbuka bagi model yang seluruh proposisi nilainya bertumpu pada skor keyakinan yang dapat dipercaya adalah apa yang dilakukan skor-skor itu pada kasus-kasus yang benar-benar ambigu — kasus-kasus di mana peninjau manusia pun akan ragu. Itulah angka yang menentukan apakah Jev aman untuk diotomatiskan, dan belum ada yang mempublikasikannya.

Sampai saat itu, sikap yang masuk akal adalah bersikap spesifik, bukan umum. Jev adalah model nyata yang sudah dirilis, luar biasa murah, dengan keunggulan struktural yang sesungguhnya dalam keandalan keluaran, profil akurasi yang berada di sekitar tingkat menengah, dan klaim kalibrasi yang masuk akal, secara eksplisit direkomendasikan untuk diuji sendiri oleh vendornya, serta divalidasi secara independen hanya pada sampel kecil. Jika alur kerja Anda memiliki langkah yang pada dasarnya hanya berupa pertanyaan bertipe yang cukup sering diajukan sehingga model terdepan akan menjadi pemborosan, ini adalah salah satu cara termurah untuk menanyakannya — dan nilai keyakinan yang dikembalikannya adalah bagian yang perlu diuji sebelum Anda memercayainya, bukan kecepatannya.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari