Kartu judul hero untuk Apodex 1.1 berjudul 'Apodex 1.1' dengan subjudul '44 pada Intelligence Index - kekuatan agen, verbositas tinggi, dan daya tangkap pengetahuan', lencana pil bertuliskan 'AA Index 44', '#11 dari 177', 'Konteks 256K', dan baris footer 'Dirilis 24 Agu 2026 - model Apodex pertama di Artificial Analysis', dengan logo OrcaRouter di pojok kanan bawah.
Guides & Insights

Apodex 1.1, dijelaskan: skor 44 pada Indeks Intelijen, kekuatan agentik yang nyata — dan kendala pada keandalan pengetahuan

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Apodex 1.1 baru berumur seminggu, bersifat proprietary, dan hingga minggu ini ia lebih banyak menjadi keingintahuan laboratorium. Kemudian Artificial Analysis menerbitkan evaluasi independen pertamanya terhadap model tersebut — yang pertama bagi Apodex di platform itu — dan papan skor melakukan sesuatu yang tidak biasa: Apodex 1.1 mencetak 44 pada Artificial Analysis Intelligence Index, menempati peringkat #11 dari 177, sekaligus mencatat skor kerja agentik yang mengalahkan setiap model di tingkat kecerdasannya, termasuk DeepSeek V4 Pro, Qwen3.7 Max, dan Kimi K2.6. Laporan yang sama memunculkan angka kedua yang lebih buruk: catatan keandalan pengetahuan yang cukup lemah untuk mengubah keputusan tentang menjalankan pekerjaan nyata di atasnya. Saudaranya dengan bobot terbuka, Apodex 1.1 Mini, adalah model yang sebenarnya dapat dijalankan oleh kebanyakan orang. Inilah yang dikatakan evaluasi tersebut, apa yang tidak, dan siapa yang seharusnya peduli.

Apodex, perusahaan AI yang didirikan oleh Chen Tianqiao, meluncurkan keluarga model ini pada 24 Agustus 2026, bersamaan dengan makalah arXiv yang ditulis 70 penulis berjudul "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). Model utamanya bersifat proprietary — sekitar 397 miliar parameter, menurut laporan vendor — dibangun berdasarkan tesis bahwa hambatan sebenarnya bagi agen bukanlah kecerdasan mentah, melainkan lingkungan tempat mereka beroperasi. Apodex 1.1 karena itu dilatih untuk bekerja langsung dengan file, pencarian, dan kode dalam rentang waktu yang panjang, dengan perangkat eksekusi bersama ("AgentOS") yang mengoordinasikan hingga 150 sub-agen paralel dan menyimpan catatan asal-usul setiap langkah. Bagian yang terbuka adalah model saudaranya: Apodex 1.1 Mini, sebuah MoE kelas 35B yang disempurnakan dari Alibaba Qwen3.5-35B-A3B, dirilis di bawah lisensi Apache-2.0 dengan perangkat agen pendamping bernama FrontierAgent. Model lengkap hanya dapat diakses melalui API dan workbench daring milik Apodex sendiri; Mini hanya bisa dihosting sendiri, atau tidak tersedia sama sekali.

Apa arti 44 pada Indeks Intelijen

Indeks Kecerdasan Artificial Analysis adalah agregat tertimbang dari rangkaian tolok ukur platform tersebut — termasuk evaluasi agenik seperti GDPval-AA v2 dan Terminal-Bench, serta komponen penalaran, matematika, dan pengetahuan. Skor 44 menempatkan Apodex 1.1 di peringkat #11 dari 177 model, jauh di atas median 18. Skor itu juga menurunkan model tersebut ke tingkat yang ramai dan menarik: Kimi K2.6 (45), MiniMax-M3 (45), dan Inkling (42) semuanya berada dalam selisih tiga poin, dan Apodex 1.1 adalah satu-satunya dari kelompok itu yang namanya tidak dikenal oleh sebagian besar pengguna AI seminggu lalu. Artificial Analysis mencatat bahwa halaman tersebut mencakup versi penalaran dari model tersebut, dan varian non-penalaran mungkin juga ada.

A single-column scoreboard for Apodex 1.1 titled 'Apodex 1.1 - the scoreboard' listing AA Intelligence Index 44 (#11 of 177), GDPval-AA v2 Elo 1348, TerminalBench v2.1 70%, Output tokens per task ~17,000, Full Index evaluation cost 18.41, and AA-Omniscience -21.9 (78% hallucination), with a footer 'All figures per Artificial Analysis, August 2026.' and the OrcaRouter logo in the bottom-right corner.

Skor indeks utama bukanlah hal yang membuat model ini menarik. Model ini menarik karena letak kekuatan dan kelemahannya relatif terhadap skor tersebut — dan itulah yang dibuat konkret oleh perbandingan tier.

Di mana ia melampaui levelnya: evaluasi agentik dan kerja pengetahuan.

Pada dua komponen Indeks yang mengukur pekerjaan agenik di dunia nyata, Apodex 1.1 mengungguli tetangga-tetangganya yang berada dalam rentang 44 poin. Pada GDPval-AA v2 — sebuah tolok ukur yang menilai kemampuan agen untuk menyelesaikan tugas-tugas bergaya kantor yang realistis dari awal hingga akhir — Apodex 1.1 mencatat Elo 1348, di depan DeepSeek V4 Pro (1333), Qwen3.7 Max (1308), dan Kimi K2.6 (1202). Pada TerminalBench v2.1, yang menguji agen yang bekerja di terminal, skornya 70%, di depan Kimi K2.6 (66%) dan tepat di belakang Qwen3.7 Max (75%). Itu adalah angka-angka independen yang dijalankan Artificial Analysis, dan itu adalah bukti terkuat dalam laporan bahwa pelatihan yang mengutamakan lingkungan berhasil.

Klaim benchmark milik vendor sendiri melangkah lebih jauh, dan sebaiknya dibaca sebagai laporan vendor sampai ada yang mereproduksinya: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% dengan tools, DeepSearchQA 92.4%, FrontierFinance 54.3, dan FrontierScience-Research 63.3. Yang membuat profil agentik ini kredibel, bukan sekadar gembar-gembor, adalah arsitektur di baliknya: penskalaan lingkungan (memperluas keragaman lingkungan file yang dapat dieksekusi, lingkungan pencarian, dan lingkungan kode yang digunakan dalam pelatihan) dan penskalaan koordinasi agentik (melatih model untuk menguraikan tugas-tugas dengan cakrawala waktu panjang, mendelegasikan pekerjaan paralel, mengintegrasikan hasil asinkron, dan menyusun ulang rencana). Mode "Agent Team" memunculkan hingga 150 sub-agen untuk tugas pengambilan dan sintesis, dan langkah verifikasi bawaan ("Statement Review") memeriksa kesimpulan sebelum disampaikan. Dengan kata lain: ini adalah model yang dirancang untuk bisa keliru, memeriksa dirinya sendiri, dan memperbaiki masalah — bukan untuk melafalkan fakta dari ingatan.

Biaya tersembunyi dari semua agensi itu: verbositas

Desain itu muncul di tabel efisiensi biaya Artificial Analysis sebagai kelemahan paling jelas model setelah pengetahuan: model ini sangat bertele-tele. Menjalankan Intelligence Index penuh menghabiskan 180M token output — dibandingkan median 67M — dan sekitar 17.000 token output per tugas benchmark, dibandingkan sekitar 9.400 untuk Qwen3.7 Max dan 8.100 untuk MiniMax-M3. Secara total, evaluasi penuh menghabiskan biaya $618.41 dalam pengeluaran API, menurut Artificial Analysis.

A screenshot of the Artificial Analysis model page for Apodex 1.1 (captured August 31, 2026), showing 'Apodex 1.1 scores 44 on the Artificial Analysis Intelligence Index' with a median of 18, the note that it generated 180M tokens versus a 67M median, pricing of $0.30 per 1M input and $3.00 per 1M output tokens, and the $618.41 total cost to evaluate the model on the Intelligence Index.

Penetapan harga yang menghasilkan tagihan tersebut: $0.30 per juta token input dan $3.00 per juta output — harga cache-hit $0.03 untuk input yang di-cache, diskon 90% — yang rata-ratanya menjadi sekitar $0.38 per juta pada campuran cache/input/output tipikal 7:2:1. Kedua harga per token tersebut berada di atas median platform ($0.25 input, $0.90 output). Namun perkiraan biaya per tugas Artificial Analysis masih menempatkan Apodex 1.1 pada sekitar $0.05 per tugas benchmark, lebih murah daripada Qwen3.7 Max (~$0.07) dan Kimi K2.6 (~$0.06). Rekonsiliasi ini penting untuk penganggaran: tokennya cukup murah sehingga bahkan verbositas tinggi pun tetap kompetitif per tugas — risiko biayanya adalah volume, bukan tarif. Jika Anda memasang agen yang berjalan lama di atasnya, tagihan ditentukan oleh seberapa banyak ia berbicara, dan ia berbicara banyak.

Satu catatan harga sebelum Anda menyusun anggaran: $0.30/$3.00 adalah daftar harga milik vendor itu sendiri. Platform routing yang meneruskan harga daftar penyedia dengan markup 0% membebankan tepat angka tersebut, dan setiap penurunan harga Apodex di masa depan akan muncul pada hari yang sama saat diumumkan.

Masalahnya: catatan keandalan pengetahuan yang lemah

Inilah angka yang sebagian besar liputan peluncuran lewatkan. Pada AA-Omniscience, probe keandalan pengetahuan dari Artificial Analysis, Apodex 1.1 mencetak -21.9. Ia mencoba menjawab 87% pertanyaan alih-alih menolak, tetapi hanya benar 32%, dan tingkat halusinasinya 78.4%. Untuk model yang diposisikan sebagai pemecah masalah berat, ini adalah kepribadian ganda yang serius: kuat dalam eksekusi agen, lemah dalam pengetahuan yang berdasar.

Dua fakta tersebut saling berhubungan, bukan bertentangan. Tolok ukur agentik memberi penghargaan pada tindakan dalam sebuah lingkungan — melakukan pemanggilan alat, melakukan iterasi, memulihkan diri — sehingga sebuah model dapat meraih skor bagus di sana meskipun daya ingatnya buruk, karena lingkunganlah yang mengingat. Desainnya bahkan mengasumsikan hal itu: Statement Review ada untuk memeriksa keluaran, dan workbench dibangun berlandaskan verifikasi, bukan berlandaskan model yang benar dari ingatan. Pembacaan praktisnya lugas: jangan arahkan Apodex 1.1 pada tugas-tugas yang bergantung pada kemampuannya mengambil fakta dari bobotnya sendiri. Arahkan pada tugas-tugas jangka panjang yang hasil kerjanya dapat diperiksa terhadap file, kode, dan sumber — dan verifikasi hasil yang diserahkan.

Saudara terbuka: Apodex 1.1 Mini dan FrontierAgent

Jika pintu tertutup sang andalan menjadi masalah, separuh keluarga yang terbuka adalah penyeimbangnya. Apodex 1.1 Mini adalah MoE dengan total ~35B / ~3B aktif yang di-fine-tune dari Qwen3.5-35B-A3B (basis Alibaba yang dirilis sebagai open-source pada Februari 2026), dirilis di bawah lisensi Apache-2.0 dengan jendela konteks 262K serta varian FP8, FP4, dan GPTQ-Int4 di Hugging Face. Angka utama yang dilaporkan vendor adalah 50.2 pada FrontierFinance (pertama dalam perbandingan Apodex sendiri) dan 27.7 pada APEX-Agents dengan harness Agent Team diaktifkan. Dan FrontierAgent — runtime open-source yang menyertainya — benar-benar artefak yang menarik: harness berbasis terminal dengan mode ReAct dan Agent Team, kerja file dalam sandbox, gerbang persetujuan, checkpoint, dan jejak, semuanya berkomunikasi dengan endpoint mana pun yang kompatibel dengan OpenAI.

Ada dua hal yang perlu diketahui sebelum Anda melakukan self-host. Pertama, Mini adalah fine-tune, bukan model frontier — baca angka benchmark-nya dengan cara yang sama seperti Anda membaca tabel vendor flagship: perbandingan yang tidak dapat direproduksi, dengan harness, dan dipilih oleh vendor. Kedua, perilakunya diwarisi dari model dasarnya: jika Anda ingin menguji apakah Qwen3.5-35B-A3B yang mendasarinya sudah bisa melakukan tugas Anda, Anda tidak perlu GPU dan tumpukan serving untuk mengetahuinya — model dasarnya hanya berjarak satu panggilan API.

Siapa yang harus menggunakan Apodex 1.1 hari ini

Model unggulan ini masih awal, tertutup, dan untuk saat ini hanya tersedia di API milik vendor dan workbench daring; Apodex mengatakan ketersediaan API yang lebih luas akan datang melalui platform-platform utama, tetapi bobotnya tidak terbuka. Hal itu membatasi siapa yang dapat bertindak berdasarkan papan skor minggu ini: tim yang sudah berada di workbench Apodex, atau yang bersedia mendaftar untuk kunci API pihak pertama. Mini adalah jalur yang lebih mudah diakses, tetapi berarti harus melakukan hosting sendiri.

A screenshot of the Apodex online workbench homepage (captured August 31, 2026), showing the deep-research interface with the prompt field 'Ask the question that matters', feature points for a step-level reasoning trace, citations in every report, branching off any report, and full-text search across threads, and a sign-in prompt for saving inquiries.

Tempat di mana model ini benar-benar membuktikan nilainya: pipeline agenik berhorizon panjang yang keluarannya diverifikasi di hilir — meja kerja riset, tugas file-dan-tool multi-langkah, pekerjaan terminal — dan di mana profil biaya ~$0,05-per-tugas tetap bertahan meskipun keluarannya bertele-tele. Tempat di mana model ini belum cocok digunakan: apa pun yang bergantung pada keandalan pengetahuan model itu sendiri, atau jalur produksi yang tidak dapat mentoleransi model berusia tujuh hari yang belum teruji bertingkah buruk. Untuk situasi yang persis seperti itu, lapisan perutean adalah pembungkus yang tepat. Satu API untuk 200+ model berarti Qwen3.5-35B-A3B dasar sudah dapat dipanggil dengan harga daftar, Mini yang dihosting sendiri dapat berada di belakang router yang sama, dengan failover otomatis, dan pendatang baru yang tidak andal tidak dapat menjatuhkan jalur produksi — saat kinerjanya kurang memadai, permintaan beralih ke penyedia yang sehat sebagai gantinya.

Tontonan Berikutnya

Evaluasi ini adalah bacaan awal, bukan vonis. Tiga hal akan menentukan apakah Apodex 1.1 masih berarti dalam sebulan: reproduksi independen atas klaim agenik vendor (angka GDPval dan TerminalBench dari Artificial Analysis adalah satu-satunya yang tidak diproduksi oleh Apodex sendiri); apakah kesenjangan reliabilitas pengetahuan menyempit dalam varian non-penalaran atau rilis lanjutan; dan apakah model ini muncul di lebih banyak API dan papan skor independen, yang pada saat itu angka 44 dan -21.9 menjadi masalah orang lain untuk dikalahkan. Untuk model yang baru berusia tujuh hari dengan profil terpecah seperti ini, itu kira-kira sebanyak yang bisa Anda minta: keunggulan agenik yang nyata, harga yang jujur, dan satu kelemahan yang Anda ketahui sebelum mendaftar.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari