Una card titolo hero per Apodex 1.1 intitolata 'Apodex 1.1' con il sottotitolo '44 sull'Intelligence Index - forza agentica, verbosità marcata e un limite di conoscenza', badge a pillola con scritto 'AA Index 44', '#11 di 177', 'contesto 256K', e una riga in fondo 'Rilasciato il 24 agosto 2026 - primo modello Apodex su Artificial Analysis', con il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

Apodex 1.1, spiegato: un 44 sull'Intelligence Index, una vera forza agentica — e un problema di affidabilità della conoscenza

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Apodex 1.1 ha una settimana di vita, è proprietario e fino a questa settimana era per lo più una curiosità da laboratorio. Poi Artificial Analysis ha pubblicato la sua prima valutazione indipendente del modello — la prima di Apodex sulla piattaforma — e la classifica ha fatto qualcosa di insolito: Apodex 1.1 ha ottenuto un 44 sull'Artificial Analysis Intelligence Index, piazzandosi all'#11 su 177, con punteggi di lavoro agentico che battono ogni modello della sua fascia di intelligenza, inclusi DeepSeek V4 Pro, Qwen3.7 Max e Kimi K2.6. Lo stesso rapporto ha fatto emergere un secondo numero, più sgradevole: un record di affidabilità delle conoscenze abbastanza debole da cambiare la decisione di eseguirci lavoro reale. Il suo fratello open-weights, Apodex 1.1 Mini, è il modello che la maggior parte delle persone può effettivamente eseguire. Ecco cosa dice la valutazione, cosa non dice e chi dovrebbe interessarsene.

Apodex, la società di IA fondata da Chen Tianqiao, ha rilasciato la famiglia il 24 agosto 2026, insieme a un paper arXiv con 70 autori, "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). L'ammiraglia è proprietaria — circa 397B di parametri, secondo il report del fornitore — costruita attorno alla tesi che il vero collo di bottiglia per gli agenti non è l'intelligenza grezza ma l'ambiente in cui operano. Apodex 1.1 è stato quindi addestrato a lavorare direttamente con file, ricerca e codice su lunghi orizzonti temporali, con un harness di esecuzione condiviso ("AgentOS") che coordina fino a 150 sotto-agenti in parallelo e mantiene un registro di provenienza di ogni passaggio. La versione aperta è la gemella: Apodex 1.1 Mini, una MoE di classe 35B messa a punto a partire dal modello di AlibabaQwen3.5-35B-A3B, rilasciata sotto Apache-2.0 con un harness complementare per agenti chiamato FrontierAgent. Il modello completo è accessibile solo tramite l'API e il workbench online di Apodex; la Mini è self-hosted o niente.

Cosa significa un 44 nell'Indice di Intelligenza

L'Artificial Analysis Intelligence Index è un aggregato ponderato della suite di benchmark della piattaforma — incluse valutazioni agentiche come GDPval-AA v2 e Terminal-Bench, oltre a componenti di ragionamento, matematica e conoscenza. Un punteggio di 44 colloca Apodex 1.1 all'11° posto su 177 modelli, ben sopra la mediana di 18. Il modello si ritrova inoltre in una fascia affollata e interessante: Kimi K2.6 (45), MiniMax-M3 (45) e Inkling (42) rientrano tutti entro tre punti, e Apodex 1.1 è l'unico di quel gruppo il cui nome era sconosciuto alla maggior parte degli utenti AI una settimana fa. Artificial Analysis nota che la pagina copre la versione reasoning del modello e che potrebbe esistere anche una variante non-reasoning.

A single-column scoreboard for Apodex 1.1 titled 'Apodex 1.1 - the scoreboard' listing AA Intelligence Index 44 (#11 of 177), GDPval-AA v2 Elo 1348, TerminalBench v2.1 70%, Output tokens per task ~17,000, Full Index evaluation cost 18.41, and AA-Omniscience -21.9 (78% hallucination), with a footer 'All figures per Artificial Analysis, August 2026.' and the OrcaRouter logo in the bottom-right corner.

Il punteggio dell'indice principale non è dove questo modello diventa interessante. È interessante per il punto in cui i suoi punti di forza e di debolezza si collocano rispetto a quel punteggio — ed è questo che il confronto tra i livelli rende concreto.

Dove supera la sua categoria: valutazioni per lavoro agentico e knowledge work

Nei due componenti dell'Indice che misurano il lavoro agentico nel mondo reale, Apodex 1.1 supera i suoi vicini di 44 punti. Su GDPval-AA v2 — un benchmark che valuta la capacità di un agente di completare attività realistiche da ufficio dall'inizio alla fine — Apodex 1.1 registra un Elo di 1348, davanti a DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) e Kimi K2.6 (1202). Su TerminalBench v2.1, che testa un agente al lavoro su un terminale, ottiene il 70%, davanti a Kimi K2.6 (66%) e subito dietro a Qwen3.7 Max (75%). Questi sono numeri indipendenti, gestiti da Artificial Analysis, e sono la prova più forte nel report che l'addestramento incentrato sull'ambiente funziona.

I benchmark dichiarati dal venditore spingono oltre, e vanno letti come dati forniti dal venditore finché qualcuno non li replica: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% con strumenti, DeepSearchQA 92.4%, FrontierFinance 54.3 e FrontierScience-Research 63.3. Ciò che rende credibile — e non semplice hype — il profilo agentico è l'architettura che ne è alla base: scalabilità ambientale (espandere la diversità degli ambienti di file eseguibili, ricerca e codice usati nell'addestramento) e scalabilità del coordinamento agentico (addestrare il modello a scomporre compiti a lungo orizzonte, delegare lavoro in parallelo, integrare risultati asincroni e riprogettare). La modalità "Agent Team" genera fino a 150 sottoagenti per attività di recupero e sintesi, e un passaggio di verifica integrato ("Statement Review") controlla le conclusioni prima che vengano consegnate. In altre parole: questo è un modello progettato per sbagliare, controllarsi e correggere le cose — non per recitare fatti a memoria.

Il costo nascosto di tutta questa agency: la verbosità

Quel design appare nella tabella di efficienza dei costi di Artificial Analysis come la debolezza più evidente del modello dopo la conoscenza: è molto verboso. Eseguire l'intero Intelligence Index ha consumato 180M token di output — contro una mediana di 67M — e circa 17,000 token di output per compito di benchmark, a fronte di circa 9,400 per Qwen3.7 Max e 8,100 per MiniMax-M3. In totale, l'intera valutazione è costata $618.41 in spese API, secondo Artificial Analysis.

A screenshot of the Artificial Analysis model page for Apodex 1.1 (captured August 31, 2026), showing 'Apodex 1.1 scores 44 on the Artificial Analysis Intelligence Index' with a median of 18, the note that it generated 180M tokens versus a 67M median, pricing of $0.30 per 1M input and $3.00 per 1M output tokens, and the $618.41 total cost to evaluate the model on the Intelligence Index.

Il prezzo che produce quella fattura: $0.30 per milione di token di input e $3.00 per milione di output — un prezzo di cache hit di $0.03 sull'input in cache, con uno sconto del 90% — che si combina in circa $0.38 per milione su un mix tipico 7:2:1 cache/input/output. Entrambi i prezzi per token si collocano al di sopra delle mediane della piattaforma ($0.25 input, $0.90 output). Tuttavia, la stima del costo per task di Artificial Analysis colloca ancora Apodex 1.1 a circa $0.05 per task di benchmark, più economico di Qwen3.7 Max (~$0.07) e Kimi K2.6 (~$0.06). La riconciliazione è importante per il budget: i suoi token sono abbastanza economici che anche una verbosità elevata rimane competitiva per task — il rischio di costo è il volume, non la tariffa. Se ci metti un agente a lunga esecuzione, la fattura è determinata da quanto parla, e parla molto.

Una nota sui prezzi prima di fare il budget: {{1}}$0.30/$3.00{{/1}} è il listino del fornitore stesso. Una piattaforma di routing che inoltra i prezzi di listino dei provider con un ricarico del {{2}}0%{{/2}} addebita esattamente quella cifra, e qualsiasi futuro taglio dei prezzi di {{3}}Apodex{{/3}} si riflette lo stesso giorno in cui viene annunciato.

Il problema: un debole record di affidabilità delle conoscenze

Ecco il numero che la copertura del lancio per lo più non menziona. Su AA-Omniscience, la sonda di affidabilità della conoscenza di Artificial Analysis, Apodex 1.1 ottiene -21,9. Tenta di rispondere all'87% delle domande invece di rifiutare, ma solo il 32% delle risposte è corretto, e il suo tasso di allucinazioni è del 78,4%. Per un modello presentato come un risolutore potente, questa è una grave scissione di personalità: forte nell'esecuzione agentica, debole nella conoscenza fondata.

Le due cose sono collegate, non contraddittorie. I benchmark agentici premiano l'azione in un ambiente — emettere chiamate agli strumenti, iterare, riprendersi — quindi un modello può ottenere buoni punteggi lì pur avendo una scarsa capacità di richiamo, perché è l'ambiente a fare da memoria. Il design lo dà addirittura per scontato: Statement Review esiste per controllare gli output, e il workbench è costruito attorno alla verifica, non attorno al fatto che il modello abbia ragione a memoria. La lettura pratica è netta: non puntare Apodex 1.1 su compiti che dipendono dal recupero di fatti dai suoi stessi pesi. Puntalo su compiti a lungo orizzonte in cui il suo lavoro può essere verificato contro file, codice e fonti — e verifica la consegna.

Il fratello open: Apodex 1.1 Mini e FrontierAgent

Se la porta chiusa dell'ammiraglia è un problema, la metà aperta della famiglia è il contrappeso. Apodex 1.1 Mini è un MoE da ~35B totali / ~3B attivi, fine-tunato da Qwen3.5-35B-A3B (una base di Alibaba resa open-source a febbraio 2026), rilasciato sotto licenza Apache-2.0 con una finestra di contesto di 262K e varianti FP8, FP4 e GPTQ-Int4 su Hugging Face. Il suo punteggio principale dichiarato dal fornitore è 50.2 su FrontierFinance (primo nella comparazione interna di Apodex) e 27.7 su APEX-Agents con l'harness Agent Team abilitato. E FrontierAgent — il runtime open-source che lo accompagna — è davvero l'artefatto interessante: un harness basato su terminale con modalità ReAct e Agent Team, lavoro sui file in sandbox, gate di approvazione, checkpoint e tracce, il tutto in grado di interfacciarsi con qualsiasi endpoint compatibile con OpenAI.

Due cose che vale la pena sapere prima di fare self-hosting. Primo, il Mini è un fine-tune, non un modello di frontiera — leggi i suoi numeri benchmark nello stesso modo in cui leggi la tabella del vendor dell'ammiraglia: confronti non riprodotti, con harness incluso, scelti dal vendor. Secondo, il suo comportamento eredita dal modello base: se vuoi testare se il Qwen3.5-35B-A3B sottostante svolge già il tuo compito, non hai bisogno di una GPU e di uno stack di serving per scoprirlo — la base è a una sola chiamata API di distanza.

Chi dovrebbe usare Apodex 1.1 oggi?

Il modello di punta è in fase iniziale, chiuso e per ora disponibile solo sull'API proprietaria del venditore e sul workbench online; Apodex afferma che una più ampia disponibilità API arriverà tramite le principali piattaforme, ma i pesi non sono aperti. Questo limita chi può agire sulla classifica di questa settimana: i team già sul workbench Apodex, o disposti a registrarsi per una chiave API di prima parte. Il Mini è il percorso più accessibile, ma significa self-hosting.

A screenshot of the Apodex online workbench homepage (captured August 31, 2026), showing the deep-research interface with the prompt field 'Ask the question that matters', feature points for a step-level reasoning trace, citations in every report, branching off any report, and full-text search across threads, and a sign-in prompt for saving inquiries.

Dove il modello guadagna davvero il suo posto: pipeline agentiche a lungo orizzonte in cui gli output vengono verificati a valle — banchi di lavoro per la ricerca, attività multi-step con file e strumenti, lavoro da terminale — e dove il profilo di costo di ~$0,05 per attività regge alla verbosità. Dove invece non trova ancora posto: qualsiasi cosa che dipenda dall'affidabilità delle conoscenze del modello stesso, o un percorso di produzione che non possa tollerare che un modello di sette giorni, non collaudato, si comporti male. Proprio per quella situazione, un livello di instradamento è il wrapper giusto.Un'API per 200+ modellisignifica che il Qwen3.5-35B-A3B di base è già chiamabile al prezzo di listino, un Mini self-hosted può stare dietro lo stesso router con failover automatico, e un nuovo arrivato inaffidabile non può compromettere un percorso di produzione — quando non rende, la richiesta viene invece reindirizzata a un provider sano.

Cosa guardare dopo

Questa valutazione è una prima lettura, non un verdetto. Tre cose decideranno se Apodex 1.1 conterà tra un mese: {{1}}la riproduzione indipendente delle affermazioni agentiche del fornitore (i numeri GDPval e TerminalBench gestiti da Artificial Analysis sono gli unici non prodotti da Apodex stessa){{/1}}; {{2}}se il divario di affidabilità della conoscenza si riduce in una variante non-reasoning o in una versione successiva{{/2}}; e {{3}}se il modello compare su più API e più classifiche indipendenti, a quel punto il 44 e il -21.9 diventano un problema che qualcun altro dovrà battere{{/3}}. {{4}}Per un modello di sette giorni con questo tipo di profilo spaccato, è più o meno tutto ciò che puoi chiedere: un vero vantaggio agentico, un prezzo onesto e un punto debole che conosci prima di iscriverti{{/4}}.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno