
Apodex 1.1, spiegato: un 44 sull'Intelligence Index, una vera forza agentica — e un problema di affidabilità della conoscenza
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 177 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1323 tok/s
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Apodex 1.1 ha una settimana di vita, è proprietario e fino a questa settimana era per lo più una curiosità da laboratorio. Poi Artificial Analysis ha pubblicato la sua prima valutazione indipendente del modello — la prima di Apodex sulla piattaforma — e la classifica ha fatto qualcosa di insolito: Apodex 1.1 ha ottenuto un 44 sull'Artificial Analysis Intelligence Index, piazzandosi all'#11 su 177, con punteggi di lavoro agentico che battono ogni modello della sua fascia di intelligenza, inclusi DeepSeek V4 Pro, Qwen3.7 Max e Kimi K2.6. Lo stesso rapporto ha fatto emergere un secondo numero, più sgradevole: un record di affidabilità delle conoscenze abbastanza debole da cambiare la decisione di eseguirci lavoro reale. Il suo fratello open-weights, Apodex 1.1 Mini, è il modello che la maggior parte delle persone può effettivamente eseguire. Ecco cosa dice la valutazione, cosa non dice e chi dovrebbe interessarsene.
Apodex, la società di IA fondata da Chen Tianqiao, ha rilasciato la famiglia il 24 agosto 2026, insieme a un paper arXiv con 70 autori, "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). L'ammiraglia è proprietaria — circa 397B di parametri, secondo il report del fornitore — costruita attorno alla tesi che il vero collo di bottiglia per gli agenti non è l'intelligenza grezza ma l'ambiente in cui operano. Apodex 1.1 è stato quindi addestrato a lavorare direttamente con file, ricerca e codice su lunghi orizzonti temporali, con un harness di esecuzione condiviso ("AgentOS") che coordina fino a 150 sotto-agenti in parallelo e mantiene un registro di provenienza di ogni passaggio. La versione aperta è la gemella: Apodex 1.1 Mini, una MoE di classe 35B messa a punto a partire dal modello di AlibabaQwen3.5-35B-A3B, rilasciata sotto Apache-2.0 con un harness complementare per agenti chiamato FrontierAgent. Il modello completo è accessibile solo tramite l'API e il workbench online di Apodex; la Mini è self-hosted o niente.
Cosa significa un 44 nell'Indice di Intelligenza
L'Artificial Analysis Intelligence Index è un aggregato ponderato della suite di benchmark della piattaforma — incluse valutazioni agentiche come GDPval-AA v2 e Terminal-Bench, oltre a componenti di ragionamento, matematica e conoscenza. Un punteggio di 44 colloca Apodex 1.1 all'11° posto su 177 modelli, ben sopra la mediana di 18. Il modello si ritrova inoltre in una fascia affollata e interessante: Kimi K2.6 (45), MiniMax-M3 (45) e Inkling (42) rientrano tutti entro tre punti, e Apodex 1.1 è l'unico di quel gruppo il cui nome era sconosciuto alla maggior parte degli utenti AI una settimana fa. Artificial Analysis nota che la pagina copre la versione reasoning del modello e che potrebbe esistere anche una variante non-reasoning.

Il punteggio dell'indice principale non è dove questo modello diventa interessante. È interessante per il punto in cui i suoi punti di forza e di debolezza si collocano rispetto a quel punteggio — ed è questo che il confronto tra i livelli rende concreto.
Dove supera la sua categoria: valutazioni per lavoro agentico e knowledge work
Nei due componenti dell'Indice che misurano il lavoro agentico nel mondo reale, Apodex 1.1 supera i suoi vicini di 44 punti. Su GDPval-AA v2 — un benchmark che valuta la capacità di un agente di completare attività realistiche da ufficio dall'inizio alla fine — Apodex 1.1 registra un Elo di 1348, davanti a DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) e Kimi K2.6 (1202). Su TerminalBench v2.1, che testa un agente al lavoro su un terminale, ottiene il 70%, davanti a Kimi K2.6 (66%) e subito dietro a Qwen3.7 Max (75%). Questi sono numeri indipendenti, gestiti da Artificial Analysis, e sono la prova più forte nel report che l'addestramento incentrato sull'ambiente funziona.
I benchmark dichiarati dal venditore spingono oltre, e vanno letti come dati forniti dal venditore finché qualcuno non li replica: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% con strumenti, DeepSearchQA 92.4%, FrontierFinance 54.3 e FrontierScience-Research 63.3. Ciò che rende credibile — e non semplice hype — il profilo agentico è l'architettura che ne è alla base: scalabilità ambientale (espandere la diversità degli ambienti di file eseguibili, ricerca e codice usati nell'addestramento) e scalabilità del coordinamento agentico (addestrare il modello a scomporre compiti a lungo orizzonte, delegare lavoro in parallelo, integrare risultati asincroni e riprogettare). La modalità "Agent Team" genera fino a 150 sottoagenti per attività di recupero e sintesi, e un passaggio di verifica integrato ("Statement Review") controlla le conclusioni prima che vengano consegnate. In altre parole: questo è un modello progettato per sbagliare, controllarsi e correggere le cose — non per recitare fatti a memoria.
Il costo nascosto di tutta questa agency: la verbosità
Quel design appare nella tabella di efficienza dei costi di Artificial Analysis come la debolezza più evidente del modello dopo la conoscenza: è molto verboso. Eseguire l'intero Intelligence Index ha consumato 180M token di output — contro una mediana di 67M — e circa 17,000 token di output per compito di benchmark, a fronte di circa 9,400 per Qwen3.7 Max e 8,100 per MiniMax-M3. In totale, l'intera valutazione è costata $618.41 in spese API, secondo Artificial Analysis.

Il prezzo che produce quella fattura: $0.30 per milione di token di input e $3.00 per milione di output — un prezzo di cache hit di $0.03 sull'input in cache, con uno sconto del 90% — che si combina in circa $0.38 per milione su un mix tipico 7:2:1 cache/input/output. Entrambi i prezzi per token si collocano al di sopra delle mediane della piattaforma ($0.25 input, $0.90 output). Tuttavia, la stima del costo per task di Artificial Analysis colloca ancora Apodex 1.1 a circa $0.05 per task di benchmark, più economico di Qwen3.7 Max (~$0.07) e Kimi K2.6 (~$0.06). La riconciliazione è importante per il budget: i suoi token sono abbastanza economici che anche una verbosità elevata rimane competitiva per task — il rischio di costo è il volume, non la tariffa. Se ci metti un agente a lunga esecuzione, la fattura è determinata da quanto parla, e parla molto.
Una nota sui prezzi prima di fare il budget: {{1}}$0.30/$3.00{{/1}} è il listino del fornitore stesso. Una piattaforma di routing che inoltra i prezzi di listino dei provider con un ricarico del {{2}}0%{{/2}} addebita esattamente quella cifra, e qualsiasi futuro taglio dei prezzi di {{3}}Apodex{{/3}} si riflette lo stesso giorno in cui viene annunciato.
Il problema: un debole record di affidabilità delle conoscenze
Ecco il numero che la copertura del lancio per lo più non menziona. Su AA-Omniscience, la sonda di affidabilità della conoscenza di Artificial Analysis, Apodex 1.1 ottiene -21,9. Tenta di rispondere all'87% delle domande invece di rifiutare, ma solo il 32% delle risposte è corretto, e il suo tasso di allucinazioni è del 78,4%. Per un modello presentato come un risolutore potente, questa è una grave scissione di personalità: forte nell'esecuzione agentica, debole nella conoscenza fondata.
Le due cose sono collegate, non contraddittorie. I benchmark agentici premiano l'azione in un ambiente — emettere chiamate agli strumenti, iterare, riprendersi — quindi un modello può ottenere buoni punteggi lì pur avendo una scarsa capacità di richiamo, perché è l'ambiente a fare da memoria. Il design lo dà addirittura per scontato: Statement Review esiste per controllare gli output, e il workbench è costruito attorno alla verifica, non attorno al fatto che il modello abbia ragione a memoria. La lettura pratica è netta: non puntare Apodex 1.1 su compiti che dipendono dal recupero di fatti dai suoi stessi pesi. Puntalo su compiti a lungo orizzonte in cui il suo lavoro può essere verificato contro file, codice e fonti — e verifica la consegna.
Il fratello open: Apodex 1.1 Mini e FrontierAgent
Se la porta chiusa dell'ammiraglia è un problema, la metà aperta della famiglia è il contrappeso. Apodex 1.1 Mini è un MoE da ~35B totali / ~3B attivi, fine-tunato da Qwen3.5-35B-A3B (una base di Alibaba resa open-source a febbraio 2026), rilasciato sotto licenza Apache-2.0 con una finestra di contesto di 262K e varianti FP8, FP4 e GPTQ-Int4 su Hugging Face. Il suo punteggio principale dichiarato dal fornitore è 50.2 su FrontierFinance (primo nella comparazione interna di Apodex) e 27.7 su APEX-Agents con l'harness Agent Team abilitato. E FrontierAgent — il runtime open-source che lo accompagna — è davvero l'artefatto interessante: un harness basato su terminale con modalità ReAct e Agent Team, lavoro sui file in sandbox, gate di approvazione, checkpoint e tracce, il tutto in grado di interfacciarsi con qualsiasi endpoint compatibile con OpenAI.
Due cose che vale la pena sapere prima di fare self-hosting. Primo, il Mini è un fine-tune, non un modello di frontiera — leggi i suoi numeri benchmark nello stesso modo in cui leggi la tabella del vendor dell'ammiraglia: confronti non riprodotti, con harness incluso, scelti dal vendor. Secondo, il suo comportamento eredita dal modello base: se vuoi testare se il Qwen3.5-35B-A3B sottostante svolge già il tuo compito, non hai bisogno di una GPU e di uno stack di serving per scoprirlo — la base è a una sola chiamata API di distanza.
Chi dovrebbe usare Apodex 1.1 oggi?
Il modello di punta è in fase iniziale, chiuso e per ora disponibile solo sull'API proprietaria del venditore e sul workbench online; Apodex afferma che una più ampia disponibilità API arriverà tramite le principali piattaforme, ma i pesi non sono aperti. Questo limita chi può agire sulla classifica di questa settimana: i team già sul workbench Apodex, o disposti a registrarsi per una chiave API di prima parte. Il Mini è il percorso più accessibile, ma significa self-hosting.

Dove il modello guadagna davvero il suo posto: pipeline agentiche a lungo orizzonte in cui gli output vengono verificati a valle — banchi di lavoro per la ricerca, attività multi-step con file e strumenti, lavoro da terminale — e dove il profilo di costo di ~$0,05 per attività regge alla verbosità. Dove invece non trova ancora posto: qualsiasi cosa che dipenda dall'affidabilità delle conoscenze del modello stesso, o un percorso di produzione che non possa tollerare che un modello di sette giorni, non collaudato, si comporti male. Proprio per quella situazione, un livello di instradamento è il wrapper giusto.Un'API per 200+ modellisignifica che il Qwen3.5-35B-A3B di base è già chiamabile al prezzo di listino, un Mini self-hosted può stare dietro lo stesso router con failover automatico, e un nuovo arrivato inaffidabile non può compromettere un percorso di produzione — quando non rende, la richiesta viene invece reindirizzata a un provider sano.
Cosa guardare dopo
Questa valutazione è una prima lettura, non un verdetto. Tre cose decideranno se Apodex 1.1 conterà tra un mese: {{1}}la riproduzione indipendente delle affermazioni agentiche del fornitore (i numeri GDPval e TerminalBench gestiti da Artificial Analysis sono gli unici non prodotti da Apodex stessa){{/1}}; {{2}}se il divario di affidabilità della conoscenza si riduce in una variante non-reasoning o in una versione successiva{{/2}}; e {{3}}se il modello compare su più API e più classifiche indipendenti, a quel punto il 44 e il -21.9 diventano un problema che qualcun altro dovrà battere{{/3}}. {{4}}Per un modello di sette giorni con questo tipo di profilo spaccato, è più o meno tutto ciò che puoi chiedere: un vero vantaggio agentico, un prezzo onesto e un punto debole che conosci prima di iscriverti{{/4}}.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
