
Apodex 1.1, uitgelegd: een 44 op de Intelligence Index, echte agentische kracht — en een addertje onder het gras wat betreft kennisbetrouwbaarheid
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 177 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1323 tok/s
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Apodex 1.1 is een week oud, propriëtair, en tot deze week was het vooral een labcuriositeit. Toen publiceerde Artificial Analysis zijn eerste onafhankelijke evaluatie van het model — de eerste van Apodex op het platform — en het scorebord deed iets ongebruikelijks: Apodex 1.1 scoorde een 44 op de Artificial Analysis Intelligence Index, gerangschikt op #11 van 177, terwijl het scores voor agentisch werk behaalde die elk model in zijn intelligentieniveau versloegen, waaronder DeepSeek V4 Pro, Qwen3.7 Max en Kimi K2.6. Hetzelfde rapport bracht een tweede, lelijker getal aan het licht: een kennis-betrouwbaarheidsrecord dat zwak genoeg was om de beslissing over het draaien van echt werk erop te veranderen. Het open-gewichten zustermodel, Apodex 1.1 Mini, is het model dat de meeste mensen daadwerkelijk kunnen draaien. Hier is wat de evaluatie zegt, wat het niet zegt, en wie dit zou moeten aangaan.
Apodex, het AI-bedrijf opgericht door Chen Tianqiao, lanceerde de familie op 24 augustus 2026, samen met een arXiv-paper van 70 auteurs, "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). Het vlaggenschip is propriëtair — grofweg 397B parameters, volgens het rapport van de leverancier — gebouwd rond de stelling dat de echte bottleneck voor agents niet ruwe intelligentie is, maar de omgeving waarin ze opereren. Apodex 1.1 is daarom getraind om rechtstreeks met bestanden, zoekopdrachten en code te werken over lange tijdshorizons, met een gedeelde uitvoeringsomgeving ("AgentOS") die tot 150 parallelle sub-agents coördineert en een herkomstregistratie van elke stap bijhoudt. Het open deel is het zustermodel: Apodex 1.1 Mini, een MoE in de 35B-klasse, verfijnd op basis van Alibaba's Qwen3.5-35B-A3B, uitgebracht onder Apache-2.0 met een bijbehorende agent-harness genaamd FrontierAgent. Het volledige model is alleen bereikbaar via Apodex' eigen API en online werkbank; de Mini is self-hosted of niets.
Wat een 44 op de Intelligentie-Index betekent
De Artificial Analysis Intelligence Index is een gewogen samenvoeging van de benchmarksuite van het platform — waaronder agentische evaluaties zoals GDPval-AA v2 en Terminal-Bench, plus componenten voor redeneren, wiskunde en kennis. Een score van 44 plaatst Apodex 1.1 op #11 van 177 modellen, ruim boven de mediaan van 18. Het plaatst het model ook in een drukke, interessante categorie: Kimi K2.6 (45), MiniMax-M3 (45) en Inkling (42) zitten allemaal binnen drie punten, en Apodex 1.1 is de enige uit die groep waarvan de naam een week geleden bij de meeste AI-gebruikers onbekend was. Artificial Analysis merkt op dat de pagina de redenerende versie van het model behandelt, en dat er mogelijk ook een niet-redenerende variant bestaat.

De hoofdindexscore is niet waar dit model interessant wordt. Het is interessant vanwege waar de sterke en zwakke punten zich bevinden ten opzichte van die score — en dat is wat de tiervergelijking concreet maakt.
Waar het boven zijn niveau presteert: agentische en kenniswerk-evaluaties.
Bij de twee Index-componenten die realistisch agentisch werk meten, {{1}}overtreft Apodex 1.1 zijn 44-puntsburen{{/1}}. Op GDPval-AA v2 — een benchmark die het vermogen van een agent om realistische kantoorachtige taken van begin tot eind uit te voeren scoort — {{2}}noteert Apodex 1.1 een Elo van 1348, vóór DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) en Kimi K2.6 (1202){{/2}}. Op TerminalBench v2.1, dat een agent test die op een terminal werkt, {{3}}scoort het 70%, vóór Kimi K2.6 (66%) en net achter Qwen3.7 Max (75%){{/3}}. Dat zijn onafhankelijke, door Artificial Analysis uitgevoerde cijfers, en {{4}}ze zijn het sterkste bewijs in het rapport dat de omgeving-eerst-training werkt{{/4}}.
De eigen benchmarkclaims van de leverancier gaan verder en moeten worden gelezen als door de leverancier gerapporteerd totdat iemand ze reproduceert: APEX-Agents 38,5, GDPVal 78,8, SWE-bench Verified 77,7%, Terminal-Bench 2.1 70,8%, Humanity's Last Exam 56,1% met tools, DeepSearchQA 92,4%, FrontierFinance 54,3 en FrontierScience-Research 63,3. Wat het agentische profiel geloofwaardig maakt in plaats van hype, is de architectuur erachter: environment scaling (het uitbreiden van de diversiteit aan uitvoerbare bestands-, zoek- en code-omgevingen die tijdens de training worden gebruikt) en agentic coordination scaling (het trainen van het model om langetermijntaken op te splitsen, parallel werk te delegeren, asynchrone resultaten te integreren en opnieuw te plannen). De "Agent Team"-modus start tot 150 sub-agents bij retrieval- en synthesetaken, en een ingebouwde verificatiestap ("Statement Review") controleert conclusies voordat ze worden opgeleverd. Met andere woorden: dit is een model dat is ontworpen om fouten te maken, zichzelf te controleren en dingen te herstellen — niet om feiten uit het geheugen op te zeggen.
De verborgen kosten van al die handelingsvrijheid: breedsprakigheid
Dat ontwerp verschijnt op de kostenefficiëntietabel van Artificial Analysis als de duidelijkste zwakte van het model na kennis: het is zeer breedsprakig. Het draaien van de volledige Intelligence Index verbruikte 180M outputtokens — tegenover een mediaan van 67M — en circa 17.000 outputtokens per benchmarktaak, tegenover ongeveer 9.400 voor Qwen3.7 Max en 8.100 voor MiniMax-M3. In totaal kostte de volledige evaluatie $618,41 aan API-uitgaven, volgens Artificial Analysis.

De prijzen achter die rekening: $0,30 per miljoen invoertokens en $3,00 per miljoen uitvoer — een cache-hit-prijs van $0,03 op gecachte invoer, een korting van 90% — wat uitkomt op ongeveer $0,38 per miljoen bij een typische 7:2:1-cache/invoer/uitvoer-mix. Beide prijzen per token liggen boven de medianen van het platform ($0,25 invoer, $0,90 uitvoer). Toch schat Artificial Analysis de kosten per taak voor Apodex 1.1 nog steeds op ruwweg $0,05 per benchmarktaak, goedkoper dan Qwen3.7 Max (~$0,07) en Kimi K2.6 (~$0,06). Het met elkaar verzoenen van deze twee gegevens is belangrijk voor de budgettering: de tokens zijn goedkoop genoeg dat zelfs bij grote spraakzaamheid de kosten per taak concurrerend blijven — het kostenrisico zit in volume, niet in tarief. Als je er een langlopende agent op zet, wordt de rekening bepaald door hoeveel hij praat, en hij praat veel.
Eén prijsnotitie voordat u uw budget opstelt: $0,30/$3,00 is de eigen lijstprijs van de leverancier. Een routeringsplatform dat de lijstprijzen van providers doorgeeft met 0% opslag brengt exact dat bedrag in rekening, en elke toekomstige prijsverlaging van Apodex verschijnt op dezelfde dag dat deze wordt aangekondigd.
Het addertje onder het gras: een zwakke staat van dienst op het gebied van kennisbetrouwbaarheid.
Dit is het getal dat de berichtgeving over de lancering meestal over het hoofd ziet. Op AA-Omniscience, de kennisbetrouwbaarheidsprobe van Artificial Analysis, scoort Apodex 1.1 -21,9. Het probeert 87% van de vragen te beantwoorden in plaats van te weigeren, maar krijgt slechts 32% goed, en het hallucinatiepercentage is 78,4%. Voor een model dat gepositioneerd is als een zware probleemoplosser, is dat een ernstige gespleten persoonlijkheid: sterk in agentische uitvoering, zwak in gefundeerde kennis.
De twee feiten hangen samen, ze zijn niet tegenstrijdig. Agentische benchmarks belonen het handelen in een omgeving — toolaanroepen doen, itereren, herstellen — dus een model kan daar goed scoren terwijl het een slechte geheugenprestatie heeft, omdat de omgeving het onthouden overneemt. Het ontwerp gaat er zelfs van uit: Statement Review bestaat om outputs te controleren, en de werkbank is gebouwd rond verificatie, niet rond het model dat uit het geheugen gelijk heeft. De praktische lezing is onomwonden: wijs Apodex 1.1 niet toe aan taken die afhangen van het ophalen van feiten uit de eigen gewichten. Wijs het toe aan langetermijntaken waarbij het werk kan worden gecontroleerd tegen bestanden, code en bronnen — en verifieer de oplevering.
De open tegenhanger: Apodex 1.1 Mini en FrontierAgent
Als de gesloten deur van het vlaggenschip een probleem is, is de open helft van de familie het tegenwicht. Apodex 1.1 Mini is een MoE met ~35B totale / ~3B actieve parameters, gefinetuned op basis van Qwen3.5-35B-A3B (een basismodel dat Alibaba in februari 2026 als open source uitbracht), uitgebracht onder Apache-2.0 met een contextvenster van 262K en FP8-, FP4- en GPTQ-Int4-varianten op Hugging Face. Het door de leverancier gerapporteerde topresultaat is 50,2 op FrontierFinance (eerste in Apodex' eigen vergelijking) en 27,7 op APEX-Agents met de Agent Team-harness ingeschakeld. En FrontierAgent — de open-sourceruntime die ermee wordt meegeleverd — is echt het interessante artefact: een terminalgebaseerde harness met ReAct- en Agent Team-modi, bestandswerk in een sandbox, goedkeuringspoorten, checkpoints en traces, die allemaal kunnen communiceren met elke willekeurige OpenAI-compatibele endpoint.
Twee dingen die je moet weten voordat je zelf host. {{1}}Ten eerste is de Mini een fine-tune, geen frontiermodel — lees de benchmarkcijfers op dezelfde manier als je de vendortabel van het vlaggenschip leest: niet-gereproduceerde, inclusief harness, door de vendor gekozen vergelijkingen.{{/1}} {{2}}Ten tweede is het gedrag geërfd van de basis: als je wilt testen of de onderliggende Qwen3.5-35B-A3B jouw taak al uitvoert, heb je geen GPU en een serving-stack nodig om daarachter te komen — de basis is nog maar één API-call verwijderd.{{/2}}
Wie zou Apodex 1.1 vandaag moeten gebruiken?
Het vlaggenschip is vroeg, gesloten, en voorlopig alleen op de eigen API en online werkbank van de leverancier; Apodex zegt dat bredere API-beschikbaarheid eraan komt via grote platforms, maar de gewichten zijn niet open. Dat beperkt wie er op het scorebord van deze week kan acteren: teams die al op de Apodex-werkbank zitten, of bereid zijn zich aan te melden voor een first-party API-sleutel. De Mini is het toegankelijkere pad, maar dat betekent self-hosting.

Waar het model echt zijn plaats verdient: agentische pipelines met een lange horizon waar outputs downstream worden geverifieerd — onderzoeksworkbenches, meerstapstaken met bestanden en tools, terminalwerk — en waar het kostenprofiel van ~$0,05 per taak de uitvoerigheid overleeft. Waar het nog niet thuishoort: alles wat afhankelijk is van de betrouwbaarheid van de eigen kennis van het model, of een productiepad dat niet kan tolereren dat een onbewezen model van zeven dagen oud zich misdraagt. Voor precies die situatie is een routeringslaag de juiste wrapper.Eén API voor 200+ modellen betekent dat de basis-Qwen3.5-35B-A3B al tegen de lijstprijs aanroepbaar is, dat een zelfgehoste Mini achter dezelfde router kan staan met automatische failover, en dat een onbetrouwbare nieuwkomer geen productiepad kan platleggen — wanneer hij ondermaats presteert, rolt het verzoek door naar een gezonde provider.
Wat nu te kijken
Deze evaluatie is een eerste lezing, geen eindoordeel. Drie dingen bepalen of Apodex 1.1 over een maand nog uitmaakt: onafhankelijke reproductie van de agentische claims van de leverancier (de door Artificial Analysis uitgevoerde GDPval- en TerminalBench-cijfers zijn de enige die niet door Apodex zelf zijn geproduceerd); of de kloof in kennisbetrouwbaarheid kleiner wordt in een niet-redenerende variant of een vervolgrelease; en of het model verschijnt op meer API's en meer onafhankelijke scoreborden, waarna de 44 en de -21,9 het probleem van iemand anders worden om te verslaan. Voor een model van zeven dagen oud met dit soort tweeledig profiel is dat ongeveer alles wat je kunt vragen: een echte agentische voorsprong, een eerlijke prijs, en één zwakte waar je van weet voordat je je aanmeldt.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
