Ett hero-titelkort för Apodex 1.1 med titeln 'Apodex 1.1' och undertiteln '44 på Intelligence Index – agentstyrka, hög mångordighet och en kunskapsmässig hake', pillmärken som visar 'AA Index 44', '#11 av 177', '256K kontext', och en sidfotsrad 'Släppt 24 augusti 2026 – första Apodex-modellen på Artificial Analysis', med OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

Apodex 1.1, förklarat: en 44 på Intelligence Index, verklig agentisk styrka — och en kunskapstillförlitlighetsbrist.

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Apodex 1.1 är en vecka gammal, proprietär och fram till denna vecka mest en laboratoriekuriositet. Sedan publicerade Artificial Analysis sin första oberoende utvärdering av modellen – Apodex första på plattformen – och poängtavlan gjorde något ovanligt: Apodex 1.1 fick 44 på Artificial Analysis Intelligence Index, rankad som #11 av 177, samtidigt som modellen presterade bättre på agentiska arbetsuppgifter än alla andra modeller i sin intelligensnivå, inklusive DeepSeek V4 Pro, Qwen3.7 Max och Kimi K2.6. Samma rapport innehöll en andra, fulare siffra: ett kunskaps- och tillförlitlighetsresultat så svagt att det förändrade beslutet om att köra riktiga arbetsuppgifter på modellen. Dess syskon med öppna vikter, Apodex 1.1 Mini, är modellen som de flesta faktiskt kan köra. Här är vad utvärderingen säger, vad den inte säger och vem som bör bry sig.

Apodex, AI-företaget som grundades av Chen Tianqiao, lanserade modellfamiljen den 24 augusti 2026, tillsammans med en arXiv-artikel med 70 författare, "Apodex 1.1: Scaling Agentic Intelligence for Complex Work" (2608.23283). Flaggskeppet är proprietärt — ungefär 397B parametrar, enligt leverantörens rapport — byggt kring tesen att den verkliga flaskhalsen för agenter inte är rå intelligens utan miljön de verkar i. Apodex 1.1 tränades därför att arbeta direkt med filer, sökning och kod över långa tidshorisonter, med ett delat exekveringsramverk ("AgentOS") som koordinerar upp till 150 parallella underagenter och för en ursprungslogg över varje steg. Den öppna delen är syskonmodellen: Apodex 1.1 Mini, en MoE i 35B-klassen finjusterad från Alibabas Qwen3.5-35B-A3B, släppt under Apache-2.0 med ett tillhörande agentramverk som kallas FrontierAgent. Hela modellen når du bara genom Apodex eget API och online-arbetsbänk; Mini är självhostad eller ingenting.

Vad en 44 på intelligensindexet betyder

Artificial Analysis Intelligence Index är en viktad sammanvägning av plattformens benchmarksvit — inklusive agentiska utvärderingar som GDPval-AA v2 och Terminal-Bench, samt komponenter för resonemang, matematik och kunskap. Med 44 poäng hamnar Apodex 1.1 på plats 11 av 177 modeller, väl över medianen på 18. Det placerar också modellen i ett tätt och intressant skikt: Kimi K2.6 (45), MiniMax-M3 (45) och Inkling (42) ligger alla inom tre poäng, och Apodex 1.1 är den enda i den gruppen vars namn var okänt för de flesta AI-användare för en vecka sedan. Artificial Analysis noterar att sidan behandlar resonemangsversionen av modellen, och att en variant utan resonemang också kan finnas.

A single-column scoreboard for Apodex 1.1 titled 'Apodex 1.1 - the scoreboard' listing AA Intelligence Index 44 (#11 of 177), GDPval-AA v2 Elo 1348, TerminalBench v2.1 70%, Output tokens per task ~17,000, Full Index evaluation cost 18.41, and AA-Omniscience -21.9 (78% hallucination), with a footer 'All figures per Artificial Analysis, August 2026.' and the OrcaRouter logo in the bottom-right corner.

Rubrikens indexpoäng är inte där den här modellen blir intressant. Den blir intressant på grund av var dess styrkor och svagheter ligger i förhållande till den poängen — och det är vad nivåjämförelsen gör konkret.

Där den slår över sin viktklass: agentiska och kunskapsarbetsutvärderingar

På de två Index-komponenter som mäter verkligt agentiskt arbete överträffar Apodex 1.1 sina 44-poängsgrannar. På GDPval-AA v2 — ett riktmärke som bedömer en agents förmåga att slutföra realistiska kontorsliknande uppgifter från början till slut — uppnår Apodex 1.1 en Elo på 1348, före DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) och Kimi K2.6 (1202). På TerminalBench v2.1, som testar en agent som arbetar i en terminal, får den 70%, före Kimi K2.6 (66%) och strax bakom Qwen3.7 Max (75%). Dessa är oberoende siffror från Artificial Analysis, och de är det starkaste beviset i rapporten på att den miljöförsta träningen fungerar.

Leverantörens egna benchmark-påståenden går längre, och bör läsas som leverantörsrapporterade tills någon reproducerar dem: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, Humanity's Last Exam 56.1% med verktyg, DeepSearchQA 92.4%, FrontierFinance 54.3, och FrontierScience-Research 63.3. Det som gör agentprofilen trovärdig snarare än hype är arkitekturen bakom den: miljöskalning (att utöka mångfalden av körbara fil-, sök- och kodmiljöer som används i träning) och agentisk koordineringsskalning (att träna modellen att bryta ner långsiktiga uppgifter, delegera parallellt arbete, integrera asynkrona resultat och planera om). "Agent Team"-läget skapar upp till 150 underagenter för hämtnings- och syntesuppgifter, och ett inbyggt verifieringssteg ("Statement Review") kontrollerar slutsatser innan de levereras. Med andra ord: det här är en modell som är utformad för att ha fel, kontrollera sig själv och fixa saker – inte för att recitera fakta från minnet.

Den dolda kostnaden för all den agensen: mångordighet

Den designen syns på Artificial Analysis kostnadseffektivitetstabell som modellens tydligaste svaghet efter kunskap: den är väldigt pratig. Att köra hela Intelligence Index förbrukade 180 miljoner utdatatokens — jämfört med en median på 67 miljoner — och ungefär 17 000 utdatatokens per benchmarkuppgift, mot cirka 9 400 för Qwen3.7 Max och 8 100 för MiniMax-M3. Totalt kostade hela utvärderingen 618,41 dollar i API-utgifter, enligt Artificial Analysis.

A screenshot of the Artificial Analysis model page for Apodex 1.1 (captured August 31, 2026), showing 'Apodex 1.1 scores 44 on the Artificial Analysis Intelligence Index' with a median of 18, the note that it generated 180M tokens versus a 67M median, pricing of $0.30 per 1M input and $3.00 per 1M output tokens, and the $618.41 total cost to evaluate the model on the Intelligence Index.

Prissättningen som ger den fakturan: 0,30 USD per miljon input-tokens och 3,00 USD per miljon output-tokens — ett cache-träffpris på 0,03 USD för cachad input, en rabatt på 90 % — vilket landar på cirka 0,38 USD per miljon vid en typisk 7:2:1-fördelning cache/input/output. Båda priserna per token ligger över plattformens medianvärden (0,25 USD input, 0,90 USD output). Ändå placerar Artificial Analysis uppskattning av kostnaden per uppgift fortfarande Apodex 1.1 på cirka 0,05 USD per benchmark-uppgift, billigare än Qwen3.7 Max (~0,07 USD) och Kimi K2.6 (~0,06 USD). Avstämningen är viktig för budgeteringen: dess tokens är tillräckligt billiga för att även hög mångordighet ska förbli konkurrenskraftig per uppgift — kostnadsrisken ligger i volymen, inte i priset. Om du sätter en långvarig agent på den drivs fakturan av hur mycket den pratar, och den pratar mycket.

En prisanmärkning innan du budgeterar: $0.30/$3.00 är leverantörens eget listpris. En routingplattform som förmedlar leverantörens listpriser med 0 % påslag debiterar exakt det beloppet, och eventuella framtida Apodex-prissänkningar syns samma dag som de tillkännages.

Haken: ett svagt resultat när det gäller kunskapstillförlitlighet.

Här är siffran som lanseringsbevakningen mestadels missar. På AA-Omniscience, ett kunskapstillförlitlighetstest från Artificial Analysis, får Apodex 1.1 -21,9. Den försöker svara på 87 % av frågorna istället för att avstå, men får bara 32 % rätt, och hallucinationsgraden är 78,4 %. För en modell som positioneras som en tung problemlösare är det en allvarlig splittrad personlighet: stark på agentisk exekvering, svag på grundad kunskap.

De två fakta är sammankopplade, inte motsägelsefulla. Agentiska riktmärken belönar agerande i en miljö — att utfärda verktygsanrop, iterera, återhämta sig — så en modell kan prestera väl där samtidigt som den har dålig återkallelse, eftersom miljön sköter minnet. Designen förutsätter till och med det: Statement Review finns för att kontrollera utdata, och arbetsbänken är byggd kring verifiering, inte kring att modellen ska ha rätt från minnet. Den praktiska tolkningen är kärnfull: rikta inte Apodex 1.1 mot uppgifter som är beroende av att den hämtar fakta från sina egna vikter. Rikta den mot långsiktiga uppgifter där dess arbete kan kontrolleras mot filer, kod och källor — och verifiera leveransen.

Det öppna syskonet: Apodex 1.1 Mini och FrontierAgent

Om flaggskeppets stängda dörr är ett problem, är familjens öppna hälft motvikten. Apodex 1.1 Mini är en MoE-modell med ~35B totalt / ~3B aktiva parametrar, finjusterad från Qwen3.5-35B-A3B (en basmodell från Alibaba som släpptes som öppen källkod i februari 2026), publicerad under Apache-2.0 med ett kontextfönster på 262K och varianter i FP8, FP4 och GPTQ-Int4 på Hugging Face. Dess leverantörsrapporterade huvudresultat är 50,2 på FrontierFinance (först i Apodex egen jämförelse) och 27,7 på APEX-Agents med Agent Team-utrustningen aktiverad. Och FrontierAgent – körtidsmiljön med öppen källkod som följer med – är verkligen den intressanta artefakten: en terminalbaserad utrustning med ReAct- och Agent Team-lägen, sandlådefilhantering, godkännandegates, kontrollpunkter och spårningar, som kan prata med vilken OpenAI-kompatibel slutpunkt som helst.

Två saker värda att veta innan du själv hostar. För det första är Mini en finjustering, inte en frontier-modell — läs dess benchmarksiffror på samma sätt som du läser flaggskeppets leverantörstabell: ej reproducerbara, med testmiljö inkluderad, leverantörsvalda jämförelser. För det andra ärver dess beteende basmodellen: om du vill testa om den underliggande Qwen3.5-35B-A3B redan klarar din uppgift behöver du varken en GPU eller en serverstack för att ta reda på det — basmodellen är ett API-anrop bort.

Vem bör använda Apodex 1.1 idag

Flaggskeppet är i ett tidigt skede, stängt och för närvarande endast tillgängligt via leverantörens eget API och online-arbetsbänk; Apodex säger att bredare API-tillgänglighet kommer via stora plattformar, men vikterna är inte öppna. Det begränsar vilka som kan agera på veckans resultattavla: team som redan finns på Apodex arbetsbänk, eller som är villiga att registrera sig för en förstaparts-API-nyckel. Mini är den mer tillgängliga vägen, men det innebär självhosting.

A screenshot of the Apodex online workbench homepage (captured August 31, 2026), showing the deep-research interface with the prompt field 'Ask the question that matters', feature points for a step-level reasoning trace, citations in every report, branching off any report, and full-text search across threads, and a sign-in prompt for saving inquiries.

Där modellen verkligen förtjänar sin plats: långsiktiga agentiska pipelines där utdata verifieras i efterhand — forskningsarbetsbänkar, flerstegsuppgifter med filer och verktyg, terminalarbete — och där kostnadsprofilen på cirka 0,05 USD per uppgift överlever pratigheten. Där den ännu inte hör hemma: allt som förlitar sig på att modellens egen kunskap är tillförlitlig, eller en produktionsväg som inte tål att en obeprövad sju dagar gammal modell beter sig illa. För just den situationen är ett routerlager rätt omslag. Ett API för 200+ modellerinnebär att basmodellen Qwen3.5-35B-A3B redan kan anropas till listpris, en självhostad Mini kan ligga bakom samma router med automatisk reservväxling, och en ostadig nykomling kan inte ta ner en produktionsväg — när den presterar dåligt rullas begäran vidare till en fungerande leverantör istället.

Vad du ska titta på härnäst

Den här utvärderingen är en första avläsning, inte en dom. Tre saker avgör om Apodex 1.1 spelar roll om en månad: oberoende reproduktion av tillverkarens agentiska påståenden (GDPval- och TerminalBench-siffrorna från Artificial Analysis är de enda som inte producerats av Apodex självt); huruvida kunskapstillförlitlighetsgapet minskar i en icke-resonerande variant eller i en uppföljande utgåva; och huruvida modellen dyker upp på fler API:er och fler oberoende resultattavlor – vid vilken punkt 44:an och -21,9:an blir någon annans problem att slå. För en sju dagar gammal modell med en sådan här splittrad profil är det ungefär så mycket man kan begära: en verklig agentisk fördel, ett ärligt pris och en svaghet du känner till innan du registrerar dig.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen