
Apodex 1.1, 설명: 지능 지수에서 44점, 실제 에이전트 능력 — 그리고 지식 신뢰성의 문제점
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1323 tok/s
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
Apodex 1.1은 출시된 지 일주일 된 독점 모델로, 이번 주 전까지는 대부분 실험실의 호기심 거리에 불과했다. 그러던 중 Artificial Analysis가 이 모델에 대한 첫 독립 평가를 발표했다 — Apodex로서는 이 플랫폼에서의 첫 평가였다 — 그리고 점수판에는 이례적인 일이 벌어졌다: Apodex 1.1은 Artificial Analysis Intelligence Index에서 44점을 기록하며 177개 모델 중 11위에 올랐고, 에이전틱 작업 점수에서는 DeepSeek V4 Pro, Qwen3.7 Max, Kimi K2.6을 포함해 같은 지능 등급의 모든 모델을 앞질렀다. 같은 보고서에서는 더 나쁜 두 번째 수치도 드러났다: 실제 작업을 실행할지에 대한 결정을 바꿀 만큼 취약한 지식 신뢰도 기록이었다. 오픈 웨이트 자매 모델인 Apodex 1.1 Mini는 대부분의 사람들이 실제로 실행할 수 있는 모델이다. 이 평가가 말하는 것, 말하지 않는 것, 그리고 누가 주목해야 하는지에 대한 내용이다.
천천차오가 설립한 AI 기업 Apodex는 2026년 8월 24일, 70명의 저자가 참여한 arXiv 논문 "Apodex 1.1: Scaling Agentic Intelligence for Complex Work"(2608.23283)와 함께 제품군을 출시했습니다. 플래그십 모델은 독점 모델로, 공급업체 보고서에 따르면 약 397B 파라미터 규모이며, 에이전트의 진정한 병목은 원시 지능이 아니라 실행 환경이라는 논지를 바탕으로 구축되었습니다. 따라서 Apodex 1.1은 파일, 검색, 코드 작업을 장기간 직접 수행하도록 훈련되었으며, 최대 150개의 병렬 하위 에이전트를 조정하고 모든 단계의 출처 기록을 유지하는 공유 실행 하네스("AgentOS")를 갖추고 있습니다. 오픈 부분은 형제 모델인 Apodex 1.1 Mini로, 알리바바의 Qwen3.5-35B-A3B를 기반으로 미세 조정된 35B급 MoE 모델이며, Apache-2.0 라이선스로 공개되었고 FrontierAgent라는 동반 에이전트 하네스가 함께 제공됩니다. 풀 모델은 Apodex의 자체 API와 온라인 워크벤치를 통해서만 이용할 수 있으며, Mini는 자체 호스팅만 가능합니다.
지능 지수에서 44가 의미하는 것
Artificial Analysis Intelligence Index는 플랫폼의 벤치마크 스위트를 가중 집계한 지표로, GDPval-AA v2 및 Terminal-Bench 같은 에이전틱 평가와 추론·수학·지식 구성 요소를 포함합니다. 44점이라는 점수는 Apodex 1.1을 177개 모델 중 11위에 올리며, 중앙값인 18점을 크게 웃돕니다. 또한 이 점수는 모델을 경쟁이 치열하면서도 흥미로운 계층에 위치시킵니다. Kimi K2.6(45), MiniMax-M3(45), Inkling(42)이 모두 3점 이내에 있으며, Apodex 1.1은 이 그룹 중 일주일 전만 해도 대부분의 AI 사용자에게 생소했던 유일한 모델입니다. Artificial Analysis는 해당 페이지가 모델의 추론 버전을 다루며, 비추론 변형도 존재할 수 있다고 밝힙니다.

헤드라인 지수 점수는 이 모델이 흥미로워지는 지점이 아닙니다. 이 모델이 흥미로운 이유는 강점과 약점이 그 점수 대비 어디에 위치하는지에 있으며, 바로 그 점이 등급 비교를 통해 구체화됩니다.
등급 이상의 성능을 보이는 분야: 에이전트형 및 지식 작업 평가
실세계 에이전트 작업을 측정하는 인덱스의 두 구성 요소에서 Apodex 1.1은 자신과 44포인트 차이인 인접 모델들을 능가합니다. 실제 사무실 스타일 작업을 처음부터 끝까지 완료하는 에이전트의 능력을 점수화하는 벤치마크인 GDPval-AA v2에서 Apodex 1.1은 Elo 1348을 기록하며 DeepSeek V4 Pro(1333), Qwen3.7 Max(1308), Kimi K2.6(1202)보다 앞섰습니다. 터미널에서 작업하는 에이전트를 테스트하는 TerminalBench v2.1에서는 70%를 기록하여 Kimi K2.6(66%)보다 앞서고 Qwen3.7 Max(75%)에 바로 뒤를 이었습니다. 이는 독립적으로 Artificial Analysis가 운영한 수치이며, 환경 우선 훈련이 효과적이라는 보고서의 가장 강력한 증거입니다.
벤더 자체 벤치마크 주장은 더 나아가며, 누군가 재현하기 전까지는 벤더 보고 수치로 읽어야 한다: APEX-Agents 38.5, GDPVal 78.8, SWE-bench Verified 77.7%, Terminal-Bench 2.1 70.8%, 도구 사용 시 Humanity's Last Exam 56.1%, DeepSearchQA 92.4%, FrontierFinance 54.3, FrontierScience-Research 63.3. 에이전트형 프로필이 과대광고가 아니라 신뢰할 만한 이유는 그 배후의 아키텍처에 있다: 환경 확장(훈련에 사용되는 실행 파일, 검색, 코드 환경의 다양성을 확장)과 에이전트 조정 확장(모델이 장기 과제를 분해하고, 병렬 작업을 위임하고, 비동기 결과를 통합하며 재계획하도록 훈련하는 것)이다. 'Agent Team' 모드는 검색 및 종합 작업에서 최대 150개의 하위 에이전트를 생성하며, 내장된 검증 단계('Statement Review')가 결론을 전달하기 전에 확인한다. 다시 말해, 이 모델은 틀릴 수 있고, 스스로 확인하고, 문제를 고치도록 설계된 모델이지, 기억에서 사실을 암송하도록 설계된 모델이 아니다.
그 모든 자율성의 숨은 대가: 장황함
그 설계는 Artificial Analysis의 비용 효율성 표에서 지식 다음으로 이 모델의 가장 명확한 약점으로 나타난다: 매우 장황하다는 점이다. 전체 Intelligence Index를 실행하는 데 출력 토큰 180M이 소비되었습니다 — 중앙값 67M과 대비하여 — 그리고 벤치마크 작업당 약 17,000개의 출력 토큰이 사용되었습니다. 이는 Qwen3.7 Max의 약 9,400개, MiniMax-M3의 8,100개와 비교됩니다. 전체적으로 전체 평가에는 API 비용으로 $618.41이 들었으며, 이는 Artificial Analysis에 따른 것입니다.

그 청구 금액을 산출하는 가격 책정은 다음과 같습니다: 입력 토큰 100만 개당 $0.30, 출력 토큰 100만 개당 $3.00 — 캐시된 입력의 경우 캐시 적중 가격이 $0.03으로 90% 할인되며, 일반적인 7:2:1 캐시/입력/출력 비율에서는 100만 개당 약 $0.38로 혼합됩니다. 두 토큰당 가격 모두 플랫폼 중앙값(입력 $0.25, 출력 $0.90)보다 높습니다. 그러나 Artificial Analysis의 작업당 비용 추정치에 따르면 Apodex 1.1은 벤치마크 작업당 약 $0.05로 여전히 낮으며, Qwen3.7 Max(약 $0.07) 및 Kimi K2.6(약 $0.06)보다 저렴합니다. 이 차이를 이해하는 것은 예산 책정에 중요합니다. 토큰 가격이 충분히 저렴해서 장황한 출력이 많아도 작업당 경쟁력을 유지하기 때문입니다. 비용 위험은 단가가 아니라 사용량에 있습니다. 장기 실행 에이전트를 여기에 올리면 청구 금액은 에이전트가 얼마나 말을 많이 하느냐에 따라 결정되는데, 이 에이전트는 말이 매우 많습니다.
예산을 세우기 전에 알아둘 가격 참고 사항: $0.30/$3.00은 공급업체 자체 목록가입니다. 제공업체 목록 가격을 0% 마크업으로 통과시키는 라우팅 플랫폼은 정확히 그 금액을 청구하며, 향후 Apodex의 가격 인하는 발표된 당일에 바로 반영됩니다.
문제는 지식 신뢰성 기록이 약하다는 것이다.
출시 보도가 대부분 놓치는 숫자가 있습니다. Artificial Analysis의 지식 신뢰성 평가 도구인 AA-Omniscience에서 Apodex 1.1은 -21.9를 기록했습니다. 질문을 거부하는 대신 87%에 답변을 시도하지만, 정답률은 32%에 불과하며 환각률은 78.4%입니다. 헤비듀티 솔버로 포지셔닝된 모델로서는 심각한 이중성입니다. 에이전트 실행에는 강하지만, 근거 기반 지식에는 약합니다.
이 두 사실은 서로 연결되어 있으며 모순되지 않는다. 에이전틱 벤치마크는 환경 속에서 행동하는 것(도구 호출 실행, 반복, 복구)을 평가한다. 그래서 모델은 회상력이 낮아도 그런 벤치마크에서는 높은 점수를 받을 수 있다. 환경이 기억을 대신하기 때문이다. 설계 자체가 이를 전제한다. Statement Review는 출력을 확인하기 위해 존재하며, 워크벤치는 모델이 기억만으로 정답을 맞히는 것이 아니라 검증 중심으로 구축되어 있다. 실용적으로 해석하면 결론은 냉정하다. Apodex 1.1을 자체 가중치에서 사실을 회상해내야 하는 작업에 투입하지 말라. 대신 파일, 코드, 소스와 대조해 그 결과물을 검증할 수 있는 장기적 작업에 투입하고, 산출물을 검증하라.
오픈 형제: Apodex 1.1 Mini 및 FrontierAgent
플래그십의 닫힌 문이 문제라면, 제품군의 열린 절반이 균형추다. Apodex 1.1 Mini는 Alibaba가 2026년 2월 오픈소스로 공개한 베이스 모델 Qwen3.5-35B-A3B를 파인튜닝한, 총 약 350억/활성 약 30억 파라미터 규모의 MoE다. Apache-2.0 라이선스로 공개되었으며, 262K 컨텍스트 윈도우와 FP8, FP4, GPTQ-Int4 변형이 Hugging Face에서 제공된다. 공급업체가 보고한 대표 점수는 FrontierFinance에서 50.2점(Apodex 자체 비교에서 1위)이고, Agent Team 하네스를 활성화한 APEX-Agents에서 27.7점이다. 그리고 함께 제공되는 오픈소스 런타임인 FrontierAgent가 진짜 흥미로운 결과물이다. ReAct 및 Agent Team 모드를 갖춘 터미널 기반 하네스로, 샌드박스 파일 작업, 승인 게이트, 체크포인트 및 트레이스를 지원하며, OpenAI 호환 엔드포인트 어디와도 연동된다.
셀프 호스팅 전에 알아두면 좋은 두 가지가 있습니다. 첫째, Mini는 프런티어 모델이 아니라 파인튜닝 모델입니다. 벤치마크 수치는 플래그십 모델의 벤더 표를 읽을 때와 같은 방식으로 읽어야 합니다. 즉, 재현되지 않았고, 하네스가 포함되어 있으며, 벤더가 선택한 비교 결과입니다. 둘째, Mini의 동작은 기본 모델의 특성을 물려받습니다. 기반이 되는 Qwen3.5-35B-A3B가 이미 원하는 작업을 수행하는지 확인하고 싶다면 GPU와 서빙 스택이 필요하지 않습니다. 기본 모델은 API 호출 한 번이면 확인할 수 있기 때문입니다.
오늘 Apodex 1.1을 사용해야 하는 사람
주력 모델은 초기 단계이고 폐쇄적이며, 현재로서는 벤더 자체 API와 온라인 워크벤치에서만 사용할 수 있다. Apodex는 주요 플랫폼을 통해 더 폭넓은 API 제공이 곧 이루어질 것이라고 밝혔지만, 가중치는 공개되지 않았다. 이는 이번 주 스코어보드에 대응할 수 있는 대상을 제한한다. 즉, 이미 Apodex 워크벤치에 있거나 자사 API 키 등록을 원하는 팀만 가능하다. Mini는 더 접근하기 쉬운 경로이지만, 자체 호스팅이 필요하다.

이 모델이 진정으로 가치를 발휘하는 곳은 출력이 다운스트림에서 검증되는 장기적 에이전트 파이프라인, 즉 연구 워크벤치, 다단계 파일 및 도구 작업, 터미널 작업과 같은 업무이며, 장황함에도 불구하고 작업당 약 0.05달러의 비용 프로필이 유지되는 경우입니다. 아직 적합하지 않은 곳은 모델 자체의 지식이 신뢰할 수 있다는 데 의존하는 모든 것 또는 검증되지 않은 출시 7일 차 모델의 오작동을 용납할 수 없는 운영 경로입니다. 바로 그런 상황에서는 라우팅 계층이 적절한 래퍼입니다. 200+ 모델을 위한 하나의 API는 기본 Qwen3.5-35B-A3B가 이미 정가로 호출 가능하고, 자체 호스팅 Mini는 자동 장애 조치와 함께 동일한 라우터 뒤에 위치할 수 있으며, 불안정한 신규 모델은 운영 경로를 중단시킬 수 없음을 의미합니다. — 성능이 저하되면 요청은 대신 정상 공급자로 전환됩니다.
다음에 볼 콘텐츠
이 평가는 1차 검토일 뿐, 최종 판결이 아닙니다. 한 달 후 Apodex 1.1이 의미를 가지게 될지는 세 가지에 달려 있습니다: 벤더의 에이전틱 주장에 대한 독립적 재현(Artificial Analysis가 운영하는 GDPval과 TerminalBench 수치만이 Apodex 자체가 산출하지 않은 유일한 숫자입니다); 비추론 변형이나 후속 릴리스에서 지식 신뢰성 격차가 좁혀지는지 여부; 그리고 모델이 더 많은 API와 더 많은 독립 스코어보드에 등장하는지 여부 — 그 시점이 되면 44와 -21.9는 다른 누군가가 극복해야 할 문제가 됩니다. 일주일 된 모델이 이런 분할된 프로필을 가졌다면, 요구할 수 있는 것은 대략 이것이 전부입니다: 진짜 에이전틱 우위, 정직한 가격, 그리고 가입 전에 알게 되는 하나의 약점.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
