Fugu Ultra v2 대 GLM 5.2 대결을 위한 히어로 카드로, '당신이 지불하는 것은 파라미터가 아니라 조율이다'라는 문구 아래 단일 Mixture-of-Experts 모델에 맞서는 오케스트레이션 시스템을 보여줍니다.
Guides & Insights

Fugu Ultra v2 vs GLM 5.2: 당신은 파라미터가 아니라 조정에 비용을 지불한다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 요금표를 나란히 놓고 보면 이 맞대결은 실수처럼 보인다. Fugu Ultra v2는 2026년 9월 11일 Sakana AI가 발표했으며, 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 30달러를 청구한다. GLM 5.2는 2026년 6월 16일 Z.ai의 주력 모델로, 1.40달러와 4.40달러를 청구한다. 둘 다 컨텍스트 윈도가 100만 토큰 규모라고 주장한다. 둘 다 정확히 같은 구매자, 즉 길고 다단계적인 저장소 규모의 에이전트 작업을 돌리는 팀을 겨냥한다. 하나는 다른 하나보다 입력 가격이 약 3.6배, 출력 가격이 6.8배이며, 더 싼 쪽이 바로 다운로드해서 계속 쓸 수 있는 쪽이다. 그래서 이 비교 전체는 결국 단 하나의 질문으로 귀결된다. 그 추가 비용은 실제로 무엇을 사는 것이며, 그것은 단일 모델이 살 수 없는 무언가를 사는 것인가?

그것들은 같은 종류의 객체가 아니다

가격 격차가 존재하는 이유는 이 두 가지가 장기 지평 과제를 완전히 다른 메커니즘으로 해결하며, 그 차이는 벤치마크를 실행하기도 전에 드러나기 때문입니다.

Fugu Ultra v2 — 파운데이션 모델이 아니라 오케스트레이션 시스템입니다. Sakana AI의 Fugu 라인에서 역량을 최대화한 등급으로, 들어온 작업을 분해한 뒤 그 조각들을 다른 모델들의 풀에 분배하는 단일 OpenAI 호환 엔드포인트입니다. 그중 일부는 오픈 웨이트이고 일부는 특화 모델입니다. Sakana의 자체 설명에 따르면 이 시스템은 "자기가 오케스트레이션하는 프런티어 모델들에 대한 필수적인 의존 없이, 최고 성능을 그 어느 때보다 더 높입니다." 여러분이 사는 것은 스케줄러이며, 여러분은 그 스케줄러가 생각하는 데 소비하는 모든 토큰, 즉 내부 오케스트레이션 토큰까지도 비용을 지불합니다.

GLM 5.2 — 단일 Mixture-of-Experts 모델입니다. Z.ai는 이를 텍스트 입력/텍스트 출력 모델로 공개합니다. 이 모델은 "실제로 사용 가능한" 100만 토큰 컨텍스트 윈도와 최대 128K 출력 토큰, reasoning_effort로 제어되는 하이브리드 추론, 그리고 네이티브 도구 호출을 갖추고 있습니다. 보고된 아키텍처는 총 파라미터가 약 753B이고 토큰당 약 40B가 활성화됩니다. 다만 Z.ai는 5.2의 활성 수치를 구체적으로 확인하지 않았으므로 — 해당 수치는 GLM-5.1에서 이어진 것으로 간주하세요.

그것이 갈림길이다. 이 둘 중 하나는 네가 호출하는 대상이고, 다른 하나는 다른 대상들을 호출하는 것이다.

Fugu Ultra v2가 우리에게 말해주지 않을 것

Sakana의 발표 페이지는 한 가지 점에 대해서는 이례적으로 솔직하고 다른 점에 대해서는 이례적으로 침묵하는데, 둘 다 구매 결정에 중요하다.

솔직한 부분: 이 회사는 Claude Fable 5, Claude Fable 5.1 및 GPT-6 Astra가 Fugu Ultra v2의 모델 풀에 포함되지 않는다고 벤치마크에서 이들을 앞선다고 주장하면서도 분명히 밝히고 있습니다. 제시된 근거는 복원력입니다. 즉, 공급업체나 지정학적 변화에 의해 회수되거나 가격이 재책정되거나 차단될 수 없는, 교체 가능한 오픈 및 특화 모델 풀입니다. 학습 컷오프는 20260828로 명시되어 있습니다. 이 논증을 어떻게 생각하든, 이것은 실제 아키텍처적 입장이며, 직접 조립한 스택보다 Fugu Ultra v2를 선택해야 하는 가장 명확한 이유입니다.

말하지 않고 넘어간 부분: 이 발표문은 컨텍스트 창을 밝히지 않았고, 페이지 자체에도 Fugu Ultra v2의 토큰 가격을 명시하지 않았다. 제3자 모델 목록에서는 창을 1M 토큰으로, 요금을 $5 / $0.50(캐시) / $30으로 적어 두었으며, 약 272K 입력 토큰을 넘으면 약 $10 / $1.00 / $45로 이동하는 재가격 구간이 있다. 이 글의 나머지 부분에서 쓰는 숫자가 바로 이것들이지만, 이는 공급업체 문서가 아니라 목록일 뿐이므로, 이 숫자로 예산을 잡기 전에 Sakana의 실시간 요금표와 대조해 확인하라.

토큰당 아무도 답하지 않는 비용 질문

토큰당 가격 책정은 이 비교에 잘못된 단위이며, 현재 이 주제로 상위에 랭크된 모든 페이지가 같은 실수를 저지르고 있다. 오케스트레이터의 청구서는 프롬프트 크기에 요율을 곱한 값이 아니다. 그것은 프롬프트 크기, 그리고 오케스트레이터가 수행하기로 결정한 모든 하위 호출, 그리고 오케스트레이터가 빌려 쓰는 모델들의 추론 토큰을 모두 합한 것이며, 이 모든 것에 오케스트레이터 자체 요율이 마크업된 값이다.

Sakana는 이를 직접 인정한다: 내부적으로 소비되는 오케스트레이션 토큰은 일반 입력 및 출력 토큰으로 청구된다. 즉, Fugu Ultra v2와 GLM 5.2를 비교하는 정직한 방법은 완료된 작업당 비용이며, 어느 공급업체도 그 수치를 공개하지 않는다.

그럼에도 불구하고 실제로 성립하는 몇 가지 구조적 요점:

입력 가격 — OrcaRouter에서 Z.ai의 제공업체 요율 기준 Fugu Ultra v2 $5.00 / 1M 대 GLM 5.2 $1.40 / 1M. Fugu는 하위 호출을 단 한 번도 실행하기 전에 이미 비용이 3.6배입니다.

출력 가격 — Fugu Ultra v2 $30.00 / 1M 대 GLM 5.2 $4.40 / 1M. 이것이 아픈 숫자입니다. 왜냐하면 에이전트는 출력을 많이 내보내고, 오케스트레이터는 요청하지도 않은 출력을 내보내기 때문입니다.

캐시된 입력 — Fugu Ultra v2는 100만 토큰당 $0.50를 책정하는데, GLM 5.2는 100만 토큰당 $0.26에 캐싱하므로 자체 입력 요율 대비 81% 할인됩니다. 안정적인 시스템 프롬프트를 반복적으로 순회하는 에이전트 루프에서 GLM 5.2의 이점이 가장 크게 누적됩니다.

장문 컨텍스트 재가격 책정 — Fugu Ultra v2는 입력이 약 272K를 넘으면 요금 구간이 올라가 요청 전체에 입력 요율 약 2배, 출력 요율 1.5배가 적용된다. GLM 5.2는 컨텍스트 구간 구분이 전혀 없어 1M까지 $1.40 / $4.40로 고정이다.

마지막 행이 바로 동그라미 쳐야 할 항목입니다. 장기 지평 에이전트 실행은 수명의 대부분을 272K 토큰 너머에서 보냅니다. GLM 5.2의 고정 요금은 Fugu Ultra v2의 요금이 두 배가 되는 바로 그 지점에서 진짜 돈값을 합니다.

Two-column comparison scoreboard for Fugu Ultra v2 and GLM 5.2 covering type, release date, input price ($5.00 vs $1.40 per million tokens), output price ($30.00 vs $4.40), cached input ($0.50 vs $0.26) and long-context pricing (reprices above roughly 272K vs flat to 1M).

벤치마크는 거의 닿지 않는다.

이 대결에서 정말로 이상한 점, 그리고 현재 어느 순위 페이지도 분명하게 말해 주지 않는 것은 바로 이것입니다: 이 두 모델은 거의 같은 테스트로 측정된 적이 없습니다.

사카나는 Fugu Ultra v2가 8개 벤치마크 중 5개 — GDP.pdf, Chartography, SWEFish, DeepSWE, Toolathon — 에서 최고 또는 공동 최고 성적을 기록했으며, 8개 중 7개에서 상위 2위 안에 들었다고 보고한다. 여기서 제시하는 두 가지 핵심 수치는 Chartography 48.3으로, 이는 Opus 5의 27.3과 Fable 5의 29.5에 대비되는 결과이며, DeepSWE는 74.3이다. SWEFish와 Toolathon은 사카나 자체 내부 벤치마크다. 이 모든 수치는 벤더가 보고한 것이며, 발행 시점 기준으로 독립적으로 재현된 것은 하나도 없다.

Z.ai가 GLM 5.2에 대해 내놓은 수치는 완전히 다른 출처에서 나온 것이다: Terminal-Bench 2.1은 81.0, SWE-bench Pro는 62.1, GPQA-Diamond는 91.2, AIME 2026은 99.2, HLE는 40.5 — 이 역시 벤더가 보고한 값이다. 독립적인 측면에서 GLM 5.2는 Artificial Analysis의 재채점 페이지에서 AA Coding Index 68.8과 Intelligence Index 39를 기록하며, 잠정 추정치로 표시되어 113개 중 7위에 올랐다. GLM 5.2에 대한 51이나 53이라는 예전 인용은 더 이상 사용되지 않는 지수 척도에서 나온 것이므로 인용해서는 안 된다.

그래서 깔끔한 일대일 비교 수치를 원한다면, 그런 건 없습니다. 공통 축에 가장 가까운 것은 둘 다 에이전틱 코딩에 강하다는 점이고, 솔직하게 해석하자면 각 회사가 자신이 잘하는 테스트에 대해서만 발표했다는 것입니다. 그건 더 높은 숫자를 고르라는 이유가 아니라, 직접 평가를 돌려봐야 하는 이유입니다.

오늘 GLM 5.2를 구매하려는 분이라면 한 가지 짚고 넘어갈 점이 있습니다. 이 모델은 더 이상 Z.ai의 최신 모델이 아닙니다. GLM-5.3이 2026년 8월 14일경 같은 정가로 출시되었지만, 대형 클라우드 제공업체를 제한하는 사용자 지정 라이선스가 적용됩니다. 그래서 GLM 5.2가 마지막 완전한 MIT 라이선스가 적용된 Z.ai 플래그십이며, 여전히 별도의 구매 근거가 있는 이유입니다.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

라이선스는 가장 날카로운 구분선이다

벤치마크는 제쳐두고, 구조적 차이는 어떤 점수보다도 더 뚜렷하다.

GLM 5.2는 Hugging Face에서 MIT 라이선스 하에 오픈 웨이트로 공개되어 있으며, 지역 제한이 없습니다. 누구의 허락을 구하거나 토큰당 요금을 전혀 지불할 필요 없이, 이를 다운로드하고, 자체 하드웨어에서 실행하고, 미세 조정하고, 제품 안에 넣어 출시할 수 있습니다. Z.ai가 이를 훈련했으며 — 특히 회사 자체 주장에 따르면 — Nvidia가 아니라 전적으로 Huawei Ascend 가속기에서 훈련했습니다.

Fugu Ultra v2는 그런 것들을 전혀 제공하지 않습니다. 이는 호스티드 서비스입니다. 즉, Sakana가 그 구성원을 주변부에서만 언급한 모델 풀 위에 얹힌 오케스트레이션 정책입니다. 여러분은 그것을 다운로드하거나, 들여다보거나, 버전을 고정하거나, 에어갭 환경에서 실행할 수 없습니다. 대신 얻는 것은 추상화입니다. 원칙적으로 어떤 업스트림 모델 하나가 사라져도 동작이 견고하게 유지되는 단일 엔드포인트입니다. 이는 의존성 하나가 사라지는 것을 감당할 수 없는 프로덕션 시스템에는 진정한 이점입니다. 동시에 진정한 비용이기도 합니다. 그 대가로 통제권을 맞바꿨기 때문입니다.

당신의 제약 조건이 "모델이 내 아래에서 바뀌어서는 안 된다"라면, 이 답변들 중 오직 하나만이 해당됩니다. 당신의 제약 조건이 "모델이 다른 누군가에 의해 제거될 수 있어서는 안 된다"라면, 오직 다른 하나만이 해당됩니다.

속도, 그리고 테스터들이 마지막 것에 대해 말한 내용

GLM 5.2는 측정상 빠르지 않다: Artificial Analysis는 첫 토큰까지 걸리는 시간이 약 4.03초인 상태에서 초당 약 66.3토큰을 기록했는데, 이는 프런티어급 모델치고는 평범한 수준이며, Z.ai의 자체 사용자들도 피크 시간대 서빙 혼잡에 대해 불만을 제기해 왔다.

Sakana는 Fugu Ultra v2의 지연 시간이나 처리량 수치를 공개하지 않는데, 이 자체가 시사하는 바가 있다 — 여러 모델로 디스패치하는 시스템의 지연 시간 프로필은 무엇을 호출하기로 결정하는지에 전적으로 달려 있으므로, 단일 처리량 수치는 거의 의미가 없을 것이다. 이전 Fugu Ultra의 경우, 테스터들은 실행 시간이 약 30분까지 늘어나고 비용이 같은 작업에서 단일 모델의 요율을 훨씬 웃돈다고 공개적으로 보고했다. 그것은 2026년 6월 모델이며 v2에 관한 증거는 아니다 — 그러나 그것이 테스트해야 할 실패 모드이고, 토큰당 비교가 오케스트레이터를 실제보다 좋아 보이게 하는 이유다.

Screenshot of the OrcaRouter model page for GLM 5.2 showing the z-ai/glm-5.2 identifier, a 1M token context window, 128K maximum output, and input pricing of $1.40 per million tokens with output at $4.40.

이들 각각을 실제로 어떻게 부를지

GLM 5.2가 오늘 OrcaRouter에 출시되었습니다 Z.ai 자체 제공자 요금 — 입력 100만 토큰당 $1.40, 출력 100만 토큰당 $4.40, 마크업 없이 그대로 전달되므로 Z.ai가 인하하는 모든 요금은 같은 날 여기에도 반영됩니다. OpenAI 호환이므로, 전환하려면 이미 사용 중인 SDK에서 base-URL과 model-ID만 변경하면 되고, 하나의 제공자에 프로덕션 경로를 걸기보다 장애 조치 체인이나 라우팅 규칙 뒤에 둘 수 있습니다.

Fugu Ultra v2는 우리가 라우팅하는 대상이 아닙니다. 이는 Sakana AI 자체의 OpenAI 호환 API에서 사용할 수 있으며, 파라미터 하나만 바꾸면 기존 Fugu 통합을 그것으로 옮길 수 있습니다. GLM 5.2와 비교해 평가 중이라면, 실용적인 구성은 기존 게이트웨이에 GLM 5.2를 유지하고 결정을 내리는 동안 Sakana에서 Fugu Ultra v2를 직접 호출하는 것입니다. 둘 다 OpenAI 호환이므로 플래그 뒤의 동일한 코드 경로에 둘 수 있습니다.

어느 걸 고를까?

선택하세요, GLM 5.2를 — 알려진 가격에 검증된 성능을 원한다면: 내일 당장 셀프 호스팅할 수 있는 MIT 라이선스 가중치, 장문 컨텍스트 페널티가 없는 고정 $1.40 / $4.40, 정말로 쓸 만한 1M 윈도우, 그리고 캐시된 에이전트 루프에서 복리로 불어나는 할인. 텍스트 전용이고, GLM-5.3보다 한 세대 뒤처지며, 독립 인덱스 점수가 잠정적이라는 점을 받아들이세요.

선택하세요: Fugu Ultra v2 — 구매하려는 것이 어려운 다단계 작업에서의 복원력과 최고 수준의 역량이고, 토큰당 조정 비용을 지불하며 호출하는 대상이 무엇인지 검사하거나 자체 호스팅할 수 있는 능력을 포기할 의향이 있다면. 공급업체 자신의 주장은 그것이 프런티어 모델에 의존하지 않고 프런티어급 출력에 도달한다는 것입니다 — 이는 실질적이고 이례적인 제안이며, 오늘날 현재 Sakana 외부에서는 단 한 명도 검증할 수 없었던 것입니다.

우리가 하지 않을 일은 벤치마크 표에서 둘 중 하나를 고르는 것입니다. 테스트들은 거의 겹치지 않고, 두 업체 모두 각자 가장 강한 영역에서 발표했으며, 결정적인 수치 — 완료된 장기 과제당 비용 — 는 두 회사 모두 어떤 페이지에도 내놓지 않은 숫자입니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트