"Fugu Max vs GLM-5.3"의 히어로 타이틀 카드로, 부제는 "볼륨 모델이 가치 모델의 가격을 밑돈다"이고, 세 개의 필 배지에는 각각 "$6.00 vs $3.96 출력", "7일당 7,962.7M 토큰", "$2.00 vs $1.26 입력"이라고 적혀 있으며, 푸터 줄에는 "Sakana AI vs Z.ai - 2026년 9월"이라고 적혀 있고, 오른쪽 하단 모서리에는 OrcaRouter 로고가 있다.
Engineering & Research

Fugu Max vs GLM-5.3: 가치 모델이 볼륨 모델에 잠식당한다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Fugu Max는 비용으로 승부하도록 가격이 책정되었지만, GLM-5.3은 두 축 모두에서 더 저렴합니다. Sakana AI의 coordinator는 2026년 9월 11일에 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $6.00로 출시되었으며, 각 작업을 처리할 수 있는 가장 저렴한 모델로 라우팅하도록 만들어졌습니다. 2026년 8월 18일부터 등록된 Z.ai의 GLM-5.3은 OrcaRouter에서 백만 토큰당 입력 $1.26, 출력 $3.96으로, Fugu Max보다 두 항목 모두에서 3분의 1에서 5분의 2가량 낮으며, 공개된 1M 컨텍스트 창과 128K 출력 상한을 갖춘 단일 텍스트 전용 모델입니다. GLM-5.3은 또한 우연히도 우리 카탈로그에서 압도적 차이로 가장 바쁜 모델입니다. 토큰당 더 저렴하면서 대규모로 프로덕션 트래픽을 처리하고 있음이 입증된다는 이 조합은, 오케스트레이션 프리미엄을 정당화하기 가장 어려운 맞대결로 만듭니다.

두 축 모두에서 더 저렴하며, 사양은 공개되어 있다

벤치마크가 등장하기도 전에, 이 비교는 Fugu Max에게 불편한 것입니다. 그것이 성능을 가격과 맞바꾸는 사안이 아니기 때문입니다. GLM-5.3은 그 자체로 최전선에 근접한 플래그십입니다. Z.ai는 이 모델이 GLM-5.2 대비 약 50%의 코딩 성능 향상을 제공하며, 일부 사이버보안 역량에서는 Mythos 5와 동등한 수준이라고 설명합니다. 이것은 저렴한 대안으로 제시되는 예산형 모델이 아닙니다. 비용 최적화된 오케스트레이터보다 낮은 가격에 책정된 플래그십일 뿐입니다.

• 입력 가격 — Fugu Max 100만 토큰당 $2.00 vs GLM-5.3 100만 토큰당 $1.26

• 출력 가격 — Fugu Max 1M 토큰당 $6.00 vs GLM-5.3 1M 토큰당 $3.96

• 캐시된 입력 — Fugu Max는 100만 토큰당 $0.25인 반면, GLM-5.3의 캐싱은 기본 입력 요율에 대한 할인으로 책정

• 컨텍스트 — Fugu Max 미공개 vs GLM-5.3 1M 토큰

• 출력 상한 — Fugu Max 미공개 vs GLM-5.3 128K 토큰

• 모달리티 — Fugu Max는 미공개 vs GLM-5.3은 텍스트 전용, 그렇게 문서화됨

• 기능 태그 — Fugu Max는 공개된 것 없음 vs GLM-5.3의 도구 사용, JSON 모드, 추론

• 벤치마크 수치 — Fugu Max는 점수 없이 6승을 주장한 반면, GLM-5.3은 공급업체 보고 기준 이전 세대 대비 DeepSWE 46.2~66.9를 기록했으며, 여기에 공개된 Artificial Analysis 지능 점수도 있음

• 가중치 — Fugu Max는 클로즈드, 풀 비공개 vs 오픈 웨이트 계보를 가진 연구소에서 나온 GLM-5.3

• OrcaRouter에서 관측된 트래픽 — Fugu Max 없음, GLM-5.3과 달리 미지원, 지난 7일간 7,962.7M 토큰

마지막 두 행이 함께 무엇을 하는지 주목하세요. GLM-5.3은 오픈 웨이트를 가진 계보에서 나왔으며, 이는 Sakana가 Fugu Max의 전체 전제로 내세우는 벤더 독립성 논거 중 이용 가능한 가장 강력한 형태입니다. 그리고 그것은 우리가 서비스하는 대부분의 모델보다 한 자릿수 더 큰 관측 가능한 트래픽 수치를 보유하고 있습니다. "텍스트가 많은 프로덕션 작업을 낮은 비용으로 돌리려면 무엇을 실행해야 하는가"가 질문이라면, 증거는 오케스트레이터가 아닌 다른 곳을 가리킵니다.

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

볼륨 논거, 그리고 그것이 단순한 인기 콘테스트가 아닌 이유

트래픽 수치는 품질 수치가 아니며, 그렇게 해석해서도 안 된다. 7일 동안 79억 6천만 토큰이라는 사실이 입증하는 것은, GLM-5.3이 여러 독립 팀에 의해 실제 워크로드에서 프로덕션 규모로 운영되어 왔고, 그로 인해 대규모 이탈이 발생하지 않았다는 점이다. 이는 품질에 관한 약한 신호이자 운영 적합성에 관한 강한 신호다. 지연 시간은 안정적이고, 처리량은 유지되며, API는 부하 상황에서도 제대로 동작하고, 장애 모드는 충분히 많은 사용자 집단에 알려져 있어 공개적으로 드러난다. Fugu Max와 같은 주에 출시된 모델은 그 뒤에 이런 것이 전혀 없다.

지연 시간 행은 이 점을 더욱 선명하게 한다. GLM-5.3은 우리가 처리하는 트래픽 전반에서 p50 time-to-first-token이 4.33초임을 보여준다. 에이전트 작업 — 두 제품 모두 겨냥하는 워크로드 — 에서는 time-to-first-token이 코디네이터가 생성하는 모든 하위 에이전트의 모든 턴에 걸쳐 누적된다. 네 개의 에이전트를 생성하는 더 저렴한 오케스트레이터도 각 에이전트가 무언가를 출력하기 전에 몇 초씩 기다린다면 더 저렴하지 않으며, 그 비용은 요금표에 결코 나타나지 않는다.

Fugu Max의 반론은 자사의 코디네이터가 요청마다 가장 경량의 유능한 모델로 라우팅한다는 것이며, 원칙적으로 이는 많은 작업이 값비싼 백엔드를 전혀 건드리지 않는다는 뜻이다. Sakana가 이번 릴리스에서 확장한 모델 풀에는 NVIDIA 협업을 통해 NVIDIA Nemotron 제품군을 비롯한 오픈 웨이트 및 특화 모델이 추가되었으므로, 그 사다리의 저렴한 칸들은 실재한다. 문제는 그 칸들이 백만 출력 토큰당 $3.96보다 더 저렴한가이다. 대부분의 텍스트 작업에서는 그렇지 않다 — 그것은 낮은 기준이고, 호스팅 요금으로 실행되는 오픈 웨이트 모델들은 일반적으로 이를 근소한 차이로 간신히 넘어선다.

고르기 전에 물어볼 만한 질문들

오케스트레이터가 단일 오픈 웨이트 모델보다 더 저렴합니까? 기본적으로는 그렇지 않으며, 직관은 반대 방향으로 흐릅니다. 오케스트레이션은 코디네이터의 합성 토큰을 추가하고, 멀티 에이전트 실행에서는 팀 내 모든 에이전트의 출력을 추가합니다. Sakana의 Fugu 가격 책정은 에이전트를 쌓아 올리는 대신 최상위 참여 모델을 기준으로 하나의 혼합 요금을 청구함으로써 최악의 경우를 제거하는데, 이는 진정한 양보입니다. 하지만 당신이 혼합하는 기본 요금은 출력 $6.00이고, 그렇지 않았다면 호출했을 단일 모델은 $3.96입니다. 오케스트레이션은 재시도를 방지할 때 비용을 절약하는 것이지, 병렬성을 그 자체를 위해 추가할 때가 아닙니다.

텍스트 전용 제한이 둘 중 하나에 문제가 될까요? GLM-5.3의 경우 문서화되어 있으므로, 감안하여 계획할 수 있는 제약입니다 — 비전, 오디오, 비디오가 없으며 카탈로그에도 그렇게 나와 있습니다. Fugu Max의 경우 모달리티는 그저 공개되지 않았습니다. 이는 제한보다 더 나쁩니다. PDF를 보내는 파이프라인이 작동할지 시도해 보기 전까지는 알 수 없기 때문입니다. 명시되지 않은 제약은 없는 제약과 같지 않습니다.

기반 모델이 바뀌면 각각은 어떻게 되나요? GLM-5.3은 Z.ai가 학습시키고 서빙하는 단일 버전의 단일 모델입니다. Z.ai가 가격을 변경하면, 그 변경은 OrcaRouter를 통해 0% 마크업으로 같은 날 귀하의 키에 적용되며, 이를 확인하고 대응할 수 있습니다. Fugu Max의 동작은 Sakana가 구성원을 공개하지 않는 풀의 함수이므로, 최전선 연구소의 지원 중단이나 가격 변경이 제품 이름은 그대로인 채로 여러분이 구매하는 내용을 조용히 바꿔 놓습니다. Sakana는 이를 복원력이라고 내세웁니다. 그것은 공급업체에게는 복원력이고, 구매자에게는 불투명성입니다.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

라우팅 결정이 실제로 내려지는 곳

이 둘은 사실상 라우팅 결정입니다 — Fugu Max는 불투명한 코디네이터 내부에서 이를 내리고, 사용자는 API 계층에서 내립니다. OrcaRouter는 두 번째 유형입니다: 200개 이상의 모델을 위한, 라우팅 DSL을 갖춘 단일 API를 사용하면 정책을 명시적으로 표현할 수 있고, 제공자 경로가 저하될 때 자동 장애 조치가 이루어지며, 블랙박스가 알아서 처리하도록 믿기보다 출력을 의도적으로 결합하고 싶을 때 모델 융합을 할 수 있습니다. GLM-5.3은 해당 카탈로그에 Z.ai의 정가에 0% 마크업을 붙인 가격으로 올라와 있습니다, 이는 이만한 트래픽이 뒷받침하는 모델로서는 평소보다 더 가치가 있습니다: 보이는 요금은 Z.ai가 공개한 요금이며, 아무런 변경 없이 그대로 전달됩니다.

실질적인 차이는 감사 가능성입니다. Fugu Max가 귀하의 요청에 사용할 모델을 선택할 때, 어떤 모델이 선택되었는지, 왜 그런지 전혀 알 수 없습니다. 라우팅 정책을 직접 작성하면, 결정은 귀하의 저장소에 있고, 코드를 검토하는 사람 누구나 검토할 수 있으며, 공급업체를 기다리지 않고 변경할 수 있습니다. 어떤 종류의 규정 준수나 비용 회계 의무를 지고 있는 팀에게 이것은 철학적 차이가 아닙니다.

평결

GLM-5.3은 프로덕션 팀에 가장 중요한 기준에서 이 비교에서 우위를 점합니다: 입력과 출력 비용이 더 저렴하고, 컨텍스트 창과 출력 상한이 공개되어 있으며, 모달리티 한계가 명시되어 있고, 도구 사용, JSON 모드, 추론을 문서화된 기능으로 갖추고 있으며, 오픈 웨이트 계보에서 나왔고, 7일 트래픽 수치가 80억 토큰에 육박합니다. 공개된 증거를 어떻게 해석하더라도 이 가격대에서 Fugu Max가 더 나은 근거를 갖춘 구매라고 볼 수는 없습니다.

Fugu Max는 단 하나의 논거를 내세우는데, 그건 실제로 유효한 논거다: 코디네이터의 2차 패스가 1차 패스였다면 그대로 출시되었을 실수를 잡아내는 작업에서는 완료된 작업당 비용이 토큰당 비용을 앞지를 수 있다. 이는 당신의 작업이 검증 가능하고 대량 처리 가능하며, 당신이 EU/EEA 밖에 있을 경우에 한해, 사전에 설정한 출력 토큰 상한과 완료된 작업당 토큰 측정치를 갖춘 범위 한정 파일럿을 해볼 가치가 있다. 그렇지 않다면, 3분의 1 더 저렴하고 한 달 동안 프로덕션 부하 아래에서 운영되어 온 단일 모델이 답이며, 그것은 OrcaRouter에서 Z.ai의 정가에 제공자의 요율을 그대로 적용한 가격으로 제공된다.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트