"Fugu Max vs GPT-5.6 Sol"의 히어로 타이틀 카드로, 부제는 "가격 주장은 제품군의 중간을 겨냥한 것이었다", 세 개의 알약 모양 배지는 "$6.00 vs $20.00 출력", "Terra 대비 40-60% 주장", "6승, 점수 없음", 하단 문구는 "Sakana AI vs OpenAI - 2026년 9월", 그리고 오른쪽 아래 모서리에 OrcaRouter 로고가 들어갑니다.
Guides & Insights

Fugu Max vs GPT-5.6 Sol: 그 가격 주장은 제품군의 중간을 겨냥한 것이었다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Fugu Max의 가격 정당화는 GPT-5.6 모델 하나를 언급하는데, 그것은 플래그십이 아니다. Sakana AI는 2026년 9월 11일 Fugu Max를 백만 입력 토큰당 $2.00, 백만 출력 토큰당 $6.00에 출시했고, 출력 가격이 Claude Sonnet 5, GPT-5.6 Terra, Kimi K3보다 40~60퍼센트 낮다고 밝혔다. 같은 OpenAI 패밀리의 플래그십이자 백만 토큰당 입력 $4.00, 출력 $20.00에 책정된 GPT-5.6 Sol은 그 문장에 나오지 않는다. 그 누락은 실수가 아니다. 바로 산수다. Sol은 Fugu Max의 출력 요율의 세 배가 넘는데, 그 격차는 이를 둘러싼 "두 배에서 여섯 배 더 낮은 비용으로 엘리트 모델들의 사정권 안에 있다"라는 프레이밍을 완전히 다른 종류의 주장으로 읽히게 했을 것이다. 그래서 이 맞대결은 벤더가 고른 조건이 아니라 Sol의 조건으로 치러 볼 가치가 있다.

그 주장이 가리키는 패밀리와 대조하여 확인하는 중

Sakana의 40~60퍼센트라는 수치는 검증할 수 있습니다. 왜냐하면 그것이 지목한 모델에는 공개된 요금이 있기 때문입니다. GPT-5.6 Terra는 백만 토큰당 입력 $2.00, 출력 $12.00로 책정되어 있습니다. Fugu Max는 입력 $2.00, 출력 $6.00로 책정되어 있습니다. 비교를 해보면 두 가지가 드러납니다. 출력에서는 $6.00 대 $12.00이 정확히 50퍼센트 인하입니다 — 제시된 40~60 범위의 한가운데이며, 이는 그 범위가 이 비교에서 발견된 것이 아니라 이 비교를 둘러싸고 그려졌다는 신호입니다. 입력에서는 두 요금이 센트 단위까지 동일합니다.

그것은 잘 구성된 주장이며, 그것을 잘 구성하는 것이 릴리스 페이지의 목적이다. 그러나 그것은 GPT-5.6 사다리의 중간에 맞춰져 있다. Terra는 세 가지 모델 패밀리의 균형 잡힌 계층이다 — 어려운 복잡한 작업을 위한 Sol이 위에 있고, 속도와 비용을 위한 Luna가 아래에 있다. Terra라는 이름은 "엘리트 모델" 벤치마크를 중간 단계에 설정하고 Fugu Max가 Terra의 출력 가격의 절반을 정직하게 주장할 수 있게 한다. Sol이라는 이름을 붙였다면 다른 문장이 필요했을 것이다. 왜냐하면 정직한 버전은 Fugu Max가 Sol보다 출력에서 70퍼센트 저렴하고 입력에서 50퍼센트 저렴하다는 것이기 때문이다 — 훨씬 더 큰 격차로, 이를 위해 어떤 능력을 포기하는지에 대한 당연한 후속 질문을 제기한다.

• 입력 가격 — Fugu Max는 100만 토큰당 $2.00, GPT-5.6 Sol은 100만 토큰당 $4.00

• 출력 가격 — Fugu Max는 100만 토큰당 $6.00, GPT-5.6 Sol은 100만 토큰당 $20.00

• 캐시된 입력 — Fugu Max는 100만 토큰당 $0.25, GPT-5.6 Sol의 캐싱은 기본 입력 요율에 대한 할인으로 책정됨

• 컨텍스트 — Fugu Max 미공개 vs GPT-5.6 Sol 100만 토큰

• 출력 상한 — Fugu Max 미공개 vs GPT-5.6 Sol 128K 토큰

• 입력 모달리티 — Fugu Max 미공개 vs GPT-5.6 Sol 텍스트, 이미지 및 파일

• 기능 태그 — Fugu Max 게시된 항목 없음 vs GPT-5.6 Sol 비전, 도구 사용, JSON 모드, 추론

• 엔드포인트 — Fugu Max의 단일 OpenAI 호환 인터페이스 vs GPT-5.6 Sol 채팅 완성 및 Responses API

• 벤치마크 수치 — Fugu Max는 점수 제시 없이 6승을 주장한 반면, GPT-5.6 Sol은 Terminal-Bench 2.0 91.9%, SWE-bench Pro 64.6%를 포함한 공개된 공급사 수치를 제시

중간 가로대가 이름 붙일 적절한 가로대인 이유

Sakana의 선택에는 방어 가능한 버전이 하나 있으며, 비판에 앞서 그것을 짚고 넘어갈 가치가 있다. 각 작업을 가장 가볍고도 유능한 모델로 라우팅하는 오케스트레이터는 플래그십 작업에서 플래그십과 경쟁하는 것이 아니다. 중간급 작업에서 중간급 모델과 경쟁하며, 그중 일부를 더 저렴하게 처리하겠다고 제안하는 것이다. 제안이 “당신 트래픽 대부분에는 Sol이 필요하지 않다”는 것이라면, Terra가 올바른 비교 대상이다. 대부분의 팀이 Sol 가격을 지불하고 싶지 않을 때 실제로 손을 뻗는 것이 Terra이기 때문이다. 고객이 그렇지 않았다면 구매했을 등급과 견주어 측정하는 것이, 이용 가능한 가장 비싼 모델과 견주어 측정하는 것보다 더 정직하다.

어려운 점은 같은 문장이 "엘리트 모델의 사정권 안에 드는" 성능까지 주장한다는 것이다. 그 홍보 문구의 두 절반은 서로 반대 방향으로 당긴다. Fugu Max가 Terra의 대체품이라면, 엘리트 모델이라는 프레이밍은 그것이 뒷받침할 수 없는 마케팅 역할을 하는 것이다. Terra는 명시적으로 엘리트로 포지셔닝되지 않는다 — 그것은 '충분히 좋은' 등급으로 포지셔닝된다. Fugu Max가 정말로 Sol의 사정권 안에 있다면, 가격 비교는 Sol을 상대로 했어야 한다. 그곳에서 격차가 가장 크고 가장 유리하게 보이기 때문이다. 공격적인 성능 주장과 보수적인 가격 비교를 같은 문단에서 하는 발표는 양쪽을 다 취하려는 것이며, 독자는 어느 절반이 핵심을 떠받치는지 알 방법이 없다.

A two-column scoreboard titled "Fugu Max vs GPT-5.6 Sol - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Cached input $0.25 / 1M, Context not published, Modality not published, Benchmarks six wins with no figures. Right column GPT-5.6 Sol: Output price $20.00 / 1M, Input price $4.00 / 1M, Cached input discount on base rate, Context 1M tokens with 128K output, Modality text, image and file, Benchmarks 91.9% on Terminal-Bench 2.0. Footer reading "Fugu Max figures vendor-reported by Sakana AI. Sakana's 40-60% output claim names GPT-5.6 Terra at $2.00 / $12.00, not Sol.", with the OrcaRouter logo bottom-right.

여섯 개의 벤치마크, 숫자는 없고, 의문을 불러일으켜야 할 하나의 이름

이 피치의 역량 부분은 목록 하나에 달려 있다. Fugu Max는 Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench 및 SWEFish에서 "최고의 종합 점수를 달성한다". 그중 어느 것에 대해서도 점수는 기재되어 있지 않다. SWEFish는 Sakana 자체의 내부 코딩 벤치마크다. 즉, 여섯 개의 승리 중 하나는 벤더가 작성했고 아직 공개하지 않은 테스트에서 채점된다는 뜻이다.

GPT-5.6 Sol이 수치를 보고합니다. Sol은 타사 비교 데이터에서 Terminal-Bench 2.0에서 91.9%, SWE-bench Pro에서 64.6%로 기재되어 있습니다. 터미널 벤치마크의 버전 불일치에 유의하세요. Sol의 공개 수치는 Terminal-Bench 2.0에 대한 것이고, Sakana는 2.1에서의 승리를 주장하는데, 이는 다른 평가이므로 그것과 맞세울 수 없습니다. 두 주장이 헤드라인에서 나란히 보이지만 실제로는 비교할 수 없기 때문에 이 점은 짚고 넘어갈 가치가 있습니다.

이 맞대결에 대한 적절한 비교는 공통 평가에서 Sol 대 Fugu 모델을 비교하는 것일 것입니다. 서드파티 비교 페이지들은 GPT-5.6 Sol을 기본 Sakana Fugu 세대와 비교하고 있긴 합니다 — Terminal-Bench 2.0에서는 91.9% 대 80.2%, SWE-bench Pro에서는 64.6% 대 59%로 Sol이 앞서죠 — 하지만 이는 이전 세대의 수치이며 Fugu Max의 것이 아니고, 같은 출처들은 공통 벤치마크 범위가 너무 부족하기 때문에 종합 우승자를 명시하기를 분명히 꺼립니다. Fugu Max와 GPT-5.6 Sol 사이에는 어떤 종류의 공개된 비교도 없습니다. 그런 비교를 주장하는 사람은 추측하는 것입니다.

독립적인 제3자가 Fugu Max를 평가한 적이 없으며, Fugu Max나 어떤 Fugu 모델에 대해서도 Artificial Analysis 항목이 존재하지 않습니다. 이번 발표에 포함된 모든 수치, 즉 여섯 번의 승리를 포함한 모든 수치는 벤더에서 비롯된 것입니다. 반면 Sol은 2026년 7월 9일부터 일반에 제공되어 왔으며 제3자 리더보드에 등장합니다 — 이는 Fugu Max가 받을 기회가 없었던 수준의 외부 검증입니다.

각 측에서 실제로 구매하고 있는 것

GPT-5.6 Sol 구성은 이미 잘 알려진 사항입니다. 1M 토큰 컨텍스트 윈도, 128K 출력 상한, 텍스트·이미지·파일 입력, 비전, 도구 사용, JSON 모드, 추론을 문서화된 기능으로 갖추고 있으며, chat completions와 responses API라는 두 개의 엔드포인트를 제공하므로 기존 통합을 옮겨갈 곳이 있습니다. 저희가 처리하는 트래픽 전반에서 첫 토큰까지 걸리는 시간(p50)은 6.68초로, 저희 카탈로그에서 가장 빠른 모델들보다 느리며, 이 모델 위에 대화형 제품을 만들기 전에 알아둘 만한 사항입니다.

Fugu Max 구성은 모델을 구매하는 것보다 서비스 수준을 구매하는 것에 더 가깝습니다. OpenAI 호환 엔드포인트 하나, 이전 Fugu에서 옮겨오기 위한 단 한 줄의 매개변수 변경, 그리고 어떤 모델을 호출할지 결정하는 코디네이터를 얻게 됩니다. 릴리스 페이지에서 얻을 수 없는 것은 컨텍스트 창, 출력 상한, 모달리티 목록, 지연 시간 수치, 벤치마크 점수입니다. 코디네이터의 라우팅 결정은 설계상 공개되지 않습니다. 이번 릴리스에서 풀은 오픈 웨이트 및 특화 모델을 포함하도록 확장되었으며, NVIDIA 협업을 통해 NVIDIA Nemotron 패밀리가 이름을 올렸고, 그 외에는 공개되지 않았습니다.

그 불투명성에 대해 Sakana가 밝힌 근거는 방어할 만하다 — 교체 가능한 벤더 비종속적 풀은 지원 중단, 가격 변동, 지역 철수에 대한 보호책이다. 이는 실질적인 헤지이며, $0.25의 캐시 입력 요금은 Sakana가 그 헤지가 가장 중요해질 장문 컨텍스트의 고반복 워크로드를 예상한다는 것을 시사한다. 하지만 그것은 당신이 구매하는 사양이 제품에 대한 설명이라기보다 공급망에 대한 약속이라는 뜻이기도 하다.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

테스트를 실행하는 방법

이 문제를 결판내는 올바른 방법은 어느 벤더의 페이지도 읽는 것이 아니다. 자체 트래픽에서 표본을 뽑아라 — 수백 건의 실제 요청, 가능하면 현재 팀이 에스컬레이션하는 요청도 포함해서 — 그리고 토큰 집계를 켠 채로 두 엔드포인트에 대해 실행하라. 비용은 호출당 토큰이 아니라 완료된 작업당 토큰으로 산정하고, 시작하기 전에 출력 예산을 정해 팬아웃이 예상을 벗어나지 않게 하라, 그리고 품질은 두 번째 사람이 그 답이 수용 가능하다는 데 동의하는지로 측정하라. 그 실험은 일주일이면 질문에 답하고 비용도 거의 들지 않는다.

걸림돌은 Fugu Max가 OrcaRouter에 없다는 점입니다. Fugu Max는 Sakana 자체의 OpenAI 호환 API와 여러 서드파티 플랫폼을 통해 제공되므로, 두 번째 통합과 두 번째 자격 증명 세트, 두 번째 청구서가 필요합니다. GPT-5.6 Sol은 Ope​nAI 정가에 0% 마크업으로 저희 카탈로그에 있습니다 — 공급자 요율을 마크업 없이 그대로 전달하기 때문에 Ope​nAI 가격이 바뀌면 기존 키에 당일 반영되며, 특정 경로가 속도 제한에 걸리거나 사용할 수 없을 때 공급자 경로 간 자동 페일오버가 이루어집니다. 이는 다음 모델들과 동일한 키를 사용합니다: 200개가 넘는 다른 모델, 따라서 파일럿이 끝나면 통합은 그대로 유지한 채 문자열 하나만 바꾸면 됩니다.

결론

GPT-5.6 Sol은 Sakana가 하지 않기로 한 비교에서 승리합니다. 입력 비용은 두 배, 출력 비용은 세 배 이상이며, 그 대가로 공개된 컨텍스트 윈도우, 128K 출력 상한, 문서화된 멀티모달 입력, 이름이 붙은 기능 태그, 두 개의 엔드포인트, 그리고 제3자가 몇 달 동안 살펴볼 수 있었던 공급업체 벤치마크를 얻습니다. 당신의 작업이 Sol이 만들어진 종류의 것—심층적인 다단계 추론, 대규모 소프트웨어 엔지니어링, 장기 지평 에이전트 작업—이라면, 가격 차이는 명세할 수 있는 무언가를 사는 비용입니다.

Fugu Max는 더 좁지만 진정으로 흥미로운 베팅에서 승리하며, 훨씬 더 저렴합니다: 출력에서 GPT-5.6 Terra보다 50퍼센트, Sol보다 70퍼센트 저렴하고, 두 요금표 중 가장 낮은 캐시 요율을 갖습니다. 트래픽이 대용량이고, 텍스트 전용이며, 검증 가능하고, 대부분 플래그십 추론이 필요 없다면, 가장 간결한 충분 모델로 라우팅하는 오케스트레이터는 일관된 설계이며 $6.00 출력 요율이 바로 가치가 있는 지점입니다. 릴리스의 자체 프레이밍을 액면 그대로 받아들이고 Sol 대체재가 아니라 Terra 대체재로 파일럿하세요 — 그리고 제공업체의 정가가 그대로 적용되는 플래그십을 원한다면, GPT-5.6 Sol은 OrcaRouter에서 키 하나만 있으면 됩니다.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol (openai/gpt-5.6-sol, captured September 11, 2026, English UI), showing the Featured badge, the openai/gpt-5.6-sol model ID, the Vision, Tools, JSON and Reasoning tags, the listing date 2026-07-09, the /v1/chat/completions and /v1/responses endpoints, the pricing tiles reading INPUT $4.00 and OUTPUT $20.00 per 1M tokens with p50 TTFT 6.68s and 153.0M tokens of 7-day traffic, the 1M token context with 128K max output and text + image + file input, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트