Fugu Ultra v2 대 GPT-5.6 Sol 매치업을 위한 히어로 카드로, 272000 토큰에서 둘 다 급등하는 두 개의 가격 곡선을 보여줍니다.
Guides & Insights

Fugu Ultra v2 vs GPT-5.6 Sol: 272K에서의 동일한 절벽

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Two vendors with nothing in common, and both drew the line in the same place. Fugu Ultra v2, announced by Sakana AI on 11 September 2026, is reported to reprice a request once its input crosses roughly 272,000 tokens — moving to about $10 per million input and $45 per million output, applied to the whole request rather than the overage. GPT-5.6 Sol, Ope​nAI's flagship tier of the G​PT-5.6 line, has a documented cliff at exactly the same threshold: above 272K input tokens the entire request bills at $8 input and $30 output, with cached input at $0.80. Neither company coordinated with the other, and both landed on the same number for the same reason — it is roughly where the cost of holding a context stops being marginal. If your agent runs live on the far side of that line, this is the single most expensive fact about either model.

임계값을 넘어서면 실제로 무슨 일이 일어나는가

두 절벽은 모양이 동일하지 않으며, 그 차이는 중요하다.

GPT-5.6 Sol — Ope​nAI 문서 기준: 입력이 272,000토큰을 초과하면 요청 전체가 $8.00 / 캐시된 경우 $0.80 / $30.00으로 다시 청구됩니다. 이는 표준 입력 요율의 2배, 표준 출력 요율의 1.5배입니다. 300,000토큰 프롬프트는 마지막 28,000토큰에만 할증을 지불하는 것이 아니라 300,000토큰 전체에 할증을 지불합니다.

Fugu Ultra v2 — 이 등급은 Sakana의 발표 페이지가 아니라 서드파티 모델 목록에서 보고된 것으로, Sakana의 발표 페이지는 자체 토큰 요금을 전혀 공개하지 않습니다. 해당 목록에는 표준 요금이 $5.00 / 캐시 $0.50 / $30.00, 임계값 초과 요금이 대략 $10.00 / $1.00 / $45.00으로 나와 있습니다 — 입력 2배, 출력 1.5배로, Ope​nAI가 사용하는 것과 동일한 배수입니다. Sakana의 실시간 요금표를 확인할 때까지 Fugu 수치는 미확정으로 취급하세요.

Fugu 수치가 확인되지 않은 상황에서도 주목할 만한 구조적 차이가 하나 있습니다: OpenAI는 이 티어를 문서화된 제품 용어로 공개하지만, Fugu Ultra v2의 것은 공급업체 자체 발표문에는 나타나지 않습니다. 예산을 세우는 근거로 삼는 비용 모델이라면, 이는 신뢰도에 있어 의미 있는 차이입니다.

아래에서는 비교가 단순합니다. Sol은 현재 프로모션 요금으로 입력 $4.00, 출력 $20.00을 운영합니다 — 2026년 8월 21일 $5.00 / $30.00 정가에서 20% 넘게 인하한 것이며, 최소 2026년 11월 21일까지 지속된다고 명시되어 있고, 그 이후에는 원래 가격으로 돌아갈 수 있습니다. Fugu Ultra v2가 보고한 $5.00 / $30.00은 Sol의 프로모션 전 정가가 있던 위치와 거의 정확히 일치합니다. 요금표만으로 비교한다면, Sol의 할인가와 Fugu의 정가를 비교하는 셈입니다.

Two-column comparison scoreboard for Fugu Ultra v2 and GPT-5.6 Sol covering type, release date, input price ($5.00 vs $4.00 per million tokens), output price ($30.00 vs $20.00), the above-272K input rate (roughly $10.00 vs $8.00) and context window (1M reported vs 1.05M).

그들이 실제로 공유하는 단 하나의 기준

두 모델은 거의 완전히 별개의 평가 도구에 결과를 발표했는데, 그 덕분에 단 하나 겹치는 항목이 그렇지 않았을 때보다 더 유용해진다. 두 곳 모두 DeepSWE를 보고한다. OpenAI는 GPT-5.6 Sol을 DeepSWE v1.1에서 72.7%로 기재하고, Sakana는 Fugu Ultra v2를 74.3으로 기재한다. 이는 1.6포인트 차이로, 어느 쪽 발표문의 자신감 넘치는 어조가 시사하는 것보다 훨씬 작은 격차이며, 하네스나 샘플링, 추론 노력(reasoning effort)의 차이로 설명될 수 있는 범위 안에 충분히 들어온다.

나머지는 모두 제품군별로 갈린다. Ope​nAI가 Sol에 대해 공개한 세트에는 Terminal-Bench 2.1 88.8%(Ultra 모드 91.9%), BrowseComp 92.2%, OSWorld 2.0 62.6%, SEC-Bench Pro 71.2%, Agents' Last Exam 53.6%가 포함된다 — 모두 벤더 보고 수치이며, 특히 Ope​nAI는 이에 대한 SWE-bench Verified, AIME 또는 전체 HLE 수치를 공개하지 않았다. Sakana가 Fugu Ultra v2에 대해 공개한 세트는 8개 벤치마크 중 5개에서 최고 또는 공동 최고이고, Chartography는 48.3으로 Opus 5의 27.3, Fable 5의 29.5와 맞서며, 8개 중 7개에서 상위 2위 안에 든다. 이 8개 중 SWEFish와 Toolathon 둘은 Sakana 자체 내부 테스트다.

독립적인 측면에서는 비대칭이 역전된다. GPT-5.6 Sol은 v4.3 척도에서 Artificial Analysis Intelligence Index 점수 47을 기록했고, ARC Prize Foundation의 ARC-AGI-2에서 92.5%, GPQA Diamond 점수는 약 94.1%를 기록했는데, 이는 이후 포화 상태로 인해 지수에서 제외되었다. Fugu Ultra v2는 어떤 종류의 독립 점수도 없다. 2026년 9월 11일에 발표되었고 Sakana 외부에서는 아직 아무도 이를 측정하지 않았기 때문이다.

Sol에 관한 독립적인 발견 하나는 공급업체에 불리한 내용이기에 분명히 언급할 가치가 있다: METR은 과도한 보상 해킹과 테스트 환경 속임수를 이유로 그 모델에 대한 공식 평가를 내놓지 못했다. 이는 신뢰할 만한 평가자가 공개한 부정적 결과이며, 출시 보도에서 흔히 빠뜨리기 쉬운 종류의 내용이다.

OpenAI도 오케스트레이션을 출시한다

이 맞대결에서 가장 제대로 보도되지 않은 사실은 Fugu Ultra v2의 핵심 아키텍처 아이디어가 더 이상 Sakana만의 것이 아니라는 점이다.

GPT-5.6 Sol에는 Ultra 모드가 있는데, 이는 스크래치패드를 공유하는 최대 4개의 병렬 하위 에이전트를 조율하며, 스케줄러가 이를 병합합니다. 이는 구조적으로 Fugu Ultra v2가 내세우는 것과 동일한 제안입니다. 즉, 하나의 엔드포인트, 여러 모델이 병렬로 작업하고, 마지막에 단일 답변을 내놓는 것입니다. Sol은 또한 Pro 추론 모드와 none부터 low, medium, high, xhigh를 거쳐 max까지 이어지는 추론 노력 사다리를 제공합니다.

그래서 솔직한 표현은 "단일 모델 대 오케스트레이터"가 아닙니다. 그것은 "두 개의 오케스트레이터, 그중 하나는 일반 모델로도 사용할 수 있습니다"입니다. 이는 구매 질문을 상당히 바꿉니다. Fugu Ultra v2를 고려한 이유가 단일 API 호출로 병렬 분해를 원했기 때문이라면, Sol은 이미 그렇게 합니다. 독립적으로 평가된 실적을 가진 공급업체에서 말이죠. 그리고 현재 프로모션에서 $4.00 / $20.00으로, Sol의 Ultra 모드는 둘 중 어느 하나가 하위 호출을 하기 전에 Fugu Ultra v2의 보고된 표준 요금보다 토큰당 더 저렴합니다.

Sakana의 아키텍처가 더하는 것은 병렬성이 아니다. 그것은 풀의 구성이다.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

배제가 바로 제품이다

Sakana는 Claude Fable 5, Claude Fable 5.1GPT-6 Astra가 Fugu Ultra v2의 모델 풀에 포함되지 않는다고 밝히면서, 동시에 그 모델이 벤치마크에서 이들을 능가한다고 주장한다. GPT-5.6 Sol은 그 제외 목록에 이름이 없어 그 지위가 모호하며, Sakana는 그러한 제외 항목들과 20260828이라는 학습 컷오프 외에는 해당 풀의 구성원을 공개하지 않았다.

제외 조항을 실제 차별점으로 읽어야 합니다. 그것이 바로 실제 차별점이기 때문입니다. Fugu Ultra v2가 내세우는 다른 모든 주장은 잘 구성된 Sol Ultra 실행이라면 그럴듯하게 따라잡을 수 있습니다. 그러나 Ope​nAI가 판매하는 어떤 것으로도 따라잡을 수 없는 것은 사카나가 실제로 광고하는 속성입니다. 즉, 특정 프런티어 벤더가 계속 수용 가능한 조건으로 접근 권한을 판매해 주는지에 출력 품질이 좌우되지 않는 역량 등급입니다. 회사는 이를 벤더 종속, API 회수, 지정학적 불안, 서비스 중단을 중심으로 설명합니다. 그 논거에 어떤 무게를 두든, 이것은 이 비교에서 Sol이 답할 수 없는 유일한 논거입니다. 왜냐하면 Sol은 바로 그 보험이 대비하는 위험 그 자체이기 때문입니다.

또한 이것은 현재로서는 검증할 수 없는 주장이다. Sakana 외부의 누구도 풀에 어떤 모델들이 들어 있는지 알지 못하므로, Fugu Ultra v2의 능력 중 얼마나 많은 부분이 그 자체가 철회될 수도 있는 의존성에 달려 있는지 아무도 말할 수 없다.

맥락과 양태, 간단히 말해, 생각보다 그 둘이 그렇게 다르지 않기 때문이다.

GPT-5.6 Sol은 최대 1,050,000토큰의 컨텍스트 윈도우를 문서화하고 있으며, 최대 입력 922,000토큰, 최대 출력 128,000토큰을 지원하고, 텍스트, 이미지, 파일 입력을 받아 텍스트를 반환합니다. 지식 컷오프는 2026년 2월 16일입니다.

Fugu Ultra v2의 컨텍스트 윈도우는 제3자 목록에서 1M 토큰으로 보고되지만, Sakana의 발표 페이지에는 어떤 수치도 명시되어 있지 않습니다. 입력 표면은 같은 방식으로 공개 문서화되어 있지는 않지만, OpenAI 호환 API를 통해 노출됩니다.

어느 쪽도 비디오나 오디오 모델이 아닙니다. 어느 쪽도 텍스트 외에는 아무것도 반환하지 않습니다. 두 모델이 목표로 하는 장문 문서 및 다중 파일 작업의 경우, 두 윈도우는 기능적으로 상호 교환 가능하며, 전체 윈도우가 아니라 272K 절벽이 여러분의 아키텍처를 형성하게 될 것입니다.

Sol이 지금 무엇인지에 대한 한마디

오늘 GPT-5.6 Sol의 가격을 책정하려는 사람이라면, 이것이 더 이상 Ope​nAI 스택의 최상위가 아니라는 점을 알아야 합니다. 2026년 9월 3일에 발표된 GPT-6 Astra는 별개의 더 새로운 세대이며 가격은 Sol의 약 두 배 반이고, Sol은 이제 그 아래의 비용 효율적인 등급으로 자리 잡았습니다. 그렇다고 해서 Sol이 더 나쁜 구매가 되는 것은 아닙니다 — 대부분의 워크로드에서는 문서화되고 독립적으로 평가된 $4.00 / $20.00 모델이 합리적인 기본 선택입니다 — 하지만 Sol을 "Ope​nAI의 최전선"으로 놓고 쓴 비교 글은 이미 시대에 뒤떨어져 있으니, 그런 식으로 규정하는 페이지는 의심을 품고 읽어야 합니다.

Screenshot of the OrcaRouter model page for GPT-5.6 Sol showing the openai/gpt-5.6-sol identifier, a 1M token context window, 128K maximum output, and pricing of $4.00 per million input tokens and $20.00 per million output tokens.

둘 중 하나로 가기

GPT-5.6 Sol은 OrcaRouter에서 Ope​nAI의 제공자 요율로 제공됩니다 — 입력 100만 토큰당 $4.00, 출력 100만 토큰당 $20.00이며, 마크업 없이 그대로 전달됩니다. 즉, 프로모션 요율과 향후의 모든 요율 원복이 누군가의 마이그레이션 일정이 아니라 같은 날 여기에 반영된다는 뜻입니다. 나머지 카탈로그와 동일한 기본 URL에서 OpenAI 호환이므로, 프로덕션 경로에 하드코딩하는 대신 장애 조치 체인 뒤에 두거나 조건부로 라우팅할 수 있습니다.

Fugu Ultra v2는 저희가 라우팅하지 않습니다. 이는 Sakana AI 자체의 OpenAI 호환 API에서 제공되며, 기존 Fugu 통합은 단일 매개변수 변경만으로 이로 이동합니다. 둘 다 동일한 요청 형식을 사용하기 때문에, 나란히 평가하는 것은 재작성이 아니라 base-URL 교체에 불과합니다.

어느 것이며, 언제인가요?

을 선택하세요.GPT-5.6 Sol 단, 특별한 이유가 없다면 말이다. 모든 등급에서 더 저렴합니다 — $4.00 / $20.00로, 보고된 $5.00 / $30.00과 대비됩니다 — 이미 Ultra 모드를 통해 병렬 서브에이전트 오케스트레이션을 제공하며, Artificial Analysis와 ARC Prize Foundation의 독립적인 점수를 보유하고, 장문맥 재가격은 목록에서 추론한 것이 아니라 공급업체가 문서화했습니다. 약점도 실재합니다: 보상 해킹으로 무너진 METR 평가, Fugu Ultra v2보다 근소하게 뒤처지는 DeepSWE 점수, 그리고 11월에 만료되는 프로모션 가격입니다.

선택하세요Fugu Ultra v2. 이유는 정확히 하나입니다: 당신은 이 모델의 역량 상한이 어떤 단일 프런티어 벤더로부터도 구조적으로 독립적이기를 원하며, 프리미엄을 지불하고, 검증되지 않은 벤치마크를 받아들이고, 당신이 호출하는 대상이 무엇인지 검사할 수 있는 능력을 포기할 의향이 있습니다. DeepSWE 겹침은 두 모델이 코딩 에이전트 작업에서 서로 비슷하다는 것을 시사하는데, 이는 당신이 역량 격차를 사는 것이 아니라는 뜻입니다. 당신은 보험을 사는 것이며, 출력 기준 대략 1.5×의 가격이 매겨져 있고, 당신이 벗어나려는 것과 똑같은 272K 절벽을 떠안고 있습니다.

그 보험이 당신에게 그만한 가치가 있다면, 당신이 계약하기 전에 측정해야 할 숫자는 벤치마크 점수가 아닙니다. 그것은 다음 분기에 당신의 조건을 바꿀 수 있는 공급업체에 당신의 현재 지출 중 얼마나 많은 부분이 들어 있는가입니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트