Fugu Ultra v2 대 Grok 4.6 매치업을 위한 히어로 카드로, 오케스트레이션 시스템과 단일 대규모 컨텍스트 추론 모델을 대비시킵니다.
Guides & Insights

Fugu Ultra v2 vs Grok 4.6: 출력 가격은 5배, 공유 벤치마크는 하나

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

단 하나의 벤치마크에서만 Fugu Ultra v2Grok 4.6이 모두 수치를 공개했으며, 그것은 바로 DeepSWE입니다: Sakana AI는 2026년 9월 11일 발표에서 Fugu Ultra v2에 대해 74.3을 보고했고, x​AI의 Grok 4.6 출시 자료는 자체 DeepSWE v1.1 점수를 65.9%로 제시합니다. 이는 8.4점 차이이며, 두 회사가 제공하는 유일한 깔끔한 비교입니다. 여러분이 나란히 놓을 수 있는 다른 모든 것, 즉 Sakana의 Chartography와 SWEFish를 Grok의 GPQA Diamond, CursorBench와 맞세우는 것은 서로 다른 연구소가 서로 다른 도구로 측정한 것입니다. 그러므로 정직한 질문은 "어느 쪽이 더 똑똑한가"가 아닙니다. Grok 4.6이 6달러를 받는데, Fugu Ultra v2가 주장하는 우위가 출력 토큰 100만 개당 30달러를 지불할 만한 가치가 있는가 하는 것입니다.

같은 문제에 대한 두 가지 서로 다른 답

Grok 4.6은 단일 모델이며, Grok 라인의 현행 플래그십입니다 — 벤더 자체 개발자 문서에 "Latest"로 등재되어 있고, 500,000 토큰 컨텍스트 윈도우, 동일한 텍스트/이미지/파일 입력 범위, 동일한 기본 가격을 그대로 이어받아 Grok 4.5의 뒤를 잇습니다. 지식 컷오프는 2026년 2월 1일이며, 추론 강도를 low, medium, high, xhigh로 제공하고 기본값은 high입니다. 사람들을 놀라게 하는 한 가지 세부 사항: 추론은 끌 수 없습니다. 사고 토큰은 모든 요청에 과금되므로, Grok 4.6의 실제 출력 비용은 모델이 얼마나 열심히 생각하기로 결정하느냐에 달려 있습니다.

Fugu Ultra v2는 일반적인 의미의 모델이 전혀 아니다. 이것은 Sakana AI의 오케스트레이션 라인에서 최고 성능 등급에 해당한다 — 작업을 분해해 여러 다른 모델 풀에 걸쳐 분배하는 단일 OpenAI 호환 엔드포인트로, 그중에는 오픈 웨이트 모델도 있고 특화 모델도 있다. Sakana의 설명에 따르면 이는 "자기가 오케스트레이션하는 프런티어 모델들에 대한 필수적인 의존 없이" 프런티어급 출력에 도달하며, Claude Fable 5, Claude Fable 5.1, GPT-6 Astra는 그 풀에서 제외된다고 분명히 밝히고 있다. 당신은 스케줄링 계층에 대한 비용과, 하위 에이전트들이 소모하는 모든 토큰에 대한 비용을 지불하는 것이다.

그 구분은 겉모습만의 문제가 아니다. 그것은 가격 격차가 존재하는 전적인 이유이며, 그 격차를 정당화할 수 있게 하는 유일한 요소이다.

반복되는 부분을 포함한 요금 카드

입력 — Fugu Ultra v2 1M당 $5.00 vs Grok 4.6 1M당 $2.00. Fugu는 하위 호출이 발생하기 전부터 2.5배입니다.

출력 — Fugu Ultra v2 1M당 $30.00 vs Grok 4.6 1M당 $6.00. 5배 차이이며, 대부분의 청구서를 좌우하는 항목입니다.

캐시된 입력 — 양쪽 모두 1M당 $0.50. 동일합니다. 다른 공통점이 전혀 없는 두 공급자가 같은 캐시 읽기 가격에 도달했다는 점은, 캐시를 많이 쓰는 에이전트 루프가 두 제품을 항목 하나하나 진정으로 비교할 수 있는 유일한 워크로드라는 뜻입니다.

장문 컨텍스트 재가격 책정 — Grok 4.6은 프롬프트가 200,000토큰을 넘으면 $4.00 / $12.00로 두 배가 되며, 이 재가격은 전체 요청에 적용되며, 초과분에만 적용되는 것이 아닙니다. Fugu Ultra v2의 보고된 등급은 약 272,000 입력 토큰을 초과하면 약 $10.00 / $45.00로 이동하며, 역시 전체 요청에 적용됩니다. 둘 다 긴 프롬프트에 부담을 주며, Grok은 72K 토큰 더 이른 지점부터 부담을 주기 시작합니다.

컨텍스트 윈도 — 제3자 목록에서 보고된 바에 따르면 Grok 4.6은 500K 토큰, Fugu Ultra v2는 1M입니다. Sakana의 발표 페이지에는 컨텍스트 수치가 전혀 명시되어 있지 않으므로, 해당 1M은 공급업체가 확인하지 않은 것으로 간주하십시오.

장문 컨텍스트 행은 양쪽으로 작용하므로 계산해 볼 가치가 있다. 300K 토큰 프롬프트는 Grok 4.6에서 입력 100만 개당 $4.00, Fugu Ultra v2에서 약 $10.00가 든다. 150K 토큰 프롬프트는 Grok에서 $2.00, Fugu에서 $5.00가 든다. Sakana의 모델은 모든 프롬프트 길이에서 더 비싸다 — 유일한 문제는 얼마나 자주 호출해야 하는가이다.

Two-column comparison scoreboard for Fugu Ultra v2 and Grok 4.6 covering type, release date, input price ($5.00 vs $2.00 per million tokens), output price ($30.00 vs $6.00), cached input ($0.50 on both) and context window (1M reported vs 500K).

출력에 5배를 지불하자는 논거

오케스트레이터의 근거는 토큰당 더 저렴하다는 데 있지 않다. 더 적은 시도가 필요하다는 점, 그리고 조정에 쓰는 토큰이 실패에 쓰게 될 토큰보다 더 저렴하다는 점에 있다.

그것은 실질적인 논거이며, Sakana는 이를 명시적으로 내세우고 있다: Fugu Ultra v2는 복잡한 다단계 작업 — 자율 연구, 풀스택 개발 — 을 겨냥하는데, 여기서 단일 모델의 실패 모드는 긴 실행 도중 중간에 탈선하는 것이다. $30 출력 단가가 세 번째 시도 대신 첫 번째 시도에서 작업을 완료하게 해 준다면, 토큰당 추가 비용은 무의미하다.

공급업체 진영 자체에서 나온 뒷받침 증거가 있기는 하지만, 이는 공급업체에 유리한 내용이므로 그렇게 감안해 읽어야 한다. xAI의 Grok 4.6 출시 자료는 장기 지평 작업을 해결하는 데 약 53턴과 약 5억 입력 토큰이 든다고 언급하며, 경쟁 프런티어 모델의 경우 약 103턴과 20억 입력 토큰이 든다고 밝힌다 — 이는 낮은 토큰당 가격에서도 Grok 자체가 작업당 경제적이라는 주장이다. 두 회사 모두 같은 행보를 취하고 있다: 요금표에서 당신을 떼어내고 완료된 작업당 비용 쪽으로 이끄는 것이다.

즉, 결정적인 숫자는 어느 벤더도 공개하지 않는 숫자이며, 여러분이 직접 측정해야 하는 숫자입니다. 바로 여러분의 작업과 비슷한 작업에서 처음부터 끝까지 소모된 토큰 수입니다.

각각이 진정으로 약한 부분

Grok 4.6의 공개된 약점은 터미널 작업이다. Terminal-Bench v3.0 점수는 26%로, 해당 분야 최상위권에 크게 뒤처진다. 같은 모델이 더 오래된 Terminal-Bench v2.1에서는 훨씬 더 강한 88.4%를 기록함에도 그렇다. 이 둘은 서로 다른 테스트이며, 이를 섞어서 보는 것은 많은 보도에서 보게 될 실수다. 또한 이 모델은 동일 집단에서 가장 높은 GPQA Diamond 점수인 94.9%를 기록하지만, GPQA Diamond는 포화 상태라는 이유로 이후 Artificial Analysis 지수에서 제외되었기 때문에, 이제 그곳의 높은 점수는 1년 전처럼 프런티어 모델 간을 변별해 주지 못한다.

독립적인 측면에서, Artificial Analysis는 Grok 4.6에 자사의 v4.3 Intelligence Index에서 44점을 부여했으며, 200개 중 #20위, 작업당 비용은 $1.86입니다. 흔히 회자되는 61이라는 수치는 대체된 지수 척도에서 나온 것이므로, 어떤 버전에서 산출된 것인지 밝히지 않고 인용해서는 안 됩니다.

Fugu Ultra v2의 약점은 검증이다. 이 글을 발표한 시점 기준으로, Sakana가 이 모델에 관해 주장한 어떤 것도 — 다섯 개의 최고 또는 공동 최고 결과, Opus 5의 27.3과 Fable 5의 29.5에 맞선 48.3의 Chartography 점수, 74.3의 DeepSWE — 독립적으로 재현되지 않았다. 공개된 지연 시간이나 처리량 수치도 없는데, 이는 단일 모델보다 오케스트레이터에게 더 중요하다. 응답 시간이 전적으로 무엇을 호출하기로 결정하느냐에 달려 있기 때문이다. 이전 Fugu Ultra의 경우, 테스터들은 실행 시간이 약 30분까지 늘어났다고 공개적으로 보고했다. 그것은 v2가 아니라 2026년 6월 모델이지만, 프로덕션 경로를 확정하기 전에 테스트해야 할 실패 모드다.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

공급업체명에 대한 참고 사항

개발자 콘솔에서 Grok 4.6을 찾아보기 전에 알아 두면 좋은 한 가지 변수: 이 모델은 일관되게 Grok 4.6이라고 불리지만, 이를 둘러싼 벤더 브랜딩은 유동적입니다. x​AI 자체 문서는 이제 SpaceXAI라는 이름을 사용하며, 이는 대부분의 출시 보도가 아직 따라잡지 못한 변화입니다. 모델 식별자와 API 표면은 변경되지 않았습니다 — Grok 4.6은 일급 Ope​nAI Responses 모델이며 번역 계층 없이 기존 도구 호출 루프에 바로 들어갑니다 — 하지만 모델 카드를 찾고 있는데 브랜딩이 잘못 보인다면, 그것은 여러분의 실수가 아닙니다.

실제로 이 둘 중 하나를 호출하는 경우

Grok 4.6는 제공업체 자체 요율로 OrcaRouter에 있습니다 — 입력 백만 토큰당 $2.00, 출력 백만 토큰당 $6.00이며, 마크업 없이 그대로 전달되므로 공급업체의 가격 변경이 마이그레이션 일정에 따라가 아니라 같은 날 이곳에 반영됩니다. 카탈로그의 다른 모든 항목과 동일한 기본 URL에서 OpenAI 호환 방식이므로, 하드코딩하는 대신 폴백 체인이나 라우팅 규칙 뒤에 배치할 수 있고, 별도의 계약이나 코드 변경 없이 다른 모델과 A/B 테스트를 할 수 있습니다.

Fugu Ultra v2는 저희가 라우팅하지 않습니다. 이는 Sakana AI 자체의 OpenAI 호환 API에서 사용할 수 있으며, 회사는 기존 Fugu 통합이 단일 매개변수 변경만으로 이쪽으로 이동한다고 말합니다. 워크로드에서 두 가지를 비교하고 싶다면, 가장 저렴한 구성은 Grok 4.6을 귀하의 게이트웨이에 그대로 두고 기능 플래그 뒤에서 Sakana의 Fugu Ultra v2를 직접 호출하는 것입니다. 둘 다 동일한 요청 형식을 사용하므로 동일한 테스트 하네스가 둘 다에서 작동합니다.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the grok/grok-4.6 identifier, a 500K token context window, and pricing of $2.00 per million input tokens and $6.00 per million output tokens.

평결

Grok 4.6은 대부분의 팀에게 합리적인 기본 선택이며, 가격 면에서는 격차가 크게 벌어집니다. $2.00 / $6.00에 캐시 읽기 $0.50, 500K 윈도우를 제공하며, 장문 문서 추론, 코딩 에이전트, 멀티모달 파일 작업을 Fugu Ultra v2 출력 요금의 5분의 1로 처리하고, 독립적으로 평가되고 독립적으로 벤치마킹됩니다. 취약점은 프롬프트 길이 — 200K 절벽에서 전체 요청 비용이 두 배가 됩니다 — 와 터미널 비중이 높은 에이전트 루프이며, 후자에서는 공개된 점수가 경쟁력이 없습니다.

Fugu Ultra v2는 특정한 종류의 워크로드가 있을 때에만 그 프리미엄 가격을 지불할 가치가 있습니다. 길고 여러 단계로 이뤄지며 자율성이 중요한 작업, 즉 단일 모델이 자주 탈선하는 작업이면서, 동시에 Sakana가 내세우는 아키텍처적 속성, 곧 어떤 프런티어 벤더가 계속 공급 가능하거나 계속 저렴하게 유지되는지에 의존하지 않는 역량 등급을 원하는 경우입니다. 그것은 정말로 바랄 만한 것입니다. 하지만 그것은 주장일 뿐 아직 측정된 것이 아니며, 그것을 그럴듯해 보이게 만드는 DeepSWE 격차는 출시 당일 단일 벤더가 내놓은 단일 벤치마크일 뿐입니다.

당신의 작업 중 현재 두 번째나 세 번째 시도에서 실패하는 것이 무엇인지 말할 수 없다면, 아직 가격 차이를 정당화할 숫자를 가진 게 아닙니다. 그것을 먼저 측정하세요. 나머지는 요율표가 이미 다 알려줍니다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트