Grok Imagine Image 2.0용 히어로 타이틀 카드에는 'Grok Imagine Image 2.0 — 텍스트-투-이미지 아레나 2위, 정밀 편집, 이제 Grok 앱에서 사용 가능'이라는 문구와 캡션 '2026년 8월 7일 xAI 발표', 그리고 평면형 사진 프레임과 펜이 있는 편집 아이콘이 포함되어 있습니다.
Guides & Insights

Grok Imagine Image 2.0: Artificial Analysis에서 4위, 가격은 3분의 1

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Grok Imagine Image 2.0이 Artificial Analysis의 텍스트-투-이미지 리더보드에서 4위에 올랐다. 그리고 중요한 숫자는 순위가 아니라 그 옆에 있는 가격이다. 이 모델은 1,153.66 Elo로, 세 항목 뒤에 자리한다: GPT Image 2.5 Flare (max), GPT Image 2.5 Sunburst (max), GPT Image 2 (high). Microsoft의 MAI-Image-2.6과 Nano Banana 2 모델을 포함해 다른 모든 연구소의 모델보다 앞선다. 그 결과 이 모델은 그 셋을 제외하면 가장 높은 순위의 이미지 생성기로 남고, 그 상위 4개 안에서 큰 차이로 가장 저렴하다. Artificial Analysis는 이를 1,000장당 $60으로 책정했는데, 이는 위의 세 항목의 약 $211과 대비된다. 모델 자체는 2026년 8월 7일자다. 바뀐 것은 독립적인 보드가 이 모델을 어디에 두는지, 그리고 그것이 제작사가 출시 당시 사용한 "세계 2위"라는 프레이밍에 어떤 영향을 미치는지이다.

#4 배치가 실제로 측정하는 것

Artificial Analysis's Text to Image Leaderboard is a blind human-preference arena: voters see outputs from the same prompt without model labels and pick the better one, and the resulting Elo is published independently of any vendor. Grok Imagine Image 2.0's entry reads #4 at 1,153.66 Elo with a 95% confidence interval of 1,141.66 to 1,165.66. None of that number comes from xAI. (One housekeeping detail worth knowing when you read the board: Artificial Analysis lists the model's creator as SpaceXAI.)

이야기에서 가격이 차지하는 절반이 더 흥미로운 절반이다. 같은 페이지에서는 품질을 가격에 대해 플롯하고, 달러당 가장 많은 Elo를 제공하는 모델을 표시하는 파레토 선을 그리는데, 보드가 자체적으로 공개한 수치에 따르면 Grok Imagine Image 2.0은 1,000장당 100달러 미만 가격의 모델 중 가장 높은 점수를 받은 모델이다. 품질 면에서 그 위에 있는 다음 모델인 GPT Image 2 (high)는 1,000장당 211달러이다. 약 17 Elo 더 높은 점수를 위해 대략 3.5배의 비용을 지불하는 셈이다. 이는 최고의 모델이라는 주장이 아니라 가격 대비 성능에 관한 주장이며, 독립적인 데이터가 실제로 뒷받침하는 이야기의 버전이다.

최전선 위치는 실재하지만 좁으며, 그 점은 분명히 말할 가치가 있다. Microsoft의 MAI-Image-2.6은 1,000개당 $38.90로 한 순위 아래에 있고, Meta의 Muse Image는 1,111 Elo에서 1,000개당 $10이다. 이 순위표에서 Elo 구간은 약 ±12점 폭이므로, 6.5 Elo 차이로 나뉜 #4와 #5는 서로의 오차 범위 안에 들어간다. 이 배치는 확정된 자리가 아니라 "상위 5위"로 보라.

14계단 상승은 Grok Imagine Image 2.0이 대체한 등급과의 격차입니다. xAI의 이전 품질 등급인 grok-imagine-image-quality는 같은 리더보드에서 1,043.21 Elo로 18위에 있고, 원래의 grok-imagine-image는 1,017.86으로 29위입니다. 이는 xAI가 이제 이미지 기본 모델로 문서화하는 모델과 그것이 대체하는 모델 사이의 약 110 Elo 및 14계단 순위 차이입니다.

"세계 2위"라는 주장은 현재 어디에 서 있는가

출시 당시 xAI는 텍스트-투-이미지와 이미지 편집 Arena 보드 양쪽에서 2위를 기록했다고 밝혔으며, Elo 점수는 약 1,320점이고 Preliminary로 표시되었다. 이 수치는 xAI가 자체 발표에서 강조한 것이지, xAI가 의뢰한 독립적 평가 결과가 아니었으며, 그 이후 순위는 달라졌다. 8월 10일 스냅샷에서는 이 모델이 1,316 Elo로 MAI-Image-2.6과 GPT Image 2에 뒤진 3위를 기록했다. 이미지 편집 부문 2위는 여전히 xAI 자체 인용에 근거한 것이다.

Artificial Analysis는 방법도, 투표자 집단도 다른 별개의 리더보드이며, 현재 이 모델을 4위에 올립니다. 둘은 실제로 서로 모순되지 않습니다. 인간 선호를 서로 다른 방식으로 표본화하며, 둘 다 매주 달라지는 리더보드의 스냅숏입니다. 6주간의 독립적 순위 평가에 대한 솔직한 요약은 Grok Imagine Image 2.0이 일관되게 톱5에 들었으며, xAI가 발표한 2위에는 결코 미치지 못했다는 것입니다.

Grok Imagine Image 2.0이 실제로 제공하는 것

xAI는 Grok Imagine Image 2.0을 또 하나의 일회성 생성기가 아닌 편집 환경으로 자리매김하고 있습니다. 기능 구성은 다음과 같습니다:

Magic Wand — 프레임의 나머지 부분은 건드리지 않고 영역 단위로 편집합니다

세그멘테이션 — 컬러 그레이딩, 교체 또는 조정을 위한 정밀 영역 선택

배경 제거 — 투명 배경 피사체 내보내기

다중 이미지 입력 — 편집 한 번당 최대 5개의 소스 이미지; xAI 문서에는 이제 5개로 기재되어 있으며, 이는 API가 출시 당시 상한으로 두었던 3개에서 늘어난 것입니다

Smart Resize — 하나의 이미지를 9가지 종횡비(1:2 세로~2:1 가로)로 재구성하며, 자르는 대신 새로운 프레임 콘텐츠를 생성합니다

템플릿 — 제품 사진, 헤드샷, 전자상거래 목록, 게임 자산, 마케팅 포스터를 위한 프리셋 워크플로우

API는 소비자 앱이 노출하지 않는 제어 항목들을 제공합니다: 화면 비율 — 2.0에서 새로 추가된 21:9와 5:2 포함 — 해상도(기본 1K, 선택 사항 2K), 그리고 low, medium 또는 auto를 받는 품질 매개변수입니다. 소비자 측면에서 이 모델은 grok.com/imagine, iOS, Android에서 기본 Quality Mode로 제공되며, 8월 13일부터는 Runway의 플랫폼에도 등재되어 Runway가 이미 호스팅하던 이미지 및 비디오 모델에 합류했습니다. 그 등재는 독립적인 평가라기보다 공급업체 및 파트너의 성명이지만, 출시 후 제3자 배포의 첫 징후였습니다.

헤드라인 텍스트 렌더링에 대해 xAI는 모델이 "디자이너처럼 타이포그래피와 레이아웃을 계획한다"고 말하며, 밀도 높은 다중 부분 구성을 온전히 유지하고 작은 텍스트를 선명하게 렌더링한다고 밝혔다. 또한 다중 턴의 반복 편집 과정에서 피사체의 정체성과 설정도 보존한다.

첫 독립 테스트가 밝혀낸 것

gpt-image-2와의 6개 프롬프트, 단일 시드, 체리피킹 없는 비교에서 뚜렷한 차이가 드러났으며, 새로운 리더보드 순위에서도 이를 뒤집을 만한 것은 없었다.

Grok 승리: 포토리얼리즘과 인물 정체성 유지. 인물 사진 속 손 해부학은 정확했으며, 모공 수준의 피부 디테일, 서브서피스 스캐터링, 자연스러운 캐치라이트와 림라이트가 있었습니다. 45도 기하학적 회전 과제에서 Grok은 ArcFace 0.5 임계값 이상으로 얼굴 정체성을 유지한 반면, gpt-image-2는 더 크게 벗어났습니다.

Grok의 실패:프로덕션 핵심 영역. 간체 중국어 영화 포스터 헤드라인을 요청했지만, 번체 중국어 문자를 렌더링했다. 이는 로컬라이제이션 및 퍼블리싱 파이프라인에서 '하드 디스퀄리파이어'로 분류된다. 수채화 스타일 퓨전 요청에는 가벼운 회화적 텍스처 패스만 적용된 포토리얼리스틱 이미지가 반환되어, '카테고리 수준의 결격 사유'로 평가된다. 로컬 편집은 세 가지 요청을 모두 완료했지만, 창밖 풍경을 보존하지 못했고 하이라이트를 잘못 고정했다.

요약: Grok Imagine Image 2.0은 포토리얼리즘과 정체성에서는 앞서지만, 편집 신뢰성, 다국어 텍스트, 진정한 스타일 전이에서는 뒤처집니다. 리더보드는 수천 건의 블라인드 비교 전반에서 선호도를 평균 낼 뿐이며, 그 모델이 여러분의 중국어 헤드라인을 제대로 만들어낼지는 알려주지 못합니다. 여섯 개 프롬프트로 구성된 한 번의 테스트 역시 충분한 증거가 되지는 못합니다 — 하지만 이 둘 중에서는 구체적인 실패가 현지화 에셋을 출시하는 팀에 더 실행 가능한 신호입니다.

API와 요금 계산

출시 이후 개발자 관련 상황은 달라졌습니다. grok-imagine-image-2.0은 이제 xAI가 이미지 생성, 단일 이미지 편집 및 다중 이미지 편집을 위해 문서화한 모델이며, xAI 자체 모델 페이지에서 이미지용으로 권장하는 모델입니다. 출시 당시의 "개발자 API 액세스 곧 제공 예정" 문구는 공급업체의 모델 및 가격 페이지에서 사라졌습니다.

• grok-imagine-image-2.0: 이미지당 $0.04부터, 실제 제공된 품질 기준으로 청구

• grok-imagine-image (1.0): 이미지당 $0.02, 아래 변경 사항의 영향을 받지 않음

• grok-imagine-image-quality: 이미지당 $0.05, 2026년 11월 2일 종료

품질은 비용을 좌우하는 지렛대입니다. 매개변수를 생략했을 때의 기본값인 Auto는 현재 생성에는 low를, 편집에는 medium을 적용하므로, 생성 요청은 low 요율로, 편집은 medium 요율로 청구됩니다. low 또는 medium을 고정하면 서비스가 어떤 경로를 선택하는지에 따라 달라지는 대신 청구 금액을 예측할 수 있습니다.

마지막 글머리 기호에는 마감 기한이 걸려 있습니다. xAI의 마이그레이션 가이드에 따르면 grok-imagine-image-quality 슬러그는 2026년 11월 2일에 폐기되며, 9월 2일에 시작된 60일 공지 기간 이후입니다. 그 날짜부터 해당 슬러그는 계속 해석되지만, 요청은 quality가 low로 설정된 grok-imagine-image-2.0에서 처리됩니다. 즉, 강제 종료가 아니라 호환성 리디렉션입니다. low 등급은 모든 해상도에서 이전 quality 등급보다 이미지당 $0.01 더 저렴하기 때문에, 아무것도 바꾸지 않는 팀은 가격 인하와 함께 출력 품질의 조용한 변화를 겪게 됩니다. grok-imagine-image-2.0을 지정하고 안정적인 출력이 중요한 곳에서 quality를 고정하여 의도적으로 마이그레이션하는 것이 바로 원하는 방식입니다. 그 날짜와 리디렉션 동작은 xAI 자체 문서에 따른 것이며, 벤더가 명시한 내용일 뿐 독립적으로 테스트된 것은 아닙니다.

OpenAI 옵션들과 비교하면, 이 비교는 가격 차이만큼이나 가격 책정 모델의 차이이기도 하다. gpt-image-2는 토큰 기반 가격이다 — OpenAI 공개 요율 기준 이미지 입력 토큰 백만 개당 $8, 이미지 출력 토큰 백만 개당 $30 — 따라서 이미지당 비용은 해상도와 디테일에 따라 달라진다. Artificial Analysis가 제시한 GPT Image 2(high)의 1,000장당 $211라는 대표 수치와 Grok의 $60을 비교하면, 그 변동 폭이 하나의 숫자로 드러난 셈이다. 이미지당 정액 가격은 대규모로 확장할 때 예측하기 훨씬 쉽고, 4위 모델을 아예 살펴볼 가치가 있는 이유도 대부분 여기에 있다.

파이프라인을 걸지 않고 시도해 보기

Grok Imagine Image 2.0에 대한 합리적인 반응은 여전히 '일단 써보되, 아직 도입을 확정하지는 말라'입니다. 그 순위는 서로 겹치는 신뢰구간 안에 놓여 있고, 한 독립 테스트에서는 현지화된 텍스트와 스타일 전이에서 실제 약점을 지적했으며, xAI는 11월에 그 아래에 있는 슬러그를 폐기할 예정입니다. 이는 직접 통합을 고정 연결하기보다 라우팅을 해야 하는 바로 그 근거입니다.

OrcaRouter에서는 grok-imagine-image — 우리 카탈로그에 있는 xAI의 이미지 모델 — gpt-image-2와 동일한 OpenAI 호환 엔드포인트에 있으므로, xAI와 OpenAI 이미지 모델 사이를 전환하는 것은 모델 문자열 변경에 불과합니다: 두 번째 계약도, 새로운 SDK도 필요 없습니다. OrcaRouter는 공급자 정가를 마크업 없이 그대로 전달하므로, 벤더가 가격을 인하하면 같은 날 여기에 반영되며, 자동 장애 조치는 오류, 속도 제한 또는 거부를 프로덕션 경로가 아닌 대체 모델로 보낼 수 있습니다. 원래 리뷰에서 변하지 않은 솔직한 단서 하나: xAI의 최신 품질 등급은 이미 우리 카탈로그에 있는 Grok 이미지 모델과는 별도 항목이므로, 특정 Grok 변형이 오늘 라우팅 가능하다고 가정하지 말고 현재 모델 목록을 확인하세요.

다음에 볼 콘텐츠

1. 11월 2일 마이그레이션.팀이 grok-imagine-image-2.0으로 명시적으로 이동하든, 리디렉션과 그 저품질 기본값 쪽으로 흘러가든, 이는 xAI가 이 모델에서 여전히 저지를 수 있는 가장 큰 실수입니다 — 그리고 리디렉션은 응답의 모델 필드를 읽지 않는 한 그 실수를 보이지 않게 만듭니다.

2. #4가 유지되는지 여부. MAI-Image-2.6과의 격차는 ±12포인트 구간을 고려할 때 6.5 Elo이므로, 수천 표가 더해지면 어느 방향으로든 순위표가 재편될 수 있다. 이전 등급 대비 110 Elo 상승은 견고해 보이지만, 정확한 순위는 그렇지 않다.

3. 소비자용 인터페이스 중 얼마나 많은 부분이 API에 도달하는가. 생성, 편집, 다중 이미지 편집은 문서화되어 있습니다. 템플릿과 명명된 Smart Resize 워크플로는 여전히 앱 기능으로 남아 있으며, 바로 그 격차에 나머지 "소비자 전용" 단서가 존재합니다.

결론: Grok Imagine Image 2.0은 실제로 유능한 모델이며, 이제 독립적으로 평가되어 Artificial Analysis의 Text to Image Leaderboard에서 4위에 올랐습니다. 그곳에서 최고의 비OpenAI 항목이고, 자신이 대체한 티어보다 약 110 Elo 앞서며, 이미지 1,000장당 $60로 바로 위에 있는 OpenAI 모델들의 약 $211과 대비되는 보드의 가격-품질 프런티어에 있습니다. "world #2"라는 표현은 언제나 xAI의 출시 시점 스냅샷이었고, 독립 보드들은 결코 그렇게 말한 적이 없습니다. 가장 명확한 두 가지 독립적 약점 — 중국어 간체 준수와 스타일 전이 신뢰성 — 은 팀들이 이미지 API에서 가장 자주 필요로 하는 기능에 걸쳐 있습니다. 사실적이고 정체성을 보존하는 작업에는 즉시 시험해 보세요. 현지화된 텍스트나 스타일화된 에셋을 제공하는 파이프라인에는 도입을 보류하세요. 그리고 이미 퇴역 예정인 quality slug를 호출하고 있다면 11월 2일 전에 마이그레이션하세요.