'GLM 5.5 또는 GLM 5.3-Vision?'이라고 표시된 기사 히어로 카드에 부제 'Z.ai의 지문과 일치하는 익명 모델이 방금 등장했다'와 배지 'LEAK — 미검증'이 붙어 있으며, 부드러운 흰색-파란색 그라데이션 위에 은은한 신경망 모티프와 물음표 요소가 깔려 있다.
Guides & Insights

GLM 5.5 아니면 GLM 5.3-Vision? Z.ai의 지문과 일치하는 익명 모델이 방금 등장했습니다

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

속도, 첫 토큰까지의 시간, 캐시 적중률 등 서빙 프로필이 Z.ai의 G​LM 스택과 일치하는 미확인 모델이 용량 분석가들의 주목을 받기 시작했다. 업계의 현재 추측으로는 GLM 5.3-Vision 또는 GLM 5.5로 명명될 수 있다는 것이다. 8월 20일, 컴퓨팅 및 용량 분석가 teortaxesTex는 자신이 추적 중인 익명 모델이 "적어도 Dee​pSeek은 분명히 아니다"라며 "지금까지 G​LM을 배제할 근거는 없다"고 말했다. 또한 "속도, ttft, 캐시 적중률이 G​LM과도 일치한다"고 덧붙였다. 그의 판단은 GLM 5.3-Vision 또는 5.5로 불릴 것이며, Artificial Analysis Intelligence Index에서 약 61점을 기록할 것이라는 것이다. 이는 현재 출시된 GLM-5.3이 위치한 지점보다 1점 높은 수치다. 여기서 확정된 것은 없다. 모델 카드도, Z.ai의 발표도, API도 없다. 이 페이지는 이 목격담을 있는 그대로, 즉 초기의 반복되지 않은 유출 신호로 취급한다. GLM-5.5가 이번 달 내내 Z.ai의 주력 모델로 예상되어 왔지만 아직 나타나지 않았기 때문에, 추적할 가치가 있는 것이다. 그 게시물 5일 후, 이번에는 완전히 확인 가능한 두 번째 데이터 포인트가 도착했다. 8월 25일, 대규모 모델 서빙의 대부분을 뒷받침하는 추론 런타임인 vLLM이 G​LM-5 헤드 차원에 대한 masked-MHA 커널 지원을 활성화하는 Do-Not-Merge 풀 리퀘스트를 열었다. 이는 어떤 변형도 명명하지 않았고 출시를 입증하지도 않는다. 이는 서빙 스택의 기반 작업으로, 새로운 모델이 남기는 일종의 배경 활동이다.

신호가 실제로 의미하는 것

출처는 8월 20일자 teortaxesTex의 X 게시물 하나입니다. 이 계정은 8월에 GLM-5.3 출시에 대한 "대략 일주일"이라는 시점 신호가 하루도 틀리지 않고 맞았던 바로 그 계정입니다. 해당 게시물의 표현은 증거 수준에 대해 명확합니다: "강력한 증거(아직 복제되지 않음)." 그 분석가는 Dee​pSeek를 배제하고, G​LM과 모순되는 것을 찾지 못했으며, 처리량, 최초 토큰 시간(time-to-first-token), 캐시 적중률이라는 세 가지 서빙 수준 측정값이 Z.ai의 스택과 일치한다고 언급합니다. 그런 다음 두 후보 이름과 예상 점수를 제시합니다: "현재 제 예상은 GLM 5.3-Vision 또는 5.5로 불릴 것이고, AA에서 대략 61점을 받을 것입니다."

각 부분을 개별적으로 다루자. 정체성 주장(Dee​pSeek이 아니라 G​LM과 일치함)은 모델 카드가 아니라 모델이 서비스되는 방식에서 얻은 핑거프린트 추론이다. 점수는 기대값이지 측정값이 아니다. 이름들은 추측이다. 이 신호가 노이즈보다 더 가치 있게 만드는 것은, 이번 달 Z.ai의 로드맵에 대해 우리가 아는 모든 것과 방향적으로 일관된다는 점이다: GLM-5.3은 텍스트 전용으로 출시되었고, 커뮤니티에서 가장 큰 요구는 비전이었으며, GLM-5.5는 여러 매체(JP모건, 로이터, CGTN, 그리고 8월 18일 골드만 노트를 통해)가 '8월 안에' 도착할 것이라고 보도했다 — 이제 그 달의 피날레가 다가왔다.

서빙 핑거프린트가 중요한 이유

첫 토큰까지의 시간(TTFT)과 캐시 적중률은 인프라 수준의 시그니처다. 이는 프롬프트가 어떤 모델 이름을 호출하는지가 아니라, 제공자가 추론 스택을 어떻게 구축하는지 — 스케줄러, 캐시 레이아웃, 배칭 정책 — 에 의해 결정된다. 분석가가 익명 모델의 TTFT와 캐시 적중률이 G​LM과 일치한다고 말할 때, 이는 그 뒤에 있는 서빙 스택이 Z.ai의 것처럼 작동한다는 뜻이며, 가중치나 모델 카드 없이 얻을 수 있는 가장 지문에 가까운 것이다. 그것은 증거가 아니다. 다른 공급업체가 동일한 스택을 그대로 구현할 수도 있고, Z.ai가 파트너를 위해 모델을 서빙할 수도 있다. 그러나 그것은 구체적이고 검증 가능한 주장이며, '재현하지 못했다'는 단서는 분석가가 이를 확정된 사실로 제시하지 않는다는 것을 알려준다.

Dee​pSeek 배제도 중요합니다. DeepSeek V4 Pro는 8월 13일에 GA(일반 공개)되었으며, 해당 Flash 빌드는 이번 달의 또 다른 고속 중국 오픈웨이트 릴리스였습니다. Dee​pSeek을 배제하면서 G​LM을 가리키는 익명의 모델은 후보를 Z.ai의 파이프라인으로 좁히며, Z.ai의 파이프라인에는 두 가지 가능한 점유자가 있는데, 이는 정확히 신호가 지칭하는 분기점입니다.

두 번째 신호: GLM-5 어텐션을 위한 서빙 스택이 구축되고 있다

8월 25일, 두 번째 데이터 포인트가 도착했습니다. 이번 것은 완전히 확인 가능합니다. 대규모 모델 서빙 대부분의 기반이 되는 추론 런타임인 vLLM은 풀 리퀘스트 #53785를 받았습니다. 제목은 '[병합 금지][Attention] GLM-5 헤드 차원에 대한 마스크드 MHA 활성화'입니다. 저장소에서 확인한 결과, 이 PR은 G​LM-5 어텐션 구조에 대한 마스크드 MHA 프리필 경로를 활성화합니다: 헤드 64개, KV 랭크 512, QK 헤드 차원 192+64, V 헤드 차원 256 — PR 설명에 따르면 256/256 QK/V 레이아웃입니다. 이 변경은 head-dimension-256 마스크 지원을 위한 FlashAttention 변경에 의존하며, FlashAttention을 임시로 포크 커밋에 고정합니다(이것이 병합 금지 표시가 있는 이유입니다). 또한 새 경로에 대한 벤치마크 기반 라우팅 임계값을 추가합니다: TP 1/2/4/8에서 FlashMLA 순수 프리필 한도는 8K / 20K / 48K / 112K 토큰, TP8에서 FlashInfer 한도는 반올림된 64K입니다. 작성자는 다른 공개 PR이 G​LM-5 마스크드 MHA 지원을 다루지 않았다고 언급합니다.

있는 그대로 읽어야 한다: 서빙 스택의 기반 작업이지 발표가 아니다. 이 PR은 GLM 5.5나 GLM 5.3-Vision을 언급하지 않는다. "GLM-5"라고만 되어 있다. GLM-5 헤드 차원을 위한 masked-MHA 프리필 경로를 활성화하는 것은 vLLM 생태계가 이미 sparse-MLA 경로로 운영 중인 계열에 대한 인프라 작업이다 (GLM-5.3의 계보 자체가 오늘날 그 경로에서 서빙되고 있다). 또한 고립된 작업도 아니다: 이번 달에 함께 올라온 PR들은 GLM-5에 대한 FlashInfer MLA 차원 검사, GLM-5급 모델을 위한 Triton sparse-MLA 폴백, 그리고 FlashAttention이 보고한 차원 지원을 다뤘다. 두 가지 세부 사항이 이 작업을 유출 추적기의 레이더에 잡히게 한다. 첫째, 이것이 목표로 하는 지오메트리 — 64개 헤드, KV 랭크 512, 256/256 QK/V — 는 DeepSeek의 192/128과는 구별된다. 이는 익명 모델의 지문이 그려내는 "DeepSeek가 아니라 GLM과 일치한다"는 구분과 동일하며, 이제 어텐션 커널 수준에서도 드러난다. 둘째, 시점이다: PR은 8월 25일에 열렸으며, GLM-5.5가 한 달 내내 기대되어 온 바로 그 8월의 기간 안에 있다. 그 어떤 것도 익명 모델이 차세대 GLM임을 증명하지는 않는다 — 이것은 마찬가지로 이미 출시된 모델에 대한 엔지니어링일 수도 있다 — 그러나 이것은 서빙 생태계가 모델 출시에 앞서 수행하는 종류의 배경 활동이며, 어떤 X 게시물도 그럴 수 없는 방식으로 검증 가능하다.

두 개의 이름, 하나의 포크: GLM 5.3-Vision vs GLM 5.5

두 후보 정체성은 실제로 서로 다른 제품이며, 유출만으로는 어느 것이 보드에 실려 있는지 확정할 수 없다.

• GLM 5.3-Vision은 8월 14일에 출시된 모델의 비전 지원 변형이 될 것입니다. GLM-5.3은 텍스트 입력 전용입니다. Artificial Analysis는 이를 텍스트 입력, 텍스트 출력, 이미지 지원 없음으로 분류합니다. 그리고 그 격차가 커뮤니티에서 가장 큰 불만입니다. Z.ai의 Tang Jie가 글로벌 피드백 캠페인을 진행했을 때, 댓글은 사실상 만장일치로 비전을 요구했습니다. Z.ai에는 이미 플래그십 라인에 통합하지 않은 빌딩 블록(GLM-5V-Turbo 멀티모달 모델과 CogVLM 인코더)이 있습니다. 5.3-Vision 변형은 그 격차를 해소하는 가장 빠른 방법이 될 것입니다.

• GLM 5.5는 플래그십 그 자체입니다. 보고되었지만 확인되지 않은 사양에 따르면, GLM-5.3의 743B에서 증가한 1조 개 이상의 매개변수를 가진 베이스 모델, 유지되는 1M 토큰 컨텍스트, 공개 가중치, 그리고 더 강화된 에이전트/코딩 중심을 가리킵니다. 이번 달의 모든 분석가 노트는 5.5를 중요한 모델로 취급합니다 — Z.ai 공동 창업자 Tang Jie가 Fable급 폐쇄 모델과의 격차를 좁힐 것이라고 암시한 수단입니다. 8월 안에 출시될 예정이며, 이 글을 쓰는 시점에는 아직 출시되지 않았습니다.

동일한 핑거프린트만으로는 이 둘 중 어느 쪽인지 알 수 없습니다. 비전 튜닝을 거친 5.3과 새 플래그십 모두 동일한 서빙 스택을 사용할 수 있기 때문입니다. 이러한 모호함은 신호가 전하는 솔직한 상태이며, 분석가의 게시물에 언급된 두 이름은 그 모호함을 해결하기보다는 반영합니다.

img src="2.png" alt="제목이 'GLM 5.5 vs GLM-5.3 — 스코어보드'인 2열 비교 스코어보드. 왼쪽 열 GLM 5.5 (유출): 'AA Index ~61 (예상, 미검증)', '상태: 미출시', '크기: 1조 개 이상 파라미터 (루머)', '비전: 예상됨', '컨텍스트: 1M (예상)', '가격: 미정'. 오른쪽 열 GLM-5.3 (출시됨): 'AA Index 60', '상태: API 8월 19일 출시', '크기: 743B MoE / 활성 40B', '비전: 텍스트 전용', '컨텍스트: 1M', '가격: $1.40 / $4.40'. 바닥글: 'GLM 5.5 수치는 검증되지 않은 예상치이며, GLM-5.3은 Artificial Analysis 기준입니다.'" />

A two-column comparison scoreboard titled 'GLM 5.5 vs GLM-5.3 — the scoreboard'. Left column GLM 5.5 (leaked): 'AA Index: ~61 (projected)', 'Status: unreleased', 'Size: >1T params (rumored)', 'Vision: expected', 'Context: 1M (expected)', 'Price: TBD'. Right column GLM-5.3 (shipped): 'AA Index: 60', 'Status: API live Aug 19', 'Size: 743B MoE / 40B active', 'Vision: text-only', 'Context: 1M', 'Price: $1.40 / $4.40'. Footer reads 'GLM 5.5 figures are unverified projections; GLM-5.3 per Artificial Analysis.'

AA Intelligence Index에서 ~61이 의미하는 바

예상 점수는 이번 유출에서 가장 예리한 부분입니다. Artificial Analysis Intelligence Index(v4.1.1)는 현재 GLM-5.3을 60으로 평가하는데, 이는 {{1}}오픈 가중치 부문 최고 점수에서 Kimi K3와 동률{{/1}}이며, GLM-5.2의 53보다 7점 높은 수치입니다. 그보다 1점 높은 61은 {{2}}GPT-5.6 Sol의 영역{{/2}}이고, {{3}}Claude Fable 5는 62{{/3}}, {{4}}Claude Opus 5는 63{{/4}}입니다. 쉽게 말하면: G​LM 계열 모델이 61점을 기록한다면 {{5}}이 지수에서 오픈 가중치 부문 단독 최고 점수{{/5}}가 되어, {{6}}Kimi K3와 GLM-5.3 위에 홀로 자리잡게 되며{{/6}}, {{7}}사실상 클로즈드 프런티어 기준선에 도달하는 셈{{/7}}입니다.

61이 무엇이 아닌지 강조할 가치가 있다. 그것은 독립적인 평가가 돌려줄 결과에 대한 teortaxesTex의 기대치이며, 게시된 Artificial Analysis 점수도 아니고 벤더의 숫자도 아니다. 예측은 어느 방향으로든 틀릴 수 있다. 비전 변형은 텍스트 중심 지수에서 1~2점을 주고받을 수 있고, >1T 플래그십은 사후 훈련이 어떻게 작용하느냐에 따라 더 높거나 낮게 나올 수 있다. 그 숫자의 가치는 그것이 담고 있는 주장에 있다. 이 익명의 모델이 누구로 밝혀지든, 현재의 오픈 웨이트 선두 모델을 단순히 따라잡는 수준이 아니라 이길 것으로 기대된다.

A screenshot of the Artificial Analysis page for GLM-5.3 (max) showing an Intelligence Index of 60 (well above the median of 35), $1.40 per 1M input tokens and $4.40 per 1M output tokens, text input and text output, a 1M-token context window, and summary text describing the model as leading in intelligence and reasonably priced.

확인된 것과 확인되지 않은 것은 무엇인가?

원장을 깨끗하게 유지하세요. 누수 부품의 생사가 그것에 달려 있으니까요.

확인됨: GLM-5.3은 실제 제품이며, 8월 14일 출시되었고, API는 8월 18/19일부터 가동되었으며, AA 인텔리전스 지수에서 60점을 기록했고(Artificial Analysis에서 독립적으로 측정), 토큰 100만 개당 $1.40/$4.40로 가격이 책정되었으며, 텍스트 입력 전용이고, 오픈 가중치는 8월 28일 금요일로 확정되었습니다. 이러한 사실은 유출과 무관합니다.

• 확인됨: GLM-5.5는 아직 출시되지 않았습니다. 이 글을 쓰는 현재 모델 카드, 가격, 제공 여부가 모두 없습니다. 8월 출시 기간과 >1T 파라미터 수치는 분석가가 보고한 것이지 Z.ai의 약속이 아닙니다.

• 확인되지 않음: 익명 모델이 별도의 제품으로 존재한다는 점, 그것이 G​LM이라는 점, 그 이름이 GLM 5.3-Vision 또는 5.5가 될 것이라는 점, 그리고 61점을 기록한다는 점. 이 네 가지 모두 한 분석가의 반복 검증되지 않은 게시물에 근거한다.

• 또한 확인되지 않은 점: 이 익명 모델이 GLM-5.3 자체와 실제로 구별되는지 여부다. 라벨이 없는 별칭으로 운영되는 실제 GLM-5.3 엔드포인트라면 동일한 서빙 핑거프린트를 생성할 것이다. 이름, 모델 카드, 또는 가중치 공개가 이를 해결하기 전까지는 "새 모델"이라는 해석이 강한 사전 확률이지만 사실은 아니다.

다음에 볼 콘텐츠

• 8월 28일 금요일 — GLM-5.3 가중치. 익명 모델이 실제로 이름만 바뀐 5.3 또는 5.3-Vision이라면, 가중치 공개와 모델 카드가 빠르게 판가름해 줄 것입니다.

• 두 번째 확증 관측. 한 분석가의 지문은 가설일 뿐이며, 동일한 익명 항목에 대한 두 번째 독립적 판독 또는 그것을 명명하는 Artificial Analysis 목록은 이를 증거로 끌어올린다.

• Z.ai의 어떤 발표든. GLM-5.5가 8월 출시 예정으로 보고되었는데, 이제 그 달이 거의 끝나가고 있다. 공식 명명, 가격 페이지, 또는 API 변경 로그 항목이 이 유출을 출시 스토리로 바꾸는 사건이다.

• AA 점수가 61에서 실현되는지 여부. 익명의 모델이 실제이고 G​LM 계열이라면, 61에 가까운 독립 지수 점수는 60을 넘는 최초의 오픈 가중치 수치가 될 것입니다.

• vLLM 어텐션 작업에 모델 이름이 붙는지 여부. PR #53785은 5.3-Vision이나 5.5를 명명하지 않고 'GLM-5' 헤드 차원을 대상으로 합니다. 병합, 지원 모델 목록 항목, 또는 해당 지오메트리를 특정 이름과 짝지은 모델 카드가 지금까지 가장 강력한 신호가 될 것입니다.

이런 누출에 어떻게 대응해야 하는가

유출은 플랫폼을 갈아탈 이유가 아니라 대비할 이유다. 다음 G​LM 계열 모델이 오픈 가중치 리더보드 최상단 또는 그 근처에 오른다면, 실질적인 질문은 실제 트래픽을 그 모델로 라우팅할 것인지다. 공급업체의 주장과 한 분석가의 전망만 믿고 검증되지 않은 모델을 쓰는 것은, 베팅을 걸기보다 안전망을 두어야 하는 바로 그런 경우다. 지난주 출시된 GLM-5.3은 이미 OrcaRouter에서 운영 중이다. 모델 페이지에는 100만 토큰당 $1.26/$3.96으로 표시되는데, 이는 공급업체 정가 $1.40/$4.40에서 10% 출시 할인된 가격이며 마크업 없이 그대로 전달된다. 5.5나 5.3-Vision이 출시되는 날 물려받게 될 라우팅 구성도 바로 이것이다. 라우터를 통해 새 모델로 일부 트래픽을 보내고 검증된 모델(GLM-5.3, DeepSeek V4 Pro, GPT-5.6 Sol)로 자동 장애 조치(failover)되도록 설정하면, 슬라이드 덱이 아닌 자체 워크로드에서 품질 신호를 얻는다. 유출된 전망이 맞다면 가장 먼저 알게 되고, 틀리면 장애 조치가 흡수하므로 고장 난 채로 출시되는 일은 없다. 동일한 키, 추가 계약 불필요, 그리고 Z.ai가 결정하기 전까지 두 후보 이름 중 하나를 고를 필요도 없다.

다음 G​LM이 곧 출시된다 — 유일한 미정 사항은 어떤 이름을 달고 나오느냐다. GLM 5.3-Vision은 Z.ai가 방금 출시한 모델에서 가장 많이 지적받던 격차를 해소하는 버전이 될 것이고, GLM 5.5는 한 달 내내 업계가 주목해온 조 단위 파라미터의 플래그십이 될 것이다. 8월 20일에 지문이 포착된 익명의 항목 teortaxesTex는 둘 중 하나로 보이는 첫 번째 구체적 대상이며, AA Intelligence Index에서 예상되는 61점은 현재 리더보드에 있는 모든 오픈 가중치 모델보다 앞서는 수치다. 지문 포착 5일 후, 서빙 스택도 움직였다. vLLM의 G​LM-5 어텐션 작업은 특정 변형을 명시하지 않지만, 새 모델이 남기는 전형적인 기반 작업이다. 이 중 어느 것도 확정되지 않았으며, 이름, 카드, 또는 가중치가 이를 확정하는 즉시 이 페이지를 업데이트할 것이다. 그때까지는 라우팅을 준비해 두는 것이 안전한 선택이다 — 지문 하나에 스택을 걸지 않는 것이다.

The OrcaRouter model page for z-ai/glm-5.3, showing the model id, capability chips (Tools, JSON, Reasoning), a 1,000,000-token context window, a 128,000-token max output, text input and text output, and pass-through pricing of $1.26 per 1M input tokens and $3.96 per 1M output tokens.