'Ox Alpha' 기사의 히어로 타이틀 카드로, 부제는 'Z.ai의 GLM-5.3-Flash 뒤에 있는 스텔스 별칭에 관한 표준 참조 페이지'이며, 칩에는 '2026년 8월 20일부터 Ox Alpha로 사전 공개', '2026년 8월 26일 공개', '총 320B / 활성 18B, 1M 컨텍스트', 'MIT 라이선스, 오픈 웨이트'가 표시되고, 하단 문구는 '엔벨로프, 모달리티, 요금표, 엔드포인트 표면 및 벤치마크 - 2026-09-28 검증됨'입니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Ox Alpha: 이제 GLM-5.3-Flash로 출시되는 스텔스 모델의 완전한 스펙 시트

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Ox Alpha는 GLM-5.3-Flash가 미리 공개될 때 사용된 익명 이름이며, 2026년 8월 26일에 공개되었고, 오늘날 호출할 수 있는 모델이 아닙니다. Ox Alpha라는 이름을 달고 있던 프리뷰 목록은 더 이상 이 모델을 제공하지 않습니다. 그 아래에 있는 모델에는 벤더 페이지, MIT 라이선스 가중치, 공개된 요금표, 문서화된 API 표면이 있으며, 이들은 모두 Z.ai의 것입니다. 이 페이지는 그 모델에 대한 참조 자료입니다 — 엔벨로프, 모달리티, 요금표, 엔드포인트 표면, 개정판이나 하네스가 함께 명시된 모든 공개 벤치마크 수치, 그리고 그 별칭이 여전히 빈약하고 혼란스러운 검색 결과를 반환하기 때문에 어디에도 문서화되지 않은 것이 무엇인지에 대한 명확한 서술까지 담고 있습니다. 아래의 모든 내용은 2026-09-28에 Z.ai 자체 모델 문서와 가격 페이지, Hugging Face의 Z.ai 모델 카드, Artificial Analysis, 그리고 자체 카탈로그에서 읽은 것입니다. 벤더가 공개하는 수치와 독립적인 주체가 측정한 수치는 별도로 표시하며, 여기에서 유사성으로부터 추론한 것은 아무것도 없습니다.

Ox Alpha라는 이름이 오늘날 무엇을 가리키는가

해당 별칭은 폐기되었고, 그것을 폐기한 것은 바로 그 벤더다. Z.ai가 GLM-5.3-Flash에 대해 제공하는 자체 문서에 따르면, 이 모델은 출시 전에 사용자 피드백을 수집하기 위해 ox-alpha라는 이름으로 익명 테스트되었으며, 그 익명 운영은 그 주 가장 인기 있는 모델이 되었다고 한다. 날짜를 특정할 수 있는 단서는 짧고 구체적이다. 스텔스 목록에는 Ox Alpha가 2026년 8월 20일에 출시된 것으로 표시되었고, 공개는 8월 26일에 이루어졌다. 이는 Z.ai의 문서 페이지에 기재된 날짜이자, 우리 자체 카탈로그가 z-ai/glm-5.3-flash에 대해 기록한 출시 날짜와도 같다.

그로부터 두 가지가 뒤따르는데, 둘 다 그 이름을 검색한 독자에게 중요하다.

• 별칭은 라우트가 아닙니다. 저희 카탈로그는 스텔스/ox-alpha 조회에 대해 "model not found"를 반환합니다, 2026-09-28 확인 기준. 그 이름으로 호출할 대상은 없습니다. 왜냐하면 벤더의 제품은 벤더의 이름을 달고 있기 때문입니다.

• 해당 별칭으로 벤더가 소유한 가중치 저장소도 없습니다. Hugging Face에서 ox-alpha를 검색하면 2026년 8월 말의 스텔스 기간 동안 생성된 커뮤니티 업로드와, 가중치를 포함하지 않고 Z.ai의 공식 릴리스를 가리키는 2026년 9월 27일의 카드 전용 저장소가 반환됩니다. 저장소 이름은 업로더가 선택한 라벨일 뿐이며, 그 자체로 어떤 문서도 아닙니다. Z.ai 자체 조직은 모델을 다음과 같이 공개합니다: zai-org/GLM-5.3-Flash, 해당 저장소는 2026-08-25(UTC)에 생성되었습니다.

에는 발견 이야기—공개에 앞선 핑거프린팅, 그것이 속한 익명 모델 계보, 그리고 함께 나온 서빙 하드웨어 공개—가 실려 있습니다. 익명 주간을 지배했던 제공자 문제는 종결되었고, 평범한 방식으로 종결되었습니다: 한 연구소가 나서서 모델에 자기 이름을 붙였습니다. 남은 것은 명세이며, 이 페이지에서 다루는 것이 바로 그것입니다.옥스 알파 조사에 관한 저희 이전 기사, 그리고 이 페이지는 그중 어느 것도 재론하지 않습니다.

공급업체가 문서에 기재한 대로의 엔벨로프

A screenshot of Z.ai's official developer documentation page for GLM-5.3-Flash, showing the Model Overview section with the four spec rows on the right reading Input Modality 'Video / Image / Text / File', Output Modality 'Text', Context Length '1M' and Maximum Output Tokens '128K', alongside vendor-stated architecture notes describing 320B total parameters with 18B activated and a hybrid sparse-and-linear attention design that reduces attention computation and KV cache by 3.01x and 4.44x versus GLM-5.3.

이는 Z.ai가 보고한 수치로, 2026-09-28에 공급업체 자체 문서 페이지에서 확인한 것이며, 네 가지 엔벨로프 차원 중 세 가지는 독립적으로 뒷받침됩니다 — Artificial Analysis의 모델 기록에도 동일한 총 320B, 활성 18B, 1,000,000토큰 컨텍스트 및 MIT 라이선스가 담겨 있고, 우리 자체 카탈로그 카드에는 컨텍스트 및 출력 제한이 담겨 있습니다.

• 컨텍스트 윈도우 — 1,000,000 토큰 (Z.ai 문서, Artificial Analysis, 1,000,000으로 기재된 자체 카탈로그 카드)

• 최대 출력 — 128K 토큰(Z.ai 문서); 당사 카드에는 128,000으로 기록됨

• 입력 — 텍스트, 이미지, 동영상 및 파일 (Z.ai 문서, 2026-09-28 열람); 우리 카드에는 텍스트, 이미지, 동영상이 나열되어 있으며 파일 입력을 주장하지 않습니다

• 출력 — 모든 소스에서 텍스트만

• 파라미터 — 총 320B, 토큰당 18B 활성화(Z.ai 문서 및 모델 카드; Artificial Analysis는 320B와 18B를 독립적으로 기록)

• 라이선스 — MIT, 가중치는 Hugging Face에 공개(벤더 모델 카드, Artificial Analysis는 이 모델을 허용적 라이선스 하의 오픈 웨이트로 분류)

• 아키텍처 — 희소 어텐션과 선형 어텐션의 하이브리드로, Z.ai는 이것이 두 방식을 결합한 최초의 오픈소스 프런티어 모델이라고 설명한다. GLM-5.3 대비 어텐션 연산은 3.01×, KV 캐시는 4.44× 줄였으며, 긴 컨텍스트에서 네 개의 인덱서 키 벡터를 하나로 압축하는 IndexPool 단계와 확장 효율을 위한 Manifold-Constrained Hyper-Connections를 갖췄다. 모두 벤더 측이 밝힌 내용이며, 인용할 수 있는 독립적인 아키텍처 감사는 없다.

• 사전 학습 — 30조 토큰 규모의 멀티모달 코퍼스(Z.ai 발표 기준). 공급업체는 총 학습 컴퓨팅 수치를 공개하지 않으며, 320B/18B라는 대표 수치 외에는 레이어별 파라미터 내역도 공개하지 않는다.

하나의 포괄적 주장은 출시 이후 범위가 좁아졌으며, 인용할 것은 현재 문서다. 8월에 유포된 서빙 하드웨어 공개 내용은 익명의 주간 용량을 약 10만 개의 중국산 칩으로 제시했다. 오늘 기준으로 읽히는 Z.ai 문서는 해당 모델이 "수만 개의 자국에서 개발된 가속기에 걸쳐" 서빙되었다고 말하며, 동일 하드웨어에서 벤더 자체 기준선 대비 3배의 엔드투엔드 서빙 개선과 벤더가 주류 NVIDIA GPU에 견줄 만하다고 설명하는 토큰당 비용을 제시한다. 수만 개가 현재 페이지가 말하는 수치이고, 더 큰 수치는 출시 당시의 것이다. 둘 다 회사 주장이며, 어느 것도 독립적으로 감사되지 않았고, 수정 방향은 하향이다.

요율표, 그리고 왜 실제 송출된 숫자가 중요한가

Z.ai의 가격 페이지에는 GLM-5.3-Flash가 100만 입력 토큰당 $0.15, 100만 캐시된 입력 토큰당 $0.03, 100만 출력 토큰당 $0.50로, 자매 FlashX 티어는 $0.37 / $0.075 / $1.25로 기재되어 있습니다. 이는 2026-09-28에 공급업체 자체 페이지에서 확인한 공급업체의 정가입니다.

오늘 우리 경로에서 실제로 적용된 요율이 더 낮으며, 바로 이 점이 이 절의 실질적인 핵심입니다. 2026-09-28에 확인한 결과, z-ai/glm-5.3-flash에 대한 OrcaRouter 카드는 입력을 $0.075백만 토큰당, 출력을 $0.25백만 토큰당, 캐시 읽기를 $0.0173백만 토큰당으로 책정하고 있습니다. 이는 같은 모델, 같은 날짜에 공급업체의 정가의 절반입니다. 즉 헤드라인 요율이 아니라 할인된 수치이며, 카드에는 프로모션 표시가 없습니다. 이 모델에 관한 우리의 이전 보도에서도 명시된 프로모션 기간이 끝난 뒤 같은 격차를 지적한 바 있습니다. 그 관찰은 오늘도 여전히 유효하고, 우리는 여전히 그 이유를 확인할 수 없기에, 적용된 수치를 보도하고 원인은 열어 둡니다.

캐시된 입력은 세 출처가 눈에 띄게 엇갈리는 부분이며, 이는 표에 있는 "$0.03"이 반드시 누군가 실제로 지불하는 가격은 아니라는 유용한 경고가 된다. 공급업체 페이지에는 캐시된 입력 토큰 100만 개당 $0.03이라고 적혀 있고, Artificial Analysis의 모델 기록에는 캐시 적중 가격이 $0.026으로 기재되어 있으며, 우리 라우트는 캐시 읽기를 $0.0173에 제공한다. 세 수치 모두 2026-09-28 또는 그 직전에 읽혔으며, 모두 공급업체 또는 플랫폼이 보고한 값이다. 우리는 공급업체의 리스트 수치를 리스트 수치로 인용하고, 제공 수치는 호출자가 실제로 청구받는 금액으로 인용한다.

대표적인 에이전트 작업을 기준으로 계산해 보겠습니다 — 입력 토큰 100,000개, 출력 토큰 10,000개, 캐시 적중 없음:

• 공급업체 목록 요율 기준 — 100,000개 토큰 × $0.15/1M = $0.015, 여기에 10,000개 × $0.50/1M = $0.005를 더하면 호출당 $0.020

• 오늘 우리 루트가 제공하는 요율로 — $0.0075 더하기 $0.0025, 즉 통화당 $0.010, 정확히 절반

워크로드 규모를 산정하기 전에 정가가 아니라 실제 적용 가격을 확인해야 하는 이유가 바로 여기에 있습니다. 하루에 수천 건의 호출을 실행하는 장기 실행 에이전트에서는 이 두 숫자의 차이가 곧 두 예산의 차이입니다. OrcaRouter는 공급자의 정가를 0% 마크업으로 그대로 전달하기 때문에, 공급업체가 진행 중인 할인이 중간 어디선가 흡수되지 않고 우리 카드에 그대로 표시됩니다.

모달리티 및 엔드포인트 표면

벤더는 하나의 인터페이스 형태와 두 모델 코드를 문서화합니다: glm-5.3-flash 및 glm-5.3-flashx, 둘 다 Chat Completion API를 통해 제공됩니다. 이미지는 메시지 콘텐츠 배열에 type이 image_url인 콘텐츠 블록으로 들어가며, URL — 벤더가 권장함 — 또는 base64 데이터 URL 중 하나를 사용하고, 한 메시지에 여러 이미지 블록을 보낼 수 있습니다. 스트리밍이 지원되며, Z.ai는 스트리밍 요청에 대해 stream과 tool_stream을 함께 활성화할 것을 권장합니다. 도구 호출, 컨텍스트 캐싱, 구조화된 JSON 출력은 모두 문서화된 기능입니다. thinking은 지원되지만, 다음 섹션에서 설명하듯이 선택 사항은 아닙니다.

FlashX는 별도의 기능이 아니라 동일한 모델의 별도 서빙 티어입니다: Z.ai는 이를 초당 200토큰으로 문서화하고 있으며, 아직 GLM Coding Plan에서는 사용할 수 없다고 밝히고 있습니다. 이는 우리 카탈로그가 제공하는 티어가 아니며, 이 페이지의 수치가 설명하는 대상도 아닙니다.

우리 라우트에서는 엔드포인트 표면이 더 좁기 때문에 정확히 명시할 가치가 있습니다. z-ai/glm-5.3-flash의 카드는 POST /v1/chat/completions를 노출합니다 — 채팅 완성 전용이며 두 번째 프로토콜 엔드포인트는 없습니다 — 그리고 reasoning, reasoning_effort, include_reasoning, tools, tool_choice, response_format, stream, temperature, top_p, max_tokens, stop을 받습니다. 카드의 기능 칩은 vision, tools, JSON, reasoning입니다. 컨텍스트는 1,000,000 토큰이고 최대 출력은 128,000으로, 벤더 문서와 일치합니다.

노력과 사고: 모든 벤치마크 수치를 고정하는 설정

이것은 점수를 읽는 방식을 가장 크게 바꾸는 사양의 일부이며, 벤더는 이를 정확히 문서화합니다. GLM-5.3-Flash는 reasoning_effort 매개변수를 받습니다. 이 매개변수는 세 가지 수준 — low, high, max — 을 가지며, 아무것도 전달하지 않거나 low 또는 high가 아닌 값을 전달하면 max로 기본 설정됩니다. Thinking은 끌 수 없습니다: 벤더는 thinking.type이 enabled만 지원한다고 명시합니다. 채팅 템플릿의 clear_thinking 플래그는 기본값이 false이며, Z.ai는 채팅 시나리오에서 이를 명시적으로 true로 전달할 것을 권장합니다. 벤더가 권장하는 샘플링 설정은 temperature 1 및 top_p 0.95이며, 벤치마크 및 리더보드 재현 시에는 기본 max effort를 유지해야 한다고 분명히 밝힙니다.

그 두 가지 사실을 함께 읽으면, 숫자를 비교하는 사람이라면 누구나 피할 수 없는 귀결이 나옵니다: effort 수준 없이 인용된 점수는 완전한 측정이 아닙니다. low, high, max 설정은 같은 모델의 서로 다른 운영 지점이고, 기본값은 세 가지 중 가장 비용이 많이 드는 설정이기 때문입니다. 우리 카드는 지원되는 매개변수 중 reasoning과 reasoning_effort를 노출하므로, 이 설정은 벤더를 통해서만이 아니라 라우트를 통해서도 접근할 수 있습니다.

개정본이 첨부된 벤치마크 시트

Z.ai는 GLM-5.3-Flash에 대한 벤치마크 표를 공개했는데, 이는 전적으로 벤더가 보고한 내용이며 — Artificial Analysis의 독립적인 기록은 이 항목들을 재현하지 않는다. 벤더가 내세운 코딩 및 에이전트 지표는 DeepSWE v1.1에서 GLM-5.2의 46.2 대비 63.4이고, AutomationBench v1.0.6에서는 GLM-5.2의 26.2 대비 48.8이다. 우리 자체 카탈로그가 Z.ai를 명시된 출처로 기재한 대로, 표의 나머지 항목은 다음과 같다: 도구를 사용한 Humanity's Last Exam 55.3, Agents' Last Exam 26.3, NL2Repo 56.3, 도구를 사용한 Chartography 78, 도구를 사용한 CharXiv 추론 89.4, 그리고 비전 부문에서는 MMVU 80.5, MVBench 77.8, BabyVision 53.4이다.

두 공급업체 행은 각주를 문장 안으로 함께 가져올 만하다. 독자가 각주 없이 인용할 가능성이 가장 높은 항목이기 때문이다. Z.ai의 사내 코딩 평가인 Z.ai Code Bench v1.0에서는 GLM-5.3-Flash에 최대 노력(max effort)에서 29.0, Claude Opus 4.8에 29.5 점수를 매긴다 — 공급업체 자체 하네스에서의 거의 동점이며, Claude Code 2.1.207에서 실행되었고, 공급업체가 보고한 결과다. 이는 독립적인 비교가 아니며 제3자가 수행한 matched-effort 비교도 아니다. Z.ai가 자체 평가에서 자기 모델을 경쟁사와 벤치마킹한 것이다. 그리고 해당 공급업체는 작업당 $0.045에 Artificial Analysis Intelligence Index 57을 인용하며, 리비전을 v4.1.1로 명시한다.

그 마지막 수치는 오늘 Artificial Analysis가 발표하는 것과 분리해서 봐야 합니다. 두 가지는 하나의 움직임으로 나란히 놓을 수 없기 때문입니다. 2026-09-28에 확인한 GLM-5.3-Flash에 대한 Artificial Analysis 자체 페이지는 Intelligence Index가 41.8Index v4.3.2로, 최대 노력에서 기록되었다고 보고합니다. v4.3.2는 열 가지 평가 — AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience 및 AA-LCR v1.1 — 를 포함하며, v4.1.1은 그렇지 않았습니다. 두 번의 지수 개정, 두 개의 작업 세트, 두 개의 숫자. 어느 쪽도 틀리지 않습니다. 그것들은 같은 측정이 아니며, 모델이 움직인 것처럼 57을 41.8 옆에 인용하는 것은 어느 방향으로든 실수가 될 것입니다.

독립적인 기록이 확증하는 것은 점수보다는 전체 사양입니다: Artificial Analysis는 320B 총 파라미터, 18B 활성화, 1,000,000토큰 컨텍스트 창, MIT 라이선스, 오픈 가중치, 2026-08-26 출시일을 독립적으로 기록하며, 백만 토큰당 입력 $0.15, 출력 $0.50, 캐시 적중 가격 $0.026의 벤더 가격을 나열합니다. 벤더가 점수를 공개하고 독립 주체가 공개하지 않는 경우, 우리는 그렇게 말합니다; 독립 주체가 사양을 확인하는 경우, 그것이 이 페이지에서 가장 강력한 종류의 사실입니다.

여기에는 조건을 맞춘 일대일 비교가 없으며, 없다고 말하는 편이 억지로 하나를 만들어 내는 것보다 더 유용하다. 공통 하네스에서 명시된 effort로 GLM-5.3-Flash를 Claude Opus 4.8, GPT-6 Sol 또는 Grok 4.7과 맞붙여 실행한 결과를 공개한 곳은 아무도 없다 — Z.ai 자체 비교는 자사 벤치에서 최대 effort로, 경쟁사 기본값을 상대로 한 것이다. 그 상황이 바뀌기 전까지, 이 모델과 다른 무엇을 비교하는 정직한 기준은 가격, 지원 범위, 엔드포인트 표면이며, 이는 이 페이지에서 누구나 같은 숫자로 확인할 수 있는 세 가지다.

문서화되지 않은 것, 쉽게 말해

정보 표면이 얇은 모델에 대한 참조 페이지는 빈틈에 대해 솔직할 때만 유용한데, 이 페이지에는 그런 빈틈이 여러 개 있다.

• 벤더 지식 컷오프 없음. Z.ai의 문서와 Hugging Face 모델 카드에는 이에 대해 명시하지 않으며, Artificial Analysis의 기록에서는 해당 필드를 null로 남겨 둡니다. 스텔스 윈도우에서 나온 추정치는 커뮤니티 작업물이지 벤더 수치가 아니며, 이 페이지는 그것을 마치 그런 수치인 것처럼 반복하지 않습니다.

• 대부분의 벤치마크 시트에는 하네스 각주가 없다. 모델 카드에는 HLE 도구 사용 실행에 대한 각주가 실제로 있다 — temperature 1.0, top_p 0.95, 163,840 토큰 최대 생성 길이, 컨텍스트 관리 전략을 사용한 최대 300,000 토큰 컨텍스트에서의 평가, 그리고 판정 모델로서 medium effort의 GPT-5.6 Luna — 그리고 벤더에 따르면 mini-swe-agent 하네스로 실행되었다고 하는 NL2Repo와 DeepSWE에 대한 각주도 있다. 나머지 행들은 하네스나 effort에 대한 정보가 첨부되지 않은 숫자만 있는 백분율이다.

• 캐시된 입력 가격 차이에 대한 설명이 없다. 동일 모델의 동일 수량에 대해 세 가지 수치가 제시되어 있는데, 왜 서로 다른지 밝히는 출처는 없다.

• 익명 서빙 기간에 대한 독립적인 벤치마크는 없습니다. 스텔스 리스팅은 사라졌고, 그것이 측정한 것은 무엇이든 다시 측정할 수 없으며, 그것이 라이브였을 때 별칭을 대상으로 한 실행을 게시한 제3자는 없었습니다.

• 위에서 제시한 이유로, 동일한 수준의 노력을 기울인 제3자 비교는 없습니다.

• 출시 당시 칩 수에 대한 벤더의 확인은 없습니다. 문서에는 국산 가속기가 수만 개라고 나와 있으며, 10만 개라는 수치는 해당 페이지에 없습니다.

결론부터 말하자면: 우리 카탈로그가 제공하는 것, 오늘 검증됨

A single-column reference scoreboard titled 'GLM-5.3-Flash, the model behind Ox Alpha', with six rows reading 'Context: 1,000,000 tokens', 'Max output: 128K tokens', 'Input / output: text, image, video in / text out', 'Parameters: 320B total, 18B active, MIT licence', 'Vendor list price: $0.15 in / $0.50 out per 1M, $0.03 cached', and 'Served on OrcaRouter: $0.075 in / $0.25 out per 1M'. A footer line reads 'Z.ai-reported envelope and list price; OrcaRouter card read 2026-09-28; Artificial Analysis independently confirms 320B/18B, 1M context and MIT.' The OrcaRouter logo is composited in the bottom-right corner.

Ox Alpha의 기반 모델은 자체 이름으로 우리 카탈로그에 라이브 상태이며, 오늘 추정이 아니라 확인했습니다. 2026-09-28에 z-ai/glm-5.3-flash에 대한 OrcaRouter 모델 API를 조회한 결과 전체 카드가 반환되었습니다: 1,000,000토큰 컨텍스트, 최대 출력 128,000, 텍스트·이미지·비디오 입력과 텍스트 출력, 기능 칩 vision, tools, JSON 및 reasoning, 출시일 2026-08-26, 지원 중단되지 않았고 목록에서 제외되지 않았으며, 가격은 백만 입력 토큰당 $0.075, 백만 출력 토큰당 $0.25, 백만 캐시 입력 토큰당 $0.0173이고, 단일 엔드포인트 POST /v1/chat/completions를 통해 제공됩니다.

그 카드에 대한 저희 자체 7일간 플레이그라운드 측정값은 같은 기간 기준으로 초당 출력 토큰 61.8개, 첫 토큰까지 걸리는 시간 p50 7.39초, 오류율 1.47%로 나타납니다. 이는 저희 서빙에 관한 퍼스트파티 수치이며, 벤더 수치도 독립적인 벤치마크도 아닙니다. 그런 이유로 이 페이지에 있는 유일한 속도 수치입니다.

이 별칭 자체는 라우트에 없습니다. Ox Alpha를 검색하다가 이곳에 도착했다면, 호출할 모델은 z-ai/glm-5.3-flash이며, 요청 형태는 위에서 설명한 것과 같습니다. 이 모델은 카탈로그의 다른 모든 항목과 동일한 키 위에 있습니다 — 200개 이상의 모델을 아우르는 단일 API, 제공업체 가격이 추가 마진 없이 그대로 전달되며, 제공업체가 멈출 경우 자동 페일오버가 지원되므로, 테스트 중인 모델이 프로덕션 경로가 의존하는 모델일 필요는 없습니다.

A screenshot of the OrcaRouter model page for Z.ai GLM-5.3-Flash (z-ai/glm-5.3-flash), showing the model name and provider, a 1M-token context window with 128K maximum output, text, image and video input with text output, a stat strip reading $0.075 input and $0.25 output per million tokens, the capability chips Vision, Tools, JSON and Reasoning, a release date of 2026-08-26 and a supported-endpoint line reading POST /v1/chat/completions, with a code sample against the OpenAI-compatible base URL https://api.orcarouter.ai/v1.

이 페이지가 무엇인지에 대해 한 가지 분명히 해두겠습니다. 모델의 이름을 따라 이곳에 도착한 독자라면 마땅히 그래야 하니까요. 이것은 이미 카탈로그에 등록된 모델에 대한 참조 페이지이며, 출시 보고서가 아닙니다: GLM-5.3-Flash는 2026년 8월 26일의 모델이고, 이곳에 자리한 이유는 릴리스의 신선도 때문이 아니라 Ox Alpha라는 이름이 계속 검색되지만 도착할 전용 페이지가 없기 때문입니다. 위의 날짜는 뉴스로서가 아니라 모델의 날짜를 명시하기 위해 사용됩니다. 이 페이지를 바꿀 수 있는 것은 다음 네 가지 중 하나입니다 — 명시된 노력 수준에서 수행된 독립 벤치마크, 벤더가 명시한 지식 컷오프, 제공 요율의 변동, 또는 출시 당시 칩 수가 실제로 어땠는지 밝히기로 한 Z.ai의 결정. 그중 하나가 실현되기 전까지, 위의 사양은 벤더가 문서화한 전부이며, 이전 섹션에 나열된 공백은 숫자만큼이나 답의 일부입니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트