GLM-5.3 は、Z.ai(Zhipu AI)の複雑なソフトウェアエンジニアリングおよび長期的なエージェントタスク向けの最新フラッグシップモデルです。GLM-5.2 と比較してコーディング体験が約50%向上し、厳選されたサイバーセキュリティ機能では Mythos 5 に匹敵し、生のパフォーマンスとトークン効率のより良いバランスを実現しています。リポジトリ規模のコーディング、自律的な多段階エンジニアリング、そして長期的に一貫性を維持する必要があるエージェントワークフロー向けに構築されたテキスト入力・テキスト出力モデルです。 GLM-5.3 は GLM-5 ラインと同じ API サーフェスを使用しますが、呼び出し側が対応する必要がある変更が2つあります。思考は常にオンです(thinking.type は enabled のみを受け付け、disabled を渡すとリクエストが失敗します)。また、推論の深さは reasoning_effort によって制御され、値は low / high / max で、デフォルトは max です。ネイティブのツール呼び出しと構造化 JSON 出力をサポートし、OpenAI 互換の chat-completions 形式に対応しています。
GLM 5.3は、プロバイダーz-aiに登録され、OrcaRouterを通じて提供される大規模言語モデルです。カタログエントリでは、テキストのみ対応で、最大1,000,000トークンの入力コンテキストと最大128,000トークンの生成に対応すると説明されています。つまり、このモデルは書籍全体や大規模なコードベースを単一のプロンプトとして受け入れ、さらに長い回答のためのスペースを確保できます。マルチ…
100万トークンのコンテキストを持つGLM 5.3は、従来であれば多数のチャンクに分割する必要があったドキュメントを処理できます。小説全体、長い技術マニュアル、何百ページにも及ぶ会話履歴をプロンプトに入れることができます。主な実用的な利点は、回答時にモデルがすべての素材を一度に考慮できることです。これにより、要約、事実抽出、比較分析などのタスクが、カスタム検索ロジックなしで可能になります。また、会話全体がコンテキストウィンドウに残るため、後続のターンで大量のテキストについて質問することもできます。ただし、100万トークンのプロンプトは無料ではありません。入力トークンは100万あたり1.40ドルで請求されるため、フルプロンプトのコストはおよそ1.40ドルになり、その数には出力は含まれません。カタログに専用の検索機能は記載されていないため、モデルは単にコンテキスト内にあるものを使用します。
GLM 5.3 の最大出力長は 128,000 トークンです。これは、多くのモデルで一般的な 4,000 から 8,000 トークンのデフォルト制限をはるかに上回ります。これにより、モデルは長いレポート、コードファイル、機械翻訳、複数章にわたる下書きを一度の呼び出しで生成できます。出力価格が 100 万トークンあたり $4.40 の場合、128,000 トークンの回答は出力トークンでおよそ $0.56 のコストになります (128,000 / 1,000,000 * 4.40)。単語あたりの実際のトークン数は異なりますが、これにより上限コストの概算が把握できます。OrcaRouter の課金はトークンベースであるため、出力が短いほどコストは比例して低くなります。出力制限をより高く設定できるという表示はありません。128,000 がカタログに記載されている上限です。アプリケーションを設計する際は、モデルが大量のテキストを生成できるため、非常に長い出力ストリームを処理するか、ストリーミングを使用して結果を段階的に表示する必要があるかもしれません。
カタログによると、Z.ai GLM 5.3 の入力モダリティはテキストです。これは、このモデルが会話履歴、システムプロンプト、ユーザーコンテンツを含むプレーンテキストメッセージを受け付けることを意味します。画像、音声、動画、その他のバイナリコンテンツは受け付けません。これは、特定のタスクにモデルを選択する際の重要な制約です。パイプラインでスクリーンショットを読み取ったり、録音を分析したり、動画を分類したりする必要がある場合は、マルチモーダルモデルか、GLM 5.3 を呼び出す前に別途文字起こし・ビジョン処理のステップが必要になります。コンテキストウィンドウは大きいものの、コンテンツは依然としてテキストであり、PDFファイルを直接添付することはできません。先にテキストを抽出する必要があります。このモデルは、長いテキスト形式のJSON、コード、ログ、記事を処理できます。テキストのみのワークロードでは、大きなコンテキストが有用かもしれませんが、他のモダリティが必要な場合は、OrcaRouter で別のモデルを探してください。
GLM 5.3の大規模なコンテキストと長い出力は、トークンあたりの価格が一部の小規模モデルより高くなります。タスクに必要なコンテキストが数千トークンだけで、短い応答で十分な場合、より安価なモデルでも低コストで良い結果が得られる可能性があります。OrcaRouterはさまざまな価格帯の多数のモデルを提供していますが、このカタログエントリには代替案は記載されていません。一般的なルールとして、単一の呼び出しで大きなコンテキストや非常に長い出力が必要な場合、およびその機能がコストを正当化する場合は、GLM 5.3を使用してください。タスクを小さな部分に分割できる場合や、より短いコンテキストで十分な場合は、小規模モデルの方が入力トークンが少なくなり、費用対効果が高くなる可能性があります。また、レイテンシも考慮してください。モデルに関係なく、100万トークンのプロンプトの処理は短いプロンプトの処理よりも時間がかかります。選択は本番環境の要件によって異なります。
Z.ai GLM 5.3 の OrcaRouter カタログエントリには、ベンチマークスコアが含まれていません。つまり、このリストには MMLU、HumanEval、その他の標準評価で引用できる公式な数値が存在しないということです。独自のテストプロンプトを実行し、自分のドメイン上で出力を比較することで、モデルを自分で評価することは依然として可能です。ベンチマークデータが提供されていないため、特定のタスクにおける相対的な品質に関する主張には注意を払う必要があります。提供されている具体的な数値は、コンテキストウィンドウ、最大出力、価格のみです。GLM のような言語モデルファミリーについては、外部の出版物が一般的な情報を提供する場合がありますが、ここにベンチマーク表がないということは、最も安全なアプローチは代表的なタスクで測定することです。OrcaRouter の API を使用して、他のモデルとのサイドバイサイド評価を実行できますが、収集した結果はグローバルなランキングではなく、あなたのユースケースに適用されます。
GLM 5.3のカタログにはレイテンシの数値が記載されていないため、正確な速度を報告することはできません。一般に、応答時間はいくつかの要因に依存します:入力プロンプトの長さ、出力で要求されるトークン数、上流プロバイダーの現在の負荷、およびネットワーク状況です。1,000,000トークンのプロンプトを持つリクエストは、生成前にモデルがそのテキストをすべて読み取る必要があるため、短いプロンプトよりも処理にかなり時間がかかります。出力生成時間も出力トークン数に応じて増加します;128,000トークンの応答は非常に遅くなる可能性があります。インタラクティブなアプリケーションでは、ストリーミングを使用して、生成されたテキストをすぐに受け取り始めるとよいでしょう。OrcaRouterのOpenAI互換APIは標準のストリーミングパラメータをサポートしていますが、実際のスループットはz-aiプロバイダーによって決まります。ワークロードのレイテンシを理解するために、代表的なリクエストをテストすることをお勧めします。
GLM 5.3の主な制限は、そのカタログ仕様に起因します。テキストのみ対応であるため、画像、音声、動画をネイティブに処理できず、それらの形式のコンテンツは先にテキストへ変換する必要があります。コンテキストウィンドウは1,000,000トークンですが、これを最大限に使用するとリクエストが大きくなり、コストとレイテンシに影響します。最大出力は128,000トークンですが、そのような出力を生成するには時間がかかり、ストリーミングを使用しない場合はプロバイダーのタイムアウトに遭遇する可能性があります。カタログにはベンチマークスコアが記載されていないため、他のモデルよりすべてのタスクで優れていると想定すべきではありません。最後に、すべての言語モデルと同様に、出力が不正確または幻覚を含む可能性があるため、重要な情報は検証する必要があります。トークン数は概算であり、100万トークンのプロンプトは実用的な上限であって、モデルがあらゆる長いプロンプトを完璧に処理することを保証するものではありません。
GLM 5.3 はトークン単位で課金されます。表示されている入力価格は 1,000,000 トークンあたり $1.40、出力価格は 1,000,000 トークンあたり $4.40 です。OrcaRouter はマークアップを加算しません。請求額はプロバイダーの料金とまったく同じです。入力トークンには、プロンプト、システム指示、送信した会話履歴が含まれます。出力トークンはモデルが生成するトークンです。ほとんどの API はプロンプトと生成テキストの両方をカウントします。このモデルも標準的なトークン単位の課金に従います。このリストには月額サブスクリプションはなく、別途固定料金についての記載もありません。リクエストの総コストは、(入力トークン / 1,000,000) * 1.40 に (出力トークン / 1,000,000) * 4.40 を加えて計算されます。10,000 入力トークンと 1,000 出力トークンのリクエストの場合、コストは $0.014 と $0.0044 を合わせて、合計約 $0.0184 になります。
GLM 5.3では入力トークンと出力トークンの価格が異なるため、コスト配分はモデルの使い方によって変わります。入力トークンは100万トークンあたり1.40ドル、出力トークンは100万トークンあたり4.40ドルで、出力はトークンあたりのコストが3倍以上になります。これは多くの言語モデルで一般的な価格体系です。長いドキュメントを読み込んで短い要約を返すタスクでは、入力コストが支配的になります。短いプロンプトから非常に長い応答を生成するタスクでは、出力コストが支配的になります。最大出力が128,000トークンであるため、最大長の生成を1回行うと、出力トークンで約0.56ドルのコストがかかる可能性があります。多くのターンを重ねる会話では、入力と出力の両方が増加します。短いコンテキストウィンドウを使用するか履歴を切り詰めない限り、過去の入力が毎回再送信されることになります。プロンプトを簡潔に保ち、可能であれば出力長を制限することで、コストを削減できます。
GLM 5.3のカタログエントリには、プロンプトキャッシュ、割引、特別な価格帯については記載されていません。表示されている価格は単純明快で、入力トークン100万個あたり1.40ドル、出力トークン100万個あたり4.40ドルです。将来、OrcaRouterまたは上流プロバイダーがキャッシュを導入した場合、繰り返しのプロンプトに対する実効コストが変わる可能性がありますが、そのような仕組みはここでは説明されていません。同様に、バッチ処理やボリュームディスカウントについても言及されていません。コストを抑えるには、送信するトークン数を管理できます。たとえば、会話全体を再送信するのではなく、関連する最近のターンのみを保持します。また、max_tokensの値を低く設定して、出力の長さを制限することもできます。OrcaRouterはプロバイダーの料金で請求され、マークアップはゼロなので、モデルリストに表示されるコストが基本レートです。価格や新機能の更新については、必ず最新のドキュメントを確認してください。
Z.ai GLM 5.3 を呼び出すには、HTTP クライアントを OrcaRouter の OpenAI 互換 API に向けます。ベース URL は https://api.orcarouter.ai/v1 です。リクエストボディでモデル ID として z-ai/glm-5.3 を使用します。公式の OpenAI SDK を使用している場合は、base_url を OrcaRouter のエンドポイントに設定し、OrcaRouter の API キーを使用します。リクエスト形式は標準的なチャット補完の形です。つまり、model フィールドと messages 配列を含む JSON オブジェクトです。各メッセージには role と content が含まれます。モデルはテキスト応答を生成します。OrcaRouter はリクエストを z-ai プロバイダーに転送します。API は OpenAI 互換であるため、OpenAI エンドポイントをサポートするライブラリやツールは、カスタム統合なしで OrcaRouter を指すように設定できます。認証には、OrcaRouter キーを含む Authorization ヘッダーを含めてください。エンドポイントは通常のチャット補完呼び出しを受け入れます。このモデル用の別個の RESTful リソースはありません。
OrcaRouter の GLM 5.3 向け OpenAI 互換 API は、OpenAI のチャット完了形式で一般的なものと同じリクエストパラメータを受け付けます。model を z-ai/glm-5.3 に設定し、messages を提供し、max_tokens、temperature、top_p、stream などのパラメータで生成を制御できます。サポートされるパラメータの正確な一覧はプロバイダによって異なる場合があります。カタログには完全なパラメータスキーマは記載されていないため、現在サポートされているフィールドについては OrcaRouter の API ドキュメントを参照してください。モデルの最大出力は 128,000 トークンなので、max_tokens を多くのクライアントのデフォルトをはるかに超えて設定できます。クライアントがこの値を上限で制限している場合は、調整が必要になることがあります。1,000,000 トークンのコンテキストウィンドウは、メッセージの合計トークン数を非常に大きくできることを意味します。その量のテキストを JSON として送信することは問題ありませんが、リクエストサイズとレイテンシに注意してください。ストリーミングは一般に OpenAI 互換 API で利用可能ですが、OrcaRouter の正確なレスポンス形式は標準に従います。
OpenAIからOrcaRouter経由でGLM 5.3にアプリケーションを移行する場合、通常2つの変更が必要です。まず、base_urlをhttps://api.orcarouter.ai/v1に変更します。次に、モデル名をz-ai/glm-5.3に変更します。messages配列、ロール、JSONレスポンス構造は、OpenAIのchat completions形式と同じままです。現在OpenAI SDKを使用している場合は、OrcaRouterを指すように環境変数またはクライアント設定を更新します。以前のキーの代わりにOrcaRouter APIキーを使用します。リクエストボディ自体にはコード変更は不要ですが、パラメータを見直すことをお勧めします。GLM 5.3はテキスト専用のため、プロンプトからimage_urlやマルチモーダル添付ファイルを削除してください。また、このモデルのコンテキストウィンドウは多くのOpenAIモデルよりもはるかに大きいため、送信する会話履歴の量を増やせます。まずは小さなリクエストでテストし、レスポンス形式がコードの期待どおりであることを確認してください。
以下は、OrcaRouterを介したGLM 5.3向けの最小限のチャット完了リクエストです。https://api.orcarouter.ai/v1/chat/completions にPOSTを送信し、AuthorizationヘッダーにOrcaRouter APIキーを含めてください。ボディには次のフィールドを含める必要があります: modelをz-ai/glm-5.3に設定し、messagesには少なくとも1つのメッセージを指定します。例: {"role":"user","content":"What is the capital of France?"}。レスポンスには、標準的なOpenAIチャット完了形式でモデルの応答が含まれます。temperatureやmax_tokensなどのオプションパラメータを追加できます。max_tokensを省略した場合、プロバイダはデフォルト値を使用します。128,000トークンの出力上限を利用するには、max_tokensを希望する値に設定してください。ストリーミングの場合は、streamをtrueに設定し、到着したデータラインを読み取ってください。正確なJSON形式はOpenAIの規約に従っているため、choicesやmessage contentを解析する既存のヘルパー関数がそのまま動作するはずです。
GLM 5.3とコンテキストウィンドウが小さいモデルとの主な違いは、単一のプロンプトに収まるテキスト量です。GLM 5.3は1,000,000トークンをサポートしていますが、一般的なモデルの多くは4,000〜200,000トークンに対応しています。書籍全体を分析するようなタスクでは、GLM 5.3を使った単一リクエストで、チャンキングや検索の複雑さを回避できます。ただし、コンテキストウィンドウが大きいからといって自動的に性能が良くなるわけではありません。コンテキストが短いモデルは、特定のタスクに特化して高精度に調整されている場合があります。コストももう一つの要素です。GLM 5.3のトークンあたりの入力価格は100万トークンあたり$1.40、出力価格は$4.40で、非常に長いプロンプトは多くのトークンを消費します。データが小さなコンテキストに収まる場合は、より安価なモデルの方が効率的かもしれません。OrcaRouterを使用すると、ワークロードに適合するモデルを選択できます。GLM 5.3のカタログエントリには比較表が含まれていないため、ご自身のデータでテストする必要があります。
GLM 5.3 はテキスト専用モデルであるため、画像、音声、動画を入力として受け付けません。マルチモーダルモデルは、これらのモダリティをテキストと組み合わせることができ、写真、録音、動画フレームについて質問することが可能です。アプリケーションに視覚的理解が必要な場合、GLM 5.3 は適していません。ただし、テキストのみのワークロードに関しては、GLM 5.3 の1,000,000トークンのコンテキストと128,000トークンの出力は際立った特徴です。多くのマルチモーダルモデルは、コンテキストウィンドウがはるかに小さかったり、出力長に制限があったりします。また、マルチモーダルモデルは、画像トークンが高コストになる可能性があるため、入力価格が高く設定されていることがよくあります。テキストのみを扱う場合は、画像エンコードのオーバーヘッドを避けるために、テキスト専用モデルを選ぶ方がよいかもしれません。GLM 5.3 とマルチモーダルモデルの選択は、アプリケーションが処理する必要のある入力タイプに基づいて行うべきです。テキストコーパスの場合、GLM 5.3 の大きなコンテキストは明確な利点となります。
Z.ai(Zhipu AIとしても知られる)は、GLMモデルのファミリーを開発しています。このカタログ項目は特にGLM 5.3を対象としており、旧バージョンや小型のGLMバージョンについては説明していません。記載されている1,000,000トークンのコンテキストウィンドウと128,000トークンの最大出力は、一般的なデフォルト制限よりも大きいものですが、この項目では他のGLMモデルとの比較仕様は提供されていません。小型のZ.aiモデルは異なる価格帯やより低いレイテンシを持つ場合がありますが、このカタログ記録には具体的な数値は記載されていません。OrcaRouterは複数のプロバイダーのモデルを提供しているため、OpenAI互換APIを使用してGLM 5.3を他のテキストモデルと並べて比較することができます。最良の判断方法は、各モデルで小さな代表的なワークロードを実行し、品質、速度、コストを測定することです。公式の比較スコアがないため、GLM 5.3と他のバージョンとの直接的なパフォーマンスランキングは推測に過ぎません。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="z-ai/glm-5.3",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_tokensreasoningreasoning_effortresponse_formatstopstreamtemperaturetool_choicetoolstop_p| 入力 / 1M tokens | $1.40 |
| 出力 / 1M tokens | $4.40 |
| キャッシュ読み取り / 1M | $0.260 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
今週の開発者の声
@misc{orcarouter_glm_5_3,
title = {GLM 5.3 API},
author = {Z.ai},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/z-ai/glm-5.3}
}Z.ai. (2026). GLM 5.3 API. OrcaRouter. https://www.orcarouter.ai/models/z-ai/glm-5.3