
無料のQwen 3.8 27B API:まだ利用不可 — 代わりに使うべきもの
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
いいえ — 2026年8月12日現在、無料のQwen3.8-27B APIは存在せず、有料のものもありません。このモデルは8月3日に発表され、オープンウェイトがHugging FaceとModelScopeに「8月10日の週」に公開されることが約束されていましたが、公式のQwen組織にはまだQwen3.8リポジトリがありません。ウェイトが公開されるまで、誰もQwen3.8-27Bをホストできないため、「無料」というのは意味を成しません。以下は、ウェイトが公開された後に無料で利用するための3つのルート(それぞれの実際のコストも含む)と、現在ローカルで無料実行できるモデルです。
まだ無料APIはない — 重みがゲートだ。
Alibabaは2026年8月3日、Qwen3.8ファミリーを発表した。2.4兆パラメータのQwen3.8-Max(アクティブパラメータは約950億、1Mトークンのコンテキスト、Alibaba Cloud Model Studioでの価格は入力100万トークンあたり2ドル、出力100万トークンあたり6ドル)と、高密度で単一マシン向けのQwen3.8-27Bである。両モデルは、同じ週にHugging FaceとModelScopeでオープンウェイトとして公開されることが約束された。
その約束は、すでに2日遅れている。私は8月12日にHugging Faceを直接確認した:公式のQwen組織には、いかなる種類のQwen3.8リポジトリも存在しない。モデル検索に表示されるQwen3.8-27B-GGUF、-FP8、-NVFP4A16、-NInferの各リポジトリはプレースホルダーカードだ——重みファイルはゼロ、ダウンロード数は一桁、モデルカードには文字通り「Qwen/Qwen3.8-27Bのリリースに先立って予約済み」と書かれている。それらをモデルが存在する証拠として扱ってはならない。駐車スペースを予約している人々だと思え。
仮定できないことが2つあります。{{1}}まずライセンスについて:Qwen3.8-27Bにはライセンスが明示されていません。最近のQwenオープンウェイトはTongyi Qianwenライセンスの下で提供されており、その月間アクティブユーザー1億人の条項により、大規模利用時には商用ライセンスの協議が必要になります。Apache 2.0が安全なデフォルトであるとは言えません。{{/1}} {{2}}次に仕様について:Alibabaは27Bのベンチマーク表、コンテキストウィンドウ、確認済みのハードウェア要件を一切公開していません。今日このモデルについて繰り返されている情報はすべて推測に過ぎません。{{/2}}
「Qwen3.8-27B Open Weights: What We Know Before the Drop」では、リリース前のチェックリスト(確認済みの事項、噂の事項、ダウンロード前に確認すべきこと)を扱いました。この記事は、その前回記事が扱わなかった部分、つまりモデルがリリースされた後に「無料」が実際にどのように機能するかを説明するものです。
重荷が下りた後:自由への3つの道、そしてそれぞれの本当の代償
「無料」は決して無料ではない。Qwen3.8-27Bを無料で利用する3つのルートはすべて、コストをどこかへ移している。違いは、そのコストがどこに降りかかるかだけだ。27Bは高密度(dense)モデルであり、約270億のパラメータすべてが各トークンでアクティブになる。つまり、以下のコストはマーケティングではなく、実際のハードウェアに関するものだ。

ルート1: 自分で実行する — 現金では無料、ハードウェアで支払う
ハードウェアを購入した後で「無料」が文字通り現実になる唯一の道。Unslothの共同創業者Daniel Han氏は、27Bがリリース時に約17GBのVRAMで動作すると見込んでいる——これは目標であり、出荷時の仕様ではない。測定済みのQwen3.6-27Bの量子化ラダーを基準にすると:Q4_K_Mは約16GB、Q6_Kは約21GB、FP8は約27GB、フルBF16は約54〜56GBとなる。今日の現実的な最低条件は24GBのカード——RTX 3090、RTX 4090、またはA6000クラス——で、Q4での使用となる。
タイミングが重要です:{{1}}vLLMまたはSGLangを使った公式ウェイトはリリースから数日以内に動作するのが通常ですが、コミュニティ製のGGUFやAWQ量子化は1〜2週間遅れるため、Ollamaスタイルの「プルして実行」はリリース当日には存在しないでしょう{{/1}}。{{2}}隠れたコストは、電力、静かなマシン、そしてあなたの時間です{{/2}}。{{3}}得られる利点はプライバシー(何もあなたのマシンの外に出ません)と限界費用ゼロであり、GPUを他のモデルにも使えばその効果はさらに大きくなります{{/3}}。
ルート2: ホステッド無料ティア — 金銭的には無料、制限という形で代償が発生する
{{1}}ウェイトが公開されたら、Alibaba Cloudからの評価用クォータと、おなじみのサーバーレスホスト各社からの無料枠が提供される見込みだ。{{/1}}{{2}}予想されるパターンは、AlibabaがQwen3.8-Maxですでに実施しているものだ。新規ユーザー向け100万トークンのクォータ、シンガポールリージョンのみ、有効期間90日、繰り越しなし——そして推論トークンは出力として課金されるため、デフォルトで推論するモデルは、週末のプロトタイピングで割り当て全体を使い切ってしまう可能性がある。{{/2}}{{3}}実際に支払うことになるのは、レート制限、リージョン制限、有効期限、そしてプロンプトが第三者に渡ることだ。{{/3}}{{4}}無料枠はモデルを評価するための入り口であり、デプロイする場所ではない。{{/4}}
Route 3: OrcaRouter の無料ティア — 計画中、未稼働
検索クエリが文字どおり「無料」であるため、明確にしておきます:OrcaRouterは、ウェイトが出荷され次第、Qwen3.8-27Bの無料ティアを計画しています。まだ稼働していません。呼び出すエンドポイントはなく、プレースホルダーの例を貼り付けるつもりもありません。発表できることがあれば、そのときに発表します。現在ホストしているのはQwen3.8-Maxで、1Mトークンあたり$2/$6、マークアップなしです。27Bは、まだ誰も提供できないため、プラットフォーム上にはありません。
今すぐ無料で使えるもの
「料金を支払わずに実行できる27Bクラスのオープンモデル」が必要なら、待つ必要はありません。正直なところ、同レベルの答えはQwen3.6-27B、つまりあなたが待っているモデルの直接の前身です。

Qwen3.6-27BはApache 2.0ライセンスで、262Kコンテキストとテキスト・画像・動画のネイティブ入力を備えた高密度27.8Bモデルです。Q4_K_M GGUFは約16.5GBで、24GBのコンシューマーGPUでは毎秒約25トークン(M4 Maxでは毎秒16〜18トークン)で動作します。モデルカードに記載されたベンダー報告の数値:SWE-Bench Verified 77.2、MMLU-Pro 86.2、AIME 2026 94.1、GPQA Diamond 87.8、MMMU 82.9。Qwen3.8-27Bが「27B」なら、これは今日実際に触れられる27Bです——同じファミリー、同じ高密度設計、すでにオープンになっています。
Nemotron 3.5 Lightning 30B A3Bは別の形態で、こちらも無料です。2026年8月11日にNVIDIAのOpenMDW 1.1ライセンスの下でリリースされました。合計30B、約3Bが活性化するMixture-of-Expertsモデルで、ハイブリッドなMamba-2アーキテクチャを採用し、最大1Mのコンテキストをサポートします。NVFP4チェックポイントは約21.6GB、Q4 GGUFは約25GBです。トークンごとに活性化するのは約30億パラメータだけですが、300億パラメータすべてがメモリ上に存在するため、24GB以上のGPUが必要です。初期の報告では、単一GPUで毎秒約45トークンとされています。これはエージェント実行レイヤー(ツール呼び出し、検証、フォーマット)向けに構築されており、フロンティア推論向けではありません。大量のエージェント雑務が主なワークロードであれば、実務においてdense 27Bモデルを上回る可能性があります。
そして、あなたが具体的に求めているのが、ローカルインストールではなく、今日すぐに使える無料のホステッドAPIであるなら、正直な意味での「無料」はAlibabaのQwen3.8-Maxのクォータだけです:100万トークン、シンガポールリージョン、90日間。それは27Bではありません。また、サービスではなく評価用の割り当てです——今すぐQwen3.8の動作を試すために使い、その後移行してください。
このアドバイスが間違っている場合
すでに24GB以上のGPUを所有しているなら、「無料ティアを待つ」という捉え方はあなたには当てはまりません。ウェイトが公開されたその日、公式ウェイトを使ったvLLMがあなたの無料ティアになります。必要でもない利便性を待つことになるだけです。磨き上げられたGGUF量子化ラダーが特に欲しい場合に限り、約2週間待つのがいいでしょう。
API コントラクトに対してプロトタイピングを行っているなら、ホスト型サービスの無料枠(27B がそれを備えた時点で)は、あなたの時間よりも安く済むかもしれません。90日間の有効期限とリージョンロックがあっても、1週間のプロトタイピング用に GPU ボックスをレンタルするほうが通常は高くつきます。
ライセンスがApacheではなくTongyi Qianwen(通義千問)であることが判明した場合、「フリーウェイト」は、1億MAU(月間アクティブユーザー数)の閾値を超える場合に商用化が自由であることを意味しません。何かを構築する前に、実際のリポジトリのLICENSEファイルを読んでください——それが「無料のオープンウェイト」が請求書に変わる最も一般的な方法です。
そして、もしAlibabaが再び期日を延期するなら — すでに約束された期間を2日過ぎている — 過ぎる週ごとに、Qwen3.6-27Bが一時しのぎではなく正しい選択となる。

結論
Qwen3.8-27Bの無料APIはありません。Qwen3.8-27Bがどこにも存在しないからです。ウェイトがリリースされれば、3つの無料ルートがあります。セルフホスティング(ハードウェアで支払う)、ホステッド無料枠(制限で支払う)、そしてOrcaRouterの計画中の無料枠です。これはまだ稼働しておらず、稼働したらその旨をお知らせします。今日の時点で最も無料に近いものは、ご自身のハードウェア上のQwen3.6-27Bです。待つことのコストは27B以外の何ものでもなく、前任モデルを実行するコストは、その間に他のすべての作業に使えるGPU以外の何ものでもありません。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
