Qwen3.8-Flash-Next Release — ภายในตัวอย่างสถาปัตยกรรม Qwen4 ของ Alibaba ภาพประกอบที่สร้างขึ้นใหม่
Guides & Insights

Qwen3.8-Flash-Next เปิดตัว: เจาะลึกพรีวิวสถาปัตยกรรม Qwen4 ของ Alibaba

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เอกสารที่มีประโยชน์ที่สุดที่ Ali​baba เผยแพร่เมื่อวันที่ 26 สิงหาคม 2026 ไม่ใช่ชุดข่าว แต่เป็นรายงานทางเทคนิค Qwen3.8-Flash-Next โมเดลแบบผสมของผู้เชี่ยวชาญ (mixture-of-experts) แบบ multimodal และเปิดน้ำหนักที่เผยแพร่ในวันนั้น มาพร้อมกับเอกสารชื่อ "On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability" และรายงานนี้คือเรื่องราวหลัก มันทำสิ่งที่การเปิดตัวของผู้ขายแทบไม่เคยทำ: มันเผยแพร่ผลการตัดตอน (ablations) ผลลัพธ์เชิงลบ และการทดลองสูตรการฝึกอบรม จากนั้นก็เชื่อมโยงผลการค้นพบแต่ละอย่างเข้ากับสถาปัตยกรรมของตระกูล Qwen4 ซึ่งโมเดลนี้ตั้งใจที่จะเปิดตัวให้เห็นตัวอย่าง

สิ่งที่จัดส่งจริงในวันที่ 26 สิงหาคม

ตัวโมเดลเองถือว่าพอประมาณเมื่อเทียบกับมาตรฐานปี 2026 ของ Qw​en และนั่นก็เป็นความตั้งใจ Qwen3.8-Flash-Next เก็บพารามิเตอร์หลักของโมเดล 125B พร้อมกับตาราง n-gram embedding แยกต่างหากอีก 51B — รวมประมาณ 176B ก่อนที่จะมีโมดูล multi-token-prediction ขนาด 4B — แต่เปิดใช้งานเพียง 6B ต่อโทเคน มันเป็นโมเดล mixture-of-experts ที่มี 512 ผู้เชี่ยวชาญ พร้อมการจัดเส้นทางแบบ top-10 และ 48 เลเยอร์ รองรับบริบท 262,144 โทเคนโดยธรรมชาติ และขยายได้ถึง 1M ผ่าน YaRN มันรับอินพุตเป็นข้อความ รูปภาพ และวิดีโอ แล้วส่งออกเป็นข้อความ น้ำหนัก (weights) อยู่บน Hugging Face และ ModelScope ภายใต้สัญญาอนุญาต qwen-community-1.0 และบล็อกของ Ali​baba เองเรียกมันว่า "ตัวอย่างเชิงทดลองของสถาปัตยกรรมที่จะรองรับ Qwen4" — บทบาทเดียวกันกับที่ Qwen3-Next เคยเล่นให้กับตระกูล Qwen3.5 คือเป็นนกคานารีที่บินนำหน้าก่อนเรือธง

ในวันเดียวกัน Ali​baba ได้เปิดตัวเวอร์ชันเชิงพาณิชย์: build ที่ให้บริการชื่อ Qwen3.8-Flash บน QwenCloud API ในราคา $0.16 ต่อล้านโทเคนสำหรับ input และ $0.47 ต่อล้านโทเคนสำหรับ output ทั้งสองอย่างนี้สับสนได้ง่าย และควรทำความเข้าใจให้ชัดเจน Qwen3.8-Flash-Next คือพรีวิวแบบ open-weights ที่รายงานทางเทคนิควิเคราะห์ ส่วน Qwen3.8-Flash คือ build API สำหรับโปรดักชัน มีการกำหนดราคา มีบริบทเริ่มต้นที่ 1M โทเคน และรูปแบบคำขอที่เข้ากันได้กับ Open​AI และ Anthropic ราคา เกณฑ์มาตรฐาน และข้อโต้แย้งด้านสถาปัตยกรรมล้วนมาจากวิศวกรรมชุดเดียวกัน

The official QwenLM/Qwen3.8-Flash-Next GitHub repository, showing the model card ('foundation model developed by Qwen Team, Alibaba Group'), 171 stars, and the tech_report.pdf file in the repository listing.

การเดิมพันทางสถาปัตยกรรมสี่รายการในรายงานทางเทคนิค

แกนหลักของเอกสารคือข้อสมมติสี่ประการเกี่ยวกับว่าโมเดลระดับแนวหน้าที่รองรับบริบทยาวและมีต้นทุนต่ำควรมีลักษณะอย่างไร โดยแต่ละข้อมีหลักฐานจากการทดลองสนับสนุน

• ความสนใจ — ไฮบริด GDN + QSA สามในสี่เลเยอร์ใช้ Gated DeltaNet ซึ่งเป็นเลเยอร์แอตเทนชันเชิงเส้นที่บีบอัดประวัติศาสตร์ลงในสถานะรีเคอร์เรนต์ขนาดคงที่แทนที่จะเป็น KV cache ที่ขยายตามความยาวลำดับ เลเยอร์ที่เหลือใช้ Qw​en Sparse Attention ซึ่งรวมลำดับเป็นไมโครบล็อก ให้คะแนนอย่างประหยัด และรันแอตเทนชันเต็มเฉพาะในส่วนที่สำคัญ Ali​baba รายงานความเร็ว prefill สูงถึง 7.6× และ decode 4.9× ที่บริบท 1M; การวัดผลวันแรกของ SGLang เองสูงกว่า ที่ 10.2× และ 6.6× ที่อัตรา hit ของ prefix cache 90% throughput ของ prefill สูงถึง 8.6× เท่าของ Qwen3.7-Plus ตัวเลขเหล่านี้เป็นตัวเลขที่รายงานโดยผู้ขายและพันธมิตร ไม่ได้ผ่านการตรวจสอบโดยอิสระ

• Residual stream — Gated Residual: ขยายเส้นทาง residual เส้นเดียวให้กว้างขึ้นเป็นสี่สาขาแบบขนาน พร้อมการ gating แบบไดนามิกในระดับองค์ประกอบ (element-wise dynamic gating) ซึ่งเป็นการออกแบบหลายสาขาแบบ Hyper-Connection ที่มีการควบคุมแบบ GatedNorm เกตจะควบคุมการอ่านและการเขียนในแต่ละสาขา ซึ่งบทความระบุว่าช่วยระงับค่า activation outliers และในทางปฏิบัติ ช่วยให้สถานะ residual ถูกจัดเก็บในรูปแบบ FP8 ได้

• Embedding — ตาราง n-gram ขนาด 51B แทนที่จะมีหนึ่ง embedding ต่อ token โมเดลจะใช้ตารางค้นหาที่อิงกับ token ปัจจุบันรวมกับ token ก่อนหน้า เพื่อเก็บทั้งวลีและรูปแบบเฉพาะท้องถิ่น ต้นทุนต่อ token แทบไม่มี และเนื่องจากทราบที่อยู่สำหรับค้นหาล่วงหน้า จึงสามารถเก็บไว้ในหน่วยความจำของโฮสต์และดึงข้อมูลล่วงหน้าแบบอะซิงโครนัส โดยไม่ใช้หน่วยความจำ GPU เลย นี่คือเคล็ดลับที่ทำให้ checkpoint ที่มีขนาดเก็บ 176B ทำงานบนเครื่องระดับ 75GB ได้ และมีที่มาจาก per-layer embeddings ของ Gemma 3n และ Engram ของ DeepSeek

• การปรับให้เหมาะสม — Muon ที่ถูกปรับแต่ง การฝึกใช้ตัวปรับให้เหมาะสม Muon ซึ่งเป็นวิธีโมเมนตัมที่ใช้การทำ orthogonalization เป็นพื้นฐาน ประยุกต์ใช้กับแผนที่เชิงเส้นสองมิติ (attention, GDN และน้ำหนักผู้เชี่ยวชาญของ MoE) ในขณะที่ AdamW ยังคงใช้สำหรับ embeddings, router และพารามิเตอร์ low-rank บทความยังรายงานผลลัพธ์เชิงลบที่น่าอ่าน: การวอร์มอัพขนาดแบตช์ถูกตัดออก หลังจากพบว่ามันทำให้ต้องใช้ขั้นตอนของ optimizer มากขึ้น 18.8% โดยไม่ได้ปรับปรุงอะไรเลย

ตารางเกณฑ์มาตรฐาน อ่านอย่างละเอียด

ตัวเลขหลักทุกตัวในที่นี่เป็นของ Qwen เองที่เผยแพร่บนโมเดลการ์ดและในรายงาน และยังไม่มีการตรวจสอบซ้ำอย่างอิสระ — โมเดลเพิ่งเปิดตัวได้เพียงวันเดียวและยังไม่มีบุคคลที่สามเข้ามาตรวจสอบ แต่ถึงจะอ่านด้วยความระมัดระวังแบบนั้น มันก็ยังน่าทึ่ง เพราะ Qwen3.8-Flash-Next กำลังแลกหมัดกับ DeepSeek-V4-Flash-0731 ซึ่งเป็นโมเดลที่ใหญ่กว่าและเป็นที่ยอมรับกว่าได้อย่างสูสี ด้วยพารามิเตอร์แอ็กทีฟเพียง 6B

• DeepSWE 1.1 — 58.7 เทียบกับ 54.4 (รายงานโดยผู้ผลิต)

• SWE-bench Pro — 62.5 เทียบกับ 56.0 (รายงานโดยผู้ขาย)

• Toolathlon ยืนยันแล้ว — 73.5 เทียบกับ 70.3 (ตามรายงานของผู้จำหน่าย)

• LiveCodeBench v6 — 91.9 เทียบกับ 90.6 (รายงานโดยผู้จำหน่าย)

• GPQA Diamond — 91.7 เทียบกับ 90.8 (รายงานโดยผู้จำหน่าย)

• IFBench — 81.3 เทียบกับ 79.2 (รายงานโดยผู้จำหน่าย).

แล้วความบกพร่องที่รายงานเปิดเผยออกมา: NL2Repo-Bench ได้ 48.1 เทียบกับ 54.2 ของ DeepSeek-V4-Flash-0731 — ซึ่งเป็นความขาดที่แท้จริงในด้านการสร้างโค้ดระดับรีโพสิทอรี มิติการเขียนโค้ดแบบเอเจนต์เพียงมิติเดียวที่โมเดลขนาดเล็กไม่ได้ตามทัน Agents' Last Exam สูสีกันที่ 24.3 เทียบกับ 25.2 ด้านระบบอัตโนมัติสำนักงาน Qw​en รายงาน CoWorkBench 73.9 — แต่เป็นเบนช์มาร์กภายในบริษัท และ Ali​baba ไม่นำมันไปแสดงในแผนภูมิหลัก

Scoreboard card for Qwen3.8-Flash-Next: 6B active of 176B stored params, 262K to 1M context (YaRN), DeepSWE 1.1 58.7, SWE-bench Pro 62.5, GPQA Diamond 91.7 (each marked vendor), API price $0.16 / $0.47 per 1M, with a footer noting all benchmark figures are vendor-reported and not independently verified.

ในด้านวิสัยทัศน์ ตารางที่รายงานด้วยตนเองแสดง AndroidWorld 84.5 เทียบกับ 62.0 ของ Claude Opus 4.6 Max และ RealWorldQA 88.5 เทียบกับ 73.9 Humanity's Last Exam เป็นหัวข้อเดียวที่ Qw​en แพ้ให้กับ Claude Opus 4.6 Max อย่างสิ้นเชิง — และการประเมินคะแนนนั้นเองก็ดำเนินการโดย GPT-4o ดังนั้นแม้การเปรียบเทียบนั้นก็ไม่สะอาด

ราคา: หนึ่งในสิบสองของรุ่นเรือธง

แล้วตัวเลขที่สำคัญต่องบประมาณก็คือ บริการรุ่น Qwen3.8-Flash อยู่ที่ $0.16 ต่อล้านโทเค็นอินพุต และ $0.47 ต่อล้านเอาต์พุตบน QwenCloud ซึ่งก็คือประมาณหนึ่งในสิบสองของราคารุ่นเรือธงของ Ali​baba เองอย่าง Qwen3.8-Max ที่ $2.00 ต่อล้านอินพุตและ $6.00 ต่อล้านเอาต์พุต — บนโมเดลที่รายงานระบุว่าใช้พลังคำนวณในการฝึกประมาณหนึ่งในเก้าของ Qwen3.7-Plus ผู้จำหน่ายโมเดลจีนใช้เวลาตลอดฤดูร้อนลดราคาระดับ flash-tier และการเปิดตัวครั้งนี้คือฝ่าย Qw​en ของแคมเปญนั้น ที่มาพร้อมกับเหตุผลเชิงสถาปัตยกรรมแนบมาด้วย แทนที่จะเป็นเพียงส่วนลด

สำหรับใครก็ตามที่เปรียบเทียบในหมวดหมู่นี้ การคำนวณจะง่ายขึ้นเมื่อผู้ให้บริการทุกรายแสดงตัวเลขเดียวกัน OrcaRouter จัดเส้นทางที่เหลือของตระกูล Qw​en ได้แก่ Qwen3.8-Max, Qwen3.8-27B และ Qwen3.8 ในราคารายการที่ผู้ให้บริการกำหนดโดยไม่มีส่วนเพิ่ม 0% ดังนั้นการลดราคาจากผู้ขายจึงมีผลกับฝ่ายเราทันทีในวันที่ประกาศ Qwen3.8-Flash-Next ยังไม่อยู่ในแคตตาล็อกของเรา เมื่อมันไปถึงรันไทม์ที่เราให้บริการ มันจะเข้าไปอยู่ในการตั้งค่าราคารายการแบบคีย์เดียวเดียวกันนั้นโดยไม่ต้องมีสัญญาที่สอง

สิ่งที่คุณสามารถทำกับมันได้ในวันนี้

การรองรับการให้บริการแบบ day-zero นั้นกว้างขวางผิดปกติ SGLang มีหน้า cookbook และอิมเมจเฉพาะ (lmsysorg/sglang:qwen38flashnext); vLLM มี vllm/vllm-openai:qwen38-flash-next; NVIDIA รับรองทั้งสองรายการรวมถึง TensorRT LLM บนแร็ค GB300 NVL72 ด้วยอัตรามากกว่า 16,000 โทเคนต่อวินาทีต่อ GPU ในรูปแบบ FP8 และ NeMo ครอบคลุมงาน fine-tuning ในระดับที่ต่ำกว่าดาต้าเซ็นเตอร์ลงไป โมเดลรันบนคลัสเตอร์ DGX Spark และเวิร์กสเตชัน 4×RTX PRO 6000 และขบวน quantization จากชุมชนในวันเดียวกัน — GGUFs จาก Unsloth และบิลด์ 1-bit ที่พอดีในแรม 75GB ด้วยความแม่นยำประมาณ 80% ของความแม่นยำเต็ม — ทำให้ checkpoint ที่เก็บขนาด 176B รันได้จริงบนฮาร์ดแวร์ที่ทีมขนาดเล็กเป็นเจ้าของ ทีมที่อยากเรียกใช้ API มากกว่าจะรันเองสามารถเข้าถึง Qwen3.8-Flash API ผ่าน QwenCloud ของ Ali​baba เองและแพลตฟอร์มบุคคลที่สามหลายแห่ง แม้ว่าน้ำหนักแบบเปิด (open weights) จะเป็นสิ่งที่ผู้ใช้งานยุคแรกส่วนใหญ่จะหยิบใช้เป็นอันดับแรกก็ตาม

LMSYS's SGLang blog post 'Qwen3.8-Flash-Next: Day-0 Support in SGLang', dated August 26, 2026, describing the GDN + QSA hybrid attention and the day-0 runtime support for the model.

คณิตศาสตร์ VRAM เบื้องหลังรายการนั้นคือตาราง n-gram และนั่นคือจุดที่ serving stacks กำลังมุ่งมาบรรจบกันเป็นอันดับถัดไป per-layer embedding ที่รายงานเทคนิคเก็บไว้นอกหน่วยความจำ GPU เป็นโครงสร้าง lookup ล้วนๆ — ในแต่ละ token ที่สร้างขึ้น โมเดลดึงข้อมูลเพียงประมาณ 16 แถวจากทั้งหมด 320 ล้านแถว — ซึ่งนั่นคือสิ่งที่ทำให้การ offload มันมีต้นทุนต่ำ vLLM ให้บริการ Qwen3.8-Flash-Next จาก dev image เฉพาะ ในขณะที่ pull request สำหรับรองรับสถาปัตยกรรมยังเปิดอยู่ และชิ้นงานใหม่ล่าสุดของงานนั้น คือ draft PR จาก vLLM author คนเดียวกัน (vllm-project/vllm#54371, ยังไม่ถูก merge) ซึ่งเพิ่ม serving path แบบ PLE-Offload ที่เก็บตารางไว้ใน host memory และอ่านผ่าน CUDA unified virtual addressing แทนการจอง VRAM ที่ FP8 ตารางมีขนาดประมาณ 48GB จาก checkpoint ~173GB ดังนั้นการ offload มันจึงเป็นตัวแบ่งระหว่าง data-center GPU กับการ์ด 96GB ใบเดียว — RTX PRO 6000 หรือ unified-memory pool ของ DGX Spark หนึ่งเครื่อง มันยังอยู่ในช่วงแรกๆ ดังนั้นให้มองมันเป็นทิศทาง มากกว่าตัวเลือกที่รองรับในวันนี้ แต่มันคือ runtime ที่กำลังตามทันสิ่งที่รายงานเทคนิคอ้างไว้แล้ว และเป็นสิ่งที่ควรจับตาดู หากตัวเลข VRAM คือสิ่งที่ฉุดรั้งคุณอยู่

พรีวิวที่เพิ่งปล่อยมาได้หนึ่งวัน พร้อมตัวเลขที่ยังไม่มีใครสามารถทำซ้ำได้ ถือเป็นกรณีตัวอย่างในตำราว่าไม่ควรเดิมพันเส้นทางโปรดักชันกับมัน และนั่นคือสิ่งที่ failover มีไว้จริง ๆ หาก runtime ตัวหนึ่งมี Qwen3.8-Flash-Next และคุณชี้ endpoint หนึ่งไปที่มัน พร้อม failover อัตโนมัติไปยังโมเดลที่คุณไว้ใจอยู่แล้ว คุณจะได้ข้อดีของสถาปัตยกรรมใหม่บนทราฟฟิกที่ไม่สำคัญ และมีทางสำรองที่ไร้รอยต่อเมื่อมันทำงานไม่ไหว — ไม่ต้อง rewiring เพราะนั่นคือกฎการจัดเส้นทาง ไม่ใช่การแก้โค้ด

สิ่งที่พรีวิวนี้บอกเกี่ยวกับ Qwen4

Ali​baba เคยเล่นเกมนี้มาก่อน Qwen3-Next เคยนำเสนอ Gated DeltaNet เป็นตัวอย่างในช่วงปลายปี 2025 พร้อมเอกสารที่บางเบา และสถาปัตยกรรมก็ได้รับการกำหนดอย่างสมบูรณ์ก็ต่อเมื่อซีรีส์ Qw​en3.5 นำมาใช้ในวงกว้าง รูปแบบกำลังเกิดขึ้นซ้ำ: Qwen3.8-Flash-Next คือตัวทดสอบ (canary) และรายงานนี้คือข้อกำหนดที่ได้จากการทดลอง สิ่งที่เป็นรูปธรรมที่ต้องจับตามองคือว่า Qwen4 รุ่นเรือธงจะนำการแบ่งสัดส่วน GDN ต่อ QSA แบบสามต่อหนึ่งมาใช้หรือไม่, ไม่ว่า n-gram embedding จะยังคงอยู่รอดเมื่อต้องเผชิญกับการให้บริการในระดับโปรดักชันของรุ่นเรือธงหรือไม่, และที่สำคัญที่สุดคือการประเมินโดยอิสระจะยืนยันข้อได้เปรียบของโมเดลแบบ 6B-active เหนือโมเดลที่ใหญ่กว่าหรือไม่ หากสมมติฐานด้านประสิทธิภาพเป็นจริง Qwen4 รุ่นเรือธงอาจเปิดตัวพร้อมต้นทุนการให้บริการที่ต่ำลงอย่างมากเมื่อเทียบกับรุ่นก่อนหน้า.

คำถามที่พบบ่อย

Qwen3.8-Flash-Next และ Qwen3.8-Flash — รุ่นเดียวกันหรือ?

ไม่ และความแตกต่างนี้สำคัญ Qwen3.8-Flash-Next คือสถาปัตยกรรมพรีวิวแบบ open-weights ที่รายงานเทคนิคใช้วิเคราะห์ ส่วน Qwen3.8-Flash คือบิลด์ API สำหรับโปรดักชันที่ Ali​baba ให้บริการบน QwenCloud ในราคา $0.16/$0.47 ต่อล้านโทเค็น พร้อมบริบทเริ่มต้น 1M มีต้นสายวิศวกรรมเดียวกัน แต่เป็นอาร์ติแฟกต์คนละชิ้น — อันหนึ่งสำหรับโฮสต์เองและตรวจสอบ อีกอันเป็นบริการจัดการที่มีค่าใช้จ่าย

ควรย้ายเวิร์กโหลดการผลิตไปใช้มันในวันนี้หรือไม่

ไม่ใช่โดยไม่มีความเห็นที่สอง ผลทดสอบทุกรายการมาจากผู้จำหน่ายและยังไม่มีใครจำลองผลได้ สถาปัตยกรรมใหม่พอที่ระบบ serving ยังคงปรับตัวไม่ลงตัว — การรองรับ vLLM เองยังทยอยเข้ามาผ่าน pull requests แบบเปิด — และช่องว่างด้าน agentic-coding หนึ่งจุด (NL2Repo) ตรงกับงานประเภทที่นักพัฒนาในสาย production เจอจริง ๆ การเปิดน้ำหนักโมเดลทำให้ประเมินด้วยตัวเองได้ไม่แพง และการรองรับ SGLang และ vLLM ตั้งแต่วันแรกทำให้ทำ pilot ได้ในสัปดาห์นี้ — แต่ pilot ที่มี failover คอยรองรับคือวิธีที่ซื่อตรงในการเริ่มต้น ไม่ใช่การสับเปลี่ยนโดยตรง

Qwen4 ตัวจริงจะจัดส่งเมื่อไหร่?

Ali​baba ยังไม่ได้กล่าว สัญญาณด้านเวลาเพียงอย่างเดียวในรีลีสนี้เป็นเรื่องในอดีต: นกคานารีตัวสุดท้าย Qwen3-Next บินไปประมาณหนึ่งฤดูกาลก่อนที่ซีรีส์ Qw​en3.5 จะนำสถาปัตยกรรมนั้นมาใช้ ตามจังหวะนั้น เรือธงของ Qwen4 ใกล้กว่าที่เห็น — แต่รายงานนี้พูดถึงสถาปัตยกรรมโดยเฉพาะ ไม่ใช่โรดแมป

สรุป

Qwen3.8-Flash-Next คือการเปิดตัวที่หาได้ยากซึ่งตัว paper คือตัวผลิตภัณฑ์จริง ๆ ในส่วนของตัวโมเดลเอง สกอร์การ์ดที่ตรงไปตรงมาระบุว่า: พารามิเตอร์แอกทีฟ 6B ที่เทียบเท่าโมเดลที่ใหญ่กว่ามากในเบนช์มาร์กร่วมส่วนใหญ่, ช่องว่างที่ระบุชื่อหนึ่งจุดในโค้ดระดับ repository, ราคาให้บริการหนึ่งในสิบสองของรุ่นเรือธง, และสถาปัตยกรรมที่คือคำตอบของ Qw​en ต่อคำถามว่าโมเดลระดับแนวหน้าจะถูกลงได้อย่างไร รายงานเทคนิคบอกว่า Qwen3.8-Flash-Next มีไว้เพื่ออะไร — และมันไม่ใช่ตัวโมเดล มันคือหลักฐานของสถาปัตยกรรมที่จะเป็น Qwen4 และเป็นสิ่งที่ควรอ่านก่อน Qwen4 จะถูกส่งออกมา เพราะการตัดสินใจที่มันเปลี่ยนแปลงคือการตัดสินใจที่คุณจะทำเมื่อ Qwen4 มาถึง

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube