Qwen3-VL 235B-A22B Instruct — โมเดลภาษาภาพแบบเปิดน้ำหนัก, พารามิเตอร์ทั้งหมด 235B / พารามิเตอร์ที่ใช้งาน 22B, บริบท 256k, ไม่มีโหมดการคิด
Qwen3 VL 235B A22B Instruct เป็นรูปแบบวิทัศน์-ภาษา (vision-language) ของโมเดลตระกูล Qwen3 ซึ่งพัฒนาโดย Alibaba Cloud โมเดลนี้ใช้การออกแบบแบบผสมผู้เชี่ยวชาญ (mixture-of-experts)…
โมเดลนี้มีความสามารถโดดเด่นในงานที่รูปภาพและข้อความมีปฏิสัมพันธ์กัน มันสามารถตอบคำถามเกี่ยวกับเนื้อหาของรูปภาพ อธิบายฉากต่างๆ อย่างละเอียด อ่านข้อความจากเอกสารหรือป้าย และให้เหตุผลเกี่ยวกับความสัมพันธ์ระหว่างวัตถุในภาพ นอกจากนี้ยังรองรับรูปภาพหลายภาพในการสนทนาเดี่ยว ช่วยให้สามารถวิเคราะห์เปรียบเทียบหรือให้เหตุผลตามลำดับได้ การปรับแต่งด้วย instruction ช่วยให้โมเดลสามารถทำตามคำแนะนำแบบ multimodal ที่ซับซ้อน เช่น 'อธิบายว่าเหตุใดกราฟนี้จึงแสดงแนวโน้ม' หรือ 'ดึงค่าตัวเลขทั้งหมดจากตารางนี้' ความสามารถเหล่านี้มีต้นกำเนิดจากแกนหลัก MoE ขนาดใหญ่และการฝึกอบรมด้านวิทัศน์และภาษาเฉพาะทาง
เนื่องจากเป็นตัวแปร Instruct โมเดลจึงได้รับการปรับแต่งให้ปฏิบัติตามคำแนะนำของผู้ใช้ด้วยความแม่นยำสูง ทั้งในพรอมต์ที่เป็นข้อความล้วนและแบบหลายรูปแบบ (multimodal) นอกจากนี้ยังสามารถจัดการสนทนาหลายรอบที่มีการเพิ่มรูปภาพทีละน้อย รักษาบริบทตลอดการสนทนาหลายครั้ง และปฏิบัติตามคำแนะนำในการจัดรูปแบบ (เช่น แสดงผลเป็น JSON, รายการหัวข้อย่อย หรือทีละขั้นตอน) โมเดลทำงานได้ดีในงานที่ต้องยึดตามข้อจำกัด เช่น 'ตอบเฉพาะเมื่อรูปภาพมีสุนัข' ทำให้เหมาะสำหรับแอปพลิเคชันที่ต้องการพฤติกรรมที่สม่ำเสมอและปฏิบัติตามกฎเกณฑ์
สำหรับงานที่ใช้ข้อความล้วนโดยไม่มีองค์ประกอบภาพ โมเดล 235B MoE อาจจะมากเกินไป โมเดล dense ขนาดเล็กกว่า หรือ Qwen รุ่นอื่นที่ใช้ข้อความล้วนจะคุ้มค่ากว่า ในทำนองเดียวกัน หากรูปภาพของคุณเรียบง่าย (เช่น โลโก้พื้นฐาน วัตถุชิ้นเดียว) หรือคุณต้องการปริมาณงานสูงมากในงบประมาณที่จำกัด โมเดลวิทัศน์ขนาดเล็กอย่าง Qwen2-VL 7B ก็อาจเพียงพอ โมเดลนี้จะคุ้มค่าที่สุดเมื่อคุณต้องจัดการกับรูปภาพที่ซับซ้อนและมีความละเอียดสูง เอกสารที่มีข้อความหนาแน่น หรืองานที่ต้องใช้การให้เหตุผลแบบหลายรูปแบบเชิงลึก บน OrcaRouter คุณสามารถเปรียบเทียบราคาและเปลี่ยนรหัสโมเดลได้อย่างง่ายดาย
ไม่ Qwen3 VL 235B A22B Instruct เป็นโมเดลสำหรับสร้างข้อความที่รับเฉพาะภาพเป็นอินพุตเท่านั้น โมเดลนี้ไม่ได้สร้างภาพ เสียง หรือรูปแบบอื่นใด ผลลัพธ์จะเป็นข้อความเสมอ หากคุณต้องการสร้างภาพ คุณจะต้องใช้โมเดลที่แยกต่างหาก จุดแข็งของโมเดลนี้อยู่ที่ความสามารถในการเข้าใจและให้เหตุผลเกี่ยวกับอินพุตภาพ ตัวอย่างเช่น สามารถอธิบายว่าภาพมีลักษณะอย่างไร หรือตอบคำถามเกี่ยวกับภาพ แต่ไม่สามารถสร้าง แก้ไข หรือแปลงภาพได้ด้วยตัวเอง
คะแนน MMLU-Pro ที่รายงานสำหรับโมเดลนี้คือ 82.3 MMLU-Pro เป็นเวอร์ชันที่ปรับปรุงของเกณฑ์มาตรฐาน Massive Multitask Language Understanding ซึ่งครอบคลุม 57 หัวข้อในสาขา STEM, มนุษยศาสตร์ และสังคมศาสตร์ คะแนน 82.3 บ่งบอกถึงความรู้ทั่วไปและการใช้เหตุผลที่ดีในหลากหลายหัวข้อ เป็นค่าสรุปตัวเลขเดียว; ประสิทธิภาพอาจแตกต่างกันไปในแต่ละหัวข้อ คะแนนนี้ทำให้โมเดลอยู่ในกลุ่มที่มีประสิทธิภาพสูงสุดในคลาสขนาดเดียวกัน โดยเฉพาะเมื่อพิจารณาสถาปัตยกรรม MoE ที่เปิดใช้งานเพียงเศษเสี้ยวของพารามิเตอร์ทั้งหมดต่อการสอบถาม
จุดแข็ง ได้แก่ ความแม่นยำสูงในการวัดประสิทธิภาพการใช้เหตุผลแบบ multimodal, การทำตามคำสั่งที่แข็งแกร่ง, และความคุ้มค่าด้านต้นทุนเมื่อเทียบกับ dense models ที่มีจำนวนพารามิเตอร์รวมใกล้เคียงกัน การออกแบบ MoE ช่วยให้สามารถขยายขีดความสามารถโดยไม่ต้องเพิ่มต้นทุนการคำนวณตามสัดส่วน ข้อจำกัด ได้แก่ ต้นทุนสัมบูรณ์ที่สูงกว่าเมื่อเทียบกับโมเดลที่เล็กกว่า, ความหน่วงที่อาจเพิ่มขึ้นเนื่องจากจำนวนพารามิเตอร์รวมที่มาก (แม้จะมีเพียง 22B ที่ทำงานอยู่ แต่โมเดลทั้งหมดต้องโหลดในหน่วยความจำ) นอกจากนี้ยังอาจเกิดภาพหลอนในรายละเอียดของรูปภาพเป็นครั้งคราว หรือล้มเหลวกับอินพุตภาพที่คลุมเครือมาก ประสิทธิภาพในงานเฉพาะโดเมน (เช่น การถ่ายภาพทางการแพทย์) ไม่ได้รับประกัน
ความเร็วในการอนุมานขึ้นอยู่กับแบ็กเอนด์ฮาร์ดแวร์ที่ OrcaRouter ใช้และโหลดปัจจุบัน ในฐานะที่เป็นโมเดล MoE ที่มีพารามิเตอร์รวม 235 พันล้านพารามิเตอร์ จึงต้องใช้หน่วยความจำ GPU อย่างมากถึงแม้จะมีพารามิเตอร์ที่ถูกเปิดใช้งานเพียง 22 พันล้านพารามิเตอร์ต่อโทเค็น ซึ่งโดยทั่วไปแล้วส่งผลให้มีความหน่วงต่อคำขอสูงกว่าเมื่อเทียบกับโมเดลหนาแน่นขนาดเล็กกว่า (เช่น 7B-70B พารามิเตอร์) ปริมาณงานยังได้รับผลกระทบจากขนาดแบตช์และความยาวลำดับ สำหรับแอปพลิเคชันที่ไวต่อความหน่วง ควรพิจารณาใช้โมเดลที่มีขนาดเล็กกว่าหรือปรับให้เหมาะสมกับพรอมป์ที่สั้นกว่า OrcaRouter ไม่ได้ให้การรับประกันความหน่วงที่เฉพาะเจาะจง แต่มุ่งหวังให้มีการตอบสนองในระดับการผลิต
OrcaRouter คิดค่าธรรมเนียมตามอัตราที่ผู้ให้บริการระบุไว้เท่านั้น: $0.40 ต่อ 1 ล้าน input tokens และ $1.60 ต่อ 1 ล้าน output tokens ไม่มีค่าใช้จ่ายเพิ่มเติม ทั้ง input และ output tokens ถูกนับตามกฎการแบ่ง token ของ OpenAI ซึ่งอาจแตกต่างจาก tokenizer ภายในของโมเดลเล็กน้อย รูปภาพจะถูกคิดค่าบริการเป็น tokens เช่นกัน โดยขึ้นอยู่กับขนาดและระดับรายละเอียดตามนโยบายของผู้ให้บริการ คุณสามารถประมาณค่าใช้จ่ายได้โดยการคูณจำนวน token ที่คาดว่าจะใช้กับอัตราเหล่านี้
ราคาต่อโทเค็นสูงกว่าโมเดลขนาดเล็กหรือหนาแน่น แต่สถาปัตยกรรม MoE มีความจุต่อพารามิเตอร์ที่ทำงานอยู่มากกว่าโมเดลหนาแน่นที่มีขนาดทำงานเท่ากัน สำหรับงานมัลติโมดัลที่ซับซ้อน โมเดลนี้อาจทำงานให้เสร็จโดยใช้โทเค็นน้อยลงหรือมีความแม่นยำสูงกว่า ซึ่งอาจลดค่าใช้จ่ายรวม อย่างไรก็ตาม สำหรับงานง่ายๆ โมเดลที่ถูกกว่าจะช่วยลดต้นทุน บน OrcaRouter คุณสามารถสลับโมเดลได้ทันที ทำให้คุณใช้โมเดลนี้เมื่อจำเป็นเท่านั้น ไม่มีข้อผูกพันขั้นต่ำรายเดือนหรือค่าธรรมเนียมแอบแฝง
OrcaRouter ไม่ได้เปิดเผยนโยบายการแคชเฉพาะสำหรับโมเดลนี้ในขณะนี้ การแคชในระดับโทเค็นอาจถูกนำไปใช้โดยผู้ให้บริการพื้นฐาน แต่ไม่รับประกัน ไม่มีส่วนลดสำหรับปริมาณมากหรือการกำหนดราคาแบบหลายระดับที่กล่าวถึง อัตราคงที่ต่อโทเค็น สำหรับผู้ใช้ที่มีปริมาณสูง อาจคุ้มค่าที่จะติดต่อฝ่ายสนับสนุนของ OrcaRouter สำหรับการจัดเตรียมแบบกำหนดเองที่อาจเป็นไปได้ โดยทั่วไป ราคามีความโปร่งใสและคิดตามการใช้งาน
รูปภาพจะถูกแปลงเป็นจำนวนโทเค็นตามความละเอียดและการตั้งค่ารายละเอียด โดยสูตรที่แน่นอนจะถูกกำหนดโดยผู้ให้บริการ (Qwen) และอาจแตกต่างกันไป โดยทั่วไปแล้ว รูปภาพที่มีความละเอียดสูงกว่าจะใช้โทเค็นมากกว่า OrcaRouter จะส่งผ่านการทำโทเค็นของผู้ให้บริการโดยไม่มีการเปลี่ยนแปลง คุณสามารถควบคุมค่าใช้จ่ายได้โดยการปรับขนาดรูปภาพหรือใช้โหมดรายละเอียดต่ำหากโมเดลรองรับ โปรดอ้างอิงเอกสารของผู้ให้บริการเสมอสำหรับการคำนวณโทเค็นรูปภาพที่แม่นยำ โทเค็นอินพุตสำหรับรูปภาพจะถูกนับรวมในอัตรา $0.40 ต่อล้าน
คุณส่งคำขอ POST ไปยัง https://api.orcarouter.ai/v1/chat/completions ด้วย JSON payload ที่เข้ากันได้กับ OpenAI ตั้งค่าฟิลด์ model เป็น "qwen/qwen3-vl-235b-a22b-instruct" รวมอาร์เรย์ messages ซึ่งแต่ละข้อความสามารถมีข้อความและ/หรือรูปภาพ สำหรับรูปภาพ ให้ใช้รูปแบบเนื้อหารูปภาพมาตรฐานของ OpenAI (URL หรือ base64) การยืนยันตัวตนผ่าน Bearer token (คีย์ API ของคุณ) พารามิเตอร์ตัวอย่าง: temperature, max_tokens, top_p และ stop sequences ทำงานเหมือนกับ OpenAI API เอกสารของ OrcaRouter ให้รายละเอียดทั้งหมด
พารามิเตอร์ chat completions มาตรฐานทั้งหมดรองรับ: temperature (0-2, ค่าเริ่มต้น 1), top_p (0-1, ค่าเริ่มต้น 1), max_tokens (จำนวนโทเค็นเอาต์พุต), stop (รายการสตริง), presence_penalty, frequency_penalty และ seed สำหรับการทำซ้ำได้ โมเดลยังเคารพ system messages สำหรับการกำหนดพฤติกรรม สำหรับคำขอ multimodal คุณรวมส่วนรูปภาพในเนื้อหาของข้อความผู้ใช้ ไม่มีพารามิเตอร์เฉพาะโมเดลที่เปิดเผย; API ถูกเก็บไว้แบบทั่วไปเพื่อความเข้ากันได้ หากคุณต้องการควบคุมการกำหนดเส้นทาง MoE นั้นจะถูกจัดการภายใน
ใช่ เพราะ OrcaRouter ใช้รูปแบบ API ของ OpenAI การย้ายจึงเป็นเรื่องตรงไปตรงมา เพียงแทนที่ base URL และรหัสโมเดลเดิมของคุณด้วย endpoint ของ OrcaRouter และ "qwen/qwen3-vl-235b-a22b-instruct" ตรวจสอบให้แน่ใจว่า API key ของคุณใช้งานได้และมีเครดิตเพียงพอ รูปแบบข้อความสำหรับรูปภาพเหมือนกับของ OpenAI (ใช้ประเภทเนื้อหา 'image_url') คุณอาจต้องปรับการประมาณค่าจำนวนโทเค็นเนื่องจากการแบ่งโทเค็นที่ต่างกัน ไม่จำเป็นต้องเปลี่ยนแปลงตรรกะของแอปพลิเคชันของคุณนอกเหนือจาก endpoint และชื่อโมเดล
Qwen3 VL 235B A22B Instruct และ GPT-4V ต่างก็รองรับอินพุตแบบ multimodal ความแตกต่างหลัก: Qwen3 VL ใช้ MoE โดยมีพารามิเตอร์ที่ทำงานอยู่ 22B ในขณะที่ GPT-4V เป็นโมเดลแบบ dense ที่เป็นกรรมสิทธิ์ซึ่งไม่เปิดเผยขนาด ราคา Qwen3 VL ผ่าน OrcaRouter อยู่ที่ $0.40/$1.60 ต่อล้านโทเค็น ซึ่งต่ำกว่าอัตราทั่วไปของ GPT-4V อย่างมาก คะแนน benchmark ไม่สามารถเปรียบเทียบโดยตรงได้เนื่องจาก MMLU-Pro และการทดสอบอื่นๆ ใช้ชุดย่อยที่แตกต่างกัน GPT-4V มีการสนับสนุนระบบนิเวศที่กว้างกว่า แต่ Qwen3 VL เสนอข้อได้เปรียบด้านต้นทุนสำหรับเวิร์กโหลด multimodal ปริมาณสูงบน OrcaRouter
Claude 3.5 Sonnet เป็นโมเดลแบบหนาแน่น (dense model) จาก Anthropic ที่มีความสามารถด้านข้อความและภาพที่แข็งแกร่ง มันไม่ได้ใช้ MoE ดังนั้นความจุรวมของมันจึงน้อยกว่าพารามิเตอร์ทั้งหมดของ Qwen3 VL แต่ความจุที่ใช้งานจริงต่อการอนุมานหนึ่งครั้งนั้นสูงกว่า 22B ราคาของ Claude 3.5 Sonnet โดยทั่วไปจะสูงกว่าต่อโทเค็น (ประมาณ $3.00/$15.00 ต่อล้านโทเค็น) Qwen3 VL มีต้นทุนที่ต่ำกว่ามากสำหรับงานแบบ multimodal อย่างไรก็ตาม โมเดล Claude มีหน้าต่างบริบทที่ใหญ่กว่า (200K โทเค็น) การเลือกขึ้นอยู่กับงบประมาณ ความต้องการความยาวของบริบท และผู้ให้บริการที่ต้องการ
OrcaRouter น่าจะมีโมเดล Qwen อื่นๆ เช่น Qwen2.5 7B, Qwen2.5 72B หรือรุ่น Qwen2-VL ต่างๆ โมเดล Qwen3 VL 235B A22B Instruct เป็นโมเดล multimodal MoE ที่ใหญ่ที่สุดในกลุ่ม Qwen เมื่อเทียบกับ Qwen2-VL 72B แล้ว โมเดลนี้มีพารามิเตอร์ทั้งหมดมากกว่าและมีสถาปัตยกรรม MoE ซึ่งสามารถให้ประสิทธิภาพที่ดีกว่าในงานที่ซับซ้อน พร้อมทั้งรักษาต้นทุนการอนุมานที่สมเหตุสมผล แม้จะมีราคาต่อ token แพงกว่าโมเดล Qwen ขนาดเล็ก แต่อาจคุ้มค่าหากลดความจำเป็นในการเรียกใช้หลายครั้งหรือการใช้ token ที่สูง
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| อินพุต / 1M โทเค็น | $0.400 |
| เอาต์พุต / 1M โทเค็น | $1.60 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructเปิด @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct