Qwen3-VL 8B Thinking — โมเดลการใช้เหตุผลด้านการมองเห็น-ภาษาขนาดเล็กแบบน้ำหนักเปิด, 8B พารามิเตอร์, บริบท 128k
Qwen3 VL 8B Thinking เป็นโมเดลภาษาแบบ multimodal ที่มีพารามิเตอร์ 8 พันล้าน ตัวพัฒนาโดยทีม Qwen ที่ Alibaba Cloud โฮสต์บน OrcaRouter ภายใต้ผู้ให้บริการ qwen มันอยู่ในตระกูล Qwen3 ของโมเดล…
Qwen3 VL 8B Thinking มีความสามารถโดดเด่นในการตอบคำถามเชิงภาพ โดยเฉพาะเมื่อคำถามเกี่ยวข้องกับวัตถุหลายชิ้น ความสัมพันธ์เชิงพื้นที่ หรือข้อความที่ฝังอยู่ในภาพ (เช่น ป้ายถนน ใบเสร็จ) นอกจากนี้ยังสามารถจัดการงานด้านความเข้าใจวิดีโอ เช่น การสรุปคลิปสั้นๆ การระบุการกระทำ หรือการตอบคำถามเกี่ยวกับช่วงเวลาที่เฉพาะเจาะจง การวิเคราะห์เอกสารเป็นกรณีการใช้งานที่แข็งแกร่ง: การดึงข้อมูลจากไฟล์ PDF ที่มีทั้งข้อความและแผนภูมิ หรือจากฟอร์มที่สแกนมา หน้าต่างบริบทยาวทำให้เหมาะสำหรับการประมวลผลเอกสารขนาดใหญ่ (เช่น PDF มากกว่า 100 หน้า) ที่มีการแทรกรูปภาพเป็นครั้งคราว ตราบใดที่อินพุตที่ถูก tokenize ทั้งหมดยังคงต่ำกว่า 131K
หากกรณีการใช้งานของคุณเป็นแบบข้อความล้วนและไม่เกี่ยวข้องกับรูปภาพหรือวิดีโอ โมเดลที่เน้นข้อความโดยเฉพาะ (เช่น Qwen3-8B หรือ Llama ตัวแปรที่มีขนาดใกล้เคียงกัน) มักจะคุ้มค่ากว่า โมเดลหลายรูปแบบ (Multimodal) มีค่าใช้จ่ายเพิ่มเติมสำหรับการเข้ารหัสข้อมูลนำเข้าที่เป็นภาพ และราคาต่อโทเค็นของ Qwen3 VL 8B Thinking ($0.18 สำหรับ input, $2.10 สำหรับ output ต่อล้านโทเค็น) อาจสูงกว่าทางเลือกที่เน้นข้อความหลายตัว นอกจากนี้ หากงานของคุณคือการจำแนกประเภทหรือการดึงข้อมูลอย่างง่ายจากรูปภาพที่สั้นมาก โมเดลภาษา-ภาพขนาดเล็กที่มีความหน่วงและต้นทุนต่ำกว่า (เช่น Qwen2 VL 2B) ก็อาจเพียงพอโดยไม่ต้องเสียสละประสิทธิภาพ
ใช่ โมเดลสามารถรับภาพหลายภาพที่สลับกับข้อความในการเรียก API เดียว ตราบใดที่จำนวนโทเค็นทั้งหมด (โทเค็นภาพบวกโทเค็นข้อความ) ยังคงอยู่ภายในหน้าต่างบริบท 131,072 ภาพแต่ละภาพจะถูกเข้ารหัสเป็นจำนวนโทเค็นที่แปรผันตามความละเอียดและความซับซ้อนของภาพ API ที่เข้ากันได้กับ OpenAI ของ OrcaRouter อนุญาตให้คุณส่ง URL ภาพหลายรายการหรือภาพที่เข้ารหัส base64 ในอาร์เรย์เนื้อหา ไม่มีขีดจำกัดตายตัวเกี่ยวกับจำนวนภาพนอกเหนือจากข้อจำกัดของบริบท สำหรับวิดีโอ โดยทั่วไปคุณจะต้องแยกเฟรมสำคัญและส่งเป็นภาพแยกต่างหากพร้อมกับข้อความแจ้ง
เช่นเดียวกับโมเดล multimodal ทั้งหมด Qwen3 VL 8B Thinking อาจเกิดอาการหลอนรายละเอียดในภาพหรือวิดีโอ โดยเฉพาะเมื่อมีความละเอียดต่ำหรือเนื้อหาที่คลุมเครือ มันไม่ได้ออกแบบมาสำหรับสตรีมมิ่งวิดีโอแบบเรียลไทม์ แต่จะประมวลผลชุดเฟรมแบบคงที่ ขนาดพารามิเตอร์ 8B หมายความว่ามันอาจมีความแม่นยำน้อยกว่าในโดเมนเฉพาะทางสูง (เช่น การถ่ายภาพทางการแพทย์, ภาพถ่ายดาวเทียม) เมื่อเทียบกับโมเดลที่ใหญ่กว่า (เช่น โมเดล vision-language 70B-100B+) มันไม่รองรับการป้อนข้อมูลเสียง กระบวนการคิดสามารถทำให้ความยาวเอาต์พุตเพิ่มขึ้น ดังนั้นควรจัดสรรโทเค็นเอาต์พุตให้เหมาะสม สุดท้ายนี้ มันได้รับการปรับให้เหมาะสมสำหรับภาษาอังกฤษ แต่สามารถรองรับภาษาอื่นได้อย่างมีประสิทธิภาพที่แตกต่างกัน
คะแนนมาตรฐานเฉพาะสำหรับ Qwen3 VL 8B Thinking ในการประเมินผลแบบ multimodal มาตรฐาน (เช่น MMMU, MathVista, VideoMME) ยังไม่ได้ถูกระบุไว้ในข้อมูลที่มีอยู่ ผู้ใช้ควรตรวจสอบบัตรโมเดล Qwen หรือเอกสารวิจัยอย่างเป็นทางการสำหรับผลลัพธ์ที่ถูกตีพิมพ์ในที่สุด โดยทั่วไปแล้ว ซีรีส์ Qwen3 VL ได้แสดงประสิทธิภาพที่แข่งขันได้ในงานด้าน vision-language เมื่อเทียบกับโมเดลพารามิเตอร์ 7B-8B อื่นๆ ตัวแปร "Thinking" คาดว่าจะปรับปรุงเกณฑ์มาตรฐานที่เน้นการใช้เหตุผล เช่น visual chain-of-thought หากไม่มีคะแนนสาธารณะ ควรทดสอบโมเดลกับชุดข้อมูลที่เป็นตัวแทนของคุณเองเพื่อประเมินความเหมาะสม
ข้อมูลเวลาแฝงสำหรับโมเดลเฉพาะนี้บนโครงสร้างพื้นฐานของ OrcaRouter ยังไม่ถูกเปิดเผย โดยทั่วไปแล้ว โมเดล multimodal ขนาด 8B พารามิเตอร์จะมีเวลาแฝงสูงกว่าโมเดลข้อความล้วนขนาดเดียวกันเนื่องจากการเข้ารหัสภาพ การป้อนวิดีโอจะเพิ่มเวลาแฝงมากขึ้นอีกเนื่องจากต้องประมวลผลเฟรมเพิ่มเติม บนคลัสเตอร์ GPU ประสิทธิภาพสูง (เช่น A100, H100) โดยทั่วไปเวลาจนถึงโทเค็นแรกสำหรับโมเดลขนาด 8B จะอยู่ในช่วงไม่กี่ร้อยมิลลิวินาทีถึงไม่กี่วินาที ขึ้นอยู่กับความยาวของอินพุตและขนาดแบตช์ ความเร็วในการสร้างโทเค็นเอาต์พุตมักวัดเป็นสิบโทเค็นต่อวินาที ค่าเหล่านี้เป็นค่าเชิงคุณภาพ ประสิทธิภาพจริงขึ้นอยู่กับการจัดเตรียมและโหลดปัจจุบันของ OrcaRouter
จุดแข็ง: โมเดลสามารถรองรับบริบทหลายรูปแบบที่มีความยาว (131K โทเค็น) อนุญาตให้มีเอาต์พุตขนาดใหญ่ (สูงสุด 40K โทเค็น) และประมวลผลอินพุตสามประเภท ความสามารถในการคิดช่วยปรับปรุงการให้เหตุผลในงานที่ต้องใช้การอนุมานทีละขั้นตอน มีราคาที่แข่งขันได้สำหรับโมเดลหลายรูปแบบขนาด 8B ข้อจำกัด: ยังไม่มีการเปรียบเทียบกับโมเดลแนวหน้าล่าสุดในลีดเดอร์บอร์ดสาธารณะหลายแห่ง ปริมาณงานเอาต์พุตสูงสุดอาจต่ำกว่าโมเดลขนาดเล็ก ไม่ได้รับการปรับให้เหมาะสมสำหรับการสร้างภาพเชิงสร้างสรรค์ (เอาต์พุตเป็นข้อความเท่านั้น) ผู้ใช้ไม่ควรสันนิษฐานว่าไม่มีภาพหลอนในงานด้านภาพ การประมวลผลวิดีโอจำกัดเฉพาะการแยกเฟรมเท่านั้น ไม่ใช่การวิเคราะห์ต่อเนื่อง
Qwen3 VL 8B Thinking จะถูกคิดค่าบริการตามอัตราของผู้ให้บริการต่อโทเคน โดยไม่มีการบวกเพิ่ม โทเคนอินพุตมีค่าใช้จ่าย $0.18 ต่อ 1 ล้านโทเคน โทเคนเอาต์พุตมีค่าใช้จ่าย $2.10 ต่อ 1 ล้านโทเคน ไม่มีค่าธรรมเนียมโครงสร้างพื้นฐานเพิ่มเติม ไม่มีค่าใช้จ่ายพื้นฐานต่อคำขอ และไม่มีค่าสมัครรายเดือน ราคาใช้บังคับเท่ากันกับทุกรูปแบบอินพุต (ข้อความ, รูปภาพ, วิดีโอ); แต่ละรูปแบบจะถูกแปลงเป็นโทเคนและคิดค่าใช้จ่ายตามอัตราอินพุต OrcaRouter ไม่คิดค่าใช้จ่ายเพิ่มเติมใด ๆ เหนืออัตราที่ระบุไว้ ตัวอย่างเช่น การประมวลผลรูปภาพที่แปลงเป็นโทเคนอินพุต 2,000 โทเคน จะมีค่าใช้จ่ายอินพุต 2,000 * ($0.18 / 1M) = $0.00036. ค่าใช้จ่ายเอาต์พุตถูกคำนวณในลักษณะเดียวกัน
รูปภาพแต่ละภาพจะถูกเข้ารหัสเป็นจำนวนโทเค็นที่แปรผันตามขนาดและระดับการบีบอัดของภาพ รูปภาพที่มีความละเอียดสูงอาจใช้โทเค็นหลายพันตัว วิดีโอจะถูกจัดการโดยการแยกเฟรม (โดยปกติหนึ่งเฟรมต่อไม่กี่วินาที) และเข้ารหัสแต่ละเฟรมเป็นรูปภาพ ดังนั้นต้นทุนโทเค็นจะเพิ่มขึ้นเชิงเส้นตามระยะเวลาและอัตราเฟรมของวิดีโอ ผู้ใช้สามารถควบคุมต้นทุนได้โดยการปรับขนาดรูปภาพหรือลดจำนวนเฟรม ไม่มีค่าธรรมเนียมแยกสำหรับการเข้ารหัสสื่อที่เกินกว่าต้นทุนโทเค็น ต้นทุนเอาต์พุตขึ้นอยู่กับจำนวนโทเค็นข้อความที่สร้างเท่านั้น สำหรับวิดีโอยาว โทเค็นอินพุตอาจเข้าถึงขีดจำกัด 131K ได้อย่างรวดเร็ว ซึ่งเพิ่มต้นทุนต่อคำขอ
ตามข้อมูลที่มีให้ในขณะนี้ ไม่มีส่วนลดสำหรับการใช้งานแบบกลุ่มหรือการชำระล่วงหน้า ปัจจุบัน OrcaRouter ไม่มีการแคชโทเค็นที่จะช่วยลดต้นทุนสำหรับการป้อนข้อมูลหรือรูปภาพซ้ำๆ คำขอทั้งหมดจะถูกคิดเงินตามจำนวนโทเค็นแบบเรียลไทม์ในอัตรามาตรฐาน หากผู้ให้บริการ (qwen) เปิดตัวราคาระดับลดราคาในอนาคต OrcaRouter จะส่งต่อส่วนลดนั้นโดยไม่บวกเพิ่ม ผู้ใช้ควรติดตามหน้าข้อมูลราคาของ OrcaRouter เพื่อดูอัปเดตต่างๆ สำหรับการใช้งานที่มีปริมาณสูง ควรพิจารณาติดต่อ OrcaRouter โดยตรงเพื่อหารือเกี่ยวกับราคาตามปริมาณที่อาจเป็นไปได้
เมื่อเปรียบเทียบกับโมเดลมัลติโมดัลขนาดใหญ่ (เช่น GPT-4V, Gemini 1.5 Pro) แล้ว Qwen3 VL 8B Thinking มีต้นทุนต่อโทเค็นที่ถูกกว่าอย่างมาก: โดยทั่วไปโมเดลเหล่านั้นมีราคา $2–$10+ ต่อล้านโทเค็นอินพุต ในกลุ่มโมเดลวิทัศน์-ภาษาที่มีพารามิเตอร์ 7B-8B ราคาของมันอยู่ในแนวเดียวกับราคาทั่วไป (Qwen2 VL 7B มีราคาอินพุตประมาณ $0.10–$0.20 และเอาต์พุต $1–$2) ต้นทุนโทเค็นเอาต์พุต ($2.10 ต่อล้าน) สูงกว่าโมเดลข้อความล้วน 8B บางรุ่น (เช่น $0.20 ต่อล้านเอาต์พุต) ซึ่งสะท้อนถึงค่าใช้จ่ายเพิ่มเติมด้านการให้เหตุผล หากคุณสามารถใช้โมเดลที่มีขนาดเล็กลง (เช่น พารามิเตอร์ 2B–4B) ต้นทุนจะลดลง 50–90% แต่ความสามารถจะลดลง
คุณเรียกใช้ Qwen3 VL 8B Thinking โดยส่งคำขอ POST ไปยังปลายทางที่เข้ากันได้กับ OpenAI ของ OrcaRouter ที่ https://api.orcarouter.ai/v1/chat/completions ตั้งค่าพารามิเตอร์ model เป็น "qwen/qwen3-vl-8b-thinking" รวมคีย์ API ของคุณในส่วนหัว Authorization เป็น "Bearer <key>" เนื้อหาคำขอเป็นไปตามสคีมา chat completions ของ OpenAI สำหรับอินพุตแบบหลายรูปแบบ ให้จัดโครงสร้างเนื้อหาข้อความเป็นอาร์เรย์ของอ็อบเจกต์: หนึ่งรายการมี type เป็น "text" สำหรับข้อความแจ้ง และหนึ่งรายการมี type เป็น "image_url" สำหรับแต่ละภาพ (ด้วย URL หรือข้อมูล base64) วิดีโอสามารถส่งเป็นรายการ image_url หลายรายการที่แสดงเฟรม การตอบสนองเป็นไปตามโครงสร้าง OpenAI มาตรฐาน โดยข้อความที่สร้างทั้งหมดอยู่ในอาร์เรย์ choices
พารามิเตอร์การเติมเต็มแชทของ OpenAI มาตรฐานทั้งหมดรองรับ: temperature (0–2, ค่าเริ่มต้น 1.0), top_p (0–1, ค่าเริ่มต้น 1.0), max_tokens (สูงสุด 40960), ลำดับหยุด, frequency_penalty, presence_penalty, logprobs และ n (จำนวน completions) โมเดลไม่รองรับการสตรีมมิ่ง? OrcaRouter น่าจะรองรับการสตรีมมิ่งเมื่อตั้งค่า streaming=true; ตรวจสอบเอกสารของผู้ให้บริการ พารามิเตอร์ tools (function calling) อาจรองรับหากผู้ให้บริการพื้นฐานเปิดใช้งาน; ปัจจุบันยังไม่รับประกัน System prompt อนุญาตให้ใช้ สามารถส่งรหัสผู้ใช้เพื่อการตรวจสอบ ตรวจสอบให้แน่ใจว่าคุณอยู่ภายในหน้าต่างบริบท 131072 token โดยการตรวจสอบจำนวน token ก่อนส่ง
หากคุณกำลังใช้โมเดลเดียวกันจากผู้ให้บริการ API รายอื่น (เช่น โดยตรงจาก Alibaba Cloud) การย้ายไปยัง OrcaRouter นั้นทำได้ง่าย: เปลี่ยน base URL เป็น https://api.orcarouter.ai/v1, อัปเดตสตริงโมเดลเป็น "qwen/qwen3-vl-8b-thinking", และแทนที่ API key ด้วย OrcaRouter API key ไม่จำเป็นต้องเปลี่ยนแปลงโค้ดอื่นๆ เพราะ OrcaRouter ใช้อินเทอร์เฟซที่เข้ากันได้กับ OpenAI เหมือนกันทุกประการ โปรดทราบว่าการใช้งานโทเค็นและราคาจะเป็นไปตามอัตราของ OrcaRouter (ซึ่งส่งผ่านโดยไม่มีมาร์กอัป) คุณอาจต้องปรับเครื่องมือติดตามต้นทุนของคุณให้สะท้อนราคาใหม่
การสตรีมสามารถใช้งานได้ผ่าน API ของ OrcaRouter ตั้งค่าพารามิเตอร์ stream เป็น true ในคำขอของคุณ การตอบกลับจะเป็นการสตรีมแบบ Server-Sent Events (SSE) ที่มี delta ของโทเค็นที่สร้างขึ้น ซึ่งมีประโยชน์สำหรับการแสดงผลแบบเรียลไทม์ โปรดทราบว่าสำหรับตัวแปร "Thinking" กระบวนการคิดอาจทำให้เกิดความล่าช้านานขึ้นก่อนโทเค็นแรก แต่การสตรีมจะยังคงส่งโทเค็นเพิ่มเติมเมื่อมีการสร้างขึ้น รูปแบบการสตรีมเป็นไปตามข้อกำหนดการสตรีมของ OpenAI โดยมีเหตุการณ์ประเภท "chat.completion.chunk" แต่ละ chunk จะมี delta ที่มีเนื้อหาหรือบทบาทของโทเค็น
Qwen3 VL 8B Thinking เป็นรุ่นต่อจาก Qwen2 VL 7B โดยมีจำนวนพารามิเตอร์ใกล้เคียงกัน (8B เทียบกับ 7B) แต่มีสถาปัตยกรรมที่ปรับปรุงเพื่อรองรับบริบทที่ยาวขึ้น (131K เทียบกับ 32K ของ Qwen2 VL 7B) นอกจากนี้ยังเพิ่มความสามารถ "Thinking" สำหรับการให้เหตุผลแบบทีละขั้นตอน ซึ่งไม่มีใน Qwen2 VL ความยาวเอาต์พุตสูงสุดเพิ่มขึ้นจาก 2048 โทเคน (Qwen2 VL 7B) เป็น 40960 โทเคน ราคาต่อโทเคนของ Qwen3 VL 8B Thinking สูงกว่า Qwen2 VL 7B เล็กน้อย (ซึ่งมีราคาประมาณ $0.15 สำหรับอินพุต, $1.80 สำหรับเอาต์พุตต่อล้านโทเคน) สะท้อนถึงความสามารถที่เพิ่มขึ้นและบริบทที่ใหญ่ขึ้น ผู้ใช้ที่อัปเกรดควรคาดหวังประสิทธิภาพที่ดีขึ้นในงานที่ต้องใช้การให้เหตุผลที่ซับซ้อน
GPT-4o mini เป็นโมเดลมัลติโมดัลเรือธงจาก OpenAI ที่มีหน้าต่างบริบท 128K มีพารามิเตอร์มากกว่าอย่างมีนัยสำคัญ (ไม่ทราบแน่ชัด แต่ประมาณว่า >70B) และโดยทั่วไปมีความแม่นยำสูงกว่าในการวัดประสิทธิภาพมาตรฐาน อย่างไรก็ตาม Qwen3 VL 8B Thinking มีราคาถูกกว่าอย่างมาก: GPT-4o mini มีราคา $0.15 ต่อล้านโทเค็นอินพุต และ $0.60 ต่อล้านโทเค็นเอาต์พุต ซึ่งจริงๆ แล้วต่ำกว่าราคา $0.18 สำหรับอินพุตและ $2.10 สำหรับเอาต์พุตของ Qwen3 หรือไม่? เดี๋ยว ตรวจสอบอีกครั้ง: อินพุตของ GPT-4o mini $0.15, เอาต์พุต $0.60 — ถูกกว่า Qwen3 VL 8B Thinking หรือ? จริงๆ แล้วเอาต์พุตถูกกว่ามาก ดังนั้นราคาจึงไม่ได้ถูกกว่าในทุกด้าน แต่ Qwen3 รองรับวิดีโอและเอาต์พุตที่ยาวกว่า (40960 เทียบกับ 16384 สำหรับ GPT-4o mini) หน้าต่างบริบทใกล้เคียงกัน การเลือกขึ้นอยู่กับความแม่นยำและงบประมาณที่ต้องการ Qwen3 เป็นตัวเลือกเฉพาะสำหรับเอาต์พุตที่ยาวมากและการปรับใช้แบบโอเพนซอร์ส
Llama 3.2 11B Vision เป็นโมเดลแบบมัลติโหมดที่มีพารามิเตอร์ 11B พร้อมหน้าต่างบริบท 128K และจำนวนโทเค็นเอาต์พุตสูงสุด 8K Qwen3 VL 8B Thinking มีจำนวนพารามิเตอร์น้อยกว่า แต่มีเอาต์พุตสูงสุดมากกว่า (40960 เทียบกับ 8000) และมีความสามารถในการคิด ทั้งสองรองรับอินพุตข้อความและรูปภาพ แต่ Llama 3.2 11B ไม่รองรับวิดีโอโดยตรง ราคาของ Llama ผ่านผู้ให้บริการใกล้เคียงกัน โดยประมาณ $0.15–$0.20 สำหรับอินพุต $0.60–$1.00 สำหรับเอาต์พุตต่อล้านโทเค็น ทำให้ Qwen3 มีราคาแพงกว่าในส่วนเอาต์พุต สำหรับงานที่ต้องการข้อความที่สร้างยาวมาก (เช่น การเขียนรายงานจากวิดีโอ) Qwen3 เหมาะสมกว่า สำหรับงานที่สั้นกว่าและคำนึงถึงต้นทุน Llama 3.2 11B อาจเป็นตัวเลือกที่ดีกว่า
Gemini 1.5 Flash เป็นโมเดล multimodal ที่รวดเร็วและคุ้มค่าด้านต้นทุน ด้วย context window ขนาด 1M (สูงสุด 2M) รองรับภาพ วิดีโอ และเสียง มีราคาถูกกว่า Qwen3 VL 8B Thinking (Gemini Flash ราคา $0.075 ต่อ input, $0.30 ต่อ output ต่อล้าน token) และเร็วกว่า อย่างไรก็ตาม Qwen3 VL 8B Thinking มีกระบวนการคิด (thinking process) ที่ช่วยปรับปรุงการให้เหตุผลในงานภาพที่ท้าทาย และ output สูงสุดมีขนาดใหญ่กว่ามาก (40K เทียบกับ 8K ของ Gemini Flash) หากแอปพลิเคชันของคุณต้องการการให้เหตุผลทีละขั้นตอนและ output ที่ยาว Qwen3 เป็นตัวเลือกที่ดีกว่า สำหรับปริมาณงานสูงและ latency ต่ำ โดยทั่วไป Gemini Flash จะเหนือกว่า นอกจากนี้ อาจเลือกใช้ Qwen3 เมื่อความต้องการอธิปไตยของข้อมูลจำเป็นต้องมีการโฮสต์เองหรือการปรับใช้ที่ไม่ขึ้นกับผู้ให้บริการ
เข้ากันได้กับ OpenAI — ใช้ SDK เดิมของคุณได้เลย
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| อินพุต / 1M โทเค็น | $0.180 |
| เอาต์พุต / 1M โทเค็น | $2.10 |
| สกุลเงิน | USD |
ประมาณการจากราคาตั้ง
เป็นเพียงการประเมิน — จำนวน token จริงขึ้นอยู่กับ tokenizer ของผู้ให้บริการ
GET /api/public/models/qwen/qwen3-vl-8b-thinkingเปิด @misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking