Qwen 3.7 Flash: โมเดลวิทัศน์ราคาถูกมากของ Alibaba สำหรับเอเจนต์ที่มองหน้าจอได้จริง
Guides & Insights

Qwen 3.7 Flash: โมเดลวิทัศน์ราคาถูกมากของ Alibaba สำหรับเอเจนต์ที่มองหน้าจอได้จริง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ทีม Qwen ของ Alibaba ใช้เวลาสองปีที่ผ่านมาปล่อยโมเดลหลากหลายรุ่นอย่างต่อเนื่อง ครอบคลุมเกือบทุกระดับราคาและความสามารถเท่าที่จะจินตนาการได้ และในวันที่ 27 กรกฎาคม 2026 ก็มีอีกหนึ่งรุ่นปรากฏตัวอย่างเงียบ ๆ ในรูปแบบรายการ API เชิงพาณิชย์: qwen/qwen3.7-flash มันไม่ได้มาพร้อมกับความเอิกเกริกของการเปิดตัวรุ่นเรือธง และ Alibaba ก็ไม่ได้เผยแพร่รายงานทางเทคนิค ชุดวัดประสิทธิภาพ หรือแผนภาพสถาปัตยกรรมสำหรับโมเดลนี้ แต่สิ่งที่มันมาพร้อมด้วยคือคำอธิบายที่มีความสำคัญต่อนักพัฒนามากยิ่งกว่าคะแนนลีดเดอร์บอร์ดอีกหนึ่งตัว นั่นคือ โมเดลให้เหตุผลด้านภาพและภาษา หน้าต่างบริบทขนาด 1 ล้านโทเคน และราคาที่ถูกจนแทบไม่นับเป็นรายการค่าใช้จ่าย

การผสมผสานระหว่างราคาถูก เนื้อหากว้างใหญ่ และ "มองเห็น" ภาพได้โดยตรง ทำให้ Qwen 3.7 Flash อยู่ในหมวดหมู่ที่กลายเป็นหนึ่งในโมเดลที่มีการแข่งขันสูงที่สุดและมีประโยชน์มากที่สุดในตลาดโมเดลทั้งหมด นั่นคือ ม้าทำงานมัลติโมดัลต้นทุนต่ำ สิ่งเหล่านี้ไม่ใช่โมเดลที่คว้าอันดับในตารางวัดประสิทธิภาพ แต่เป็นโมเดลที่ถูกเรียกใช้งานวันละสิบล้านครั้งภายในลูปเอเจนต์ ไปป์ไลน์อัตโนมัติของเบราว์เซอร์ และเครื่องมือสนับสนุน เพราะเมื่อมีต้นทุนอินพุต $0.03 และเอาต์พุต $0.13 ต่อล้านโทเค็น ต้นทุนก็แทบจะไม่ใช่ข้อจำกัดในการออกแบบอีกต่อไป

บทความชิ้นนี้เป็นการอธิบายแบบ First Look: ว่าแท้จริงแล้ว Qwen 3.7 Flash คืออะไร, Alibaba เปิดเผยอะไรบ้าง (และที่สำคัญคือ สิ่งที่ยังไม่ได้เปิดเผย), เรื่องเศรษฐศาสตร์การใช้งานจะเป็นอย่างไรเมื่อคำนวณด้วยโทเคนจริง, และโมเดลนี้อยู่ตรงไหนในตระกูล Qwen — รวมถึงการเทียบกับ Qwen 3.8 และ Qwen 3.7 Max ที่ใหญ่กว่ามาก — และการเทียบกับคู่แข่ง multimodal ราคาย่อมเยาอย่าง Gemini 3.5 Flash-Lite เราจะพาไปดูด้วยว่าเลเยอร์จัดเส้นทางอย่าง OrcaRouter มองโมเดลแบบนี้อย่างไร: ไม่ใช่ในฐานะโมเดลเรือธง แต่เป็นชั้นค่าเริ่มต้นที่รองรับทราฟฟิก multimodal ส่วนใหญ่อย่างเงียบๆ

TL;DR

Qwen 3.7 Flash เป็นโมเดลวิทัศน์-ภาษา (vision-language model) จากทีม Qwen ของ Alibaba โดยใช้รหัสโมเดลqwen/qwen3.7-flash ตั้งแต่วันที่ 27 กรกฎาคม 2026 โมเดลนี้สร้างขึ้นสำหรับเอเจนต์มัลติโมดัล การเขียนโค้ดเชิงภาพ การค้นหา และการโต้ตอบกับคอมพิวเตอร์/UI โดยมีจุดแข็งที่อ้างไว้ในด้านการรู้จำวัตถุและความเข้าใจเชิงพื้นที่ รองรับหน้าต่างบริบท 1,000,000 โทเคน และมีราคาอยู่ที่$0.03 ต่อโทเคนนำเข้า 1M และ $0.13 ต่อโทเคนส่งออก 1M — ซึ่งถือเป็นหนึ่งในโมเดลที่รองรับภาพที่ถูกที่สุดที่มีอยู่ในปัจจุบัน ความยาวเอาต์พุตสูงสุด จำนวนพารามิเตอร์ที่แน่นอน และสถาปัตยกรรมไม่ได้รับการเปิดเผยอย่างเป็นทางการ; การคาดเดาในชุมชนชี้ไปที่การออกแบบ mixture-of-experts ขนาดเล็ก และอาจเป็นรุ่นก่อนหน้าของการเผยแพร่ Qwen 3.7 แบบ open-weight แต่ยังไม่ได้รับการยืนยัน โมเดลนี้มีความแตกต่าง เป็นรุ่นที่เล็กกว่าและถูกกว่าทั้ง Qwen 3.8 (เรือธง open-weight ขนาด 2.4T พารามิเตอร์ที่ Alibaba ประกาศแยกต่างหาก) และ Qwen 3.7 Max (เรือธงขนาดใหญ่กว่าในเจเนอเรชันเดียวกันนี้) ยังไม่มีชุดเกณฑ์มาตรฐานอิสระใด — รวมถึง Artificial Analysis — ที่ให้คะแนนโมเดลนี้ ดังนั้นควรถือว่าข้อกล่าวอ้างด้านคุณภาพยังอยู่ในช่วงเริ่มต้นและยังไม่ได้รับการพิสูจน์จนกว่าจะมีตัวเลขจากบุคคลที่สาม

ประเด็นสำคัญ

• Qwen 3.7 Flash เป็นโมเดลภาษาแบบมองเห็น (vision-language) ไม่ใช่เฉพาะข้อความ — มันถูกออกแบบมาสำหรับเอเจนต์มัลติโมดัล, การเขียนโค้ดแบบภาพ, การค้นหา, และงานที่ใช้คอมพิวเตอร์, ไม่ใช่การสนทนาทั่วไป

• ราคาคือ $0.03 ต่อ 1M โทเค็นอินพุต และ $0.13 ต่อ 1M โทเค็นเอาต์พุต ซึ่งใกล้เคียงกับระดับราคาถูกที่สุดของโมเดล multimodal ที่ใกล้เคียงกับ frontier ที่มีอยู่ในตลาดในปัจจุบัน

• หน้าต่างบริบทคือ 1M โทเคน ซึ่งมีความสำคัญมากกว่าที่ฟังดูสำหรับเซสชันตัวแทนที่มีรูปภาพหนักและหลายรอบ เนื่องจากรูปภาพและภาพหน้าจอใช้โทเคนอย่างรวดเร็ว

• หมายเหตุด้านราคาของรายการระบุว่าด้วย prompt caching สำหรับ context ที่เกิดขึ้นซ้ำ ต้นทุนที่เกิดขึ้นจริงอาจต่ำกว่าราคาที่แสดง 60-80% — ซึ่งเป็นกลไกสำคัญสำหรับ agent loop ที่ต้องเล่นซ้ำ system prompt หรือประวัติภาพหน้าจอชุดเดิม

• Alibaba ยังไม่ได้เผยแพร่จำนวนโทเค็นสูงสุดที่ส่งออก จำนวนพารามิเตอร์ หรือรายละเอียดสถาปัตยกรรม; สิ่งที่เฉพาะเจาะจงอื่นๆ ที่คุณอ่านที่อื่นเป็นการคาดเดาของชุมชน ไม่ใช่การเปิดเผยจากผู้ขาย

• มันไม่ใช่ Qwen 3.8 (เรือธงแบบเปิดน้ำหนัก 2.4T) และไม่ใช่ Qwen 3.7 Max (เรือธงแบบปิดที่ใหญ่กว่าในรอบเปิดตัวเดียวกัน) — ความคล้ายคลึงของชื่อนั้นไม่สำคัญ ทั้งสามรุ่นนี้เป็นโมเดลที่แตกต่างกัน โดยมีหน้าที่แตกต่างกันสามอย่าง

• ไม่มีองค์กรทดสอบมาตรฐานอิสระใด รวมถึง Artificial Analysis ที่เผยแพร่คะแนนสำหรับ Qwen 3.7 Flash ณ เวลาที่เขียนนี้ — คุณภาพยังไม่ได้รับการพิสูจน์อย่างแท้จริง นอกเหนือจากคำอธิบายจากผู้ผลิต

Qwen 3.7 Flash จริงๆ แล้วคืออะไร

ถอดคราบแบบแผนการตั้งชื่อออกไป และ Qwen 3.7 Flash คือคำตอบของ Alibaba ต่อคำถามที่ทุกแล็บใหญ่ต่างก็ถามกันในตอนนี้: โมเดลจะมีหน้าตาเป็นอย่างไร เมื่อโจทย์การออกแบบทั้งหมดคือ "จัดการภาพ, การทำงานแบบเอเจนต์, การรับส่งข้อมูลปริมาณสูงให้ถูกที่สุดเท่าที่จะทำได้ โดยไม่ไร้ประโยชน์" Google ตอบด้วยกลุ่มผลิตภัณฑ์ Gemini Flash และ Flash-Lite OpenAI ตอบด้วยกลุ่มผลิตภัณฑ์ mini และ nano คำตอบของ Alibaba ในรุ่นนี้คือ Qwen 3.7 Flash

คำอธิบายอย่างเป็นทางการเน้นที่กรณีการใช้งานสี่กรณี ได้แก่ เอเจนต์มัลติโมดัล การเขียนโค้ดเชิงภาพ การค้นหา และการโต้ตอบกับคอมพิวเตอร์หรืออินเทอร์เฟซผู้ใช้ นั่นคือรายการที่ตั้งใจอย่างมาก มันไม่ใช่ "เก่งด้านการเขียนเชิงสร้างสรรค์" หรือ "การให้เหตุผลที่แข็งแกร่งในโจทย์โอลิมปิกคณิตศาสตร์" แต่เป็นรายการงานที่โมเดลต้องดูภาพหน้าจอ หน้าเว็บ ชิ้นส่วนของอินเทอร์เฟซผู้ใช้ หรือโค้ดที่แสดงผลเป็นภาพ แล้วดำเนินการตามนั้น Alibaba ยังชี้ให้เห็นถึงการรู้จำวัตถุและความเข้าใจเชิงพื้นที่ว่าเป็นจุดแข็งเฉพาะ ซึ่งสอดคล้องกับกรอบการใช้งานคอมพิวเตอร์และการโต้ตอบกับอินเทอร์เฟซ: เอเจนต์ที่จะคลิกปุ่ม อ่านเลย์เอาต์ หรือนำทางหน้าจอ จำเป็นต้องรู้ว่าสิ่งต่างๆ อยู่ที่ไหน ไม่ใช่แค่ความหมายของสิ่งที่พูด

มันคุ้มค่าที่จะอธิบายให้ชัดเจนว่า "การใช้เหตุผล" หมายถึงอะไรในบริบทนี้ Qwen 3.7 Flash ถูกอธิบายว่าเป็นโมเดลการใช้เหตุผลทางภาษา-ภาพ หมายความว่ามันคาดว่าจะทำงานผ่านงานด้านภาพแบบหลายขั้นตอน แทนที่จะแค่อธิบายภาพหรือตอบคำถามค้นหาเดียว นั่นคือความแตกต่างระหว่าง "อธิบายภาพหน้าจอนี้" กับ "นี่คือภาพหน้าจอของฟอร์มที่มีข้อผิดพลาดการตรวจสอบสามข้อ — ค้นหาว่ามีอะไรผิดและบอกฉันว่าควรแก้ไขฟิลด์ไหนก่อน"

สเปกและจุดเน้นด้านมัลติโมดัล-เอเจนติก

นี่คือรายการทั้งหมดของสิ่งที่ได้รับการยืนยันจริง ๆ เทียบกับสิ่งที่ยังไม่ได้รับการยืนยัน

ยืนยันแล้ว: ผู้สร้างคือทีม Qwen ของ Alibaba โดยระบุภายใต้รหัสโมเดล qwen/qwen3.7-flash เปิดใช้งานตั้งแต่วันที่ 27 กรกฎาคม 2026 รองรับอินพุตแบบมัลติโมดัล (ภาพและภาษา) หน้าต่างบริบทคือ 1,000,000 โทเค็น ราคาอยู่ที่ $0.03 ต่ออินพุต 1M โทเค็น และ $0.13 ต่อเอาต์พุต 1M โทเค็น หมายเหตุราคาในรายการระบุว่าการแคชพรอมต์สำหรับบริบทที่เกิดซ้ำสามารถลดต้นทุนจริงลงได้ 60-80% เมื่อเทียบกับราคาที่ระบุ สำหรับงานที่ใช้คำสั่งระบบเดียวกันหรืออ้างอิงรูปภาพซ้ำในการเรียกแต่ละครั้ง — รายละเอียดที่สำคัญมากสำหรับลูปเอเจนต์ที่ส่งประวัติภาพหน้าจอหรือสคีมาเครื่องมือชุดเดิมซ้ำในทุกเทิร์น

ไม่เปิดเผย:ขีดจำกัดของโทเค็นเอาต์พุตสูงสุด จำนวนพารามิเตอร์ที่แน่นอน สถาปัตยกรรม (dense vs. mixture-of-experts) องค์ประกอบของข้อมูลการฝึกอบรม คะแนนมาตรฐานจากฝ่ายแรกใดๆ

การคาดเดาของชุมชน (ให้ระบุว่าเป็นการคาดเดา เพราะนั่นคือทั้งหมดที่มี): เมื่อพิจารณาจากชื่อ "Flash" การตั้งราคาที่ aggressive และรูปแบบที่ Alibaba เคยทำกับ Qwen รุ่นก่อนหน้า ผู้สังเกตการณ์บางรายสงสัยว่า Qwen 3.7 Flash ใช้สถาปัตยกรรม mixture-of-experts ขนาดเล็กที่ปรับให้ต้นทุนต่อ token ต่ำ และอาจเป็นตัวอย่างหรือขั้นตอนการกลั่นก่อนการเปิดตัว Qwen 3.7 แบบ open-weight ในที่สุด ซึ่งสะท้อนให้เห็นว่า Qwen รุ่น "flash" หรือ "turbo" ในอดีตบางครั้งก็มาก่อนการเปิดตัวแบบกว้าง Alibaba ยังไม่ได้ยืนยันสิ่งนี้ ให้ถือเป็นการคาดเดาที่มีข้อมูล ไม่ใช่ข้อเท็จจริง จนกว่าจะมีรายงานทางเทคนิคหรือ model card อย่างเป็นทางการระบุเป็นอย่างอื่น

การไม่มีค่ากำลังสูงสุดที่เผยแพร่ออกมาเป็นสิ่งที่ควรแจ้งเตือนสำหรับผู้ที่กำลังสร้างระบบโดยใช้โมเดลนี้: หากกรณีการใช้งานของคุณต้องการผลลัพธ์ที่มีโครงสร้างยาว (เช่น JSON payload ขนาดใหญ่, การสร้างโค้ดหลายไฟล์, บทถอดความยาวๆ) คุณควรทดสอบขีดจำกัดผลลัพธ์ที่เกิดขึ้นจริงด้วยเชิงประจักษ์ก่อนที่จะนำไปใช้ในระบบผลิต เนื่องจากคุณไม่สามารถตรวจสอบเอกสารสำหรับตัวเลขที่ไม่มีอยู่ได้

ตัวอย่างการคิดราคา: ต้นทุนที่แท้จริงคืออะไร

ตัวเลขที่เล็กขนาดนี้มักถูกมองข้ามได้ง่าย ดังนั้นเรามาคำนวณเลขกันอย่างถูกต้องกันเถอะ

ที่อัตรา $0.03 ต่อ 1M โทเค็นอินพุต และ $0.13 ต่อ 1M โทเค็นเอาต์พุต การเรียกใช้ครั้งเดียวที่มีโทเค็นอินพุต 2,000 โทเค็น (ภาพหน้าจอขนาดปานกลางพร้อมคำแนะนำสั้นๆ) และโทเค็นเอาต์พุต 300 โทเค็น (คำตอบที่มีโครงสร้าง) มีค่าใช้จ่าย: 2,000/1,000,000 × $0.03 = $0.00006 สำหรับอินพุต บวก 300/1,000,000 × $0.13 = $0.000039 สำหรับเอาต์พุต รวมทั้งหมด: ประมาณ $0.0001 ต่อการเรียกใช้ — หนึ่งในร้อยของเซ็นต์

ขยายไปสู่ระดับปริมาณ เรียกใช้งาน 1 ล้านครั้ง — ซึ่งเป็นปริมาณรายวันที่สมเหตุสมผลสำหรับผลิตภัณฑ์เอเจนต์ขนาดกลางที่ทำการวิเคราะห์ภาพหน้าจอหรือตรวจสอบสถานะ UI — แล้วคุณจะได้: 1,000,000 × 2,000 = 2 พันล้าน input tokens × $0.03/1M = $60, บวกกับ 1,000,000 × 300 = 300 ล้าน output tokens × $0.13/1M = $39. รวมทั้งหมด: ประมาณ $99 สำหรับการเรียก vision-agent หนึ่งล้านครั้ง. แม้ก่อนที่จะเพิ่ม prompt caching (ซึ่งหมายเหตุในลิสต์แนะนำว่าอาจลดค่านี้ได้ 60-80% สำหรับงานที่มีบริบทซ้ำๆ) นั่นก็เป็นตัวเลขที่ทีมส่วนใหญ่อนุมัติได้โดยไม่ต้องประชุมเรื่องงบประมาณ.

ทีนี้ลองเปรียบเทียบสถานการณ์ที่หนักหน่วงกว่า: เอเจนต์ที่ใช้คอมพิวเตอร์ซึ่งรักษาบริบทแบบต่อเนื่องจำนวน 50,000 โทเค็น (ภาพหน้าจอ, ประวัติการกระทำ, ผลลัพธ์จากเครื่องมือ) และสร้างการกระทำ 500 โทเค็นต่อขั้นตอน โดยรัน 100,000 ครั้งต่อวัน ต้นทุนอินพุต: 100,000 × 50,000 = 5 พันล้านโทเค็น × $0.03/1M = $150/วัน ต้นทุนเอาต์พุต: 100,000 × 500 = 50 ล้านโทเค็น × $0.13/1M = $6.50/วัน ซึ่งคิดเป็นประมาณ $156/วัน หรือประมาณ $4,700/เดือน สำหรับปริมาณงานแบบเอเจนต์บริบทยาวที่ค่อนข้างรุนแรง — และนั่นยังไม่รวมส่วนลดจากการแคชในส่วนที่ซ้ำกันของบริบท 50K นั้น ซึ่งในลูปการใช้งานคอมพิวเตอร์ (พรอมต์ระบบเดียวกัน, คำจำกัดความเครื่องมือเดียวกัน, สถานะหน้าจอที่ซ้อนทับกัน) เป็นประเภทงานที่การแคชพรอมต์ถูกสร้างขึ้นมาโดยเฉพาะ

การแนะนำสถานการณ์ในโลกจริง

งานวิทัศน์ปริมาณสูง

ลองนึกภาพไปป์ไลน์การจัดทำแคตตาล็อกสินค้าที่ต้องจำแนกประเภท ติดแท็ก และดึงคุณลักษณะจากภาพสินค้าหลายแสนภาพต่อวัน — นี่คืองานที่ต้นทุนต่อโทเค็นจะเพิ่มขึ้นอย่างรวดเร็วจนเกินงบประมาณสำหรับโมเดลวิทัศน์ระดับกลาง แต่ยังคงอยู่ในระดับที่จ่ายไหวสบาย ๆ เมื่อใช้ราคาของ Qwen 3.7 Flash ความสามารถในการรู้จำวัตถุและความเข้าใจเชิงพื้นที่ ซึ่งอาลีบาบาระบุไว้อย่างชัดเจนนั้น สอดคล้องโดยตรงกับ "มีอะไรอยู่ในภาพนี้ อยู่ตรงไหน และอยู่ในสภาพใด"

การเขียนโค้ดแบบภาพ

"Visual coding" เป็นกรณีการใช้งานที่มีชื่อเฉพาะซึ่งบ่งบอกถึงขั้นตอนการทำงาน เช่น ป้อนภาพหน้าจอของ UI ที่แสดงผลแล้ว รวมถึงโค้ดของคอมโพเนนต์ที่อยู่เบื้องหลังให้กับโมเดล และขอให้มันระบุความไม่ตรงกัน หรือนำ Figma export มาและรับการใช้งานครั้งแรกกลับคืนมา นี่คือหมวดหมู่ของงานที่ลงโทษโมเดลโค้ดแบบข้อความล้วนโดยเฉพาะ — คุณสามารถอธิบายบั๊กเค้าโครงด้วยคำพูดได้ แต่โมเดลที่สามารถเห็นการเว้นวรรคที่เสียหายหรือปุ่มที่จัดตำแหน่งผิดจริง ๆ จะวินิจฉัยได้เร็วและน่าเชื่อถือกว่า

เอเจนต์ / การใช้คอมพิวเตอร์

นี่คือกรณีการใช้งานหลัก เอเจนต์ที่ใช้คอมพิวเตอร์ต้องมองหน้าจอ ทำความเข้าใจว่าสิ่งใดคลิกได้ ตัดสินใจดำเนินการ แล้วทำซ้ำ — บ่อยครั้งหลายสิบขั้นตอนต่อหนึ่งงาน เศรษฐศาสตร์ในที่นี้โหดร้ายสำหรับโมเดลราคาแพง: งานอัตโนมัติบนเบราว์เซอร์หรือเดสก์ท็อปที่มี 30 ขั้นตอน แต่ละขั้นตอนมีภาพหน้าจอใหม่ อาจกินโทเค็นหลายแสนตัวก่อนที่งานจะเสร็จ ในราคาของโมเดลชั้นนำ นั่นคือเงินจริงต่องานหนึ่ง; ที่ราคาของ Qwen 3.7 Flash การรันเซสชันนับพันแบบนี้ต่อวันยังคงอยู่ในงบประมาณของทีมเล็กๆ

การค้นหาด้วยภาพ — การจับคู่ภาพกับชุดข้อมูล การยืนยันว่าผลลัพธ์ที่ดึงมาว่าตรงกับภาพอ้างอิงจริง หรือการตั้งคำถามค้นหาบนภาพหน้าจอที่ผู้ใช้กำลังดู — ได้รับประโยชน์จากการผสมผสานแบบเดียวกันของบริบทขนาดใหญ่ (เพื่อเก็บภาพที่เป็นไปได้หลายภาพหรือชุดเอกสารที่ดึงมายาว) และต้นทุนต่ำต่อการเรียกใช้ (เพราะลูปการค้นหาและยืนยันมักหมายถึงการเรียกใช้โมเดลหลายครั้งต่อคำค้นหาหนึ่งครั้ง ไม่ใช่ครั้งเดียว)

วิธีการเข้าถึงและใช้ Qwen 3.7 Flash

Qwen 3.7 Flash ถูกเรียกด้วยตัวระบุโมเดล qwen/qwen3.7-flash และมันทำงานร่วมกับเครื่องมือใด ๆ ที่รองรับ OpenAI-compatible หมายความว่า การผสานรวมแบบ chat-completions หรือ responses-style ที่มีอยู่สามารถชี้มาที่มันได้เพียงแค่เปลี่ยนชื่อโมเดล โดยไม่ต้องเขียนโค้ดไคลเอนต์ใหม่ นี่คือจุดที่เลเยอร์การจัดเส้นทาง (routing layer) อย่าง OrcaRouter กลายเป็นสิ่งปฏิบัติได้จริงมากกว่าทฤษฎี: แทนที่จะเขียนโค้ดฮาร์ดโค้ดโมเดลเดียวลงในทุกบริการ ปลายทางแบบ unified ที่รองรับ OpenAI-compatible ช่วยให้คุณตั้งค่าโมเดลมัลติโมดัลที่ถูกและมีความสามารถเป็นค่าเริ่มต้นสำหรับทราฟฟิกด้านวิทัศน์ (vision) และเอเจนต์ (agentic) และสำรองโมเดลให้เหตุผล (reasoning) ที่แพงกว่าไว้สำหรับคำขอเพียงบางส่วนที่ต้องการจริง ๆ สำหรับโมเดลที่คุณค่าทั้งหมดคือ “ถูกมาก เก่งพอสมควร แต่ยังไม่ผ่านการพิสูจน์ในระดับแนวหน้า” การจัดเส้นทางแบบแบ่งชั้นแบบนี้ — ถูกเป็นค่าเริ่มต้น เพิ่มระดับเมื่อจำเป็น — นับเป็นวิธีที่ถูกต้องในการนำไปใช้ในโปรดักชัน มากกว่าจะเดิมพันทั้งไปป์ไลน์กับโมเดลเดียวที่ยังไม่ได้รับการพิสูจน์

การจัดรูปแบบคำขอแบบมัลติโมดัลมาตรฐานมีผลบังคับใช้: อินพุตรูปภาพควบคู่ไปกับข้อความในข้อความเดียวกัน หน้าต่างบริบทขนาดใหญ่สำหรับเซสชันที่มีหลายรูปภาพหรือหลายเทิร์น และการเรียกเก็บเงินต่อโทเค็นที่แสดงอย่างชัดเจนในแดชบอร์ดการใช้งาน ทดสอบขีดจำกัดความยาวเอาต์พุตที่ใช้งานได้จริงสำหรับปริมาณงานของคุณก่อนที่จะพึ่งพามัน เนื่องจากค่าสูงสุดไม่ได้ถูกเผยแพร่

ข้อจำกัดที่ตรงไปตรงมาและสิ่งที่ยังไม่ได้รับการยืนยัน

เพื่อพูดอย่างตรงไปตรงมาเกี่ยวกับสิ่งที่ยังไม่ทราบแน่ชัด ณ ที่นี้: ยังไม่มีข้อมูลเกณฑ์มาตรฐานอิสระสำหรับ Qwen 3.7 Flash จาก Artificial Analysis หรือผู้ประเมินที่เทียบเคียงได้ใดๆ ณ เวลาที่เขียนนี้ ทุกอย่างเกี่ยวกับคุณภาพของมัน — ว่ามันทำงานได้ดีเพียงใดในการใช้เหตุผลเชิงภาพ, มีความน่าเชื่อถือเพียงใดสำหรับงานแบบหลายขั้นตอนที่ต้องอาศัยเอเจนต์, และมันทนทานต่อสิ่งรบกวนในสถานการณ์บริบทยาวได้ดีเพียงใด — ปัจจุบันได้รับการสนับสนุนเฉพาะจากภาษาการวางตำแหน่งของ Alibaba เองเท่านั้น ไม่ใช่จากบุคคลที่สามที่นำมันไปทดสอบผ่านชุดทดสอบมาตรฐาน คำอธิบายจากผู้ขายและการตรวจสอบโดยอิสระไม่ใช่สิ่งเดียวกัน และผู้อ่านควรให้น้ำหนักกับความสามารถของโมเดลนี้ตามนั้นจนกว่าจะมีการตรวจสอบดังกล่าวเกิดขึ้น

นอกเหนือจากเกณฑ์มาตรฐาน อาลีบาบายังไม่ได้เปิดเผยสถาปัตยกรรม จำนวนพารามิเตอร์ หรือความยาวเอาต์พุตสูงสุด ทฤษฎี "MoE ขนาดเล็ก ซึ่งอาจเป็นรุ่นก่อนของ Qwen 3.7 แบบโอเพนเวต" ที่แพร่หลายในชุมชนนั้นเป็นการคาดเดาที่สมเหตุสมผลโดยอิงจากรูปแบบการตั้งชื่อและราคา แต่มันเป็นเพียงการคาดคะเน ไม่ใช่สิ่งที่อาลีบาบาได้ยืนยัน หากความโปร่งใสของโมเดล (สถาปัตยกรรมที่เผยแพร่ โอเพนเวต รายงานทางเทคนิค) เป็นข้อกำหนดสำหรับการใช้งานของคุณ Qwen 3.7 Flash ในปัจจุบันยังไม่ผ่านเกณฑ์ดังกล่าว — มันเป็นโมเดลแบบปิดที่ใช้งานผ่าน API เท่านั้น โดยมีเอกสารสาธารณะเพียงเล็กน้อยนอกเหนือจากรายการ API

การเปรียบเทียบ: Qwen 3.8, Qwen 3.7 Max และคู่แข่งราคาถูก

การตั้งชื่อตรงนี้ทำให้คนสับสน ดังนั้นจึงควรระบุให้แม่นยำ Qwen 3.8 เป็นโมเดลเรือธงแบบ open-weight ที่ Alibaba ประกาศแยกต่างหาก รายงานว่าสร้างขึ้นจากดีไซน์ 2.4 ล้านล้านพารามิเตอร์ — เป็นโมเดลที่แตกต่างกันโดยพื้นฐานและมีวัตถุประสงค์ต่างกัน: เป็นโมเดลขนาดใหญ่ เปิดกว้าง ใช้งานทั่วไป ที่ตั้งใจแข่งขันในระดับแนวหน้า ไม่ใช่ระดับมัลติโมดัลราคาถูกสำหรับงานทั่วไป Qwen 3.7 Max เป็นโมเดลเรือธงแบบปิดที่ใหญ่กว่าและน่าจะมีความสามารถมากกว่าในคลื่นการเปิดตัว "3.7" เดียวกันนี้ — โมเดลที่คุณจะเลือกใช้เมื่องานต้องการคุณภาพสูงสุดโดยไม่คำนึงถึงต้นทุน Qwen 3.7 Flash เป็นหัวข้อของบทความนี้ เป็นจุดที่สามและถูกที่สุดในกลุ่มนั้น: เล็กกว่า เร็วกว่า ถูกกว่าอย่างมาก และมีขอบเขตเฉพาะสำหรับงานมัลติโมดัลแบบเอเจนต์ ไม่ใช่เพื่อความเป็นเลิศทั่วไป อย่าสันนิษฐานว่าความสามารถหรือพฤติกรรมจะถ่ายทอดระหว่างสามโมเดลนี้เพียงเพราะสองตัวมีหมายเลขเวอร์ชันเดียวกัน — พวกมันเป็นโมเดลที่แตกต่างกันและมีหน้าที่ต่างกัน

เมื่อเทียบกับคู่แข่งภายนอก ตัวเปรียบเทียบที่ใกล้เคียงที่สุดคือของ Google Gemini 3.5 Flash-Lite, ซึ่งอยู่ในกลุ่มตลาดที่คล้ายคลึงกัน: ระดับราคาถูก มัลติโมดัล และปริมาณงานสูงที่ออกแบบมาเพื่อโหลดงานปริมาณมากตามที่อธิบายไว้ข้างต้น ทั้งสองโมเดลแข่งขันกันหลักๆ ในมิติเดียวกัน — ราคาต่อโทเค็น ความยาวบริบท และการจัดการหลายรูปแบบ — มากกว่าการวัดประสิทธิภาพการใช้เหตุผลดิบ เนื่องจากทั้งคู่ไม่ได้ถูกวางตำแหน่งเป็นโมเดลการใช้เหตุผลระดับแนวหน้า หากไม่มีข้อมูลเกณฑ์มาตรฐานอิสระสำหรับ Qwen 3.7 Flash การอ้างคุณภาพแบบเผชิญหน้ากับ Gemini 3.5 Flash-Lite นั้นไม่ใช่สิ่งที่บทความนี้สามารถทำได้อย่างรับผิดชอบ สิ่งที่กล่าวได้คือ ราคาของ Qwen 3.7 Flash นั้นแข่งขันได้หรือต่ำกว่าระดับดังกล่าว และหน้าต่างบริบท 1M ของมันมีขนาดใหญ่เพียงพอสำหรับโมเดลในกลุ่มราคานี้ ซึ่งเป็นช่องว่างที่ทำให้ระดับมัลติโมดัลราคาถูกควรค่าแก่การทดสอบเชิงประจักษ์กับโหลดงานของคุณเอง แทนที่จะเลือกโดยพิจารณาจากราคาเพียงอย่างเดียว

คำถามที่พบบ่อย

Qwen 3.7 Flash คืออะไร

เป็นโมเดลการให้เหตุผลด้านวิสัยทัศน์-ภาษาจากทีม Qwen ของ Alibaba สร้างขึ้นสำหรับเอเจนต์มัลติโมดัล การเขียนโค้ดเชิงภาพ การค้นหา และการโต้ตอบกับคอมพิวเตอร์/UI โดยขึ้นทะเบียนภายใต้รหัสโมเดล qwen/qwen3.7-flash ตั้งแต่วันที่ 27 กรกฎาคม 2026

Qwen 3.7 Flash ราคาเท่าไหร่

0.03 ดอลลาร์ต่อ 1 ล้านโทเคนอินพุต และ 0.13 ดอลลาร์ต่อ 1 ล้านโทเคนเอาต์พุต — ซึ่งจัดอยู่ในกลุ่มโมเดลที่รองรับการประมวลผลภาพที่ถูกที่สุดในปัจจุบัน โดยรายการระบุว่าสามารถได้รับส่วนลดเพิ่มเติม 60-80% ผ่านการแคชพรอมต์สำหรับบริบทที่ซ้ำกัน

หน้าต่างบริบทคืออะไร

1,000,000 โทเคน

Qwen 3.7 Flash เหมือนกับ Qwen 3.8 หรือไม่?

ไม่ Qwen 3.8 เป็นโมเดลเรือธงแบบ open-weight ที่มีพารามิเตอร์ 2.4 ล้านล้าน ซึ่งอาลีบาบาประกาศแยกต่างหาก Qwen 3.7 Flash เป็นโมเดล multimodal แบบปิดที่เล็กกว่าและถูกกว่ามาก โดยมีวัตถุประสงค์ที่แตกต่างกัน ไม่ควรสับสนแม้ว่าทั้งคู่จะมาจากสาย Qwen ของอาลีบาบาก็ตาม

Qwen 3.7 Flash เหมือนกับ Qwen 3.7 Max หรือไม่?

ไม่ใช่ Qwen 3.7 Max เป็นโมเดลเรือธงขนาดใหญ่กว่าในคลื่นการเปิดตัว "3.7" เดียวกัน ส่วน Qwen 3.7 Flash เป็นระดับที่เล็กกว่า เร็วกว่า และถูกกว่ามาก ซึ่งมุ่งเน้นไปที่งาน multimodal และ agentic ปริมาณสูง แทนที่จะเป็นเอาต์พุตคุณภาพสูงสุด

Qwen 3.7 Flash รองรับภาพหรือไม่?

ใช่ มันเป็นโมเดลภาษา-ภาพ — มันรับอินพุตแบบหลายรูปแบบ (ภาพและข้อความ) และถูกวางตำแหน่งโดยเฉพาะเกี่ยวกับงานเชิงภาพ เช่น การจดจำวัตถุ ความเข้าใจเชิงพื้นที่ การเขียนโค้ดเชิงภาพ และการโต้ตอบกับคอมพิวเตอร์และส่วนติดต่อผู้ใช้

ความยาวเอาต์พุตสูงสุดคือเท่าใด

ไม่ได้เปิดเผยอย่างเป็นทางการโดย Alibaba ผู้ใดที่กำลังสร้างภาระงานในระบบผลิตควรทดสอบเพดานผลลัพธ์ที่ใช้งานได้จริงโดยตรงแทนที่จะสมมติตัวเลข

Qwen 3.7 Flash เป็นโมเดลแบบผสมผสานของผู้เชี่ยวชาญ (Mixture-of-Experts) หรือไม่?

ยังไม่ได้รับการยืนยัน บางคนในชุมชนคาดเดาว่ามันใช้สถาปัตยกรรม MoE ขนาดเล็กโดยอิงจากราคาและรูปแบบการตั้งชื่อของมัน แต่อาลีบาบายังไม่ได้เผยแพร่รายละเอียดสถาปัตยกรรม ดังนั้นสิ่งนี้จึงยังคงเป็นการคาดเดามากกว่าข้อเท็จจริง

มันเทียบกับ Gemini 3.5 Flash-Lite อย่างไร

ทั้งสองอยู่ในระดับ multimodal ที่มีต้นทุนต่ำและปริมาณงานสูงใกล้เคียงกัน และแข่งขันกันหลักที่ราคาและความยาวบริบท มากกว่าการวัดประสิทธิภาพการให้เหตุผลดิบ ยังไม่มีข้อมูล benchmark อิสระเพื่อเปรียบเทียบคุณภาพที่ชัดเจนสำหรับ Qwen 3.7 Flash

ฉันจะเข้าถึง Qwen 3.7 Flash ได้ที่ไหน

ใช้โมเดล ID qwen/qwen3.7-flash ผ่านไคลเอนต์ที่เข้ากันได้กับ OpenAI ใดๆ หรือผ่านเลเยอร์การจัดเส้นทาง เช่น OrcaRouter ที่สามารถตั้งค่าเป็นระดับมัลติโมดัลราคาถูกเริ่มต้นควบคู่ไปกับโมเดลอื่นๆ

Qwen 3.7 Flash ดีไหม?

ยังไม่ได้รับการพิสูจน์โดยอิสระ ณ เวลาที่เขียนนี้ — ไม่มีองค์กรวัดประสิทธิภาพบุคคลที่สาม รวมถึง Artificial Analysis ที่เผยแพร่คะแนนสำหรับมันแล้ว จุดเด่นด้านคุณค่าของมันคือราคาและขนาดบริบท ไม่ใช่ความเป็นผู้นำด้านคุณภาพที่ได้รับการพิสูจน์ ดังนั้นจึงควรทดสอบเชิงประจักษ์กับภาระงานเฉพาะของคุณก่อนที่จะตัดสินใจนำไปใช้

บรรทัดล่าง

Qwen 3.7 Flash ไม่ได้พยายามชนะลีดเดอร์บอร์ด และ Alibaba ก็ไม่ได้ให้เอกสารแก่ใครเพื่อตรวจสอบ แม้ว่าจะต้องการก็ตาม สิ่งที่มันพยายามทำคือทำให้เวิร์กโหลดด้านวิทัศน์และเอเจนต์ — การวิเคราะห์ภาพหน้าจอ, การตรวจสอบโค้ดด้วยภาพ, ลูปการใช้งานคอมพิวเตอร์, การค้นหาด้วยภาพ — มีราคาถูกพอจนค่าใช้จ่ายไม่ใช่เหตุผลที่คุณไม่สร้างฟีเจอร์นั้นอีกต่อไป ที่ราคา $0.03/$0.13 ต่อล้านโทเค็นพร้อมคอนเทกซ์ 1 ล้านโทเค็น เศรษฐศาสตร์สนับสนุนทราฟฟิกเอเจนต์มัลติโมดัลที่มีปริมาณสูงและเปิดตลอดเวลาในแบบที่มีโมเดลน้อยมากในทุกระดับคุณภาพจะเทียบได้ จุดอ่อนคือความซื่อสัตย์เกี่ยวกับช่องว่าง: ไม่มีเกณฑ์มาตรฐานอิสระ, ไม่มีการเปิดเผยสถาปัตยกรรมหรือความยาวเอาต์พุตสูงสุด, และความไม่แน่นอนจริงๆ ว่ามันจะสู้กับคู่แข่งระดับราคาถูกที่ตั้งหลักแล้วอย่าง Gemini 3.5 Flash-Lite ได้ดีแค่ไหน ให้มองมันเป็นค่าเริ่มต้นที่มีแนวโน้มดีและราคาย่อมเยาสำหรับเวิร์กโหลดมัลติโมดัล-เอเจนต์ที่ควรทดสอบตอนนี้ — และแยกให้ชัดเจนในความคิดของคุณจากทั้ง Qwen 3.8 และ Qwen 3.7 Max ซึ่งเป็นโมเดลคนละตัวที่แก้ปัญหาคนละอย่างกันโดยสิ้นเชิง

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube