
Perceptron Mk1.5 vs Qwen 3.8: หุ่นยนต์ต้องมีทั้งสอง และไม่มีอันใดทดแทนกันได้
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 610 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 189 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
หุ่นยนต์ที่ต้องหยิบสิ่งของต้องการสองสิ่งจากโมเดล และไม่มีโมเดลใดเพียงตัวเดียวในการจับคู่นี้ที่ให้ทั้งสองอย่างแก่คุณ Perceptron Mk1.5 คืนค่าข้อมูลเรขาคณิต: เมื่อได้รับเฟรมวิดีโอ มันสามารถส่งคืนจุด กล่อง รูปหลายเหลี่ยม หรือองค์ประกอบ <track> ที่มีการประทับเวลา และหน้าต่างบริบทของมันมีขนาด 36,864 โทเค็น Qwen 3.8 — ชื่อที่หมายถึงแกนกลาง Qwen3.8-2.4T-A95B แบบโอเพนเวทของผู้ขาย — เป็นตัวให้เหตุผลแบบ mixture-of-experts ที่มีพารามิเตอร์ 2.4 ล้านล้านตัว พร้อมหน้าต่างบริบทดั้งเดิมขนาด 262K ที่ขยายไปได้ถึงราวหนึ่งล้าน และเป็นแบบข้อความเท่านั้น จึงไม่สามารถดูเฟรมได้เลย ตัวหนึ่งเป็นเลเยอร์การรับรู้ที่มีค่าใช้จ่าย $0.15 และ $1.50 ต่อล้านโทเค็น; อีกตัวเป็นแกนการให้เหตุผลที่มีค่าใช้จ่ายขาเข้าประมาณสิบสามเท่า และขาออกประมาณสี่เท่า และมีคะแนนอิสระ 40 บน Artificial Analysis Intelligence Index ขณะที่โมเดลการรับรู้ไม่มีคะแนนอิสระที่ใดเลย
เมื่อวางเคียงกันในฐานะผลิตภัณฑ์ที่แข่งขันกัน พวกมันแพ้กันเองไปคนละทิศทาง และการเปรียบเทียบก็ไม่ได้ให้ผลลัพธ์อะไรที่นำไปใช้ได้ เมื่อวางเคียงกันในฐานะสองครึ่งของไปป์ไลน์เดียว พวกมันอธิบายการตัดสินใจเรื่องต้นทุนและความน่าเชื่อถือแทบทุกอย่างในสแตกแบบ embodied ได้: ว่าเฟรมถูกตีความตรงไหน แผนถูกสร้างขึ้นตรงไหน และเกิดอะไรขึ้นกับบิลของคุณเมื่อครึ่งที่ทำหน้าที่ให้เหตุผลเขียนโทเคนมากกว่าที่งานต้องใช้
การแยกที่ทำให้การจับคู่นี้สมเหตุสมผล
Perceptron Mk1.5 เปิดตัวเมื่อวันที่ 25 กันยายน 2026 ในฐานะผู้สืบทอดของ Perceptron Mk1 และหน้าที่ของมันถูกกำหนดไว้อย่างเฉพาะเจาะจง มันรับข้อความ รูปภาพ วิดีโอ และเสียง แล้วส่งคืนข้อความพร้อมคำอธิบายประกอบแบบมีโครงสร้างซึ่งเป็นทางเลือก — จุด กรอบล้อมรอบ รูปหลายเหลี่ยม คลิป และแทร็ก เอาต์พุต <track> มีทั้งการสังเกตเชิงพื้นที่และเวลาที่มันสังกัดอยู่ ดังนั้นคลิป 60 วินาทีจึงส่งกลับมาเป็นตำแหน่งตามเวลา ไม่ใช่การคาดเดาแบบเฉลี่ยเพียงค่าเดียว ฟิลด์ asset_idx ช่วยให้คำขอเดียวจัดการรูปภาพหรือวิดีโอหลายรายการแยกกันได้ ซึ่งเป็นสิ่งที่การเปรียบเทียบเฟรมอ้างอิงกับเฟรมสดต้องใช้ การตอบกลับแบบจำกัดมีสองรูปแบบ คือ JSON Schema และ regex และจุดประสงค์ทั้งหมดของทั้งสองก็คือเอาต์พุตมีชนิดข้อมูล
Qwen 3.8 เป็นเครื่องมืออีกประเภทที่ตรงกันข้าม โดยแกน 2.4T เป็น MoE แบบละเอียดยิบ — 92 เลเยอร์ ผู้เชี่ยวชาญ 512 รายต่อเลเยอร์ โดยกำหนดเส้นทาง 10 รายบวกหนึ่งรายที่ใช้ร่วมกัน และ 69 จาก 92 เลเยอร์นั้นใช้ linear attention — ซึ่งเป็นวิธีที่สถาปัตยกรรมขนาดใหญ่ขนาดนั้นไปถึงบริบทแบบยาวได้ จุดแข็งของมันคือการให้เหตุผลข้ามข้อความจำนวนมาก การวิเคราะห์หลายขั้นตอนที่ซับซ้อน การอนุมานแบบยาว และการวางแผนแบบเอเจนต์ จุดที่มันทำไม่ได้คือฝั่งอินพุต แกนเปิดรองรับเฉพาะข้อความ และไม่สามารถปิดการให้เหตุผลของมันได้ ทุกคำตอบจะเริ่มด้วยบล็อกการคิดไม่ว่าคุณจะต้องการหรือไม่
นั่นไม่ใช่ข้อบกพร่องของโมเดลการให้เหตุผล หากแต่เป็นข้อบกพร่องของโมเดลการรับรู้ และ Qwen 3.8 ไม่ใช่โมเดลแบบนั้น เมื่อนำทั้งสองมาเรียงต่อกัน รูปแบบก็ชัดเจน — Mk1.5 ตอบคำถามว่า "รถโฟล์คลิฟต์อยู่ที่ไหนและมันเคลื่อนที่เมื่อใด" ส่วน Qwen 3.8 ตอบว่า "จากข้อมูลนั้น แขนกลควรทำอะไร" ไม่มีคำถามข้อใดที่โมเดลอีกตัวจะตอบได้

แต่ละครึ่งมีค่าใช้จ่ายเท่าไร ตามอัตราที่เรียกเก็บจริง
• อินพุต — Perceptron Mk1.5 $0.15 ต่อล้านโทเคน。 Qwen 3.8 $2.00 ต่อล้านบนบิลด์ที่โฮสต์ซึ่งฮาร์เนสอิสระเป็นตัววัด โดยใช้ส่วนลดแคช 88% ซึ่งทำให้แคชฮิตอยู่ที่ประมาณ $0.24
• เอาต์พุต — Mk1.5 1.50 ดอลลาร์ต่อล้าน. Qwen 3.8 6.00 ดอลลาร์ต่อล้าน.
• แคช — อินพุตแบบแคชของ Mk1.5 อยู่ที่ $0.0375 ต่อล้าน ซึ่งเป็นหนึ่งในสี่ของอัตราอินพุตมาตรฐานแบบคงที่ของมัน ส่วนลดของ Qwen 3.8 คิดเป็นเปอร์เซ็นต์แต่ลดลึกกว่า โดยอยู่ที่ 88% ดังนั้นอัตราแบบแคชของมันจึงถูกกว่าของทั้งสองเมื่อคิดเป็นค่าสัมบูรณ์ และอัตราแบบไม่แคชของมันสูงกว่าของ Mk1.5 เกินสิบเท่า
• ต้นทุนต่องานที่ทำเสร็จ — นี่คือจุดที่อันดับพลิกกลับ Artificial Analysis ระบุว่าต้นทุนต่อหนึ่งงานใน Intelligence Index ของ Qwen 3.8 อยู่ที่ 2.16 ดอลลาร์ จัดอยู่ในอันดับ 32 จาก 115 ในรุ่นเดียวกัน และได้คะแนนสี่จากสี่หน่วยในด้านต้นทุน — ถูกต่อการทำงานหนึ่งงานที่เสร็จสมบูรณ์แม้ค่าโทเคนจะแพง เพราะโมเดลสร้างโทเคนเอาต์พุต 170 ล้านโทเคนตลอดการรันดัชนี เทียบกับกลุ่มคู่แข่งที่พูดเยิ่นเย้อมากกว่า ส่วน Mk1.5 ไม่มีตัวเลขเทียบเคียงที่ใครเผยแพร่เลย
• คอนเท็กซ์ — 36,864 โทเค็นสำหรับ Mk1.5 เทียบกับ 262K แบบเนทีฟของแกน Qwen ซึ่งขยายต่อได้ถึงหนึ่งล้านด้วยการตั้งค่าการให้บริการที่เหมาะสม
• การควบคุมการคิดวิเคราะห์ — Mk1.5 เปิดให้ตั้งค่า reasoning_effort ได้ที่ระดับ high, medium, low, minimal หรือ none โดยค่าเริ่มต้นคือ high ส่วน Qwen 3.8 ล็อกให้เปิดโหมดคิดวิเคราะห์ไว้ตลอด คุณจึงต้องจ่ายค่าโทเคนสำหรับการคิดวิเคราะห์ในทุกครั้งที่เรียกใช้
อ่านรายการนั้นสองครั้ง เพราะโมเดลทั้งสองกลับด้านกันในเรื่องต้นทุน เมื่อคิดต่อโทเคน Mk1.5 ถูกกว่าอย่างมาก เมื่อคิดต่องานที่ทำเสร็จบนเบนช์มาร์กอิสระ Qwen 3.8 ถูกวัดว่ามีต้นทุนต่ำ และ Mk1.5 ยังไม่มีการวัด สองข้อความนี้จะขัดแย้งกันก็ต่อเมื่อคุณสมมติว่าพวกมันทำงานอย่างเดียวกัน และพวกมันไม่ได้ทำงานอย่างเดียวกัน

หลักฐานในกรณีนี้กลับชี้ไปในทางตรงกันข้าม
ในการเปรียบเทียบส่วนใหญ่ของแบตช์นี้ ฝั่งโอเพนเวตส์คือฝั่งที่มีตัวเลขที่ผู้ขายรายงานเองเรียงกันเป็นชุด และ API แบบปิดคือฝั่งที่มีหน้าเว็บจากบุคคลที่สาม ในกรณีนี้กลับกัน และการกลับกันนี้ควรกล่าวให้ชัดเจน เพราะมันเปลี่ยนสิ่งที่คุณตรวจสอบได้และตรวจสอบไม่ได้
Qwen 3.8 มีการวัดผลแบบอิสระ ดัชนี Artificial Analysis Intelligence Index จัดให้คอร์ 2.4T อยู่ที่ 40 จัดอันดับที่ 5 จาก 115 โมเดลในคลาสเดียวกัน ณ เวลาที่เขียน โดยมีความเร็วในการส่งออก 39.6 โทเค็นต่อวินาที — อันดับที่ 56 จาก 115 ซึ่งอยู่ระดับกลาง และเป็นสิ่งที่ควรรู้ก่อนที่ใครจะวางแผนสร้างลูปโต้ตอบรอบๆ มัน การแก้ไขดัชนีจะเปลี่ยนไปมาระหว่างสแนปช็อต และวิธีอ่านตัวเลขเหล่านี้อย่างซื่อสัตย์คือมองเป็นทิศทาง แต่ประเด็นยังคงอยู่: มีคนนอก Alibaba รันโมเดลนี้และเผยแพร่ตัวเลขออกมา
Perceptron Mk1.5 ไม่มีสิ่งดังกล่าว ไม่มีรายการใน Artificial Analysis และไม่มีคะแนน arena สำหรับ Mk1.5 หรือรุ่นก่อนหน้า ดังนั้นตัวเลขความสามารถทุกตัวที่มีอยู่จึงถูกสร้างโดย Perceptron เกี่ยวกับโมเดลของ Perceptron เอง ชุดข้อมูลนั้นเจาะจงอย่างผิดปกติ ซึ่งเป็นข้อดี — 0.9433 บน egocentric hand_box เทียบกับ 0.4467 สำหรับ Gemini 3.1 Pro ในการทดสอบของผู้ขายเอง; EgoSchema 80.40 เทียบกับ 81.20 สำหรับคู่แข่งรายเดียวกัน เป็นการแพ้เพียงเล็กน้อยบนเกณฑ์วัดความเข้าใจภาพรวม ควบคู่กับการอ้างว่าชนะ 12% บนเซตย่อย EgoSchema ที่ยากกว่าที่ 63.75; 0.647 centre-F1 และ 0.628 point-HOTA บน Molmo2-Track — แต่ความเจาะจงกับความถูกตรวจสอบอย่างอิสระเป็นคุณสมบัติที่แตกต่างกัน และมีเพียงอย่างหลังเท่านั้นที่บอกคุณได้ว่าจะเกิดอะไรขึ้นกับฟุตเทจของคุณ
ข้อควรระวังสองประการในการอ่านตารางของ Perceptron ซึ่งทั้งสองข้อใช้ได้กับการอ้างอิงตารางนี้ไม่ว่าจะในรูปแบบใด ตัวเลข LiveVQA-W ที่ 56.0 เมื่อเปิดใช้เครื่องมือนั้นมาจากการโหวตเสียงข้างมากจากสี่ตัวอย่าง ขณะที่ 53.2 ที่นำมาเทียบสำหรับ Gemini 3.8 Flash ที่ใช้ Google Search grounding ไม่ได้มาจากการโหวตเสียงข้างมาก เทคนิคนี้เป็นวิธีที่ชอบด้วยเหตุผล และทำให้คะแนนดูดีขึ้นเมื่อเทียบกับการรันแบบ greedy เพียงครั้งเดียว และแถว tracking ระบุ Qwen3-VL-8B ที่ 0.180 centre-F1 ซึ่งนำมาจากเปเปอร์ของโมเดลนั้น โดยอยู่ในคอลัมน์เดียวกับตัวเลขที่วัดได้ของตระกูล checkpoint อื่น ตัวเลขจากเปเปอร์ที่อยู่ในคอลัมน์ที่วัดค่าได้ไม่ใช่แถวที่เทียบกันได้แบบเดียวกัน และมันเป็นบรรทัดประเภทที่มักถูกอ้างถึงโดยไม่ระบุที่มา
คอร์ 2.4T ไม่ใช่สิ่งที่คุณจะเรียกจากเราได้ — แต่สถาปัตยกรรมของมันใช่

นี่คือส่วนหนึ่งของการเปรียบเทียบที่คำตอบอย่างตรงไปตรงมาแตกต่างจากสิ่งที่ชื่อเสียงของโมเดลนี้ชี้ให้เข้าใจ Qwen 3.8 ในฐานะชื่อนั้นถูกใช้กันอย่างแพร่หลายเพื่อหมายถึงโอเพนคอร์ และโอเพนคอร์คือไฟล์ที่ดาวน์โหลดได้ ไม่ใช่ปลายทางให้เรียกใช้: เวต BF16 ขนาด 2.4TB ภายใต้สัญญาอนุญาต Qwen3.8-Max แบบกำหนดเองของ Alibaba ซึ่งเผยแพร่ในเดือนสิงหาคม 2026 เราไม่ได้ให้บริการมัน และไม่มีผู้ให้บริการรายใดให้บริการมันในฝั่งของเรา ณ วันนี้ — รายการในแคตตาล็อกมีอยู่ในลักษณะหน้าติดตามที่ประกาศไว้แต่ยังไม่พร้อมใช้งาน มากกว่าเป็นเส้นทางที่ใช้งานได้จริง
สิ่งที่เราให้บริการคือ API เรือธงที่สร้างขึ้นบนสถาปัตยกรรม 2.4T เดียวกัน โดยเปิดให้ใช้งานจริงแล้วในชื่อ qwen/qwen3.8-max ในราคา $2.00 และ $6.00 ต่อล้านโทเคน ซึ่งเป็นอัตราของ Alibaba เองที่ส่งผ่านมาตรง ๆ โดยไม่มีการบวกเพิ่มต่อโทเคน พร้อมหน้าต่างมัลติโมดัล 1M โทเคน — อินพุตทั้งข้อความ รูปภาพ และวิดีโอ — และการออกแบบแอตเทนชันแบบไฮบริดเดียวกับคอร์โอเพนซอร์ส หากส่วนงานให้เหตุผลของคุณจำเป็นต้องเห็นอะไร นั่นคือเส้นทางนั้น และยังเป็นเส้นทางที่การเปลี่ยนแปลงอัตราค่าบริการของผู้ให้บริการมาตกที่ฝั่งเราในวันเดียวกัน แทนที่จะไปโผล่ในรอบบิลถัดไปของคุณ ควบคู่กันนั้น เรายังให้บริการรุ่น dense พี่น้องของ Alibaba qwen/qwen3.8-27b บนโครงสร้างพื้นฐานของเราเอง ในราคา $0.33 และ $2.40 ต่อล้าน พร้อมหน้าต่าง 262,144 โทเคน และอินพุตทั้งข้อความ รูปภาพ และวิดีโอ สำหรับกรณีที่นักให้เหตุผลขนาด 27B นั้นเพียงพอ และดัชนี 40 ของรุ่น 2.4T ก็มากเกินกว่าที่งานจะต้องการ
การเชื่อมสองส่วนเข้าด้วยกันโดยไม่มีสัญญาฉบับที่สอง
เหตุผลในทางปฏิบัติที่การจับคู่นี้สำคัญกว่าข้อโต้แย้งเรื่องเบนช์มาร์ก ก็คือสแต็กแบบฝังกายนั้นเป็นโมเดลสองตัวอยู่แล้ว และต้นทุนการผสานรวมของตัวที่สามคือสิ่งที่ฆ่าการออกแบบนี้อย่างเงียบ ๆ Mk1.5 ไม่ได้อยู่ในแคตตาล็อกของเรา ดังนั้นการเข้าถึงมันจึงต้องใช้ API ของผู้ขายเอง — pip install "perceptron>=0.4.0", key ใน PERCEPTRON_API_KEY, endpoint api.perceptron.inc ส่วนครึ่งที่เป็น Qwen นั้นห่างแค่คีย์เดียว
จุดที่เกตเวย์พิสูจน์คุณค่าของตัวเองคือรอยต่อ กฎการกำหนดเส้นทางที่ส่งทุกเฟรมที่มีคำถามไปยังโมเดลการรับรู้ และส่งทุกแผนที่เป็นข้อความล้วนไปยังโมเดลการให้เหตุผล เป็นเพียงบรรทัดการตั้งค่าเมื่อทั้งคู่ตั้งอยู่หลังจุดเชื่อมต่อเดียวที่เข้ากันได้กับ OpenAI, และการสลับไปใช้ระบบสำรองอัตโนมัติหมายความว่าเหตุการณ์ขัดข้องของผู้ให้บริการฝั่งใดฝั่งหนึ่งจะลดระดับกลายเป็นการใช้ระบบสำรอง แทนที่จะเป็นหุ่นยนต์ที่หยุดชะงัก API หนึ่งตัวที่ครอบคลุมโมเดลมากกว่า 200 รายการ โดยมีราคาตามรายการส่งผ่านโดยบวกกำไร 0% ก็ยังเป็นวิธีที่ถูกที่สุดในการตอบคำถามที่บทความนี้ตอบไม่ได้: ว่างานติดตามวัตถุของคุณจำเป็นต้องใช้พิกัดของ Mk1.5 เลยหรือไม่ หรือโมเดลวิชันทั่วไปที่มีหน้าต่างใหญ่กว่ามากและมีคะแนนอิสระจะเพียงพอแล้ว การกำหนดเส้นทางทราฟฟิกจริงส่วนหนึ่งระหว่างตัวเลือกต่างๆ และวัดผลบนเฟรมของคุณเองมีค่าใช้จ่ายน้อยกว่าการศึกษาเปรียบเทียบมาตรฐานใดๆ ที่คุณอาจจ้างให้ทำ
จะทำอย่างไรกับสิ่งนี้ อย่างเป็นรูปธรรม
หากคุณกำลังสร้างการรับรู้ลงในระบบกายภาพ Perceptron Mk1.5 เป็นโมเดลเดียวในการจับคู่นี้ที่ตอบเป็นพิกัด และนั่นคือความสามารถมากกว่าคะแนน — ทดสอบข้อกล่าวอ้างเรื่อง hand-box กับวิดีโอของคุณเอง ตั้งค่า reasoning_effort อย่างตั้งใจแทนที่จะยอมรับค่าเริ่มต้นระดับสูง และวางงบสำหรับหน้าต่าง 36,864 โทเคนเป็นข้อจำกัดแบบแข็ง ไม่ใช่แบบอ่อน หากคุณกำลังสร้างชั้นการให้เหตุผลเหนือสิ่งนั้น Qwen 3.8 ถูกวัดในจุดที่ Mk1.5 ไม่ได้ถูกวัด และต้นทุนต่องานที่ทำเสร็จคือตัวเลขที่ต้องใช้ในการวางแผน แทนที่จะเป็นตัวเลขพาดหัว $2.00 — โดยมีข้อแม้ว่าการคิดของมันไม่สามารถปิดได้ ดังนั้นงานที่ไม่จำเป็นต้องใช้ลำดับการคิดก็ยังต้องจ่ายสำหรับมันอยู่ดี
ทีมที่ทำพลาดเรื่องนี้คือทีมที่พยายามให้โมเดลตัวเดียวทำทั้งสองอย่าง ผู้เชี่ยวชาญด้านการรับรู้ขนาด 36,864 โทเคนจะไม่เก็บประวัติการดำเนินงาน และตัวให้เหตุผลขนาด 2.4T ที่รับเฉพาะข้อความจะไม่มีทางเห็นเฟรม การจับคู่นี้ไม่ใช่การประนีประนอมระหว่างผลิตภัณฑ์สองตัว แต่มันคือการแบ่งงานกันจริง ๆ และคำถามที่มีประโยชน์ก็มีเพียงว่า การเรียกใช้งานแต่ละครั้งของคุณควรอยู่ฝั่งไหนของการแบ่งงานนี้
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
