
Claude Haiku 5.5 vs Qwen3.8 27B: การกวาดชัยชนะอย่างหมดจดบน API และเหตุใด Open Weights จึงยังคงมีอยู่
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
การเปรียบเทียบส่วนใหญ่ในซีรีส์นี้ท้ายที่สุดก็归结为การแลกเปลี่ยน แต่ครั้งนี้ไม่ใช่ และการไม่มีการแลกเปลี่ยนใด ๆ นั่นเองคือข้อค้นพบ Claude Haiku 5.5 ซึ่งเปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 เอาชนะ Qwen3.8 27B โมเดล dense ขนาด 27B แบบเปิดน้ำหนักจากวันที่ 14 สิงหาคม 2026 ได้ในคะแนนสติปัญญารวม ต้นทุนต่อโทเคน ต้นทุนต่องานที่ทำเสร็จ หน้าต่างบริบท เพดานการตอบสนอง การเขียนโค้ดแบบเอเจนต์ และแถวการให้เหตุผลเชิงวิทยาศาสตร์ — และทำได้เช่นนั้นจาก API เชิงกรรมสิทธิ์เพียงตัวเดียวที่ไม่ต้องใช้ฮาร์ดแวร์ แถวเดียวที่ Qwen3.8 27B ชนะอย่างชัดเจนคืออินพุตวิดีโอ และสิ่งที่ชนะอีกอย่างหนึ่งคือสัญญาอนุญาต
นั่นไม่ใช่เหตุผลที่จะตัดโมเดลนี้ทิ้ง เพราะสัญญาอนุญาต Apache-2.0 และความสามารถด้านวิดีโอไม่ใช่รางวัลปลอบใจ มันเป็นเหตุผลให้ต้องพูดให้ชัดเจนว่าเหตุใดใครบางคนจึงเลือกฝั่งโอเพนเวตส์ และเลิกแสร้งว่าข้อถกเถียงนี้เป็นเรื่องเกี่ยวกับเบนช์มาร์ก
ตัวเลขที่โมเดลทั้งสองถูกนำไปรันจริง
ต่อหนึ่งล้านโทเคนในหน่วยดอลลาร์สหรัฐ อัตราของผู้ให้บริการมาจากเอกสารการกำหนดราคาของตนเอง ส่วนการวัดที่ใช้อ้างอิงร่วมกันคือ Artificial Analysis Intelligence Index v4.3.2 ซึ่งอ่านค่าเมื่อ 2026-10-08 โดยทั้งคู่อยู่ในการตั้งค่าระดับความพยายามสูงสุดที่เผยแพร่

• อินพุต — Claude Haiku 5.5 $0.10 สูงสุด 100,000 โทเค็น และ $0.50 สำหรับส่วนที่เกิน; Qwen3.8 27B $0.50 ตามอัตราบุคคลที่สามที่คณะกรรมการบันทึกไว้
• เอาต์พุต — Claude Haiku 5.5 $0.50 สูงสุด 100,000 โทเค็น และ $2.50 สำหรับส่วนที่เกิน; Qwen3.8 27B $3.00
• อินพุตแบบแคช — Claude Haiku 5.5 $0.01 และ $0.05 ลดราคา 90%; Qwen3.8 27B $0.10 ลดราคา 80%
• คะแนนอิสระ — 43.40 สำหรับ Claude Haiku 5.5 (Max) เทียบกับ 33.70 สำหรับ Qwen3.8 27B (Xhigh) เป็นช่องว่าง 9.70 คะแนน ซึ่งกว้างที่สุดในชุดนี้
• ต้นทุนต่อหนึ่งงานที่เสร็จสมบูรณ์ — 0.21 ดอลลาร์ เทียบกับ 1.01 ดอลลาร์ ในการประเมินรอบเดียวกัน ความต่าง 4.7 เท่า และยังเป็นความต่างที่กว้างที่สุดในที่นี้ด้วย
• บริบทและเอาต์พุต — 1M โทเค็น และขีดจำกัดการตอบกลับ 128,000 โทเค็นสำหรับ Claude Haiku 5.5; บริบท 256K โทเค็นสำหรับ Qwen3.8 27B
• โมดัลลิตี้ — ทั้งคู่รับข้อความและรูปภาพ แล้วส่งคืนข้อความ Qwen3.8 27B เพิ่มอินพุตวิดีโอ; Claude Haiku 5.5 ไม่รองรับ
• น้ำหนักโมเดล — Qwen3.8 27B เป็นพารามิเตอร์แบบ dense จำนวน 27B ภายใต้ Apache 2.0 ซึ่งดาวน์โหลดได้ ส่วน Claude Haiku 5.5 เป็นซอฟต์แวร์กรรมสิทธิ์และใช้ผ่าน API เท่านั้น

ทำไมช่องว่างต่องานจึงเป็นสี่เท่าของช่องว่างต่อโทเคน
ตารางราคาแสดงส่วนต่างอินพุต 5 เท่าและส่วนต่างเอาต์พุต 6 เท่าที่เอื้อต่อผู้ขายอยู่แล้ว ดังนั้นทิศทางจึงไม่เป็นที่สงสัย สิ่งที่น่าอ่านคือ ตัวเลขต่องานเล็กกว่าตัวเลขต่อโทเคน ซึ่งตรงข้ามกับสิ่งที่เกิดขึ้นในการจับคู่อื่น ๆ ในแบตช์นี้ และเหตุผลก็ให้แง่คิด
Claude Haiku 5.5 ปล่อยโทเคนเอาต์พุต 162,164 โทเคนต่องานใน Intelligence Index — เป็นการคิดวิเคราะห์ 129,047 และคำตอบ 33,118 ส่วน Qwen3.8 27B ปล่อย 66,797 โทเคน แบ่งเป็นการคิดวิเคราะห์ 47,711 และคำตอบ 19,087 โมเดลของผู้ขายรายนี้ใช้โทเคนต่องานมากกว่า 2.4 เท่า ดังนั้นข้อได้เปรียบด้านอัตราเอาต์พุต 6 เท่าจึงบีบเหลือข้อได้เปรียบ 4.7 เท่าต่องาน มันยังคงมหาศาลอยู่ เพียงแต่ไม่ใช่ตัวเลขที่การ์ดราคาโฆษณาไว้
การคำนวณแบบผสมเป็นวิธีที่ชัดเจนกว่าในการมองภาพรวมของเรื่องนี้ ในการผสมแบบเน้นอินพุต 7:2:1 ซึ่งเป็นสัดส่วนที่ทราฟฟิกโปรดักชันจริงส่วนใหญ่มี Claude Haiku 5.5 คิดเป็น $0.077 ต่อล้านโทเคน เทียบกับ $0.470 สำหรับ Qwen3.8 27B ในการผสมแบบสมดุล 1:1 มันอยู่ที่ $0.30 เทียบกับ $1.75 หน้าผา 100,000 โทเคนของผู้ขายเป็นสิ่งเดียวที่เคยปิดช่องว่างนี้ได้ เมื่อเลยจุดนั้นไป อัตราคิดค่าบริการของ Claude Haiku 5.5 จะกลายเป็น $0.50 และ $2.50 สำหรับคำขอทั้งหมด และทั้งสองโมเดลมาบรรจบกันที่ราคาใกล้เคียงกัน ซึ่ง ณ จุดนั้นคุณกำลังจ่ายส่วนเพิ่มเพื่อแลกกับคะแนนที่มากกว่า 9.7 แต้มโดยเปล่าประโยชน์
ในกรณีที่การ์ดผู้ขายและบอร์ดอิสระไม่ตรงกัน
แถวชุดนี้เป็นแถวที่ควรหยุดพิจารณาให้ละเอียด เพราะการ์ดโมเดลของ Qwen3.8 27B เองระบุประสิทธิภาพได้แข็งแกร่งกว่าที่ผลการวัดจากแหล่งอิสระชี้ไว้อย่างมาก และความต่างนี้เองคือเหตุผลทั้งหมดที่ทำให้ข้ออ้างเรื่อง "โมเดล 27B ที่เทียบชั้นกับโมเดลขนาดใหญ่กว่ามากได้" จำเป็นต้องมีแหล่งอ้างอิงที่สอง
The vendor's own published figures, as recorded on our catalogue page for the model, include 90.3 on LiveCodeBench v6, 89.2 on GPQA Diamond, 84.3 on OSWorld-Verified, and 79.0 on QwenSWEBench. Those are vendor-reported and unreproduced, and they describe a model that is competitive well above its weight class.
ในการรันของ Artificial Analysis นั้น Qwen3.8 27B ได้คะแนน 0.055 บน Terminal-Bench 4.0 0.4664 บน SciCode, 0.3392 บน Humanity's Last Exam และ 1423.21 บน GDPval-AA v2.1 เมื่อนำ 0.0556 ไปวางเทียบกับ 84.3 ที่การ์ดของผู้ขายรายงานบน OSWorld รูปทรงของความไม่สอดคล้องก็ชัดเจนขึ้น: ในงานเอเจนต์ที่ใช้คอมพิวเตอร์และเทอร์มินัล คณะกรรมการอิสระจัดวางโมเดลนี้ไว้ในระดับที่โมเดล dense ขนาด 27B ควรอยู่ และการ์ดของผู้ขายไม่ได้ทำเช่นนั้น
มีสองแถวที่ให้ผลสวนทาง และทั้งสองก็ควรค่าแก่การกล่าวถึงด้วยเหตุผลเดียวกัน Qwen3.8 27B ได้คะแนน 0.4824 บน AutomationBench เมื่อเทียบกับ 0.3541 ของ Claude Haiku 5.5 — นับเป็นชัยชนะ 12.8 จุดจากการทดสอบอิสระ บนสิ่งที่ใกล้เคียงที่สุดกับเกณฑ์มาตรฐานด้านระบบอัตโนมัติทางธุรกิจที่บอร์ดทั้งสองมีอยู่ นั่นคือตัวเลขจริงจากการรันเดียวกัน ในแถวที่ใกล้เคียงที่สุดกับสิ่งที่ผู้คนนำโมเดลขนาดเล็กไปใช้งานจริง
การอ่านอย่างตรงไปตรงมาไม่ใช่ “ผู้ขายโม้ทุกอย่างเกินจริง” แต่เป็นเพราะการ์ดข้อมูลโมเดลวัดงานที่ผู้เขียนของมันเลือกเอง คณะกรรมการอิสระวัดชุดที่กำหนดไว้ตายตัว และจุดแข็งของ Qwen3.8 27B อยู่ในรายการของผู้ขาย ไม่ได้อยู่ในรายการของคณะกรรมการ
เศรษฐศาสตร์จะเปลี่ยนไปเมื่อคุณเป็นเจ้าของฮาร์ดแวร์เอง
อัตราทุกอัตราที่อ้างถึงข้างต้นเป็นราคา API และสำหรับ Qwen3.8 27B นั่นเป็นกรอบอ้างอิงที่ไม่ถูกต้อง
นี่คือโมเดล dense ขนาด 27B ภายใต้ Apache 2.0 มันรันได้บนตัวเร่งความเร็วสมัยใหม่เพียงตัวเดียวที่ระดับควอนไทเซชันที่ทีมส่วนใหญ่ยอมรับได้ ซึ่งหมายความว่าต้นทุนส่วนเพิ่มต่อโทเคนจะไม่ใช่มาตรวัดของผู้ขายอีกต่อไป แต่กลายเป็นอัตราการใช้งานของคุณเอง นั่นคือเหตุผลที่ราคาในการเรียกใช้งานแตกต่างกันไปตามโฮสต์ ในแบบที่โมเดลแบบกรรมสิทธิ์ทั้งสองตัวในการเปรียบเทียบนี้ทำไม่ได้เลย: บอร์ดบันทึกอัตราของบุคคลที่สามไว้ที่ $0.50 ขาเข้า และ $3.00 ขาออก และแคตตาล็อกของ OrcaRouter ระบุไว้ที่ $0.33 ขาเข้า และ $2.40 ขาออก โดยไม่มีบรรทัด cache-read เลย เพราะเรารัน weights บนโครงสร้างพื้นฐานของเราเอง แทนที่จะขายต่อเอนด์พอยต์ของคนอื่น
สำหรับทีมที่จ่ายค่า GPU อยู่แล้ว การเปรียบเทียบไม่ใช่ $0.21 กับ $1.01 ต่องาน แต่คืออัตราที่ผู้ขายเรียกเก็บ เทียบกับต้นทุนส่วนเพิ่มของการเรียกใช้หนึ่งครั้งบนฮาร์ดแวร์ที่คุณเป็นเจ้าของ และนั่นเป็นตัวเลขที่แตกต่างกัน นั่นคือข้อโต้แย้งของฝั่ง open-weights และเป็นข้อเดียวที่ยังยืนได้เมื่อต้องเผชิญกับตาราง benchmark
ผลที่ตามมาประการที่สองที่เห็นได้ไม่ชัดนักของการที่สัญญาอนุญาตเป็น Apache 2.0 คือ โมเดลสามารถถูกบรรจุไปพร้อมกับผลิตภัณฑ์ ไฟน์จูนด้วยทราฟฟิกของคุณเอง ตรึงไว้ที่รีวิชันเฉพาะ และตรวจสอบย้อนกลับได้ลงไปถึงระดับค่าน้ำหนัก ไม่มีสิ่งเหล่านั้นให้ใช้ได้ไม่ว่าจะจ่ายในราคาใดจากโมเดลแบบ API เท่านั้นที่เป็นกรรมสิทธิ์ และสำหรับงานที่มีข้อกำหนดด้านกฎระเบียบ สิ่งนี้มักเป็นข้อจำกัดชี้ขาดมากกว่าความชอบส่วนบุคคล

เรียกหนึ่งในสองคนนั้น
Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.
Claude Haiku 5.5 ไม่ได้อยู่ในแคตตาล็อก แต่สามารถเข้าถึงได้โดยตรงผ่าน API ของผู้ให้บริการ และผ่าน AWS, Azure และแพลตฟอร์มคลาวด์รายใหญ่ทั้งหลาย ซึ่งนั่นคือคำกล่าวที่ถูกต้อง สิ่งที่แคตตาล็อกมีจากไลน์อัปของผู้ให้บริการคือ Claude Sonnet 5.5 และ Claude Opus 5.5 ซึ่งทำให้เส้นทางการยกระดับจากโมเดลขนาดเล็กที่โฮสต์เองไปสู่โมเดลเอเจนต์ระดับกลางที่โฮสต์ให้บริการ เป็นเพียงการเปลี่ยนแปลงการกำหนดเส้นทาง แทนที่จะเป็นการผสานรวมครั้งที่สอง — การสลับไปใช้ระบบสำรองอัตโนมัติรองรับอยู่ข้างใต้ไม่ว่าจะทางใด
คำตัดสิน ซึ่งไม่สมดุลอย่างผิดปกติ
ในฐานะการเรียก API กับข้อความหรือรูปภาพ Claude Haiku 5.5 ชนะการเปรียบเทียบนี้ในทุกแถวที่ไม่เกี่ยวกับการอนุญาตสิทธิ์ 9.7 คะแนนดัชนี ถูกกว่าต่องานที่ทำเสร็จ 4.7 เท่า หน้าต่างบริบทใหญ่กว่า 4 เท่า เพดานการตอบกลับสูงกว่า 2 เท่า และราคาหน้าป้ายต่ำกว่า 5 ถึง 6 เท่าในช่วงการใช้งานพรอมป์ต์สั้น ไม่มีข้อโต้แย้งเรื่องรูปแบบภาระงานใดที่จะช่วยกอบกู้ Qwen3.8 27B ในด้านราคาได้ เพราะข้อเสียเปรียบของผู้จำหน่าย — การใช้โทเคนเอาต์พุตปริมาณมาก — มีค่าน้อยกว่าข้อได้เปรียบด้านอัตราราคาของมันมาก
สิ่งที่ช่วยกอบกู้มันไว้ก็คือทุกสิ่งทุกอย่างที่ราคาผ่าน API ไม่ได้สะท้อนออกมา ทั้งสัญญาอนุญาตที่อนุญาตให้เผยแพร่ต่อได้ เวตที่สามารถถือครองและปักหมุดไว้ได้ อินพุตวิดีโอ และเส้นทางแบบโฮสต์เองที่ต้นทุนต่อโทเคนคือฮาร์ดแวร์ของคุณเอง ไม่ใช่การ์ดของผู้ให้บริการ หากคุณกำลังมองหาวิธีที่ถูกที่สุดในการจำแนกประเภท สกัด สรุป และจัดเส้นทางข้อความ Claude Haiku 5.5 คือคำตอบ และช่องว่างไม่ได้ใกล้กันเลย หากคุณกำลังมองหาโมเดลที่คุณสามารถใส่ไว้ในผลิตภัณฑ์ของคุณเอง บนฮาร์ดแวร์ของคุณเอง ภายใต้การตรวจสอบของคุณเอง ช่องว่างด้านเบนช์มาร์กก็เลิกเป็นคำถามไปตั้งแต่หลายย่อหน้าก่อนแล้ว
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
