การ์ดฮีโร่ที่สร้างขึ้นชื่อ 'Claude Haiku 5.5 vs Qwen3.8 27B' พร้อมคำโปรย 'OPEN WEIGHTS ปะทะ THE API' แสดง Claude Haiku 5.5 ที่อินพุต $0.10 เอาต์พุต $0.50 และดัชนี 43.40 เทียบกับ Qwen3.8 27B ที่อินพุต $0.50 เอาต์พุต $3.00 และดัชนี 33.70 บนแถบที่ระบุ 'ต้นทุนต่องานที่เสร็จสมบูรณ์ $0.21 เทียบกับ $1.01'
Engineering & Research

Claude Haiku 5.5 vs Qwen3.8 27B: การกวาดชัยชนะอย่างหมดจดบน API และเหตุใด Open Weights จึงยังคงมีอยู่

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

การเปรียบเทียบส่วนใหญ่ในซีรีส์นี้ท้ายที่สุดก็归结为การแลกเปลี่ยน แต่ครั้งนี้ไม่ใช่ และการไม่มีการแลกเปลี่ยนใด ๆ นั่นเองคือข้อค้นพบ Claude Haiku 5.5 ซึ่งเปิดตัวเมื่อวันที่ 7 ตุลาคม 2026 เอาชนะ Qwen3.8 27B โมเดล dense ขนาด 27B แบบเปิดน้ำหนักจากวันที่ 14 สิงหาคม 2026 ได้ในคะแนนสติปัญญารวม ต้นทุนต่อโทเคน ต้นทุนต่องานที่ทำเสร็จ หน้าต่างบริบท เพดานการตอบสนอง การเขียนโค้ดแบบเอเจนต์ และแถวการให้เหตุผลเชิงวิทยาศาสตร์ — และทำได้เช่นนั้นจาก API เชิงกรรมสิทธิ์เพียงตัวเดียวที่ไม่ต้องใช้ฮาร์ดแวร์ แถวเดียวที่ Qwen3.8 27B ชนะอย่างชัดเจนคืออินพุตวิดีโอ และสิ่งที่ชนะอีกอย่างหนึ่งคือสัญญาอนุญาต

นั่นไม่ใช่เหตุผลที่จะตัดโมเดลนี้ทิ้ง เพราะสัญญาอนุญาต Apache-2.0 และความสามารถด้านวิดีโอไม่ใช่รางวัลปลอบใจ มันเป็นเหตุผลให้ต้องพูดให้ชัดเจนว่าเหตุใดใครบางคนจึงเลือกฝั่งโอเพนเวตส์ และเลิกแสร้งว่าข้อถกเถียงนี้เป็นเรื่องเกี่ยวกับเบนช์มาร์ก

ตัวเลขที่โมเดลทั้งสองถูกนำไปรันจริง

ต่อหนึ่งล้านโทเคนในหน่วยดอลลาร์สหรัฐ อัตราของผู้ให้บริการมาจากเอกสารการกำหนดราคาของตนเอง ส่วนการวัดที่ใช้อ้างอิงร่วมกันคือ Artificial Analysis Intelligence Index v4.3.2 ซึ่งอ่านค่าเมื่อ 2026-10-08 โดยทั้งคู่อยู่ในการตั้งค่าระดับความพยายามสูงสุดที่เผยแพร่

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8 27B — the scoreboard' with rows Index v4.3.2 43.40 against 33.70, cost per task $0.21 against $1.01, input price $0.10 against $0.50, context window 1M tokens against 256K tokens, AutomationBench 0.3541 against 0.4824 and weights 'proprietary' against 'open, Apache 2.0', footed 'All figures per Artificial Analysis Intelligence Index v4.3.2; Qwen vendor-card scores are unreproduced by the board.'

• อินพุต — Claude Haiku 5.5 $0.10 สูงสุด 100,000 โทเค็น และ $0.50 สำหรับส่วนที่เกิน; Qwen3.8 27B $0.50 ตามอัตราบุคคลที่สามที่คณะกรรมการบันทึกไว้

• เอาต์พุต — Claude Haiku 5.5 $0.50 สูงสุด 100,000 โทเค็น และ $2.50 สำหรับส่วนที่เกิน; Qwen3.8 27B $3.00

• อินพุตแบบแคช — Claude Haiku 5.5 $0.01 และ $0.05 ลดราคา 90%; Qwen3.8 27B $0.10 ลดราคา 80%

• คะแนนอิสระ — 43.40 สำหรับ Claude Haiku 5.5 (Max) เทียบกับ 33.70 สำหรับ Qwen3.8 27B (Xhigh) เป็นช่องว่าง 9.70 คะแนน ซึ่งกว้างที่สุดในชุดนี้

• ต้นทุนต่อหนึ่งงานที่เสร็จสมบูรณ์ — 0.21 ดอลลาร์ เทียบกับ 1.01 ดอลลาร์ ในการประเมินรอบเดียวกัน ความต่าง 4.7 เท่า และยังเป็นความต่างที่กว้างที่สุดในที่นี้ด้วย

• บริบทและเอาต์พุต — 1M โทเค็น และขีดจำกัดการตอบกลับ 128,000 โทเค็นสำหรับ Claude Haiku 5.5; บริบท 256K โทเค็นสำหรับ Qwen3.8 27B

• โมดัลลิตี้ — ทั้งคู่รับข้อความและรูปภาพ แล้วส่งคืนข้อความ Qwen3.8 27B เพิ่มอินพุตวิดีโอ; Claude Haiku 5.5 ไม่รองรับ

• น้ำหนักโมเดล — Qwen3.8 27B เป็นพารามิเตอร์แบบ dense จำนวน 27B ภายใต้ Apache 2.0 ซึ่งดาวน์โหลดได้ ส่วน Claude Haiku 5.5 เป็นซอฟต์แวร์กรรมสิทธิ์และใช้ผ่าน API เท่านั้น

A capture of Anthropic's Claude Platform models documentation showing the Claude model comparison table — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 'This model', the latter reading 1M context, 128K max output, 'From $0.10/$0.50', latency 'Fastest', default effort medium — above the Claude Haiku 5.5 specifications block with model ids claude-haiku-5-5, the two-tier pricing lines and 'Released October 7, 2026'.

ทำไมช่องว่างต่องานจึงเป็นสี่เท่าของช่องว่างต่อโทเคน

ตารางราคาแสดงส่วนต่างอินพุต 5 เท่าและส่วนต่างเอาต์พุต 6 เท่าที่เอื้อต่อผู้ขายอยู่แล้ว ดังนั้นทิศทางจึงไม่เป็นที่สงสัย สิ่งที่น่าอ่านคือ ตัวเลขต่องานเล็กกว่าตัวเลขต่อโทเคน ซึ่งตรงข้ามกับสิ่งที่เกิดขึ้นในการจับคู่อื่น ๆ ในแบตช์นี้ และเหตุผลก็ให้แง่คิด

Claude Haiku 5.5 ปล่อยโทเคนเอาต์พุต 162,164 โทเคนต่องานใน Intelligence Index — เป็นการคิดวิเคราะห์ 129,047 และคำตอบ 33,118 ส่วน Qwen3.8 27B ปล่อย 66,797 โทเคน แบ่งเป็นการคิดวิเคราะห์ 47,711 และคำตอบ 19,087 โมเดลของผู้ขายรายนี้ใช้โทเคนต่องานมากกว่า 2.4 เท่า ดังนั้นข้อได้เปรียบด้านอัตราเอาต์พุต 6 เท่าจึงบีบเหลือข้อได้เปรียบ 4.7 เท่าต่องาน มันยังคงมหาศาลอยู่ เพียงแต่ไม่ใช่ตัวเลขที่การ์ดราคาโฆษณาไว้

การคำนวณแบบผสมเป็นวิธีที่ชัดเจนกว่าในการมองภาพรวมของเรื่องนี้ ในการผสมแบบเน้นอินพุต 7:2:1 ซึ่งเป็นสัดส่วนที่ทราฟฟิกโปรดักชันจริงส่วนใหญ่มี Claude Haiku 5.5 คิดเป็น $0.077 ต่อล้านโทเคน เทียบกับ $0.470 สำหรับ Qwen3.8 27B ในการผสมแบบสมดุล 1:1 มันอยู่ที่ $0.30 เทียบกับ $1.75 หน้าผา 100,000 โทเคนของผู้ขายเป็นสิ่งเดียวที่เคยปิดช่องว่างนี้ได้ เมื่อเลยจุดนั้นไป อัตราคิดค่าบริการของ Claude Haiku 5.5 จะกลายเป็น $0.50 และ $2.50 สำหรับคำขอทั้งหมด และทั้งสองโมเดลมาบรรจบกันที่ราคาใกล้เคียงกัน ซึ่ง ณ จุดนั้นคุณกำลังจ่ายส่วนเพิ่มเพื่อแลกกับคะแนนที่มากกว่า 9.7 แต้มโดยเปล่าประโยชน์

ในกรณีที่การ์ดผู้ขายและบอร์ดอิสระไม่ตรงกัน

แถวชุดนี้เป็นแถวที่ควรหยุดพิจารณาให้ละเอียด เพราะการ์ดโมเดลของ Qwen3.8 27B เองระบุประสิทธิภาพได้แข็งแกร่งกว่าที่ผลการวัดจากแหล่งอิสระชี้ไว้อย่างมาก และความต่างนี้เองคือเหตุผลทั้งหมดที่ทำให้ข้ออ้างเรื่อง "โมเดล 27B ที่เทียบชั้นกับโมเดลขนาดใหญ่กว่ามากได้" จำเป็นต้องมีแหล่งอ้างอิงที่สอง

The vendor's own published figures, as recorded on our catalogue page for the model, include 90.3 on LiveCodeBench v6, 89.2 on GPQA Diamond, 84.3 on OSWorld-Verified, and 79.0 on QwenSWEBench. Those are vendor-reported and unreproduced, and they describe a model that is competitive well above its weight class.

ในการรันของ Artificial Analysis นั้น Qwen3.8 27B ได้คะแนน 0.055 บน Terminal-Bench 4.0 0.4664 บน SciCode, 0.3392 บน Humanity's Last Exam และ 1423.21 บน GDPval-AA v2.1 เมื่อนำ 0.0556 ไปวางเทียบกับ 84.3 ที่การ์ดของผู้ขายรายงานบน OSWorld รูปทรงของความไม่สอดคล้องก็ชัดเจนขึ้น: ในงานเอเจนต์ที่ใช้คอมพิวเตอร์และเทอร์มินัล คณะกรรมการอิสระจัดวางโมเดลนี้ไว้ในระดับที่โมเดล dense ขนาด 27B ควรอยู่ และการ์ดของผู้ขายไม่ได้ทำเช่นนั้น

มีสองแถวที่ให้ผลสวนทาง และทั้งสองก็ควรค่าแก่การกล่าวถึงด้วยเหตุผลเดียวกัน Qwen3.8 27B ได้คะแนน 0.4824 บน AutomationBench เมื่อเทียบกับ 0.3541 ของ Claude Haiku 5.5 — นับเป็นชัยชนะ 12.8 จุดจากการทดสอบอิสระ บนสิ่งที่ใกล้เคียงที่สุดกับเกณฑ์มาตรฐานด้านระบบอัตโนมัติทางธุรกิจที่บอร์ดทั้งสองมีอยู่ นั่นคือตัวเลขจริงจากการรันเดียวกัน ในแถวที่ใกล้เคียงที่สุดกับสิ่งที่ผู้คนนำโมเดลขนาดเล็กไปใช้งานจริง

การอ่านอย่างตรงไปตรงมาไม่ใช่ “ผู้ขายโม้ทุกอย่างเกินจริง” แต่เป็นเพราะการ์ดข้อมูลโมเดลวัดงานที่ผู้เขียนของมันเลือกเอง คณะกรรมการอิสระวัดชุดที่กำหนดไว้ตายตัว และจุดแข็งของ Qwen3.8 27B อยู่ในรายการของผู้ขาย ไม่ได้อยู่ในรายการของคณะกรรมการ

เศรษฐศาสตร์จะเปลี่ยนไปเมื่อคุณเป็นเจ้าของฮาร์ดแวร์เอง

อัตราทุกอัตราที่อ้างถึงข้างต้นเป็นราคา API และสำหรับ Qwen3.8 27B นั่นเป็นกรอบอ้างอิงที่ไม่ถูกต้อง

นี่คือโมเดล dense ขนาด 27B ภายใต้ Apache 2.0 มันรันได้บนตัวเร่งความเร็วสมัยใหม่เพียงตัวเดียวที่ระดับควอนไทเซชันที่ทีมส่วนใหญ่ยอมรับได้ ซึ่งหมายความว่าต้นทุนส่วนเพิ่มต่อโทเคนจะไม่ใช่มาตรวัดของผู้ขายอีกต่อไป แต่กลายเป็นอัตราการใช้งานของคุณเอง นั่นคือเหตุผลที่ราคาในการเรียกใช้งานแตกต่างกันไปตามโฮสต์ ในแบบที่โมเดลแบบกรรมสิทธิ์ทั้งสองตัวในการเปรียบเทียบนี้ทำไม่ได้เลย: บอร์ดบันทึกอัตราของบุคคลที่สามไว้ที่ $0.50 ขาเข้า และ $3.00 ขาออก และแคตตาล็อกของ OrcaRouter ระบุไว้ที่ $0.33 ขาเข้า และ $2.40 ขาออก โดยไม่มีบรรทัด cache-read เลย เพราะเรารัน weights บนโครงสร้างพื้นฐานของเราเอง แทนที่จะขายต่อเอนด์พอยต์ของคนอื่น

สำหรับทีมที่จ่ายค่า GPU อยู่แล้ว การเปรียบเทียบไม่ใช่ $0.21 กับ $1.01 ต่องาน แต่คืออัตราที่ผู้ขายเรียกเก็บ เทียบกับต้นทุนส่วนเพิ่มของการเรียกใช้หนึ่งครั้งบนฮาร์ดแวร์ที่คุณเป็นเจ้าของ และนั่นเป็นตัวเลขที่แตกต่างกัน นั่นคือข้อโต้แย้งของฝั่ง open-weights และเป็นข้อเดียวที่ยังยืนได้เมื่อต้องเผชิญกับตาราง benchmark

ผลที่ตามมาประการที่สองที่เห็นได้ไม่ชัดนักของการที่สัญญาอนุญาตเป็น Apache 2.0 คือ โมเดลสามารถถูกบรรจุไปพร้อมกับผลิตภัณฑ์ ไฟน์จูนด้วยทราฟฟิกของคุณเอง ตรึงไว้ที่รีวิชันเฉพาะ และตรวจสอบย้อนกลับได้ลงไปถึงระดับค่าน้ำหนัก ไม่มีสิ่งเหล่านั้นให้ใช้ได้ไม่ว่าจะจ่ายในราคาใดจากโมเดลแบบ API เท่านั้นที่เป็นกรรมสิทธิ์ และสำหรับงานที่มีข้อกำหนดด้านกฎระเบียบ สิ่งนี้มักเป็นข้อจำกัดชี้ขาดมากกว่าความชอบส่วนบุคคล

A capture of the OrcaRouter model page for Qwen3.8 27B under qwen/qwen3.8-27b, showing a 262K-token context chip, text, image and video input, text output, a p50 time to first token of 1.84 seconds, public benchmarks by Qwen dated 2026-08-15, and the page's own description of the model as Alibaba's open-weight 27B dense multimodal model released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

เรียกหนึ่งในสองคนนั้น

Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.

Claude Haiku 5.5 ไม่ได้อยู่ในแคตตาล็อก แต่สามารถเข้าถึงได้โดยตรงผ่าน API ของผู้ให้บริการ และผ่าน AWS, Azure และแพลตฟอร์มคลาวด์รายใหญ่ทั้งหลาย ซึ่งนั่นคือคำกล่าวที่ถูกต้อง สิ่งที่แคตตาล็อกมีจากไลน์อัปของผู้ให้บริการคือ Claude Sonnet 5.5 และ Claude Opus 5.5 ซึ่งทำให้เส้นทางการยกระดับจากโมเดลขนาดเล็กที่โฮสต์เองไปสู่โมเดลเอเจนต์ระดับกลางที่โฮสต์ให้บริการ เป็นเพียงการเปลี่ยนแปลงการกำหนดเส้นทาง แทนที่จะเป็นการผสานรวมครั้งที่สอง — การสลับไปใช้ระบบสำรองอัตโนมัติรองรับอยู่ข้างใต้ไม่ว่าจะทางใด

คำตัดสิน ซึ่งไม่สมดุลอย่างผิดปกติ

ในฐานะการเรียก API กับข้อความหรือรูปภาพ Claude Haiku 5.5 ชนะการเปรียบเทียบนี้ในทุกแถวที่ไม่เกี่ยวกับการอนุญาตสิทธิ์ 9.7 คะแนนดัชนี ถูกกว่าต่องานที่ทำเสร็จ 4.7 เท่า หน้าต่างบริบทใหญ่กว่า 4 เท่า เพดานการตอบกลับสูงกว่า 2 เท่า และราคาหน้าป้ายต่ำกว่า 5 ถึง 6 เท่าในช่วงการใช้งานพรอมป์ต์สั้น ไม่มีข้อโต้แย้งเรื่องรูปแบบภาระงานใดที่จะช่วยกอบกู้ Qwen3.8 27B ในด้านราคาได้ เพราะข้อเสียเปรียบของผู้จำหน่าย — การใช้โทเคนเอาต์พุตปริมาณมาก — มีค่าน้อยกว่าข้อได้เปรียบด้านอัตราราคาของมันมาก

สิ่งที่ช่วยกอบกู้มันไว้ก็คือทุกสิ่งทุกอย่างที่ราคาผ่าน API ไม่ได้สะท้อนออกมา ทั้งสัญญาอนุญาตที่อนุญาตให้เผยแพร่ต่อได้ เวตที่สามารถถือครองและปักหมุดไว้ได้ อินพุตวิดีโอ และเส้นทางแบบโฮสต์เองที่ต้นทุนต่อโทเคนคือฮาร์ดแวร์ของคุณเอง ไม่ใช่การ์ดของผู้ให้บริการ หากคุณกำลังมองหาวิธีที่ถูกที่สุดในการจำแนกประเภท สกัด สรุป และจัดเส้นทางข้อความ Claude Haiku 5.5 คือคำตอบ และช่องว่างไม่ได้ใกล้กันเลย หากคุณกำลังมองหาโมเดลที่คุณสามารถใส่ไว้ในผลิตภัณฑ์ของคุณเอง บนฮาร์ดแวร์ของคุณเอง ภายใต้การตรวจสอบของคุณเอง ช่องว่างด้านเบนช์มาร์กก็เลิกเป็นคำถามไปตั้งแต่หลายย่อหน้าก่อนแล้ว

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube