
Kolibri vs Qwen 3.8: โมเดลเยอรมันแพ้บนตารางของตัวเอง และนั่นคือประเด็นสำคัญ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 218 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 115 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 982 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 215 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
เริ่มจากประโยคที่การรายงานข่าวการเปิดตัวของ Kolibriส่วนใหญ่ละเว้นไป บนตาราง benchmark ที่ Aleph Alpha เผยแพร่พร้อมกับโมเดลของตัวเองเมื่อวันที่ 3 ตุลาคม 2026 โมเดลที่ถูกนำมาเปรียบเทียบด้วยบ่อยที่สุดไม่ใช่คู่แข่งจากยุโรปและไม่ใช่จากอเมริกา มันคือ Qwen3.8 27Bซึ่งเป็นระดับ open-weight ของผู้พัฒนาสำหรับเจเนอเรชันนั้น เปิดตัวเมื่อวันที่ 13 สิงหาคม 2026 — และจากตัวเลขของ Aleph Alpha เอง มันชนะ Qwen3.8 27B ได้ 80.2 ในค่าเฉลี่ยภาษาอังกฤษ และ 79.9 ในค่าเฉลี่ยภาษาเยอรมันของชุดการประเมินเดียวกันที่ให้ Kolibri อยู่ที่ 75.5 และ 70.8 มันนำใน GPQA Diamond 89.2 เทียบกับ 84.3 นำใน LiveCodeBench v6 93.8 เทียบกับ 85.9 นำใน SWE-Bench Verified 72.6 เทียบกับ 66.4 และนำใน benchmark บริบทยาวทั้งสองรายการ ด้วยคะแนน 76.9 เทียบกับ 64.5 ใน LongBench Pro และ 81.3 เทียบกับ 68.3 ใน AA-LCR โมเดลจีนแบบ dense ขนาด 27 พันล้านพารามิเตอร์ ที่ถูกประเมินโดยแล็บเยอรมัน เอาชนะโมเดลเรือธงขนาด 78 พันล้านพารามิเตอร์ของแล็บนั้นเองในตารางส่วนใหญ่ของตัวเอง นั่นไม่ใช่เรื่องอื้อฉาว มันเป็นข้อเท็จจริงที่มีประโยชน์ที่สุดในการเปิดตัวครั้งนี้ เพราะมันบังคับให้ต้องถามว่าแท้จริงแล้ว Kolibri มีไว้เพื่ออะไร
ขอชี้แจงหนึ่งประเด็นก่อนที่การเปรียบเทียบจะดำเนินต่อไป เพราะ "Qwen 3.8" เป็นชื่อของตระกูลมากกว่าเป็นโมเดล และความแตกต่างตรงนี้สำคัญ Qwen3.8-Max เป็นเรือธงแบบโฮสต์ของ Alibaba เปิดให้บริการตั้งแต่ 3 สิงหาคม 2026 พร้อมหน้าต่างบริบท 1M โทเคน ในราคา $2.00 ต่ออินพุตหนึ่งล้านโทเคน และ $6.00 ต่อเอาต์พุต Qwen3.8-27B เป็นระดับ open-weights เผยแพร่เมื่อ 13 สิงหาคม 2026 ภายใต้หน้าต่าง 262,144 โทเคน Qwen3.8-Flash เป็นระดับสำหรับปริมาณมาก เผยแพร่เมื่อ 26 สิงหาคม 2026 พร้อมหน้าต่าง 1M โทเคนและราคาที่ต่ำกว่ามาก และ Qwen3.8 เปล่า ๆ — ประกาศเมื่อ 19 กรกฎาคม 2026 ในฐานะเรือธง open-weight ขนาด 2.4 ล้านล้านพารามิเตอร์ — ยังไม่เปิดตัว; มันมีอยู่เพียงในรูปหน้าติดตามแค็ตตาล็อกและประกาศเท่านั้น ทุกอย่างด้านล่างนี้เกี่ยวกับรุ่นที่มีน้ำหนักให้ดาวน์โหลดและรันได้ ซึ่งก็คือ 27B
จุดที่ Kolibri ชนะจริง อ่านจากตารางเดียวกัน
แถวที่ Kolibri นำ Qwen3.8 27B ไม่ได้กระจัดกระจายแบบสุ่ม พวกมันเกาะกลุ่มกัน และการเกาะกลุ่มนั้นคือผลิตภัณฑ์
• การงดตอบ — ใน RGB Negative, Kolibri ได้คะแนน 85.6 เทียบกับ 70.6 เมื่อบริบทไม่มีคำตอบ Kolibri จะบอกเช่นนั้นบ่อยกว่ามาก
• การเรียกใช้เครื่องมือภายใต้ข้อจำกัด — บน τ²-bench telecom ได้ 94.7 เทียบกับ 82.5; บนชุดทดสอบเฉพาะอุตสาหกรรมสำหรับซัพพลายเออร์ยานยนต์ ได้ 99.0 เทียบกับ 97.3
• บริบทที่ยาวมาก — บน SealQA โดยไม่มีตัวลวงที่เกิน 24k โทเคน, 100.0 เทียบกับ 94.4
• เศรษฐศาสตร์การให้บริการภาษาเยอรมัน — โทเคไนเซอร์สองภาษาที่ใช้เฉลี่ย 4.90 ไบต์ต่อโทเคนบนข้อความเว็บภาษาเยอรมัน เทียบกับ 4.17 สำหรับตระกูล Qwen3.5–3.8 จากการวัดของ Aleph Alpha เอง จำนวนโทเคนที่น้อยลงต่อเอกสารภาษาเยอรมันหนึ่งฉบับคือการลดต้นทุนการอนุมานโดยตรงที่ปรากฏบนใบแจ้งหนี้ และไม่ปรากฏในแถวผลเบนช์มาร์กใดเลย
สามในสี่ข้อนั้นเกี่ยวกับพฤติกรรมมากกว่าความสามารถ การงดตอบเมื่อไม่รู้ การเรียกใช้เครื่องมือแบบมีข้อจำกัด และการค้นคืนบริบทยาวที่ยึดโยงกับข้อมูลจริง คือสิ่งที่คุณต้องการจากโมเดลที่อ่านเนื้อหาขององค์กรคุณเอง และคาดหวังว่าจะยอมรับเมื่อเนื้อหานั้นไม่ตอบคำถาม Aleph Alpha สร้างรีลีสทั้งหมดนี้โดยอิงกับเดิมพันนั้น และตารางก็แสดงให้เห็นว่าเดิมพันนั้นได้ผล

แถวที่ Qwen3.8 27B ชนะนั้นเกี่ยวกับความกว้างของความสามารถ ได้แก่ ความรู้ในทั้งสองภาษา คำถามวิทยาศาสตร์ระดับบัณฑิตศึกษา การเขียนโปรแกรมเชิงแข่งขัน วิศวกรรมซอฟต์แวร์ระดับรีโพซิทอรี และความเข้าใจเอกสารยาว หากสิ่งที่คุณต้องการคือโมเดลทั่วไปที่แข็งแกร่งในราคาต่อโทเค็นต่ำพร้อมน้ำหนักแบบเปิด Qwen3.8 27B เป็นโมเดลที่ดีกว่า และตารางก็บอกเช่นนั้นด้วยหมึกของผู้ขายเอง
การตีความนั้นได้รับการยืนยันในกรณีที่ของ Kolibri ไม่ได้รับการยืนยัน Artificial Analysis ได้วัด Qwen3.8 27B อย่างเป็นอิสระ ในคอนฟิกูเรชันการให้เหตุผล Xhigh ของมัน และรายงานดัชนี Intelligence Index ที่ 34 อยู่อันดับ #1 จาก 142 โมเดลในการเปรียบเทียบนั้น เอาต์พุต 45.4 โทเคนต่อวินาที บริบท 256,000 โทเคน และสัญญาอนุญาต Apache 2.0 บันทึกของพวกเขาไม่ประจบประแจงในแบบที่คุ้นเคย — ละเอียดเกินจำเป็นมากเมื่อสร้าง 200 ล้านโทเคนระหว่างการประเมินดัชนี เทียบกับค่ามัธยฐานที่ 82 ล้าน และช้า — แต่ตัวคะแนนเองเป็นผลการวัดจากบุคคลที่สามของคู่แข่ง Kolibri ไม่มีหน้าบน Artificial Analysis เลย ดังนั้นโมเดลที่แข็งแกร่งที่สุดในการเปรียบเทียบนี้ได้รับการยืนยันอย่างอิสระ ส่วนโมเดลที่อ่อนกว่าก็เป็นเพียงคำกล่าวอ้างของผู้ขาย ซึ่งตรงกันข้ามกับวิธีที่เรือธงยุโรปรุ่นแรกมักถูกนำเสนอ
ข้อกล่าวอ้างเกี่ยวกับห่วงโซ่อุปทานสองประเภท ที่ชี้ไปในทิศทางตรงกันข้าม
การเปิดตัวทั้งสองครั้งนี้เป็นข้อโต้แย้งเกี่ยวกับที่มาของโมเดล และข้อโต้แย้งเหล่านั้นเป็นภาพสะท้อนของกันและกัน
กรณีของ Aleph Alpha คือการระบุที่มาในฐานะคุณสมบัติ Kolibri ถูกฝึกโดยทีมเยอรมันบนโครงสร้างพื้นฐานในเยอรมนีและฟินแลนด์ ภายใต้กฎหมายของสหภาพยุโรปและเยอรมนี การ์ดนี้เปิดเผยส่วนผสมก่อนการฝึก — 20 ล้านล้านโทเค็นที่ประมาณ 62.5 เปอร์เซ็นต์เป็นภาษาอังกฤษ 23.9 เปอร์เซ็นต์เป็นภาษาเยอรมัน และ 13.6 เปอร์เซ็นต์เป็นโค้ด — งบประมาณการฝึกช่วงกลางและบริบทแบบยาว การประมวลผลที่แน่นอน 768 NVIDIA B200s ทั่ว 96 โหนด HGX เป็นเวลา 21 วัน และพลังงานประมาณ 9.5×10² MWh รวมถึงค่าใช้จ่ายส่วนเกินของศูนย์ข้อมูล มันระบุวิธีการฝึกอย่างละเอียดถึงระดับชั้น: ทรานส์ฟอร์มเมอร์แบบผสมผู้เชี่ยวชาญ 50 ชั้นที่มีการแบ่ง 4:1 ระหว่าง sliding-window กับ grouped-query attention, Muon และ Exact Quantile Balancing ทั่ว 384 ผู้เชี่ยวชาญ โดยมี 1 ตัวที่ใช้ร่วมกันและ 6 ตัวที่กำหนดเส้นทาง คำเปิดเผย 12,000 คำแนบมากับดาวน์โหลด 78 GB และตำแหน่งผู้ลงนามที่ระบุไว้ในหลักปฏิบัติว่าด้วย AI สำหรับวัตถุประสงค์ทั่วไปของสหภาพยุโรป
กรณีของ Alibaba แตกต่างในเชิงประเภท: ไม่ใช่ "เราอธิบายทุกการตัดสินใจได้" แต่เป็น "นี่คือเวต เอาไปเลย" เวตแบบเปิดภายใต้สัญญาอนุญาต Apache ในระดับขนาดและคุณภาพที่ทำให้ Qwen กลายเป็นค่าเริ่มต้นโดยพฤตินัยทั่วโลก คำศัพท์ขนาด 248,077 โทเคนที่ครอบคลุมภาษามากกว่าร้อยภาษา และระบบนิเวศการให้บริการที่ถูกปรับจูนรอบเช็กพอยต์เหล่านั้นนานพอที่เกือบทุกสแตกการอนุมานจะรองรับได้ทันทีโดยไม่ต้องตั้งค่าเพิ่ม ข้อโต้แย้งเรื่องอธิปไตยตรงนี้เป็นเรื่องของความพร้อมใช้งาน: ไม่มีผู้ขายรายใดถอนโมเดลคืนได้ เพราะคุณมีไฟล์อยู่ในมือแล้ว
ข้อกล่าวอ้างทั้งสองเป็นความจริงสุจริต และตอบความกลัวที่ต่างกัน ผู้ซื้อในภาครัฐที่บาเดิน-เวือร์ทเทิมแบร์กกังวลเรื่องเขตอำนาจทางกฎหมายและความสามารถในการตรวจสอบ และ Kolibri ถูกออกแบบมาเพื่อตอบความกังวลนั้น กลุ่มวิจัยในไนโรบีหรือเซาเปาโลกังวลว่าโมเดลถูกปิดกั้นไว้หลังบัตรเครดิตในสกุลเงินที่พวกเขาจ่ายไม่ได้ และน้ำหนัก Qwen แบบเปิดถูกออกแบบมาเพื่อตอบความกังวลนั้น สิ่งที่ไม่ซื่อสัตย์คือการแสร้งว่าอันใดอันหนึ่งเป็นการเปรียบเทียบขีดความสามารถ เพราะตารางขีดความสามารถได้ให้คำตอบไปแล้ว

ช่องว่างด้านใบอนุญาตมีอยู่จริง แต่แคบกว่าที่ฟังดู
Kolibri เป็น Apache 2.0 ส่วน Qwen3.8 27B เป็นโมเดลน้ำหนักเปิดที่ได้รับอนุญาตภายใต้ Apache ทั้งคู่ไม่มีข้อกำหนดแนบท้ายว่าด้วยการใช้งานที่ยอมรับได้ ไม่มีเกณฑ์ขั้นต่ำเรื่องจำนวนผู้ใช้ที่ใช้งานต่อเดือน และไม่มีข้อกำหนดทางการค้าแยกต่างหาก ซึ่งทำให้ทั้งคู่อยู่ในกลุ่มเล็ก ๆ และหมายความว่าทั้งคู่ไม่จำเป็นต้องผ่านการตรวจสอบทางกฎหมายก่อนนำไปใช้ในเชิงพาณิชย์
สิ่งที่แยกพวกมันออกจากกันคือทุกอย่างที่ตามหลังสัญญาอนุญาต Kolibri มาพร้อมกับปลั๊กอิน vLLM และแพ็กเกจพาร์เซอร์จากผู้ขาย อิมเมจคอนเทนเนอร์ ระดับความพยายามในการให้เหตุผลสี่ระดับที่กำหนดค่าได้ผ่านเทมเพลตแชท พฤติกรรมการงดตอบอย่างชัดเจน และการกำหนดค่าการสุ่มตัวอย่างที่แนะนำ Qwen3.8 27B มาในรูปแบบเวตที่ Transformers, vLLM และ SGLang รู้วิธีให้บริการอยู่แล้ว พร้อมกับรูปแบบการเรียกใช้เครื่องมือที่ระบบนิเวศวงกว้างมีเวลาหลายเดือนในการรองรับ
ฮาร์ดแวร์สำหรับการติดตั้งใช้งานก็แตกต่างกันไปในแนวทางเดียวกัน น้ำหนัก FP8 ของ Kolibri มีขนาดประมาณ 78 GB โดยต้องใช้ขั้นต่ำการ์ด A100 80 GB สองใบ, H100 SXM5 สองใบ, H200 หนึ่งตัว, B200 หนึ่งตัว หรือ B300 หนึ่งตัว ส่วน Qwen3.8 27B ใน bfloat16 มีน้ำหนักประมาณ 54 GB ซึ่งเท่ากับตัวเร่งความเร็ว 80 GB หนึ่งตัวที่ความแม่นยำเต็ม หรือบิลด์แบบควอนไทซ์บนฮาร์ดแวร์ที่น้อยกว่าอย่างเห็นได้ชัด โมเดลเยอรมันใช้ฮาร์ดแวร์มากกว่า แต่ให้ผล benchmark น้อยกว่าเมื่อเทียบกับที่ลงทุนไป นั่นจะเป็นการแลกที่ไม่คุ้มก็ต่อเมื่อคุณซื้อ benchmark
สิ่งที่ป้ายราคาบอกคุณ และสิ่งที่ไม่ได้บอกคุณ
Kolibri ไม่มีราคา เพราะ Aleph Alpha ไม่ได้ขายอินเฟอเรนซ์สำหรับมัน การเผยแพร่คือเวต รายงานทางเทคนิค และการ์ด; ไม่มี SKU แบบโฮสต์ ตัวเลขต้นทุนใด ๆ สำหรับ Kolibri เป็นการคำนวณค่าตัดจำหน่ายฮาร์ดแวร์ที่คุณต้องทำเอง
Qwen3.8 เปิดเผยราคาต่อสาธารณะเป็นสามระดับ และระดับกลางคือระดับที่สำคัญสำหรับทีมที่กำลังเปรียบเทียบการโฮสต์เองกับการเช่า
• Qwen3.8-Max — 2.00 ดอลลาร์ต่อล้านโทเค็นอินพุต และ 6.00 ดอลลาร์สำหรับเอาต์พุต, คอนเท็กซ์ 1 ล้านโทเค็น, การอ่านแคชที่ 0.25 ดอลลาร์, เปิดตัวเมื่อวันที่ 3 สิงหาคม 2026
• Qwen3.8-27B — อินพุต $0.33 และเอาต์พุต $2.40, คอนเท็กซ์ 262,144 โทเคน, เปิดตัว 13 สิงหาคม 2026 เนื่องจากเป็นเวทแบบเปิด ราคานี้จึงเป็นราคาที่คุณจ่ายหากคุณไม่อยากรันโมเดลเหล่านี้เอง
• Qwen3.8-Flash — ราคาอินพุต $0.15 และเอาต์พุต $0.47 พร้อมหน้าต่าง 1M โทเคน เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026
นั่นคือราคาตามรายการของผู้ให้บริการบน OrcaRouter ซึ่งส่งผ่านโดยไม่มีการบวกเพิ่มใด ๆ ต่อโทเคน ซึ่งเป็นคุณสมบัติที่มีประโยชน์เมื่อคำถามคือการติดตั้งใช้งานแบบโฮสต์เองจะคุ้มทุนหรือไม่: คุณสามารถวัดปริมาณโทเคนจริงของคุณที่ระดับที่โฮสต์ให้บริการก่อนตัดสินใจลงทุนกับฮาร์ดแวร์ เราไม่บวกกำไร ดังนั้นหากผู้ขายลดราคา ฝั่งเราก็ปรับให้มีผลทันทีในวันเดียวกัน ทั้งสามระดับของ Qwen3.8 สามารถกำหนดเส้นทางได้แล้ววันนี้บน คีย์เดียวที่เข้ากันได้กับ OpenAI พร้อมการสลับไปยังผู้ให้บริการรายอื่นโดยอัตโนมัติเมื่อเกิดข้อขัดข้อง และ Qwen3.8 ขนาด 2.4 ล้านล้านพารามิเตอร์ที่กำลังจะมาถึงมีหน้ารายการในแค็ตตาล็อกที่รอค่าน้ำหนักโมเดลอยู่ แทนที่จะเป็นหน้าตัวอย่างที่แสร้งทำเป็นให้บริการอยู่
Kolibri ไม่สามารถกำหนดเส้นทางได้ เราได้ตรวจสอบแค็ตตาล็อกภายใต้การสะกดชื่อผู้จำหน่ายและชื่อโมเดลทุกรูปแบบแล้ว และไม่พบมัน ดังนั้นวิธีเดียวที่จะเรียกใช้มันได้คือดาวน์โหลดขนาด 78 GB หากคุณต้องการทราบว่าโมเดลเยอรมันจะทำให้เวิร์กโหลดของคุณมีค่าใช้จ่ายเท่าใด คำตอบคือแร็กหนึ่งตู้และคนหนึ่งคนที่รัน vLLM ได้ และปัจจุบันไม่มีบุคคลที่สามรายใดเสนอราคาอย่างอื่นให้คุณได้

ใครควรซื้ออันไหน
การตัดสินใจไม่ได้ขึ้นอยู่กับคุณภาพ เพราะประเด็นนั้นจบไปแล้วโดยตารางของผู้ขายเองที่เอนไปทาง Alibaba แต่ขึ้นอยู่กับว่าคุณกำลังซื้อประกันความเสี่ยงอะไร
• เลือก Kolibri หากข้อจำกัดที่มีผลผูกพันคือเขตอำนาจทางกฎหมาย เอกสารที่มาที่ไป หรือความสามารถในการตรวจสอบย้อนกลับ — หากคุณจำเป็นต้องตอบให้ได้ว่าข้อมูลที่ใช้ฝึกมาจากไหน การประมวลผลเกิดขึ้นที่ใด และภายใต้กฎหมายใด และหากภาระงานคือเอกสารภาษาเยอรมันและอังกฤษที่ประมวลผลภายในขอบเขตของคุณเอง คุณกำลังจ่ายค่าพรีเมียมด้านขีดความสามารถสำหรับสิ่งนั้น และค่าพรีเมียมนั้นปรากฏอยู่ในตารางด้านบน
• เลือก Qwen3.8 27B หากข้อจำกัดที่ผูกมัดคือความสามารถต่อดอลลาร์ ความหลากหลายของภาษา หรือการสนับสนุนจากระบบนิเวศ มันเป็นโมเดลที่แข็งแกร่งกว่าจากการประเมินของ Aleph Alpha เอง ใช้สัญญาอนุญาต Apache ทำงานบนตัวเร่งความเร็วตัวเดียว และระดับบริการแบบโฮสต์เริ่มต้นที่ $0.33 ต่อโทเคนอินพุตหนึ่งล้านโทเคน หากคุณไม่อยากจะรันมันเองเลย
• พิจารณาทั้งสองแบบในสถาปัตยกรรมเดียวกัน หากเวิร์กโหลดมีแกนหลักที่ถูกกำกับดูแลและส่วนรอบนอกทั่วไป เอกสารที่ไม่สามารถออกจากอาคารได้ให้ส่งไปยังปลายทาง Kolibri ที่โฮสต์เอง ส่วนงานสรุป งานแปล และงานโค้ดให้ส่งไปยังเทียร์ Qwen3.8 ที่จัดเส้นทางไว้ ในราคาหนึ่งในสามของเซนต์ต่อพันโทเค็น คีย์ API เดียว กฎการจัดเส้นทางเดียว ราคาตามรายการของผู้ให้บริการที่ส่งผ่านตรง และการสลับสำรองเมื่อขัดข้องที่จัดการให้คุณ ซึ่งเป็นรูปแบบการจัดวางที่มีประโยชน์กว่าอย่างมาก เมื่อเทียบกับการเลือกหนึ่งในสองนี้ แล้วทำราวกับว่าอีกอันหนึ่งไม่มีอยู่
