
TwIL-LM3-Pro กับ Qwen 3.8: ความไม่เข้าคู่กัน และการเปรียบเทียบที่สำคัญจริง ๆ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 219 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
TwIL-LM3-Pro และ Qwen3.8-Maxไม่ควรอยู่บนหน้าเดียวกัน และเหตุผลไม่ใช่เพราะตัวหนึ่งดีกว่า แต่เป็นเพราะกรณีศึกษาที่เผยแพร่สำหรับโมเดลตรรกะเชิงรูปแบบขนาด 3.66B ของ webAI นั้นสร้างขึ้นบนการเปรียบเทียบกับโมเดล Qwen — และโมเดล Qwen ที่ว่านี้ไม่ใช่ตัวที่ชื่อในพาดหัวระบุ ตาราง Track A และ Track B ของ webAI วัด TwIL-LM3-Pro เทียบกับ Qwen3-8B ซึ่งเป็นโมเดลเปิดเวทแบบ dense ขนาด 8B จากรุ่นก่อนหน้า และไม่ให้ความสนใจ Qwen3.8-Max เลยแม้แต่น้อย: ไม่ใช่เพราะ TwIL-LM3-Pro จะชนะ แต่เพราะ Qwen3.8-Max เป็นระบบโฮสต์เรือธงของ Alibaba เป็นโมเดล sparse mixture-of-experts ที่มีรายงานว่ามีพารามิเตอร์ 2.4 ล้านล้านตัว โดยเปิดใช้งานราว 95,000 ล้านตัวต่อโทเคน หน้าต่างบริบทมัลติโหมดหนึ่งล้านโทเคน และอัตราค่าบริการ 2.00 ดอลลาร์ต่อล้านโทเคนอินพุต และ 6.00 ดอลลาร์ต่อล้านโทเคนเอาต์พุต การเอา GGUF ขนาด 2.09 GiB สำหรับแล็ปท็อปมาวางไว้ข้างสิ่งนั้นคือข้อผิดพลาดเชิงประเภทที่แต่งตัวเป็นหน้า versus
ดังนั้นบทความนี้ทำสองสิ่ง มันแก้ไขการเปรียบเทียบที่ผลการค้นหาให้มาอย่างผิด ๆ แล้วจากนั้นก็ตอบคำถามในเวอร์ชันที่ผู้อ่านน่าจะมีจริง ๆ: เมื่อพิจารณาว่าโมเดลระดับแนวหน้าเข้าถึงได้ด้วยการเรียก API เพียงครั้งเดียว และผู้เชี่ยวชาญด้านตรรกศาสตร์เชิงรูปแบบทำงานบนเครื่องของคุณเอง แต่ละตัวจะสมควรได้ที่ของตนเมื่อใด?
โมเดลที่การ์ดวัดได้จริง
การเปรียบเทียบที่เกี่ยวข้องคือกับ Qwen3-8B และสรุปของ webAI เองเกี่ยวกับเรื่องนี้ก็ถ่อมตัวมากกว่าที่งานเขียนที่เล่าต่อ ๆ กันชี้ให้เห็น in-domain macro gate ของ TwIL-LM3-Pro อยู่ที่ 0.5539 เทียบกับ 0.5336 ของ Qwen3-8B และ model card มีประโยคที่หน้าเพจการตลาดคงตัดออกไป: gate lead อยู่ที่ 0.020 "เล็กกว่าสัญญาณรบกวนจากการสุ่มที่ n = 200 ต่อเลน — ดังนั้นให้อ่านอันนั้นเป็นความเท่าเทียม ไม่ใช่ชัยชนะ"
ในกรณีที่การเปรียบเทียบไม่ใช่การทอยเหรียญ: strict-7, 0.2879 เทียบกับ 0.2093 ซึ่งเป็นแถวที่ไม่ใช้เครดิตการจับคู่แบบหลวมเลยแม้แต่จุดเดียว และดังนั้นจึงไม่สามารถถูกปั้นขึ้นมาด้วยการจัดรูปแบบได้ ปรนัยแบบเข้มงวด 0.4100 เทียบกับ 0.0000 การเหนี่ยวนำกฎ 0.4195 เทียบกับ 0.3680 และอัตราส่วนพารามิเตอร์ — 3.66B เทียบกับราว 8B — ซึ่งเป็นข้ออ้างทั้งหมดที่ว่า "เล็กกว่าครึ่งหนึ่ง"
ในชุดทดสอบที่กันไว้ webAI ยิ่งพูดตรง ๆ มากกว่าเดิม: “TwIL-LM3-Pro ไม่ได้เป็นผู้นำในชุดนี้” ค่ามาโครจากสิบชุดข้อมูลอยู่ที่ 0.7901 เท่ากับ Granite base ของตัวเอง และตามหลัง 0.8493 ของ Qwen3-8B โมเดลเฉพาะทางขนาดเล็กที่ทำคะแนนเท่ากับโมเดลทั่วไปที่มีขนาดใหญ่เป็นสองเท่าในด้านตรรกะเชิงรูปแบบ และแพ้โมเดลนั้นในด้านความสามารถทั่วไป คือลักษณะที่คาดไว้ และการรายงานแบบนั้นเองที่ทำให้ตัวเลข strict-7 น่าเชื่อถือ
Qwen3.8-Max จริง ๆ แล้วคืออะไร
Qwen3.8-Max ไม่ใช่การพัฒนาต่อยอดจาก Qwen3-8B แต่เป็นระดับพรีเมียมของ Alibaba และบนหน้าคาตาล็อกของ OrcaRouter ปรากฏเป็น `qwen/qwen3.8-max` โดยมีวันที่เปิดตัว 3 สิงหาคม 2026 หน้าต่างบริบทหนึ่งล้านโทเคน รองรับอินพุตข้อความ รูปภาพ และวิดีโอ เอาต์พุตเป็นข้อความ และรองรับโหมดคิด การเรียกฟังก์ชัน เครื่องมือในตัว และเอาต์พุตแบบมีโครงสร้างอย่างเต็มรูปแบบ ให้บริการผ่านแดชบอร์ดที่เข้ากันได้กับ OpenAI, เข้ากันได้กับ Anthropic และแดชบอร์ดเนทีฟในห้าภูมิภาค และโหมดคิดเปิดปิดด้วยพารามิเตอร์ `enable_thinking` อัตราค่าบริการอยู่ที่ $2.00 ต่ออินพุตหนึ่งล้านโทเคน และ $6.00 ต่อเอาต์พุตหนึ่งล้านโทเคน
สแนปช็อตที่ระบุวันที่ `qwen/qwen3.8-max-0902` ถูกเผยแพร่เมื่อวันที่ 2 กันยายน 2026 โดยมีความสามารถเดียวกันและราคาเดียวกัน ถูกเผยแพร่ขึ้นโดยเฉพาะเพื่อให้สามารถปักหมุดพฤติกรรมไว้สำหรับการรันที่ทำซ้ำได้ หากคุณกำลังสร้างบน Qwen3.8-Max สำหรับสิ่งใดก็ตามที่ใช้ระยะยาว ตัวระบุสแนปช็อตนั้นคือสิ่งที่ควรใส่ในคอนฟิก แทนที่จะเป็นนามแฝงที่เปลี่ยนแปลงไป
สังเกตว่าอะไรที่หายไปจากคำอธิบายนั้น: จำนวนพารามิเตอร์ที่คุณดาวน์โหลดได้ ไฟล์สัญญาอนุญาต และเส้นทางใด ๆ ในการรันมันด้วยตัวเอง Qwen3.8-Max เป็นผลิตภัณฑ์แบบโฮสต์ การรายงานข่าวตอนเปิดตัวระบุว่ามีการสัญญาว่าจะเปิดเวตในสัปดาห์ถัดไป และถ้อยคำของ techsy — "2.4T พารามิเตอร์, คอนเท็กซ์ 1M, ยังไม่มีเวต" — คือสถานะที่ผู้อ่านควรตรวจสอบมากกว่าจะสันนิษฐาน เพราะคำสัญญาที่ถูกรายงานตอนเปิดตัวไม่ใช่เช็กพอยต์ที่เผยแพร่แล้ว
สี่มิติ และไม่มีมิติใดใกล้เคียงเลย
• พารามิเตอร์ — TwIL-LM3-Pro 3.66B แบบ dense ที่ทำงานทั้งหมด เทียบกับ Qwen3.8-Max ที่รายงานไว้ที่ 2.4T รวมในดีไซน์ sparse mixture-of-experts ที่มีการทำงานประมาณ 95B ต่อโทเค็น ต่างกันสามลำดับขนาดในส่วนของค่าทั้งหมด และสองลำดับในส่วนของค่าที่ทำงาน
• รันที่ไหนได้ — TwIL-LM3-Pro ดาวน์โหลดได้ในรูปแบบ bf16 ขนาด 6.82 GiB หรือ Q4_K_M GGUF ขนาด 2.09 GiB สำหรับ CPU หรือ VRAM 4 GB เทียบกับ Qwen3.8-Max ซึ่งมีให้ใช้เฉพาะเป็นปลายทางแบบโฮสต์เท่านั้น
• บริบท — TwIL-LM3-Pro 131,072 โทเคน สืบทอดมาจากฐาน Granite ของตน และไม่เคยได้รับการตรวจสอบยืนยันเกิน 8,192 ในการประเมินของตัวเองเมื่อเทียบกับ Qwen3.8-Max ที่ 1,000,000 โทเคน
• โมดัลลิตี — ข้อความเข้า ข้อความออก เทียบกับ ข้อความ รูปภาพ และวิดีโอเข้า ข้อความออก
• สัญญาอนุญาต — webAI Non-Commercial License ver. 1.0 โดยต้องมีข้อตกลงแยกต่างหากสำหรับการใช้งานที่ก่อให้เกิดรายได้ ต่างจาก API เชิงพาณิชย์แบบโฮสต์ที่ไม่มีเวตให้ต้องขอสิทธิ์การใช้งาน
• ค่าใช้จ่าย — TwIL-LM3-Pro: ไม่มีค่าธรรมเนียมต่อโทเค็นและไม่มีโฮสต์เอนด์พอยต์ เมื่อเทียบกับ Qwen3.8-Max ที่คิดราคา $2.00 ต่อล้านโทเค็นอินพุต และ $6.00 ต่อล้านเอาต์พุต โดยมีอัตราอินพุตแคชอยู่ที่ประมาณ $0.25 ต่อล้าน
โมเดล 3.66B นั้นราคาถูกเพราะมันมีขนาดเล็ก และมันมีขนาดเล็กเพราะมันทำเพียงสิ่งเดียว Qwen3.8-Max นั้นราคาแพงเพราะมันเป็นโมเดลทั่วไปและถูกโฮสต์ ไม่มีราคาใดที่เป็นคำตัดสิน
คำถามที่อยู่เบื้องหลังคำถาม
ปอกความสับสนเรื่องการตั้งชื่อออกไป ก็ยังเหลือคำถามทางวิศวกรรมข้อหนึ่ง และมันเป็นคำถามที่ดีด้วย: ถ้าโมเดลที่โฮสต์ไว้ระดับแนวหน้าสามารถให้เหตุผลเกี่ยวกับตรรกศาสตร์เชิงรูปแบบได้ แล้วทำไมต้องรันโมเดลผู้เชี่ยวชาญเฉพาะทางแบบแคบ ๆ เลยล่ะ
มีสามเหตุผลที่หนักแน่น เหตุผลแรกคือเรื่องสัญญาอนุญาตและเครือข่าย กลุ่มวิจัยที่ไม่ใช่เชิงพาณิชย์ สภาพแวดล้อมแบบแยกจากเครือข่าย หรือรอบการติดป้ายแบบกลุ่มที่ต้องรันบนแล็ปท็อปที่ไม่มีการเชื่อมต่อ ไม่สามารถเรียกปลายทางที่โฮสต์ไว้ได้ และ GGUF ขนาด 2.09 GiB ตอบข้อจำกัดนั้นได้โดยตรง เหตุผลที่สองคือต้นทุน งานติดป้ายด้วยตรรกะเชิงรูปนัยบนข้อมูลสั้นกว่าล้านรายการต้องจ่ายตามจำนวนโทเคนเมื่อใช้โมเดลที่โฮสต์ไว้ แต่จ่ายเพียงเวลาในการประมวลผลเมื่อรันในเครื่อง เหตุผลที่สามคือรูปร่างของผลลัพธ์ TwIL-LM3-Pro ถูกปรับมาเพื่อสร้างโครงสร้างที่เครื่องตรวจสอบได้แทนที่จะเป็นข้อความร้อยเรียง และสำหรับป้ายการอนุมานเชิงความหมายและการวิเคราะห์เชิงความหมาย นั่นเป็นกระบวนการที่เล็กกว่าการพรอมป์โมเดลทั่วไปแล้วแยกวิเคราะห์คำตอบของมัน
ในทางตรงกันข้าม กรณีของ Qwen3.8-Max นั้นตรงไปตรงมา มันมองเห็นภาพและวิดีโอ รองรับหนึ่งล้านโทเค็น จัดการเครื่องมือและเอาต์พุตแบบมีโครงสร้างผ่าน API ที่มีเอกสารประกอบ และมีเบนช์มาร์กที่เผยแพร่แล้วกับการประเมินอิสระรองรับอยู่เบื้องหลัง ไม่มีอะไรเกี่ยวกับผู้เชี่ยวชาญเฉพาะทางแคบ ๆ ที่คุกคามสิ่งนั้น ทั้งสองกำลังตอบชุดข้อจำกัดที่แตกต่างกัน
สแตกที่ใช้ทั้งสอง
รูปแบบที่อยู่รอดเมื่อสัมผัสกับไปป์ไลน์จริงคือแบบสองชั้น และไม่ใช่เรื่องแปลกใหม่ โมเดลที่โฮสต์ระดับแนวหน้าอ่านอินพุตที่ยุ่งเหยิง — หน้าหนังสือเรียนที่สแกน แหล่งข้อมูลแบบผสมโมดัล ข้อกำหนดที่ยาว — แล้วเปลี่ยนเป็นข้อความที่มีโครงสร้างสะอาด ข้อความนั้นจะไปยังโมเดลตรรกะเชิงรูปแบบภายในเครื่องซึ่งมีหน้าที่ทั้งหมดในการส่งออกป้ายกำกับ การแยกวิเคราะห์ หรือคำวิจารณ์ Lean บนฮาร์ดแวร์ที่คุณเป็นเจ้าของ คำตัดสินว่าชั้นที่สองนั้นคุ้มค่ากับต้นทุนการบำรุงรักษาหรือไม่คือการเปรียบเทียบแบบ strict-7 ไม่ใช่เกต เพราะผู้เชี่ยวชาญจะได้ตำแหน่งของมันในเลนที่เมตริกไม่มีที่ว่างสำหรับการให้คะแนนแบบผ่อนปรน
ยังมีข้อสังเกตหนึ่งที่น่าดึงมาจากการ์ดของ webAI เอง: pipeline นี้ถูกรันบนโมเดลฐานที่แตกต่างกันห้าโมเดล โดยมีเพียงค่า merge coefficient ที่เปลี่ยนไปในแต่ละโมเดล และ webAI รายงานผลลัพธ์ของแต่ละโมเดล รวมถึงตัวที่เปลี่ยนแปลงน้อยที่สุดด้วย นั่นเป็นข้ออ้างเกี่ยวกับสูตรที่หนักแน่นกว่าบรรทัด benchmark ใดเพียงบรรทัดเดียว และเป็นหลักฐานประเภทที่บอกว่าวิธีการหนึ่งใช้ได้ทั่วไป แทนที่จะบอกว่า checkpoint ตัวหนึ่งโชคดี
อะไรที่สามารถกำหนดเส้นทางได้ที่นี่ และอะไรที่ไม่สามารถ
นี่คือที่เดียวที่โมเดลทั้งสองปรากฏอยู่ในประโยคเดียวกันอย่างตรงไปตรงมา Qwen3.8-Max เป็นเส้นทางหนึ่ง: ให้บริการผ่าน OrcaRouter ในชื่อ `qwen/qwen3.8-max` และ เนื่องจากแพลตฟอร์มส่งต่อราคาตามรายการของผู้ให้บริการโดยบวกมาร์กอัป 0% อัตรา $2.00/$6.00 จึงเป็นราคาของผู้จำหน่ายเอง และการลดราคาของผู้จำหน่ายจะมีผลทันทีในวันเดียวกัน แทนที่จะเป็นหลังรอบสัญญา สแนปช็อต `qwen/qwen3.8-max-0902` ที่ระบุวันที่สามารถกำหนดเส้นทางใช้งานควบคู่ไปกับมันได้ ดังนั้นการปักหมุด ID โมเดลที่ทำซ้ำได้จึงเป็นทางเลือกด้านการตั้งค่า ไม่ใช่ความสัมพันธ์กับผู้จำหน่ายอีกรายหนึ่ง
TwIL-LM3-Pro ไม่ใช่ route และการบอกเป็นนัยว่าเป็นเช่นนั้นก็คงไม่ซื่อสัตย์ มันมีสัญญาอนุญาตแบบไม่ใช้เชิงพาณิชย์ โดยไม่มีเอนด์พอยต์แบบโฮสต์ที่เผยแพร่ไว้ และวิธีใช้ในปัจจุบันคือดาวน์โหลดเช็กพอยต์แล้วรันเอง สิ่งที่ router ทำเพื่อไปป์ไลน์ที่สร้างขึ้นรอบ ๆ มันคืองานข้อความโดยรอบ — การขยายพรอมป์ต์ การสร้างคลังข้อมูล การกรอง — ซึ่งทำงานบนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI แบบเดียวกันกับโมเดลกว่า 200 รายการ ดังนั้นการสลับโมเดลที่สร้างข้อมูลสำหรับประเมินผลไปเป็นโมเดลที่ให้คะแนนจึงมีต้นทุนเพียงแค่แก้ไขคอนฟิก โดยมี การสลับสำรองอัตโนมัติเพื่อให้แบตช์ที่ยาวยังคงดำเนินต่อไปได้เมื่อผู้ให้บริการขัดข้อง.
การใช้ทั้งสองอย่างร่วมกันที่สมเหตุสมผลที่สุดก็คือแบบนี้เลย: ชั้นฟรอนเทียร์ที่จัดเส้นทางได้ทำหน้าที่ให้เหตุผลทั่วไปและสกัดข้อมูลเชิงโครงสร้าง ผู้เชี่ยวชาญที่ดาวน์โหลดมาทำหน้าที่ตัดสินเชิงตรรกศาสตร์รูปแบบ และมีคีย์เดียวสำหรับทุกอย่างที่อยู่ระหว่างนั้น
จะเปรียบเทียบโมเดลไหน และเมื่อไหร่
หากคุณกำลังประเมินโมเดลตรรกะเชิงรูปแบบขนาดเล็ก Qwen ที่คู่ควรแก่การวางไว้เคียงข้าง TwIL-LM3-Pro คือ Qwen3-8B และ webAI ได้เผยแพร่การเปรียบเทียบนั้นแล้วพร้อมข้อควรระวังที่แนบมาด้วย หากคุณกำลังเลือกว่าจะรันเวิร์กโหลดระดับโปรดักชันที่ไหน Qwen3.8-Max เป็นการตัดสินใจที่ต่างออกไปโดยสิ้นเชิง — ระบบฟรอนเทียร์แบบโฮสต์ที่มีเรตการ์ดและไม่มีให้ดาวน์โหลด — และคำถามที่ถูกต้องไม่ใช่ว่าอันไหนดีกว่า แต่เป็นว่าข้อจำกัดใดเป็นตัวผูกมัด: การเชื่อมต่อและสิทธิ์การใช้งานในด้านหนึ่ง กับบริบท มัลติโมดาลิตี และสเกลในอีกด้านหนึ่ง ระบบจริงส่วนใหญ่ลงเอยด้วยการต้องการคำตอบทั้งสอง



การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
