
Intern-Decision-2B vs Qwen 3.8: แบ็กโบนเดียว สองงานที่ต่างกันสุดขั้ว
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 584 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
เปิดคอนฟิกของ internlm/Intern-Decision-2Bกับคอนฟิกของ Qwen/Qwen3.5-2Bวางเทียบกันแบบเคียงข้าง แล้วแทบไม่มีอะไรแตกต่างเลย 24 เลเยอร์เท่ากัน ขนาด hidden 2,048 เท่ากัน หัว query 8 หัวเทียบกับหัว key-value 2 หัวเท่ากัน มิติหัว 256 เท่ากัน เพดาน embedding 262,144 ตำแหน่งเท่ากัน คำศัพท์ 248,320 โทเคนเท่ากัน รูปแบบซ้ำ ๆ ของเลเยอร์ linear attention สามชั้นต่อเลเยอร์ full attention หนึ่งชั้นก็เหมือนกัน Intern-Decision-2B ไม่ใช่สถาปัตยกรรมใหม่ มันคือแบ็กโบนตัวนั้นที่ถูกถอดความสามารถในการสร้างข้อความออกไป และปรับคาลิเบรตความมั่นใจของมัน — และการลบเพียงหนึ่งเดียวนี้เองที่ทำให้การเปรียบเทียบกับ Qwen3.8-Max ซึ่งเป็นเรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ที่ชื่อตระกูล "Qwen 3.8" ทั้งหมดหมายถึงในระดับสูงสุดนั้น มีค่ามากกว่าการนับถอยหลังจำนวนพารามิเตอร์
ทั้งสองไม่ใช่คู่แข่งกัน และการจับคู่นี้ก็ไม่ใช่การแข่งขัน Intern-Decision-2B เป็นโมเดล fine-tune ขนาด 2,213,241,664 พารามิเตอร์ของ Qwen3.5-2B ซึ่งอัปโหลดขึ้น Hugging Face เมื่อเวลา 05:36 UTC วันที่ 26 กันยายน 2026 พร้อมกับพี่น้องอีกสามตัวที่ยังไม่ประกาศ และมันไม่ปล่อยโทเคนออกมาเลย: มันรับสถานะและคำถามที่มีการระบุชนิด รัน causal forward pass หนึ่งครั้ง อ่าน logits ณ ตำแหน่ง placeholder คงที่ และส่งคืนการแจกแจงที่ปรับเทียบแล้วต่อหนึ่งฟิลด์ Qwen3.8-Max เป็นโมเดลเรือธงแบบโฮสต์ของ Alibaba เป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์ประมาณ 95 พันล้านตัวที่ทำงานต่อโทเคน หน้าต่างบริบทแบบมัลติโมดัลขนาด 1 ล้านโทเคน และราคาตามรายการที่ $2.00 ต่อล้านโทเคนอินพุต และ $6.00 ต่อล้านโทเคนเอาต์พุต สิ่งหนึ่งเป็นองค์ประกอบ อีกสิ่งหนึ่งเป็นบริการ คำถามที่มีประโยชน์คือรอยต่อระหว่างทั้งสองควรอยู่ตรงไหนในไปป์ไลน์ที่คุณจ่ายเงินอยู่แล้ว
การลบ อย่างแม่นยำ
สิ่งสำคัญที่ควรกล่าวอย่างชัดเจนคือการเปลี่ยนแปลงที่ decision tuning ทำไป เพราะมันช่วยให้เข้าใจได้ชัดเจนว่าโมเดลฐานมีสิ่งใดอยู่แล้ว
งานนี้ถูกตั้งชื่อในรีพอซิทอรีว่า autoregressive masked language modelling อินพุตของแอสซิสแทนต์มีโครงร่าง JSON ที่สมบูรณ์ซึ่งมีโทเคน <decision> หนึ่งโทเคนต่อหนึ่งฟิลด์ สัญลักษณ์คำตอบเฉลยจะปรากฏเฉพาะในเลเบลเท่านั้น ไม่เคยอยู่ในอินพุต การเทรนใช้การจัดแนวโทเคนถัดไปแบบ causal ทั่วไป โดยลอจิทที่อยู่ก่อนมาร์กเกอร์ทันทีจะทำนายคำตอบของฟิลด์นั้น และทุกฟิลด์ใช้ forward pass ร่วมกันหนึ่งครั้ง ในขั้นตอนอินเฟอเรนซ์ ลอจิทจะถูกจำกัดให้เหลือเฉพาะสัญลักษณ์คำตอบแบบโทเคนเดียวที่ถูกต้อง — A–Z, a–z, 0–9 ซึ่งเป็นที่มาของเพดาน 62 ตัวเลือก — จากนั้นจึงทำ softmax และแมปกลับไปยังเลเบลของคุณ
ดังนั้น กลไกโทเค็นถัดไปของโมเดลฐานยังคงสมบูรณ์และไม่ถูกแก้ไข สิ่งที่ถูกฝึกเข้าไปคือความชอบที่จะอยู่ในตำแหน่งคำตอบเพียงไม่กี่ตำแหน่งแทนที่จะเขียนประโยคต่อ รวมถึงอุณหภูมิเฉพาะเช็กพอยต์ที่ 2.100509348278 ซึ่งถูกฟิตด้วย negative log-likelihood จากเคสปรับเทียบที่กำหนดไว้ 1,728 เคส โดยมี 1,693 เคสถูกกันไว้ การ์ดระบุชัดเจนว่าการสร้างผลลัพธ์ไม่ใช่ตัวเลือกที่ใช้ได้: API "ทำการให้คะแนนแคนดิเดตแบบมีโครงสร้าง ไม่ได้เรียก generate() หรือสุ่มข้อความอิสระ"
ที่เก็บโค้ดยังบันทึกสิ่งที่การปรับแต่งไม่ได้แตะต้องไว้ด้วย: มัน "ไฟน์จูนแกนหลักด้านภาษาของ Qwen3.5 ขณะตรึง vision tower และ projector ไว้" ชาร์ดภาพขนาด 612,517,440 ไบต์บนรุ่น 2B มีจำนวนไบต์เท่ากับบนเช็กพอยต์การตัดสินใจของ 4B ซึ่งสอดคล้องกับคอมโพเนนต์ที่สืบทอดมา มากกว่าคอมโพเนนต์ที่ผ่านการเทรน เส้นทางภาพทำงานได้; เพียงแต่ไม่ใช่สิ่งที่รอบการตัดสินใจใช้งบไปกับมัน

สิ่งที่พารามิเตอร์ 2.2 พันล้านทำไม่ได้ และสิ่งที่พารามิเตอร์ 2.4 ล้านล้านทำแทน
ทุกสิ่งแยกออกตามแกนเดียว: ว่าคำตอบของคุณมีอยู่เป็นรายการอยู่แล้วหรือไม่
Intern-Decision-2B ตอบชุดปิด หนึ่งถึงสิบหกคำถาม แต่ละข้อมีตัวเลือกสูงสุด 62 ตัวเลือก รูปภาพสูงสุดแปดรูป ทั้งหมดอยู่ภายในงบ 8,192 โทเคนที่ตัวเอนจินปฏิเสธแทนที่จะตัดทอน ส่งคืนเป็นความน่าจะเป็น ที่ค่าเฉลี่ย 33.28 มิลลิวินาทีต่อคำขอ บน RTX 4090 เพียงตัวเดียว โดยมี P95 ที่ 33.55 มิลลิวินาที และไม่มีการคิดค่าบริการต่อการเรียกใช้ เพราะไม่มีเอาต์พุตให้คิดค่าบริการ
Qwen3.8-Max เขียนได้ บริบทขนาด 1 ล้านโทเคน อินพุตข้อความ รูปภาพ และวิดีโอ การให้เหตุผลด้วยโหมดคิด การเรียกใช้เครื่องมือแบบเนทีฟ เอาต์พุตแบบมีโครงสร้าง สูงสุด 131,000 โทเคนเอาต์พุตบนบิลด์ 0902 ที่ลงวันที่ โดยหลักการแล้ว มันยังสามารถตัดสินใจเลือกเส้นทางแบบเดียวกับที่ Intern-Decision-2B ทำได้ — คุณสามารถพรอมป์ต์ให้มันเลือกจากตัวเลือกต่างๆ และส่งคืน JSON ได้ มีสามสิ่งที่ผิดพลาดเมื่อคุณทำเช่นนั้น คุณต้องจ่ายสำหรับโทเคนที่มันใช้ในการตัดสินใจ คุณจะได้สตริงที่การแยกวิเคราะห์อาจสำเร็จหรือไม่ก็ได้ และตัวเลขในสตริงนั้นคืออะไรก็ตามที่ตัวสุ่มสร้างขึ้น ไม่ใช่ softmax ที่คุณสามารถตั้งเกณฑ์ที่ 0.8 แล้วนำไปดำเนินการได้
ทั้งสองคำอธิบายเป็นจริง และไม่ได้หักล้างกัน โมเดลเรือธงขนาด 2.4 ล้านล้านพารามิเตอร์มีอยู่เพราะปัญหาส่วนใหญ่ไม่ใช่เซตปิด ตัวให้คะแนนขนาด 2.2 พันล้านพารามิเตอร์มีอยู่เพราะเซตย่อยที่เป็นเช่นนั้นสมควรได้รับเครื่องมือที่ถูกกว่า
สกอร์บอร์ด

• พารามิเตอร์ — Intern-Decision-2B 2,213,241,664 ใน BF16 บวกกับวิชันทาวเวอร์และโปรเจกเตอร์ ประมาณ 4.46 GB บนดิสก์; Qwen3.8-Max รวมประมาณ 2.4 ล้านล้าน โดยมีพารามิเตอร์ที่ใช้งานประมาณ 95 พันล้านต่อโทเคน ให้บริการ ไม่ใช่ดาวน์โหลด
• บริบท — 8,192 โทเคน ถูกปฏิเสธเมื่อเกินค่านี้; 1,000,000 โทเคน โดยมีเอาต์พุตสูงสุด 131,000 บนบิลด์ 0902
• เอาต์พุต — ความน่าจะเป็นที่ปรับเทียบแล้วและค่า argmax โดยไม่มีการสร้างข้อความ; ข้อความที่สร้างขึ้นซึ่งรวมถึงร่องรอยการให้เหตุผล
• รูปแบบอินพุต — ข้อความพร้อมรูปภาพสูงสุด 8 รูป; ข้อความ รูปภาพ และวิดีโอ
• ต้นทุน — ไม่มีค่าใช้จ่ายต่อการเรียกใช้ และคุณเป็นเจ้าของ GPU เอง; $2.00 ต่อล้านโทเค็นอินพุต, $6.00 ต่อล้านโทเค็นเอาต์พุต โดยการอ่านแคชอยู่ที่ $0.25 และการเขียนแคชอยู่ที่ $2.50
• หลักฐานที่เผยแพร่ — ตารางเจ็ดชุดของผู้ขาย ซึ่งเฉลี่ย 84.68, Brier 0.437 และ ECE 0.100 จาก 10,751 แถวทดสอบ โดยยังไม่มีใครนอก InternLM ทำซ้ำได้ บน checkpoint ที่มี 1 ไลก์และ 0 ดาวน์โหลด; ดัชนี Artificial Analysis Intelligence Index ที่ 45.4 ในอันดับ 15 จาก 145 และ AA coder ที่ 76.2 ในอันดับ 9 จาก 138 โดยวัดอย่างอิสระ
• ความหน่วง — ค่าเฉลี่ย 33.28 ms ต่อคำขอบน RTX 4090 หนึ่งตัว โดยจะลดลงเมื่อเพิ่มการแบตช์; 2.655 วินาที P50 จนถึงโทเคนแรกตามที่แค็ตตาล็อกรายงาน โดยจะเพิ่มขึ้นตามโหลด
แถวหลักฐานไม่เทียบเท่ากัน และไม่ควรพิมพ์ออกมาราวกับว่าเทียบเท่ากันได้ เรือธงของ Alibaba มีคะแนนดัชนีอิสระรองรับอยู่ เช็กพอยต์ของ InternLM มีตารางที่ผู้เขียนของมันเองสร้างขึ้น และโดยเฉพาะตัวเลขการคาลิเบรตควรถูกอ่านเป็นความตั้งใจที่บันทึกไว้อย่างดี จนกว่าจะได้พบกับข้อมูลของคนอื่น — ยิ่งเป็นเช่นนั้นในกรณีนี้ เพราะขนาดเฉพาะนี้รายงานความคลาดเคลื่อนการคาลิเบรตที่คาดหวังได้แย่ที่สุดในสามรุ่นที่ InternLM เปิดตัว คือ 0.100 เทียบกับ 0.066 สำหรับโมเดลที่มีขนาดครึ่งหนึ่งของมัน และ 0.065 สำหรับโมเดลที่ใหญ่เกือบสองเท่าของมัน
รอยต่อ และวิธีการรันมัน
ไปป์ไลน์ที่สมเหตุสมผลไม่ใช่การเลือกระหว่างสองสิ่งนี้ แต่เป็นการแยกงานกัน: ตัวให้คะแนนจัดการการตัดสินใจที่ระบุเป็นรายการไว้ และโมเดลระดับแนวหน้าจัดการทุกอย่างที่คำตอบไม่ใช่รายการ การคัดแยกงานสนับสนุนที่ส่งต่อไปยังหนึ่งในหกทีม และให้คะแนนความเร่งด่วนบนมาตรวัดสามระดับ ไม่จำเป็นต้องมีพารามิเตอร์ที่ใช้งานอยู่ 9.5 หมื่นล้านตัว; มันต้องการเพียงความน่าจะเป็นและค่าเกณฑ์ ส่วนเส้นทางการส่งต่อที่ในที่สุดแล้วเขียนคำตอบให้ลูกค้านั้นต่างหากที่จำเป็นต้องใช้
การแบ่งแยกนี้มีรูปแบบในเชิงปฏิบัติการ Intern-Decision-2B ไม่ได้อยู่บน OrcaRouter — หน้าโมเดลของเราสำหรับมันคืนค่า 404 และไม่มีเส้นทางแบบโฮสต์ที่ใดก็ตามที่เราหาเจอ — ดังนั้นมันจึงทำงานบนฮาร์ดแวร์ของคุณเอง ซึ่งหมายความว่ามันเป็นองค์ประกอบที่คุณต้องดำเนินการและเฝ้าติดตาม Qwen3.8-Max เป็นเส้นทาง: คีย์เดียวใช้ได้กับโมเดลกว่า 200 ตัว ราคาตามที่ผู้ให้บริการระบุถูกส่งผ่านโดยไม่บวกเพิ่ม ซึ่งหมายความว่าการเปลี่ยนแปลงราคาจากผู้จำหน่ายสำหรับโมเดลเรือธงจะไปถึงบิลของคุณในวันเดียวกับที่มันประกาศออกมา การวางส่วนที่โฮสต์ไว้ของไปป์ไลน์ให้อยู่เบื้องหลังพื้นผิวเดียวนี้ คือสิ่งที่ทำให้ขาที่มีต้นทุนต่ำกว่ายังคงประหยัด: ตัวให้คะแนนช่วยกดปริมาณการเรียกให้ต่ำลง และโมเดลแนวหน้าจะถูกเรียกใช้เฉพาะกรณีที่จำเป็นจริง ๆ เท่านั้น

หากคุณยังกำลังประเมินว่าตัวให้คะแนนใดควรอยู่ในช่องนั้น — ตัวนี้ไม่มีการประเมินที่เป็นอิสระ และการปรับเทียบของมันอ่อนที่สุดในตระกูลของตัวเอง — การสลับสำรองอัตโนมัติข้ามผู้ให้บริการคือวิธีลองใช้มันในเส้นทางที่มีทางเลือกที่ทำงานได้อยู่เบื้องหลังอยู่แล้ว แทนที่จะแทนที่ทางเลือกนั้นโดยสิ้นเชิง
คำตัดสินที่ตรงไปตรงมา
ถ้าปัญหาของคุณคือการตัดสินใจเลือกจากชุดคำตอบที่คุณแจกแจงได้ และสถานะนั้นพอดีอยู่ในแปดพันโทเค็น Intern-Decision-2B จะทำมันเสร็จในสามสิบสามมิลลิวินาที โดยไม่มีค่าใช้จ่ายต่อการเรียกใช้ และไม่มีโมเดลระดับแนวหน้าใดจะเอาชนะมันในแกนนั้นได้ ไม่ว่าคุณจะเช่าพารามิเตอร์มากี่ตัวก็ตาม จงนำการปรับเทียบของคุณเองไปใช้กับมันก่อนที่คุณจะพึ่งพาความมั่นใจที่มันรายงาน
หากปัญหาของคุณเป็นเรื่องอื่นใด — การใช้เหตุผล บริบทยาว การใช้เครื่องมือ วิดีโอ เอกสารล้านโทเคน หรือเพียงคำตอบที่ยังไม่ได้เขียนขึ้นมา — Qwen3.8-Max ไม่ได้แค่ดีกว่าเท่านั้น มันเป็นรุ่นเดียวในสองรุ่นนี้ที่ทำงานนั้นได้เลย
และถ้าคุณยังบอกไม่ได้ว่าคุณมีสิ่งใดในสองสิ่งนั้น คำตอบก็คงเป็นว่าคุณมีทั้งสองอย่างในไปป์ไลน์เดียวกัน ซึ่งนั่นคือสถาปัตยกรรมที่จำนวนพารามิเตอร์คอยบอกคุณแบบเงียบ ๆ มาตลอด
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
