การ์ดชื่อเรื่องที่สร้างขึ้นซึ่งมีข้อความว่า 'Intern-Decision-2B vs Qwen 3.8' พร้อมคำบรรยายใต้ชื่อว่า 'โครงหลักเดียว สองงานที่ต่างกันสุดขั้ว' และป้ายข้อความ 'ตัวให้คะแนน 2.2B, 33 ms' กับ 'เรือธง 2.4T, บริบท 1M' โดยมีโลโก้ OrcaRouter วางซ้อนอยู่ที่มุม
Guides & Insights

Intern-Decision-2B vs Qwen 3.8: แบ็กโบนเดียว สองงานที่ต่างกันสุดขั้ว

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เปิดคอนฟิกของ internlm/Intern-Decision-2Bกับคอนฟิกของ Qwen/Qwen3.5-2Bวางเทียบกันแบบเคียงข้าง แล้วแทบไม่มีอะไรแตกต่างเลย 24 เลเยอร์เท่ากัน ขนาด hidden 2,048 เท่ากัน หัว query 8 หัวเทียบกับหัว key-value 2 หัวเท่ากัน มิติหัว 256 เท่ากัน เพดาน embedding 262,144 ตำแหน่งเท่ากัน คำศัพท์ 248,320 โทเคนเท่ากัน รูปแบบซ้ำ ๆ ของเลเยอร์ linear attention สามชั้นต่อเลเยอร์ full attention หนึ่งชั้นก็เหมือนกัน Intern-Decision-2B ไม่ใช่สถาปัตยกรรมใหม่ มันคือแบ็กโบนตัวนั้นที่ถูกถอดความสามารถในการสร้างข้อความออกไป และปรับคาลิเบรตความมั่นใจของมัน — และการลบเพียงหนึ่งเดียวนี้เองที่ทำให้การเปรียบเทียบกับ Qwen3.8-Max ซึ่งเป็นเรือธงขนาด 2.4 ล้านล้านพารามิเตอร์ที่ชื่อตระกูล "Qwen 3.8" ทั้งหมดหมายถึงในระดับสูงสุดนั้น มีค่ามากกว่าการนับถอยหลังจำนวนพารามิเตอร์

ทั้งสองไม่ใช่คู่แข่งกัน และการจับคู่นี้ก็ไม่ใช่การแข่งขัน Intern-Decision-2B เป็นโมเดล fine-tune ขนาด 2,213,241,664 พารามิเตอร์ของ Qwen3.5-2B ซึ่งอัปโหลดขึ้น Hugging Face เมื่อเวลา 05:36 UTC วันที่ 26 กันยายน 2026 พร้อมกับพี่น้องอีกสามตัวที่ยังไม่ประกาศ และมันไม่ปล่อยโทเคนออกมาเลย: มันรับสถานะและคำถามที่มีการระบุชนิด รัน causal forward pass หนึ่งครั้ง อ่าน logits ณ ตำแหน่ง placeholder คงที่ และส่งคืนการแจกแจงที่ปรับเทียบแล้วต่อหนึ่งฟิลด์ Qwen3.8-Max เป็นโมเดลเรือธงแบบโฮสต์ของ Alibaba เป็นโมเดล sparse mixture-of-experts ที่มีพารามิเตอร์ประมาณ 95 พันล้านตัวที่ทำงานต่อโทเคน หน้าต่างบริบทแบบมัลติโมดัลขนาด 1 ล้านโทเคน และราคาตามรายการที่ $2.00 ต่อล้านโทเคนอินพุต และ $6.00 ต่อล้านโทเคนเอาต์พุต สิ่งหนึ่งเป็นองค์ประกอบ อีกสิ่งหนึ่งเป็นบริการ คำถามที่มีประโยชน์คือรอยต่อระหว่างทั้งสองควรอยู่ตรงไหนในไปป์ไลน์ที่คุณจ่ายเงินอยู่แล้ว

การลบ อย่างแม่นยำ

สิ่งสำคัญที่ควรกล่าวอย่างชัดเจนคือการเปลี่ยนแปลงที่ decision tuning ทำไป เพราะมันช่วยให้เข้าใจได้ชัดเจนว่าโมเดลฐานมีสิ่งใดอยู่แล้ว

งานนี้ถูกตั้งชื่อในรีพอซิทอรีว่า autoregressive masked language modelling อินพุตของแอสซิสแทนต์มีโครงร่าง JSON ที่สมบูรณ์ซึ่งมีโทเคน <decision> หนึ่งโทเคนต่อหนึ่งฟิลด์ สัญลักษณ์คำตอบเฉลยจะปรากฏเฉพาะในเลเบลเท่านั้น ไม่เคยอยู่ในอินพุต การเทรนใช้การจัดแนวโทเคนถัดไปแบบ causal ทั่วไป โดยลอจิทที่อยู่ก่อนมาร์กเกอร์ทันทีจะทำนายคำตอบของฟิลด์นั้น และทุกฟิลด์ใช้ forward pass ร่วมกันหนึ่งครั้ง ในขั้นตอนอินเฟอเรนซ์ ลอจิทจะถูกจำกัดให้เหลือเฉพาะสัญลักษณ์คำตอบแบบโทเคนเดียวที่ถูกต้อง — A–Z, a–z, 0–9 ซึ่งเป็นที่มาของเพดาน 62 ตัวเลือก — จากนั้นจึงทำ softmax และแมปกลับไปยังเลเบลของคุณ

ดังนั้น กลไกโทเค็นถัดไปของโมเดลฐานยังคงสมบูรณ์และไม่ถูกแก้ไข สิ่งที่ถูกฝึกเข้าไปคือความชอบที่จะอยู่ในตำแหน่งคำตอบเพียงไม่กี่ตำแหน่งแทนที่จะเขียนประโยคต่อ รวมถึงอุณหภูมิเฉพาะเช็กพอยต์ที่ 2.100509348278 ซึ่งถูกฟิตด้วย negative log-likelihood จากเคสปรับเทียบที่กำหนดไว้ 1,728 เคส โดยมี 1,693 เคสถูกกันไว้ การ์ดระบุชัดเจนว่าการสร้างผลลัพธ์ไม่ใช่ตัวเลือกที่ใช้ได้: API "ทำการให้คะแนนแคนดิเดตแบบมีโครงสร้าง ไม่ได้เรียก generate() หรือสุ่มข้อความอิสระ"

ที่เก็บโค้ดยังบันทึกสิ่งที่การปรับแต่งไม่ได้แตะต้องไว้ด้วย: มัน "ไฟน์จูนแกนหลักด้านภาษาของ Qwen3.5 ขณะตรึง vision tower และ projector ไว้" ชาร์ดภาพขนาด 612,517,440 ไบต์บนรุ่น 2B มีจำนวนไบต์เท่ากับบนเช็กพอยต์การตัดสินใจของ 4B ซึ่งสอดคล้องกับคอมโพเนนต์ที่สืบทอดมา มากกว่าคอมโพเนนต์ที่ผ่านการเทรน เส้นทางภาพทำงานได้; เพียงแต่ไม่ใช่สิ่งที่รอบการตัดสินใจใช้งบไปกับมัน

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

สิ่งที่พารามิเตอร์ 2.2 พันล้านทำไม่ได้ และสิ่งที่พารามิเตอร์ 2.4 ล้านล้านทำแทน

ทุกสิ่งแยกออกตามแกนเดียว: ว่าคำตอบของคุณมีอยู่เป็นรายการอยู่แล้วหรือไม่

Intern-Decision-2B ตอบชุดปิด หนึ่งถึงสิบหกคำถาม แต่ละข้อมีตัวเลือกสูงสุด 62 ตัวเลือก รูปภาพสูงสุดแปดรูป ทั้งหมดอยู่ภายในงบ 8,192 โทเคนที่ตัวเอนจินปฏิเสธแทนที่จะตัดทอน ส่งคืนเป็นความน่าจะเป็น ที่ค่าเฉลี่ย 33.28 มิลลิวินาทีต่อคำขอ บน RTX 4090 เพียงตัวเดียว โดยมี P95 ที่ 33.55 มิลลิวินาที และไม่มีการคิดค่าบริการต่อการเรียกใช้ เพราะไม่มีเอาต์พุตให้คิดค่าบริการ

Qwen3.8-Max เขียนได้ บริบทขนาด 1 ล้านโทเคน อินพุตข้อความ รูปภาพ และวิดีโอ การให้เหตุผลด้วยโหมดคิด การเรียกใช้เครื่องมือแบบเนทีฟ เอาต์พุตแบบมีโครงสร้าง สูงสุด 131,000 โทเคนเอาต์พุตบนบิลด์ 0902 ที่ลงวันที่ โดยหลักการแล้ว มันยังสามารถตัดสินใจเลือกเส้นทางแบบเดียวกับที่ Intern-Decision-2B ทำได้ — คุณสามารถพรอมป์ต์ให้มันเลือกจากตัวเลือกต่างๆ และส่งคืน JSON ได้ มีสามสิ่งที่ผิดพลาดเมื่อคุณทำเช่นนั้น คุณต้องจ่ายสำหรับโทเคนที่มันใช้ในการตัดสินใจ คุณจะได้สตริงที่การแยกวิเคราะห์อาจสำเร็จหรือไม่ก็ได้ และตัวเลขในสตริงนั้นคืออะไรก็ตามที่ตัวสุ่มสร้างขึ้น ไม่ใช่ softmax ที่คุณสามารถตั้งเกณฑ์ที่ 0.8 แล้วนำไปดำเนินการได้

ทั้งสองคำอธิบายเป็นจริง และไม่ได้หักล้างกัน โมเดลเรือธงขนาด 2.4 ล้านล้านพารามิเตอร์มีอยู่เพราะปัญหาส่วนใหญ่ไม่ใช่เซตปิด ตัวให้คะแนนขนาด 2.2 พันล้านพารามิเตอร์มีอยู่เพราะเซตย่อยที่เป็นเช่นนั้นสมควรได้รับเครื่องมือที่ถูกกว่า

สกอร์บอร์ด

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• พารามิเตอร์ — Intern-Decision-2B 2,213,241,664 ใน BF16 บวกกับวิชันทาวเวอร์และโปรเจกเตอร์ ประมาณ 4.46 GB บนดิสก์; Qwen3.8-Max รวมประมาณ 2.4 ล้านล้าน โดยมีพารามิเตอร์ที่ใช้งานประมาณ 95 พันล้านต่อโทเคน ให้บริการ ไม่ใช่ดาวน์โหลด

• บริบท — 8,192 โทเคน ถูกปฏิเสธเมื่อเกินค่านี้; 1,000,000 โทเคน โดยมีเอาต์พุตสูงสุด 131,000 บนบิลด์ 0902

• เอาต์พุต — ความน่าจะเป็นที่ปรับเทียบแล้วและค่า argmax โดยไม่มีการสร้างข้อความ; ข้อความที่สร้างขึ้นซึ่งรวมถึงร่องรอยการให้เหตุผล

• รูปแบบอินพุต — ข้อความพร้อมรูปภาพสูงสุด 8 รูป; ข้อความ รูปภาพ และวิดีโอ

• ต้นทุน — ไม่มีค่าใช้จ่ายต่อการเรียกใช้ และคุณเป็นเจ้าของ GPU เอง; $2.00 ต่อล้านโทเค็นอินพุต, $6.00 ต่อล้านโทเค็นเอาต์พุต โดยการอ่านแคชอยู่ที่ $0.25 และการเขียนแคชอยู่ที่ $2.50

• หลักฐานที่เผยแพร่ — ตารางเจ็ดชุดของผู้ขาย ซึ่งเฉลี่ย 84.68, Brier 0.437 และ ECE 0.100 จาก 10,751 แถวทดสอบ โดยยังไม่มีใครนอก InternLM ทำซ้ำได้ บน checkpoint ที่มี 1 ไลก์และ 0 ดาวน์โหลด; ดัชนี Artificial Analysis Intelligence Index ที่ 45.4 ในอันดับ 15 จาก 145 และ AA coder ที่ 76.2 ในอันดับ 9 จาก 138 โดยวัดอย่างอิสระ

• ความหน่วง — ค่าเฉลี่ย 33.28 ms ต่อคำขอบน RTX 4090 หนึ่งตัว โดยจะลดลงเมื่อเพิ่มการแบตช์; 2.655 วินาที P50 จนถึงโทเคนแรกตามที่แค็ตตาล็อกรายงาน โดยจะเพิ่มขึ้นตามโหลด

แถวหลักฐานไม่เทียบเท่ากัน และไม่ควรพิมพ์ออกมาราวกับว่าเทียบเท่ากันได้ เรือธงของ Alibaba มีคะแนนดัชนีอิสระรองรับอยู่ เช็กพอยต์ของ InternLM มีตารางที่ผู้เขียนของมันเองสร้างขึ้น และโดยเฉพาะตัวเลขการคาลิเบรตควรถูกอ่านเป็นความตั้งใจที่บันทึกไว้อย่างดี จนกว่าจะได้พบกับข้อมูลของคนอื่น — ยิ่งเป็นเช่นนั้นในกรณีนี้ เพราะขนาดเฉพาะนี้รายงานความคลาดเคลื่อนการคาลิเบรตที่คาดหวังได้แย่ที่สุดในสามรุ่นที่ InternLM เปิดตัว คือ 0.100 เทียบกับ 0.066 สำหรับโมเดลที่มีขนาดครึ่งหนึ่งของมัน และ 0.065 สำหรับโมเดลที่ใหญ่เกือบสองเท่าของมัน

รอยต่อ และวิธีการรันมัน

ไปป์ไลน์ที่สมเหตุสมผลไม่ใช่การเลือกระหว่างสองสิ่งนี้ แต่เป็นการแยกงานกัน: ตัวให้คะแนนจัดการการตัดสินใจที่ระบุเป็นรายการไว้ และโมเดลระดับแนวหน้าจัดการทุกอย่างที่คำตอบไม่ใช่รายการ การคัดแยกงานสนับสนุนที่ส่งต่อไปยังหนึ่งในหกทีม และให้คะแนนความเร่งด่วนบนมาตรวัดสามระดับ ไม่จำเป็นต้องมีพารามิเตอร์ที่ใช้งานอยู่ 9.5 หมื่นล้านตัว; มันต้องการเพียงความน่าจะเป็นและค่าเกณฑ์ ส่วนเส้นทางการส่งต่อที่ในที่สุดแล้วเขียนคำตอบให้ลูกค้านั้นต่างหากที่จำเป็นต้องใช้

การแบ่งแยกนี้มีรูปแบบในเชิงปฏิบัติการ Intern-Decision-2B ไม่ได้อยู่บน OrcaRouter — หน้าโมเดลของเราสำหรับมันคืนค่า 404 และไม่มีเส้นทางแบบโฮสต์ที่ใดก็ตามที่เราหาเจอ — ดังนั้นมันจึงทำงานบนฮาร์ดแวร์ของคุณเอง ซึ่งหมายความว่ามันเป็นองค์ประกอบที่คุณต้องดำเนินการและเฝ้าติดตาม Qwen3.8-Max เป็นเส้นทาง: คีย์เดียวใช้ได้กับโมเดลกว่า 200 ตัว ราคาตามที่ผู้ให้บริการระบุถูกส่งผ่านโดยไม่บวกเพิ่ม ซึ่งหมายความว่าการเปลี่ยนแปลงราคาจากผู้จำหน่ายสำหรับโมเดลเรือธงจะไปถึงบิลของคุณในวันเดียวกับที่มันประกาศออกมา การวางส่วนที่โฮสต์ไว้ของไปป์ไลน์ให้อยู่เบื้องหลังพื้นผิวเดียวนี้ คือสิ่งที่ทำให้ขาที่มีต้นทุนต่ำกว่ายังคงประหยัด: ตัวให้คะแนนช่วยกดปริมาณการเรียกให้ต่ำลง และโมเดลแนวหน้าจะถูกเรียกใช้เฉพาะกรณีที่จำเป็นจริง ๆ เท่านั้น

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

หากคุณยังกำลังประเมินว่าตัวให้คะแนนใดควรอยู่ในช่องนั้น — ตัวนี้ไม่มีการประเมินที่เป็นอิสระ และการปรับเทียบของมันอ่อนที่สุดในตระกูลของตัวเอง — การสลับสำรองอัตโนมัติข้ามผู้ให้บริการคือวิธีลองใช้มันในเส้นทางที่มีทางเลือกที่ทำงานได้อยู่เบื้องหลังอยู่แล้ว แทนที่จะแทนที่ทางเลือกนั้นโดยสิ้นเชิง

คำตัดสินที่ตรงไปตรงมา

ถ้าปัญหาของคุณคือการตัดสินใจเลือกจากชุดคำตอบที่คุณแจกแจงได้ และสถานะนั้นพอดีอยู่ในแปดพันโทเค็น Intern-Decision-2B จะทำมันเสร็จในสามสิบสามมิลลิวินาที โดยไม่มีค่าใช้จ่ายต่อการเรียกใช้ และไม่มีโมเดลระดับแนวหน้าใดจะเอาชนะมันในแกนนั้นได้ ไม่ว่าคุณจะเช่าพารามิเตอร์มากี่ตัวก็ตาม จงนำการปรับเทียบของคุณเองไปใช้กับมันก่อนที่คุณจะพึ่งพาความมั่นใจที่มันรายงาน

หากปัญหาของคุณเป็นเรื่องอื่นใด — การใช้เหตุผล บริบทยาว การใช้เครื่องมือ วิดีโอ เอกสารล้านโทเคน หรือเพียงคำตอบที่ยังไม่ได้เขียนขึ้นมา — Qwen3.8-Max ไม่ได้แค่ดีกว่าเท่านั้น มันเป็นรุ่นเดียวในสองรุ่นนี้ที่ทำงานนั้นได้เลย

และถ้าคุณยังบอกไม่ได้ว่าคุณมีสิ่งใดในสองสิ่งนั้น คำตอบก็คงเป็นว่าคุณมีทั้งสองอย่างในไปป์ไลน์เดียวกัน ซึ่งนั่นคือสถาปัตยกรรมที่จำนวนพารามิเตอร์คอยบอกคุณแบบเงียบ ๆ มาตลอด

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube