
Intern-Decision-0.8B เทียบกับ Qwen 3.8: พารามิเตอร์ 853 ล้านตัวและชุดคำตอบแบบปิด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 592 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
Intern-Decision-0.8B เป็นโมเดลที่เล็กที่สุดในสามโมเดลตัดสินใจที่ InternLM เปิดตัวบน Hugging Face ในเช้าวันที่ 26 กันยายน 2026 และไม่ใช่ตัวที่เร็วที่สุดในบรรดาสามตัวนั้น นี่คือสิ่งแรกที่ควรรู้ จากการวัดของแล็บเอง โมเดลพี่น้องขนาด 2B เร็วกว่าเล็กน้อย — 33.28 ms เทียบกับ 33.98 ms — และได้คะแนนสูงกว่าหกจุดบนค่าเฉลี่ยชุดทดสอบเจ็ดชุดเดียวกัน ดังนั้นเหตุผลตามปกติที่ทำให้เลือกเช็กพอยต์ขนาดต่ำกว่าหนึ่งพันล้านพารามิเตอร์ ซึ่งก็คือความเร็วดิบ ใช้ไม่ได้กับกรณีนี้ สิ่งที่ใช้ได้คือขนาด: 852,985,920 พารามิเตอร์ น้ำหนัก bf16 1.71 GB เล็กพอที่จะอยู่ในพื้นที่ว่างของเครื่องที่ยังมีอย่างอื่นต้องทำได้อย่างถาวร เมื่อวางเทียบกับ Qwen3.8-Max — บริการโฮสต์ของแกน sparse mixture-of-experts ขนาด 2.4 ล้านล้านพารามิเตอร์ที่ผู้จำหน่ายเผยแพร่ในเดือนสิงหาคม โดยคิดราคา $2.00 และ $6.00 ต่อล้านโทเคน — ทั้งสองไม่ได้แข่งขันกันในงานเดียวกัน ตัวหนึ่งคืนค่าการแจกแจงความน่าจะเป็นเหนือตัวเลือกที่คุณให้ไว้ล่วงหน้า อีกตัวหนึ่งเขียน
คำตอบสั้น ๆ: Intern-Decision-0.8B คุ้มที่จะมีถ้าคุณต้องการการตัดสินใจแบบชุดปิด (closed-set) ที่ให้คะแนนบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว และถ้า 1.71 GB แทนที่จะเป็น 4.43 GB คือความแตกต่างระหว่างการส่งมอบกับการไม่ส่งมอบ มันไม่คุ้มที่จะมีถ้าคุณต้องการตัวให้คะแนนขนาดเล็กที่แม่นยำที่สุดที่ InternLM เปิดตัวสัปดาห์นี้ — นั่นคือ 4B — หรือถ้าคำตอบของคุณยังไม่ได้ถูกระบุเป็นรายการไว้ในพรอมต์ของคุณอยู่แล้ว ซึ่งในกรณีนั้นทั้งสองตัวนี้ไม่ใช่เครื่องมือที่ใช่ และ Qwen 3.8 เป็นเพียงตัวเดียวในคู่นี้ที่ทำงานนี้ได้เลย
สิ่งที่ repository บอก และสิ่งที่ไม่มีสิ่งอื่นใดทำได้
เริ่มจากหลักฐานก่อน เพราะมีหลักฐานอยู่น้อยมาก InternLM ไม่ได้ประกาศอะไรเกี่ยวกับโมเดลนี้ ไม่มีโพสต์เปิดตัว ไม่มีเปเปอร์ ไม่มีคำอธิบายรีโพซิทอรี การ์ดบน Hugging Face ลิงก์ไปยัง Space สาธิตและรีโพซิทอรี GitHub และ ณ ขณะที่เขียนนี้ Space ตอบกลับ 401 และลิงก์ GitHub ตอบกลับ 404 — สองจุดที่การ์ดชี้ให้คุณไปหาข้อมูลเพิ่มเติมถูกปิดอยู่ มีเช็กพอยต์สามรายการปรากฏขึ้นห่างกันภายในสี่สิบวินาที เมื่อราว 05:36 UTC วันที่ 26 กันยายน: Intern-Decision-0.8B, Intern-Decision-2B และ Intern-Decision-4B ทั้งหมดมีแท็กเดียวกัน — การตัดสินใจ, มัลติโมดัล, การพยากรณ์แบบมีโครงสร้าง — และทั้งหมดเป็นไฟน์จูนของเช็กพอยต์ Qwen ในกรณีนี้คือ Qwen3.5-0.8B.
สิ่งที่สามารถรู้ได้จากรีโพซิทอรีนี้แม่นยำอย่างผิดปกติสำหรับการเปิดตัวที่ยังไม่ประกาศ เพราะแล็บได้จัดส่งโมดูล inference ของตัวเองมาพร้อมกับน้ำหนักโมเดล โมเดล 0.8B โหลดผ่าน inference.py ขนาด 16 KB ในไดเรกทอรีโมเดล ต้องใช้ Python 3.12 หรือใหม่กว่า และ torch 2.9.1 กับ transformers 5.14.1 และเปิดเผยคลาส DecisionEngine ที่คุณสร้างอินสแตนซ์ครั้งเดียวแล้วนำกลับมาใช้ซ้ำ ป้อน dict ของ Python หนึ่งตัวเข้า ออกมาเป็น dict ของคำตอบหนึ่งตัว สิ่งที่ไม่สามารถรู้ได้: นี่เป็นการเปิดตัวที่เสร็จสมบูรณ์แล้วหรือเป็นการปล่อยช่วงแรก จะมีเอนด์พอยต์แบบโฮสต์ตามมาหรือไม่ และสองเช็กพอยต์ที่มันอยู่ระหว่างนั้นตั้งใจให้เป็นผลิตภัณฑ์เดียวกันในขนาดที่ต่างกัน หรือเป็นผลิตภัณฑ์ที่แตกต่างกันสามตัวที่บังเอิญใช้ชื่อร่วมกัน ไม่มีใครนอก InternLM ได้รันตัวใดในนั้นเลย

ปัญหาของพี่น้อง: 2B นั้นเร็วกว่าและดีกว่า
นี่คือส่วนหนึ่งในตารางที่ InternLM เผยแพร่เอง ซึ่งทำให้ 0.8B จัดตำแหน่งได้ยาก เมื่อไล่อ่านสามขนาดลงไปตามเจ็ดชุดเดียวกัน:
• ความเร็ว — 0.8B: ค่าเฉลี่ย 33.98 ms, ค่ามัธยฐาน 33.44 ms, 37.50 ms ที่ p95. 2B: 33.28 ms, 33.15 ms, 33.55 ms. 4B: 44.16 ms, 44.03 ms, 44.60 ms. ทั้งหมดวัดต่อหนึ่งคิวรีบน RTX 4090 เครื่องเดียวผ่านเส้นทาง Hugging Face ภายในเครื่อง
• ค่าเฉลี่ยเจ็ดชุด — 0.8B: 79.38. 2B: 84.68. 4B: 90.02.
• การสอบเทียบ — 0.8B: Brier 0.530, ECE 0.066 2B: Brier 0.437, ECE 0.100 4B: Brier 0.347, ECE 0.065
• ขนาดบนดิสก์ที่ bf16 — 0.8B: 1.71 GB. 2B: 4.43 GB. 4B: 9.08 GB.
2B เร็วกว่าในค่าเฉลี่ย แคบลงอย่างมากที่ปลายการกระจาย และแม่นยำกว่า ทั้งหมดนี้ในเวลาเดียวกัน ดังนั้น “เล็กกว่าแปลว่าเร็วกว่า” จึงไม่จริงในตระกูลนี้ — ผิดถึงสองครั้ง เพราะ 4B ช้ากว่าทั้งคู่ แกนเดียวที่ 0.8B ชนะขาดคือแกนที่ไม่มีใครวัดเป็น benchmark: 1.71 GB เทียบกับ 4.43 GB ของ 2B และ 9.08 GB ของ 4B หากคุณกำลังวางตัวให้คะแนนในงบหน่วยความจำที่จำกัด — เครื่องเล็กที่เปิดตลอดเวลา, GPU ที่ใช้ร่วมกัน, โหนดเอดจ์ที่มีโมเดลภาษาครอบครองการ์ดส่วนใหญ่ไปแล้ว — นั่นคือเหตุผลทั้งหมด และมันเป็นเหตุผลที่จริง
ส่วนที่เหลือของตารางคือการศึกษาว่าโมเดลขนาดเล็กแตกสลายไม่สม่ำเสมอตรงไหน คะแนน Typed Decision ของ 0.8B อยู่ที่ 77.35 เทียบกับ 80.55 ของ 4B — ห่างกันสามคะแนนทั้งที่จำนวนพารามิเตอร์เพียงหนึ่งในห้า แต่ Jevbench-Original ลดลงจาก 98.61 เหลือ 80.56 และ WildJailBreak ดิ่งจาก 89.86 เหลือ 64.48 ไม่ว่าสองชุดทดสอบนั้นกำลังวัดอะไรอยู่ — การ์ดไม่ได้บอก และการ์ดก็ไม่ได้ให้นิยามชุดทดสอบใด ๆ เลย — พวกมันคือชุดที่ลงโทษเช็กพอยต์ขนาดเล็กอย่างรุนแรงที่สุด โมเดลที่ยืนหยัดได้บนแกนหนึ่งแต่ดิ่งลงหน้าผาบนอีกสองแกนไม่ใช่โมเดลที่อ่อนแอกว่าแบบสม่ำเสมอ มันคือโมเดลที่มีขอบเขตความสามารถเฉพาะ และคุณคงอยากรู้ว่างานของคุณอยู่ตรงไหนก่อนจะมอบฟลีตทั้งหมดให้กับมัน
ข้อควรระวังเพิ่มเติมอีกประการในแถวการปรับเทียบ ECE ของ 0.8B ที่ 0.066 เป็นตัวเลขที่ดีที่สุดของมัน — ดีกว่า 0.095 ของ Jev ในชุดทดสอบเดียวกัน — ในขณะที่ Brier score 0.530 ของมันแย่กว่า 0.358 ของ Jev ความคลาดเคลื่อนที่ปรับเทียบแล้วกับความคลาดเคลื่อนความน่าจะเป็นกำลังสองเฉลี่ยไม่ใช่การวัดเดียวกัน และตารางที่แสดงให้เห็นอันหนึ่งดูแข็งแกร่งและอีกอันดูอ่อนแอ กำลังบอกคุณว่าการแจกแจงมีรูปร่างที่ดีใกล้จุดสูงสุดของความมั่นใจ และมีมวลหนาเกินกว่าที่ควรในช่วงระหว่างนั้น หากระบบของคุณใช้ความมั่นใจเป็นเกณฑ์ตัดสิน ความแตกต่างนี้สำคัญกว่าค่าเฉลี่ย
1.71 GB ซื้ออะไรได้จริง
เส้นทางการอนุมานในโมเดลนี้เป็นตัวให้คะแนน ไม่ใช่ตัวสร้าง และความแตกต่างของต้นทุนเป็นเชิงโครงสร้างมากกว่าเชิงส่วนเพิ่ม คุณป้อนสถานะที่ใช้ร่วมกัน สคีมาของคำถามที่มีชื่อ และรูปภาพได้สูงสุดแปดรูป (ไม่บังคับ) คำถามแต่ละข้อเป็นหนึ่งในสามประเภท: ตัวเลือก (หนึ่งในชุดตัวเลือกที่มีลำดับ), คะแนน (สเกลอันดับ ซึ่งคืนค่าเป็นค่าคาดหวังถ่วงน้ำหนักด้วยความน่าจะเป็น), หรือ ไม่/ใช่ (แบบไบนารี ไม่/ใช่) สถานะ สคีมา และโครงร่าง JSON ของผู้ช่วยที่สมบูรณ์จะถูกเรนเดอร์โดยมีตัวแทนหนึ่งตัวต่อหนึ่งฟิลด์ โมเดลจะรัน forward pass เชิงสาเหตุเพียงครั้งเดียว และค่าลอจิตจะถูกอ่านที่ตำแหน่งก่อนหน้าตัวแทนแต่ละตัวทันที มีการใช้ softmax เฉพาะกับสัญลักษณ์ตัวเลือกที่อนุญาตของฟิลด์นั้นเท่านั้น มีการนำการปรับเทียบที่ฟิตแล้วของเช็กพอยต์มาใช้ และสัญลักษณ์จะแมปกลับไปยังค่าตัวเลือกของคุณ
ผลที่ตามมาสามประการเกิดขึ้นจากสิ่งนั้น ไม่มีโทเคนเอาต์พุต ดังนั้นจึงไม่มีราคาเอาต์พุต — การตัดสินใจหนึ่งล้านครั้งไม่มีค่าใช้จ่ายเป็นโทเคนเลย ไม่มีลูปถอดรหัสและไม่มีวงเล็บปีกกาที่ต้องลืม ดังนั้น JSON ที่ผิดรูปแบบจึงไม่ใช่โหมดความล้มเหลว และเนื่องจากช่องคำตอบของแต่ละฟิลด์ถูกประกอบขึ้นต่อคำขอ สคีมาที่คุณคิดขึ้นในบ่ายนี้จึงไม่ต้องฝึกใหม่: เพิ่มคำถาม แล้วตัวเลือกของมันจะกลายเป็นสัญลักษณ์ที่เป็นไปได้สำหรับฟิลด์นั้น
ขีดจำกัดถูกระบุไว้อย่างตรงไปตรงมาเช่นกัน หนึ่งถึงสิบหกคำถาม สูงสุด 62 ตัวเลือกต่อข้อ สูงสุดแปดรูปภาพ และเพดานเริ่มต้นที่ 8,192 โทเคน — โดยอินพุตที่เกินกว่านั้นจะถูกปฏิเสธแทนที่จะถูกตัดทอน ข้อกำหนดหลังนี้เป็นการตัดสินใจเชิงออกแบบที่ควรค่าแก่การใส่ใจ เพราะการตัดทอนอย่างเงียบ ๆ คือวิธีที่ตัวจำแนกประเภทเริ่มตอบคำถามคนละข้อกับที่คุณถามอย่างเงียบ ๆ InternLM ล้มเหลวอย่างเสียงดังแทน ซึ่งถูกต้องและก็เป็นกับดักในการปฏิบัติงานเช่นกัน: กระทู้ตั๋วที่ยาวบวกกับสคีมาและรูปภาพจะทะลุ 8,192 เร็วกว่าที่คุณคาด และไม่มีเส้นทางที่นุ่มนวลเมื่อมันเกิดขึ้น
และ 1.71 GB ให้เศรษฐศาสตร์ด้านรันไทม์ที่คุณสามารถคูณคำนวณออกมาได้ ที่ 33.98 มิลลิวินาทีต่อการตัดสินใจหนึ่งครั้ง หนึ่งล้านการตัดสินใจคือ 9.44 ชั่วโมงของ RTX 4090 หนึ่งตัว ส่วน 4B ต้องใช้ 12.3 ชั่วโมงสำหรับหนึ่งล้านครั้งเท่ากัน และยอมเสียความแม่นยำไปสิบจุดครึ่ง เพื่อแลกกับ 7.37 GB ที่คุณไม่มี ทั้งสองตัวเลขไม่ได้รวมต้นทุนของตัวเครื่อง และไม่ได้รวมส่วนที่คนมักลืม: คุณกำลังให้บริการอยู่ และไม่มีเซิร์ฟเวอร์ในรีโพซิทอรี

Qwen 3.8 ไม่ใช่โมเดลเดียว และรุ่นราคาถูกคือรุ่นที่ควรจับตามอง
Qwen 3.8 เมื่อใช้เป็นชื่อเดี่ยว ๆ คือ Qwen3.8-2.4T-A95B: แกนกลาง sparse mixture-of-experts ขนาด 2.4 ล้านล้านพารามิเตอร์ ที่ Alibaba เผยแพร่เป็นน้ำหนักแบบเปิดเมื่อวันที่ 12 สิงหาคม 2026 โดยมีพารามิเตอร์ที่ทำงานอยู่ประมาณ 95 พันล้านตัวต่อโทเค็น และใช้สัญญาอนุญาตแบบกำหนดเองแทน Apache 2.0 การให้บริการโฮสต์ของแกนเดียวกันนั้นคือ Qwen3.8-Max ซึ่งพร้อมใช้งานทั่วไปบน API ที่มีค่าใช้จ่ายตั้งแต่ 3 สิงหาคม และรีเฟรชเป็นสแนปช็อตที่ลงวันที่ 2 กันยายน ทั้งสองคือสมองเดียวกันที่ถูกขายในสองรูปแบบ และการให้บริการแบบที่สองคือสิ่งที่คนส่วนใหญ่จะเรียกจริง ๆ
จากตัวเลขของแหล่งอิสระ Artificial Analysis วัดสแนปช็อตเดือนกันยายนของ Qwen3.8-Max ได้ดัชนี Intelligence Index ที่ 45.4 — เป็นอันดับที่ 15 จาก 145 โมเดลที่จัดอันดับ — ด้วยคะแนน AA Coding 76.2 อยู่อันดับที่ 9 จาก 138, GPQA Diamond ที่ 92.8, Humanity's Last Exam ที่ 43.1 และคะแนนการเรียกคืนบริบทยาว 80.3 เช็กพอยต์แบบเปิดตามหลัง API ต้นทางที่กลั่นมันมา โดยอยู่ที่ 39.9 ในหน้าต่าง playground เจ็ดวันของเราเอง Qwen3.8-Max อยู่ที่ p50 2,578 ms และ p95 9,539 ms ที่ 55.5 โทเคนเอาต์พุตต่อวินาที โดยมีอัตราข้อผิดพลาด 1.57% Qwen3.8-Max เรียกใช้งานได้บน OrcaRouter ที่ราคาตามรายการของผู้ให้บริการโดยบวกมาร์กอัป 0%ดังนั้นการเปลี่ยนแปลงราคาของ Alibaba จึงมีผลฝั่งเราภายในวันเดียวกัน ไม่ใช่ที่รอบบิลถัดไป
อย่างไรก็ตาม รุ่นพี่น้องแบบ dense คือตัวที่ควรนำมาชั่งน้ำหนักเทียบกับเช็กพอยต์ภายในเครื่องขนาด 1.71 GB เพราะมันเป็นวิธีที่ถูกที่สุดในการซื้อความสามารถทั่วไปในตระกูลนี้ Qwen3.8-27B เป็น Apache 2.0 มีบริบทเนทีฟขนาด 262,144 โทเคน และ Qwen3.8-27B มีราคาอยู่ที่ $0.33 และ $2.40 ต่อล้านโทเคนในแค็ตตาล็อกของเรา Artificial Analysis Intelligence Index ของมันอยู่ที่ 33.7 โดยมีจำนวนพารามิเตอร์ประมาณสามสิบสองเท่าของ Intern-Decision-0.8B ยังเป็นแบบ generative และยังคงเป็นเครื่องมือผิดประเภทสำหรับการตัดสินใจแบบชุดปิดในปริมาณมาก — แต่ก็เป็นตัวเลือกกลางๆ ที่ซื่อตรง และเป็นสมาชิกเพียงตัวเดียวของการเปรียบเทียบนี้ที่ทั้งถูกจริงและทั่วไปจริงในเวลาเดียวกัน
สกอเรอร์เทียบกับเจนเนอเรเตอร์ พูดกันตรง ๆ
• บริบท — Qwen3.8-Max มีหน้าต่างโทเค็นขนาด 1,000,000 โทเค็น ส่วน Intern-Decision-0.8B จะปฏิเสธทุกอย่างที่เกิน 8,192 คิดเป็นอัตราส่วน 122 เท่า ซึ่งถูกบังคับใช้จริงแทนที่จะถูกตัดทอน
• อินพุต — Qwen3.8-Max รับข้อความ รูปภาพ และวิดีโอ Intern-Decision-0.8B รับข้อความและรูปภาพได้สูงสุดแปดรูป และโทเค็นรูปภาพจะถูกนับรวมกับงบ 8,192 เดียวกัน
• เอาต์พุต — Qwen3.8-Max เขียน ให้เหตุผล เรียกใช้เครื่องมือ และส่งออก JSON ตามคำขอ Intern-Decision-0.8 ไม่สามารถสร้างย่อหน้า แผน หรือแผนได้ มันทำได้เพียงให้คะแนนตัวเลือกที่คุณคิดไว้แล้วเท่านั้น
• ค่าใช้จ่ายต่อการเรียก — การเรียกแบบคัดแยกที่ใช้โทเคนอินพุต 800 และเอาต์พุต 150 มีค่าใช้จ่ายประมาณ $0.002 บน Qwen3.8-Max, โทเคนการให้เหตุผล และเอาต์พุตของมันมีขนาดเล็กเพราะมันเป็นโมเดลที่ให้เหตุผล การเรียกแบบนี้หนึ่งล้านครั้งคือ $2,500 Intern-Decision-0.8B ไม่มีราคาต่อโทเคนเลย: หนึ่งล้านการตัดสินใจคือ 9.44 ชั่วโมงของ 4090 ที่คุณเป็นเจ้าของหรือเช่า
• ความหน่วง — 2,578 ms ที่ค่ามัธยฐานบน Qwen3.8-Max ในช่วงเจ็ดวันที่ผ่านมา ซึ่งรวมเวลาเครือข่ายและการเข้าคิวแล้ว 33.98 ms ของ Intern-Decision-0.8B เป็นเพียงการทำ forward pass เปล่า ๆ บนการ์ดในเครื่อง และไม่ใช่การวัดแบบเดียวกัน การเปรียบเทียบที่ตรงไปตรงมาคือหนึ่งอันดับขนาด ไม่ใช่แปดสิบเท่า
• หลักฐาน — ตัวเลขทุกตัวของ Intern-Decision-0.8B ที่ปรากฏที่นี่เป็นข้อมูลที่ผู้ขายรายงานบนฮาร์เนสของ InternLM เอง และยังไม่มีใครทำซ้ำได้ รวมถึงค่าความหน่วงด้วย ตัวเลขทุกตัวของ Qwen 3.8 ไม่ว่าจะเป็นของ Alibaba เอง หรือเป็นการวัดของ Artificial Analysis และได้ติดป้ายแยกไว้ด้านบนแล้ว
• คะแนนอิสระ — Qwen3.8-Max มีหนึ่งรายการ ส่วน Intern-Decision-0.8B ไม่มีเลยไม่ว่าแบบใด และไม่มีผู้ให้บริการ inference รายใดนำไปให้บริการ

สองวิธีในการรันไปป์ไลน์นี้
ทางแยกด้านปฏิบัติการนั้นคมชัดกว่าทางแยกด้านเบนช์มาร์ก Intern-Decision-0.8B เป็นโมดูล ไม่ใช่บริการ ไม่มีเอนด์พอยต์ที่เข้ากันได้กับ OpenAI ไม่มีเซิร์ฟเวอร์สำหรับทำแบตช์ ไม่มีการตรวจสอบสถานะ ไม่มีนโยบายลองใหม่ และไม่มีรีพลิกาตัวที่สอง เว้นแต่คุณจะสร้างขึ้นเอง มันโหลดในโปรเซสเดียวและตอบทีละ dict และถ้าคุณต้องการ failover คุณเองก็คือ failover นั่นเป็นคำอธิบายที่เป็นธรรมของเช็กพอยต์งานวิจัยขนาด 853 ล้านพารามิเตอร์ที่เผยแพร่โดยไม่มีบันทึกการเปิดตัว และควรนำมาคิดเป็นต้นทุนประกอบการตัดสินใจตามความเหมาะสม
ครึ่งหนึ่งที่เป็นส่วนสร้าง (generative) ของไปป์ไลน์เดียวกันคือการเรียกผ่านเครือข่าย และการเรียกผ่านเครือข่ายก็คือสิ่งที่เราเตอร์มีไว้สำหรับ ทั้ง Qwen3.8-Max และ Qwen3.8-27B เข้าถึงได้ผ่านคีย์ที่เข้ากันได้กับ OpenAI เพียงคีย์เดียว และการสลับสำรองอัตโนมัติ (automatic failover) หมายความว่า upstream ที่ประสิทธิภาพลดลงจะไม่กลายเป็นเหตุการณ์ของคุณ — ตรงนี้ควรเอ่ยถึง เพราะอัตราความผิดพลาดแบบสด ๆ ในรอบเจ็ดวันของ Qwen3.8-Max ฝั่งเราอยู่ที่ 1.57% ซึ่งถือว่าต่ำ จนกระทั่งมันกลายเป็นคำขอของคุณเอง รูปแบบที่สมเหตุสมผลคือรูปแบบที่การจับคู่นี้กำลังบรรยายอย่างเงียบ ๆ มาตลอด นั่นคือ ให้รันตัวให้คะแนนแบบชุดปิด (closed-set scorer) ราคาถูกในเครื่อง เพราะมันเร็วและไม่มีค่าใช้จ่ายต่อการเรียกหนึ่งครั้ง และให้ส่งขั้นตอนการให้เหตุผลผ่านเราเตอร์ เพราะนั่นคือจุดที่ราคาถูกลง มีการสับเปลี่ยนโมเดล และเกิดเหตุระบบล่มจริง ๆ
สองเรื่องที่เราจะไม่กล่าวอ้าง Intern-Decision-0.8B ไม่ใช่หนึ่งในเส้นทางของเรา และจะยังไม่ใช่จนกว่า InternLM จะโฮสต์มันไว้ที่ใดที่หนึ่ง — เราจะไม่สื่อความเป็นนัยเป็นอย่างอื่น และวันนี้เราไม่ได้โฮสต์โมเดล InternLM ใด ๆ เลย ดังนั้นไม่มีสิ่งใดในบทความนี้ที่เป็นการชักชวนให้รันโมเดลที่พูดถึงผ่านเรา
อะไรจะเปลี่ยนคำตอบ
สามคำถามที่ยังไม่มีคำตอบ ซึ่งทั้งหมดสามารถตอบได้ภายในไม่กี่วัน InternLM เผยแพร่ที่เก็บ GitHub ที่การ์ดของตัวเองลิงก์ไปถึงหรือไม่ และเผยแพร่คำอธิบายว่าเวตเหล่านี้ถูกปรับจูนมาอย่างไรพร้อมกันหรือไม่ มีโพสต์เปิดตัวตามหลังเช็กพอยต์หรือไม่ ซึ่งเปลี่ยนการพุชแบบเงียบ ๆ ให้กลายเป็นรีลีสที่มีเอกสารประกอบพร้อมเรื่องราวการดีพลอยที่ระบุไว้หรือไม่ และมีใครที่เป็นอิสระทำซ้ำค่าเฉลี่ย 79.38 หรือความคลาดเคลื่อนในการคาลิเบรต 0.066 บนฮาร์ดแวร์ที่ไม่ใช่ของ InternLM ได้หรือไม่
จนกว่าจะมีหนึ่งในนั้นเปิดตัว การอ่าน Intern-Decision-0.8B อย่างตรงไปตรงมาจะแคบและเฉพาะเจาะจง: มันเป็นตัวให้คะแนนแบบชุดปิดที่ถูกที่สุดในตระกูลที่มีสามรุ่น บนขนาดพื้นที่ที่ลงตัวในจุดที่รุ่นพี่น้องที่เร็วกว่าและแม่นยำกว่าของมันเองลงไม่ได้ ถูกเผยแพร่โดยไม่มีการประกาศ และไม่มีชิ้นงานชิ้นเดียวที่จะบอกคุณได้ว่ามันถูกปรับแต่งมาเพื่ออะไร หากการตัดสินใจของคุณเป็นแบบชุดปิด คำตอบของคุณสามารถแจกแจงได้ในพรอมป์ต และ 1.71 GB คือตัวเลขที่การนำไปใช้งานของคุณขึ้นอยู่กับมันจริง ๆ มันคือตัวเลือกที่ถูกต้อง และไม่มีสิ่งอื่นใดเหมือนมันที่ขนาดนั้น หากคำตอบของคุณไม่สามารถแจกแจงล่วงหน้าได้ หรือสถานะของคุณยาวเกิน 8,192 โทเค็น หรือคุณต้องการเหตุผลที่คุณสามารถแสดงให้มนุษย์ดูได้ การเปรียบเทียบก็ไม่เคยสูสีตั้งแต่แรก — และโมเดลที่คุณต้องการก็ไม่เคยเป็นตัวที่มีพารามิเตอร์ 853 ล้านตัวนั้น
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
