การ์ดชื่อเรื่องหลักที่เขียนว่า 'Intern-Decision-0.8B' พร้อมคำบรรยายใต้ภาพว่า 'เปิดตัวเงียบ ๆ ไม่ได้ประกาศ' มีป้ายกำกับว่า 'ไม่มีเปเปอร์ ไม่มีรีโพซิทอรี ไม่มีโพสต์เปิดตัว' และ 'พารามิเตอร์ 852,985,920 ตัว, 1.73 GB บนดิสก์' โดยมีโลโก้ OrcaRouter ประกอบอยู่ที่มุม
Guides & Insights

Intern-Decision-0.8B เปิดตัวโดยไม่มีการประกาศ: InternLM วางอะไรไว้บน Hugging Face อย่างเงียบ ๆ

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ลิงก์ GitHub บนการ์ดโมเดลส่งคืน 404 เดโม Space ส่งคืน 401 ไม่มีคอลเลกชัน ไม่มีบล็อกโพสต์ ไม่มีรายงานทางเทคนิค และไม่มีผลการค้นหาใดๆ สำหรับสตริง "Intern-Decision" ที่ไม่ใช่ประกาศรับสมัครงานฝึกงาน — แต่กระนั้น Intern-Decision-0.8B กลับอยู่บน Hugging Face ในตอนนี้ในฐานะเช็กพอยต์ Apache-2.0 ที่สมบูรณ์และดาวน์โหลดได้ ซึ่งไฟน์จูนจาก Qwen3.5-0.8B อัปโหลดในช่วงเช้ามืดของวันที่ 26 กันยายน 2026 พร้อมกับโมเดลพี่น้องที่ใหญ่กว่าสองตัวที่ปรากฏในสามนาทีเดียวกัน: Intern-Decision-2B และ Intern-Decision-4B InternLM เคยเปิดตัวในลักษณะนี้มาก่อน และนั่นคือเหตุผลว่าทำไมทุกสิ่งด้านล่างจึงถูกรวบรวมมาจากตัวรีโพซิทอรีเองแทนที่จะมาจากโพสต์เปิดตัว ความแตกต่างนี้สำคัญตรงนี้มากกว่าปกติ: รีโพบอกคุณว่ามีอะไรอยู่ และมีเพียงผู้ขายเท่านั้นที่บอกคุณได้ว่ามันมีไว้เพื่ออะไร

สิ่งที่รีโปบอกไว้จริง ๆ อย่างละเอียดนั้นแปลกพอที่จะคุ้มค่าอ่าน สิ่งเหล่านี้ไม่ใช่โมเดลแชตและไม่ใช่โมเดลภาษาขนาดเล็กในความหมายปกติ Intern-Decision-0.8B รับสถานะหนึ่งชุด สคีมาของคำถามที่มีชื่อซึ่งคุณเขียนไว้ล่วงหน้า และรูปภาพได้สูงสุดแปดรูป (ไม่บังคับ) แล้วคืนค่าการแจกแจงคำตอบสำหรับทุกคำถามใน forward pass หนึ่งครั้ง มันไม่เคยเรียก generate() มันไม่เคยสุ่มตัวอย่าง ไม่มีเอาต์พุตข้อความให้แยกวิเคราะห์ ไม่มี JSON ให้ซ่อม ไม่มีลูปการลองใหม่รอบวงเล็บปีกกาที่ไม่เคยปิด ความแคบคือสถาปัตยกรรมทั้งหมด และมันจัดโมเดลนี้ไว้ในหมวดเล็ก ๆ เดียวกันกับ Jev 1.13 ของ TypeSafe และ Laya ของ Convai — หมวดที่เห็นได้ชัดว่า InternLM ตั้งใจทำ benchmark เทียบด้วย เพราะ Jevbench เป็น benchmark ของ TypeSafe เอง และเป็นคอลัมน์แรกของตาราง

นี่คือสิ่งที่รู้ได้จากเช็กพอยต์ สิ่งที่เช็กพอยต์เพียงอ้างเท่านั้น และสิ่งที่ไม่มีใครนอก InternLM สามารถกล่าวได้เลยในตอนนี้

จริงๆ แล้วมีอะไรอยู่ในรีโพซิทอรี

การ์ดนี้สั้นและตรงไปตรงมาเกี่ยวกับที่มา โดย Intern-Decision-0.8B ถูกอธิบายว่าเป็น "โมเดลตัดสินใจแบบมีโครงสร้างหลายรูปแบบที่ปรับแต่งจาก Qwen3.5-0.8B" — ฐาน Qwen ที่เผยแพร่เมื่อวันที่ 28 กุมภาพันธ์ 2026 — และรีโพซิทอรีมีไฟล์สัญญาอนุญาตใบที่สองชื่อ LICENSE-QWEN ควบคู่ไปกับเงื่อนไข Apache-2.0 ซึ่งเป็นสิ่งที่โมเดลที่ต่อยอดมาควรทำ และเป็นสัญญาณความซื่อตรงเล็ก ๆ ในตัวเอง ดัชนีของ Hugging Face รายงานพารามิเตอร์ 852,985,920 ตัว กระจายอยู่ในสามชาร์ด: ชาร์ดภาษาขนาด 1.50 GB, ชาร์ดวิชันขนาด 176 MB และโปรเจกเตอร์ขนาด 25 MB พื้นที่จัดเก็บทั้งหมดของรีโพซิทอรีอยู่ที่ประมาณ 1.73 GB รวมไฟล์ tokenizer ซึ่งทำให้ทั้งหมดนี้ลงตัวสบาย ๆ บน GPU สำหรับผู้บริโภคตัวเดียว หรือแล็ปท็อปที่สเปกเพียงพอ

คอนฟิกนี้เผยให้เห็นสถาปัตยกรรมที่ Qwen ส่งออกมาตลอดทั้งเจเนอเรชัน 3.5 มากกว่าจะเป็นเครือข่ายการตัดสินใจที่ออกแบบมาเฉพาะ มันคือ Qwen3_5ForConditionalGeneration ที่มี 24 เลเยอร์จัดเรียงในรูปแบบซ้ำ ๆ คือสามเลเยอร์ linear attention ต่อหนึ่งเลเยอร์ full attention, ขนาด hidden 1,024, 8 attention head ต่อ 2 key-value head, มิติ head เท่ากับ 256 และ maximum position embedding 262,144 โทเคน โดยยังคงเก็บเลเยอร์ multi-token prediction ไว้หนึ่งเลเยอร์ ส่วนเส้นทางวิชันนั้นมีอยู่จริง: ข้อความบนการ์ดอธิบายการจัดการรูปภาพ โปรเซสเซอร์รับรูปภาพได้ และเช็กพอยต์ก็มาพร้อม vision tower และโปรเจกเตอร์เพื่อรองรับการทำงานนั้น ดังนั้นแท็ก multimodal บนรีโปจึงมีน้ำหนักโมเดลรองรับ ไม่ใช่แค่แท็กเฉย ๆ

ภาพรวมของตระกูลนี้ควรค่าแก่การสังเกต เพราะมันกำหนดวิธีอ่านสิ่งอื่นทั้งหมด InternLM อัปโหลดสามขนาดภายใน 40 วินาที: 0.8B จากนั้น 2B แล้ว 4B จำนวนพารามิเตอร์คือ 852,985,920, 2,213,241,664 และ 4,539,265,536 การ์ดของโมเดล 4B มีส่วนเพิ่มเติม — การทดลองนำร่องการปรับเทียบการแจกแจงที่ทราบ 96 กรณี พร้อมคะแนนก่อนและหลัง — ซึ่งการ์ด 0.8B ไม่มี ความไม่สมมาตรนั้นไม่ใช่หลักฐานของข้อบกพร่องในโมเดลเล็ก แต่เป็นหลักฐานว่าเอกสารของโมเดลเล็กถูกเขียนภายใต้งบที่สั้นกว่า ซึ่งเป็นลักษณะของสิ่งที่การเปิดตัวแบบเงียบ ๆ ดูเป็นเช่นนั้น

เส้นทางการอนุมานทำงานจริงได้อย่างไร

inference.py ที่มาพร้อมชุดนี้เป็นไฟล์ที่ให้ข้อมูลมากที่สุดใน repo เพราะมันบันทึกเป็นสัญญาแทนที่จะเป็นพรอมต์ ลำดับการทำงานเป็นดังนี้:

• คุณส่งคำขอที่มีสถานะ (สิ่งที่ถูกตัดสิน) คำถาม (สคีมา) และรูปภาพ (ไม่บังคับ)

• ตัวเลือกของแต่ละคำถามจะถูกจับคู่กับสัญลักษณ์แบบโทเคนเดียว — A ถึง Z, ตามด้วยตัวพิมพ์เล็ก, ตามด้วยตัวเลข, สูงสุด 62 ตัวเลือกต่อคำถาม

• พรอมต์ระบบ สถานะ สคีมา และโครงร่าง JSON ของผู้ช่วยที่สมบูรณ์ จะถูกเรนเดอร์โดยมีตัวยึดตำแหน่ง <decision> หนึ่งตัวต่อฟิลด์

• มีการรัน forward pass แบบ causal หนึ่งครั้ง โดยอ่านค่า logits ณ ตำแหน่งที่อยู่ก่อนหน้าตัวแทนแต่ละตัวโดยทันที

• softmax จะถูกคำนวณบนสัญลักษณ์ผู้สมัครที่ได้รับอนุญาตของฟิลด์นั้นเท่านั้น จากนั้นจึงนำการปรับเทียบ (calibration) ของ checkpoint มาใช้ และสัญลักษณ์จะถูกแมปกลับไปยังค่าตัวเลือกดั้งเดิมของคุณ

เอนจินนี้เปิดให้ใช้ประเภทคำถามสามประเภท choice รับออบเจ็กต์แบบมีลำดับที่จับคู่ค่าตัวเลือกกับคำอธิบาย score รับลิสต์ — ซึ่งกลายเป็นค่าสตริง "0", "1", "2" และอื่นๆ — หรือออบเจ็กต์แบบมีลำดับที่มีคีย์สตริงตัวเลขจำกัด ทำให้โมเดลส่งคืนค่าคาดหวังที่ถ่วงน้ำหนักด้วยความน่าจะเป็น ไม่ใช่เพียงหมวดหมู่ noul เป็นการตัดสินใจแบบไบนารีที่มี no ก่อน yes การตอบสนองจะส่งคืน สำหรับแต่ละฟิลด์ การแจกแจงความน่าจะเป็นที่ปรับเทียบแล้ว ความเชื่อมั่นเท่ากับความน่าจะเป็นสูงสุดของผู้สมัคร การตัดสินใจแบบ argmax พร้อมการตัดสินเสมอด้วยลำดับตัวอักษร และสำหรับคำถาม score จะส่งคืนค่าตัวเลขที่คาดหวังและคำอธิบายสัญลักษณ์ ข้อจำกัดมีระบุไว้อย่างชัดเจน: หนึ่งถึงสิบหกคำถามต่อคำขอ สูงสุด 62 ตัวเลือกต่อคำถาม เพดานอินพุตเริ่มต้นที่ 8,192 โทเค็นซึ่งจะถูกปฏิเสธแทนที่จะถูกตัดทอน และสูงสุดแปดรูปภาพซึ่งโทเค็นจะนับรวมในเพดานนั้น

รายละเอียดสองข้อในรายการนั้นควรค่าแก่การให้ความสนใจ เพราะมันกำหนดว่าคุณจะเชื่อถือผลลัพธ์ได้หรือไม่ ข้อแรกคือ ไม่มีคำตอบเฉลยถูกแทรกเข้าไปในพรอมป์ต์ — โมเดลกำลังให้คะแนนตัวเลือกที่มันยังไม่เคยเห็นคำตอบ ข้อที่สองคือ usage.output_tokens ไม่ใช่จำนวนโทเค็นข้อความ แต่นับเป็นฟิลด์ที่ถูกให้คะแนน ใครก็ตามที่นำสิ่งนี้ไปผูกเข้ากับการคำนวณงบประมาณโทเค็นที่มีอยู่จะต้องประหลาดใจกับเรื่องนั้น และการ์ดก็บอกไว้เช่นนั้นแทนที่จะปล่อยให้ไปค้นพบเอง

A single-column scoreboard headed 'Intern-Decision-0.8B — the scoreboard' listing parameters of 852,985,920 across three shards, a repository of about 1.73 GB under Apache 2.0 plus LICENSE-QWEN, an inference path of one causal forward pass with no generate() and no sampling, RTX 4090 latency of 33.98 ms mean and 37.50 ms p95, calibration at Brier 0.530 and ECE 0.066 with a fitted temperature of 2.747760550703, a suite average of 79.38 across seven benchmarks, and WildJailBreak at 64.48 against Jev's 96.29, with a footer noting every figure is vendor-reported and unreproduced.

ตารางเบนช์มาร์ก และควรเชื่อถือได้มากน้อยเพียงใด

ข้อควรระวังสำหรับผู้อ่านในส่วนนี้: ตัวเลขทุกตัวด้านล่างเป็นข้อมูลที่ผู้พัฒนาเป็นผู้รายงานและยังไม่มีการทำซ้ำ InternLM เป็นผู้เลือกเบนช์มาร์ก เลือกโมเดลที่ใช้เปรียบเทียบ ดำเนินการประเมิน และเผยแพร่ตาราง ไม่มีการรัน Intern-Decision-0.8B โดยอิสระบนลีดเดอร์บอร์ดสาธารณะใด ๆ และการค้นหาใน Artificial Analysis ก็ไม่พบข้อมูลใด ๆ เกี่ยวกับโมเดลนี้เลย นั่นไม่ได้ทำให้ตารางเป็นเท็จ แต่ทำให้ตารางยังไม่ผ่านการตรวจสอบ และหมายความว่าคอลัมน์เหล่านี้มีประโยชน์ที่สุดสำหรับการอ่านรูปแบบของผลลัพธ์มากกว่าระดับของผลลัพธ์

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

• Jevbench สามชุดการแบ่ง — Intern-Decision-0.8B ทำคะแนนได้ 97.92 บน Easy, 80.56 บน Original และ 52.25 บน Hard ส่วน Jev ของ TypeSafe อยู่ที่ 100.00, 98.61 และ 72.07 บนชุดการแบ่งเดียวกัน

Typed Decision — รุ่น 0.8B ได้คะแนน 77.35 เทียบกับ 73.35 ของ Jev นี่คือคอลัมน์เดียวที่โมเดลที่เล็กที่สุดในกลุ่มเอาชนะโมเดลที่เบนช์มาร์กตั้งชื่อตาม

• ToolACE — 94.52 สำหรับ 0.8B เทียบกับ 91.29 สำหรับ Jev ToolACE เป็นเบนช์มาร์กการเรียกใช้ฟังก์ชัน และหัวตัดสินใจที่เหนือกว่า Jev ในการเลือกเครื่องมือถือเป็นข้อกล่าวอ้างที่มีสาระสำคัญที่สุดในตาราง

AG News — 88.61 เทียบกับ 89.57 ของ Jev ถือว่าอยู่ในระดับเดียวกับแนวหน้าของหมวดหมู่นี้สำหรับการจำแนกหัวข้อแบบสี่ทาง

• WildJailBreak — 64.48 เทียบกับ 96.29 ของ Jev นี่คือการล่มสลาย อาจกล่าวได้ว่านี่คือคอลัมน์ที่สำคัญที่สุดสำหรับโมเดลที่คุณจะชี้ไปที่อินพุตที่ไม่น่าเชื่อถือ และเป็นคอลัมน์ที่ 0.8B ห่างจากค่าอ้างอิงมากที่สุด

• ค่าเฉลี่ย — 79.38 สำหรับรุ่น 0.8B, 84.68 สำหรับรุ่น 2B ที่เป็นพี่น้องของมันเอง, 90.02 สำหรับรุ่น 4B ตระกูลนี้ไต่ขึ้นอย่างชัน ซึ่งเป็นสิ่งที่คุณคาดหวังไว้พอดี และในตัวมันเองก็เป็นข้อโต้แย้งเบา ๆ ว่าตารางนี้ไม่ได้ถูกวิศวกรรมย้อนกลับเพื่อยกยอเรือธง

• การปรับเทียบ (calibration) — Brier 0.530 และความคลาดเคลื่อนการปรับเทียบที่คาดหวัง 0.066 สำหรับ 0.8B โดย Jev รายงาน 0.358 และ 0.095 เมื่ออ่านสองค่านี้ร่วมกัน ภาพที่ชัดเจนกว่าตัวเลขใดตัวเลขหนึ่งให้ไว้เพียงลำพังก็จะปรากฏขึ้น: 0.8B ปรับเทียบได้ดีกว่า Jev ในความหมายของ ECE — ระดับความมั่นใจที่มันระบุนั้นสะท้อนความแม่นยำของมันได้ใกล้เคียงกว่า — ในขณะที่โดยรวมแล้วแม่นยำน้อยกว่าอย่างชัดเจน นั่นเป็นโปรไฟล์ที่เป็นไปได้สำหรับโมเดลขนาดเล็กที่มี temperature ซึ่งถูกฟิตมาอย่างจงใจ และมันไม่ใช่ชุดค่าผสมที่น่าชื่นชมหากเผยแพร่โดยบังเอิญ

ชุดการเปรียบเทียบมีคุณสมบัติหนึ่งที่สะดุดตา: มันถูกครอบงำด้วยโมเดลการตัดสินใจ Jev, Laya, SemIf, Kev และ JevK5 ปรากฏทั้งหมด; เกณฑ์มาตรฐานของตารางเองก็เป็นของ TypeSafe InternLM เลือกที่จะถูกวัดบนสนามของคู่แข่ง โดยใช้ฮาร์เนสของคู่แข่ง แล้วยังเผยแพร่คอลัมน์ที่โมเดลที่เล็กที่สุดของตนแพ้ มันเป็นการตัดสินใจแบบที่ทีมหนึ่งทำเมื่อไม่ได้วางแผนแคมเปญการตลาดรอบการเปิดตัว — ซึ่งสอดคล้องกับทุกอย่างอื่นเกี่ยวกับการเปิดตัวครั้งนี้

อุณหภูมิการสอบเทียบเป็นตัวเลขที่น่าสนใจที่สุด

Intern-Decision-0.8B กำหนดอุณหภูมิเริ่มต้นที่ 2.747760550703 โดยการลดค่า NLL ให้ต่ำสุดจากกรณีการปรับเทียบที่กำหนดไว้ 1,728 กรณี โดยมีกรณีตรวจสอบแยกต่างหาก 1,693 กรณี การ์ดระบุไว้อย่างชัดเจนว่าป้ายกำกับชุดทดสอบไม่ได้ถูกใช้ในการเลือกค่านี้ การแปลงที่ใช้คือ p = softmax(candidate_logits.float()) ตามด้วย calibrated_p = softmax(log(p) / T)

นั่นคือการปรับเทียบความน่าจะเป็นของแคนดิเดต ไม่ใช่อุณหภูมิการสุ่ม และความแตกต่างนี้ไม่ใช่ความพิถีพิถันเกินเหตุ เนื่องจากการแปลงนี้ถูกนำไปใช้หลัง softmax และรักษาลำดับไว้ จึงไม่สามารถเปลี่ยนการตัดสินใจแบบ argmax ได้เลย มันเปลี่ยนความมั่นใจ ความน่าจะเป็นแบบ yes ของ noul และค่าคาดหวังของคำถามให้คะแนน — และปล่อยให้การตัดสินใจหลักเหมือนเดิม หากเวิร์กโฟลว์ของคุณอ่านป้ายกำกับ อุณหภูมิก็ไม่มีผลใด ๆ หากเวิร์กโฟลว์ของคุณอ่านความน่าจะเป็น — ตั้งเกณฑ์ให้มัน จัดอันดับตามมัน หรือป้อนมันเข้าสู่การคำนวณค่าคาดหวังปลายทาง — อุณหภูมิคือความแตกต่างระหว่างตัวเลขที่มีความหมายกับตัวเลขที่ไม่มีความหมาย การส่ง temperature=1 จะคืนการแจกแจงที่ยังไม่ได้ปรับเทียบ ซึ่งเป็นทางออกที่มีประโยชน์สำหรับใครก็ตามที่ต้องการปรับเทียบของตนเองซ้อนทับลงไป

อุณหภูมิถูกปรับให้พอดีกับเช็คพอยต์แต่ละตัวแทนที่จะใช้ค่าร่วมกัน โมเดล 4B ใช้ค่าที่แตกต่างออกไป คือ 1.99241824 และการ์ดแนะนำให้คุณใช้โมดูล inference ที่มาพร้อมกับขนาดที่คุณดาวน์โหลด เพื่อให้การสอบเทียบเริ่มต้นของมันตรงกัน ใครก็ตามที่คัดลอก inference wrapper จากโมเดลพี่น้องตัวหนึ่งไปยังอีกตัวหนึ่งจะนำอุณหภูมิที่ผิดไปใช้อย่างเงียบๆ

สามสิบสี่มิลลิวินาที และผลลัพธ์ที่ไม่ควรจะเป็นไปได้

InternLM วัดความหน่วงแบบ end-to-end ต่อหนึ่งคำค้นบน RTX 4090 เพียงตัวเดียวโดยใช้เส้นทาง Hugging Face ภายในเครื่อง — เป็นการวัดจริง แต่ก็เป็นรูปแบบการให้บริการที่ช้าที่สุดเท่าที่เป็นไปได้ เนื่องจากการติดตั้งใช้งานจริงจะใช้รันไทม์แบบคอมไพล์หรือแบบแบตช์ Jev ระบุไว้ที่ค่าเฉลี่ย 109.70 ms และค่ามัธยฐาน 106.30 ms โดยมี p95 อยู่ที่ 146.70 ms ส่วน Intern-Decision-0.8B อยู่ที่ 33.98 / 33.44 / 37.50 ms

ตัวเลขที่ควรค่าแก่การหยุดดูคือรุ่นพี่น้อง 2B: ค่าเฉลี่ย 33.28 ms, ค่ามัธยฐาน 33.15 ms 2B นั้น เร็วกว่า 0.8B ด้วยส่วนต่างที่เล็กพอจะเป็นสัญญาณรบกวน แต่ไม่ใช่ในทิศทางที่จำนวนพารามิเตอร์ทำนายไว้ นั่นไม่ใช่ข้อผิดพลาดในตาราง และไม่ใช่เรื่องเกี่ยวกับตัวโมเดลจริง ๆ โมเดลตัดสินใจทำ forward pass เพียงหนึ่งครั้งบนพรอมป์ต์ที่ความยาวถูกกำหนดโดยสถานะ สคีมา และคำอธิบายตัวเลือก — ไม่ใช่โดยสิ่งที่โมเดลเขียน เพราะมันไม่เขียนอะไรเลย สำหรับพรอมป์ต์ในลักษณะนั้น การประมวลผลพรอมป์ต์เป็นปัจจัยหลัก และจำนวนพารามิเตอร์เป็นต้นทุนระดับรอง ผลในทางปฏิบัติคือเหตุผลตามปกติที่ทำให้เลือกเช็กพอยต์ที่เล็กที่สุด — คุณจ่ายต่อโทเคน — ใช้ไม่ได้กับกรณีนี้ เหตุผลจริง ๆ ในการเลือก 0.8B แทน 2B คือพื้นที่หน่วยความจำที่ใช้ และความจริงที่ว่า repository ทั้งหมดของมันพอดีใน 1.73 GB ไม่ใช่อัตราการประมวลผล

สิ่งที่ยังไม่อาจยืนยันได้

นี่คือส่วนที่โพสต์เปิดตัวจะตอบให้ได้ แต่รีโพซิทอรีทำไม่ได้

ยังไม่มีการระบุวันเปิดตัว ไม่มีการประกาศ และไม่มีสิ่งใดบนช่องทางสาธารณะของ InternLM ที่อธิบายเกี่ยวกับตระกูลนี้ URL ของ GitHub ที่พิมพ์บนการ์ดโมเดลไม่สามารถเข้าถึงได้ Space ตัวอย่างที่อ้างถึงในการ์ดไม่เปิดให้อ่านแบบสาธารณะ ไม่มีคอลเลกชันที่รวบรวมเช็คพอยต์ทั้งสาม ซึ่งหมายความว่าวิธีเดียวที่จะพบ 2B หรือ 4B คือการดูรายการโมเดลขององค์กร ไม่มีบทความ ดังนั้นข้อมูลการฝึก สูตรการปรับแต่ง จำนวนขั้นตอนการฝึก และสิ่งที่ "decision tuning" แก้ไขในน้ำหนัก ล้วนไม่ได้รับการระบุ ไม่มีการประเมินอิสระ ไม่มีการทำซ้ำความหน่วงจากบุคคลที่สาม และยังไม่มีหลักฐานว่าใครนอกเหนือจาก InternLM ได้รันเช็คพอยต์นี้

ยังมีคำถามสองข้อที่การ์ดนี้ยกขึ้นมาโดยไม่ได้ตอบ ข้อแรกคือช่องว่าง WildJailBreak หมายความว่าอะไรในทางปฏิบัติ: ภาวะขาดความทนทานต่อการปฏิเสธในขนาดนั้นเป็นคุณสมบัติของการ fine-tune และว่ามันสะท้อนโมเดลฐาน วัตถุประสงค์การปรับแต่งการตัดสินใจ หรือจำนวนพารามิเตอร์ที่น้อย ไม่ใช่สิ่งที่รีโพซิทอรีบอกคุณ ข้อที่สองคือสิ่งที่เกิดขึ้นที่เพดานอินพุต คำขอที่เกิน 8,192 โทเคนจะถูกปฏิเสธแทนที่จะถูกตัดทอน ซึ่งเป็นพฤติกรรมที่ถูกต้องสำหรับโมเดลให้คะแนน แต่มันหมายความว่าหน้าต่างบริบทที่ใช้ได้จริงไม่ใช่ 262,144 ที่คอนฟิกโฆษณาไว้ — แต่เป็นสิ่งที่พอดีกับ 8,192 โทเคนของสถานะ สคีมา ตัวเลือก และแพตช์ภาพ สำหรับเอกสารยาวที่มีสคีมาซับซ้อน เพดานนั้นมาถึงเร็วกว่าที่แผนภาพสถาปัตยกรรมบ่งชี้

จุดยืนของสิ่งนี้ และวิธีลองใช้โดยไม่ต้องเดิมพันกับมัน

การวางกรอบอย่างซื่อตรงก็คือ Intern-Decision-0.8B เป็นเช็กพอยต์ที่เผยแพร่แล้ว ซึ่งมีข้ออ้างที่ยังไม่ได้ตรวจสอบและไม่มีเอกสารประกอบ การผสมกันแบบนั้นไม่ใช่เหตุผลที่จะมองข้ามมัน — การปล่อยเวตภายใต้สัญญาอนุญาต Apache-2.0 ที่คุณดาวน์โหลดและวัดผลได้ภายในบ่ายเดียวถือเป็นสถานการณ์ที่ดีกว่าการต้องรอคิว API — แต่มันหมายความว่าภาระในการตรวจสอบตกอยู่ที่คุณ เอนจินโหลดจากไดเรกทอรีในเครื่อง รันบน GPU ระดับ 4090 หรือเล็กกว่า และโมเดลการ์ดก็มีตัวอย่างคำขอที่คุณคัดลอกวางได้ การประเมินหนึ่งวันกับเคสที่คุณติดป้ายกำกับเองจะบอกคุณเกี่ยวกับคอลัมน์ WildJailBreak ได้มากกว่าที่ตารางของผู้ขายจะบอกได้

หากเลเยอร์การตัดสินใจเป็นส่วนที่คุณกำลังประเมิน เป้าหมายการเปรียบเทียบที่มีประโยชน์คือแบบโฮสต์ TypeSafe's Jev 1.13 เป็นโมเดลที่ InternLM ใช้เป็นเกณฑ์เปรียบเทียบ และวันนี้สามารถเรียกใช้ได้ผ่านปลายทางที่เข้ากันได้กับ OpenAI เพียงจุดเดียว ในราคา $0.042 ต่อล้านโทเค็นอินพุต โดยคิดค่าต์พุตเป็นศูนย์ — ราคาเดียวกับที่ผู้ขายเผยแพร่ เพราะ OrcaRouter ส่งต่อราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม แทนที่จะบวกกำไรทับลงไป การนำ decision head ขนาด 0.8B ที่โฮสต์เองและ API การตัดสินใจแบบโฮสต์มาใช้คีย์เดียวกัน ในบ่ายเดียวกัน เป็นการทดลองที่ถูกกว่าอย่างมากเมื่อเทียบกับการตั้งสัญญาแยกกันสองฉบับเพื่อตอบคำถามเดียวกัน

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

สิ่งที่เปลี่ยนภาพนี้ได้ไม่ใช่เบนช์มาร์ก แต่คือการที่รีโพซิทอรีบน GitHub ปรากฏขึ้น หรือ InternLM เผยแพร่สูตรการปรับจูน หรือการรันอิสระครั้งแรกของเช็กพอยต์ที่ได้ไปอยู่บนลีดเดอร์บอร์ด จนกว่าหนึ่งในนั้นจะเกิดขึ้น คำอธิบายที่ถูกต้องของ Intern-Decision-0.8B ก็ยังคงแคบ ไม่น่าดึงดูดใจ และเป็นผลดีต่อตัวมันเองอย่างเต็มที่: ค่าน้ำหนักนั้นมีอยู่จริง สัญญาการอนุมานได้รับการบันทึกเป็นเอกสารไว้ดีกว่าที่โมเดลเปิดตัวส่วนใหญ่ทำได้ และการตลาดยังไม่เริ่มต้น

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube