การ์ดไตเติลแบบฮีโร่ที่สร้างขึ้นสำหรับ MiniCPM5-2B-DSpark พร้อมคำบรรยายใต้ภาพว่า "OpenBMB เปิดเผยน้ำหนักโมเดล MiniCPM5-2B อย่างเงียบ ๆ — และปล่อยโมเดลร่างขนาดเล็กเพื่อทำให้มันทำงานเร็วขึ้น" โดยแสดงโทรศัพท์มือถือและแล็ปท็อป แต่ละเครื่องแสดงชิป "2B" ทรงมน ชิปขนาดเล็กกว่า "Draft 0.3B" ที่ป้อนโทเคนลูกศรชี้ไปข้างหน้าเจ็ดตัวเข้าสู่ชิปขนาดใหญ่ เกจวัดความเร็วที่มีเข็มชี้ขึ้น และไอคอนระฆังแบบปิดเสียง พร้อมโลโก้ OrcaRouter ที่ประกอบอยู่ที่มุมขวาล่าง
Guides & Insights

MiniCPM5-2B-DSpark: OpenBMB เปิดตัวน้ำหนัก MiniCPM5-2B อย่างเงียบๆ พร้อมด้วยโมเดลร่างที่ออกแบบมาเพื่อความเร็ว

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อหกสัปดาห์ก่อน MiniCPM5-2B เป็นเพียงคำมั่นสัญญา เปิดตัวที่งานประชุม WAIC ในนครเซี่ยงไฮ้เมื่อวันที่ 2026-07-19 ในฐานะโมเดลต่ำกว่า 4B ที่ครองตำแหน่งสูงสุดในดัชนี Artificial Analysis Index พร้อมกับหมายเหตุในแผนที่ว่า open weights จะมาใน “เร็วๆ นี้” และเร็วๆ นั้นก็มาถึงในสัปดาห์นี้ โดยไม่มีการโหมโรงใดๆ เมื่อวันที่ 2026-09-06 OpenBMB ได้อัปโหลดที่เก็บ (repository) หลักของ MiniCPM5-2B ขึ้นสู่ Hugging Face ภายใต้สัญญาอนุญาต Apache-2.0 และยี่สิบเอ็ดนาทีต่อมา ก็ได้อัปโหลด MiniCPM5-2B-DSpark ตามไป — ดราฟต์เช็คพอยต์ที่มี 323.8 ล้านพารามิเตอร์ ซึ่งมีหน้าที่เดียวคือทำให้ MiniCPM5-2B ถอดรหัสได้เร็วขึ้นภายใต้อัลกอริทึม speculative decoding แบบ DSpark จากนั้นก็มีบิลด์ GPTQ ตามมาในวันที่ 2026-09-07 ณ เวลาที่เขียนนี้ ยังไม่มีการประกาศ ไม่มีโพสต์เปิดตัว และไม่พบรายการในบันทึกการเปลี่ยนแปลง (changelog) การเปิดตัวนี้ปรากฏขึ้นโดยที่ repositories ถูกเปิดเป็นสาธารณะอย่างเงียบๆ ทอดยาวเป็นช่วงสิบเอ็ดวัน

นี่คือบทความที่รวบรวมสิ่งที่เรารู้เท่าที่รู้ในตอนนี้ และการวางกรอบการนำเสนอมีความสำคัญ MiniCPM5-2B-DSpark ไม่ใช่แชตบอตแบบสแตนด์อโลนหรือโมเดลเรือธงรุ่นใหม่ — แต่มันคือตัวเร่งความเร็ว: โมเดลขนาดเล็กที่ทำงานเร็วซึ่งเสนอโทเค็นล่วงหน้าให้ MiniCPM5-2B จากนั้น MiniCPM5-2B จะตรวจสอบโทเค็นเหล่านั้นแบบขนาน มันไร้ประโยชน์หากไม่มีเป้าหมายของมัน และเป้าหมายของมันคือเหตุผลที่เราควรสนใจ การเปิดตัวโมเดล open-weight อย่าง MiniCPM5-2B ที่ OpenBMB สัญญาไว้ในเดือนกรกฎาคม ตอนนี้อยู่บน Hugging Face จริงแล้ว และโมเดลดราฟต์ที่ปล่อยมาพร้อมกันคือกลไกที่ผู้พัฒนาแนะนำสำหรับการรันโมเดลดังกล่าวด้วยความเร็วที่ใช้งานได้จริง ทุกอย่างที่ไม่ได้ระบุแหล่งที่มาอย่างชัดเจนด้านล่างนี้ อ่านโดยตรงจาก model card ทั้งสองฉบับและ repositories ของโมเดลทั้งสอง

จัดส่งอะไรไปบ้าง และเมื่อใด

ตระกูล 2B เปิดตัวสู่สาธารณะในรูปแบบการทยอยปล่อยโดยไม่มีการประกาศล่วงหน้า โดยเริ่มจากรายการใหม่ล่าสุดก่อน:

• 2026-08-27 — MiniCPM5-2B-Base และ MiniCPM5-2B-SFT ปรากฏขึ้น ซึ่งเป็น checkpoint ที่ผ่านการ pretrain แบบดิบ และ checkpoint ที่ผ่านการ fine-tune แบบมีผู้สอน

• 2026-09-01 — MiniCPM5-2B-Midtrain ซึ่งเป็นขั้นตอนการฝึกกลางแบบเอเจนต์

• 2026-09-05 — MiniCPM5-2B-MLX และ MiniCPM5-2B-GGUF ซึ่งเป็นรูปแบบ Apple Silicon และ llama.cpp

• 2026-09-06 — รีโพเรือธง MiniCPM5-2B จากนั้น MiniCPM5-2B-DSpark ในอีกยี่สิบเอ็ดนาทีต่อมา

• 2026-09-07 — MiniCPM5-2B-GPTQ รูปแบบการให้บริการแบบควอนไทซ์

ทั้งหมดนี้ใช้สัญญาอนุญาต Apache-2.0 ซึ่ง ModelBest ใช้สำหรับตระกูล MiniCPM5-1B เมื่อเดือนพฤษภาคม และ checkpoint ก่อนหน้าในลำดับยังคงแสดงสัญญาณจากชุมชนแทบเป็นศูนย์ — มีการดาวน์โหลดและกดถูกใจเพียงไม่กี่ครั้งต่อรายการ นั่นคือเครื่องหมายของการปล่อยน้ำหนักโมเดลที่กำลังดำเนินอยู่ ไม่ใช่การเปิดตัวอย่างเป็นระบบ: ไฟล์ผลลัพธ์ปรากฏตามลำดับการพึ่งพา (base และ SFT ก่อน ส่วนรูปแบบ quantized และ draft ทีหลัง) โดยไม่มีวันเดียวที่ทำหน้าที่เป็นวันวางจำหน่าย

MiniCPM5-2B-DSpark แท้จริงแล้วคืออะไร

การถอดรหัสแบบคาดการณ์ล่วงหน้า (speculative decoding) แบ่งการสร้างออกเป็นตัวเสนอที่ใช้ต้นทุนต่ำและตัวตรวจสอบที่ใช้ต้นทุนสูง โมเดลร่างขนาดเล็กจะคาดเดาโทเค็นสองสามตัวถัดไป โมเดลขนาดใหญ่จะตรวจสอบการคาดเดาทั้งหมดใน forward pass เพียงรอบเดียว และยอมรับตัวที่เห็นด้วย เมื่อร่างมีความเที่ยงตรงดี คุณจะได้ผลลัพธ์ของโมเดลใหญ่ในต้นทุนเพียงเศษเสี้ยว และเมื่อร่างผิด คุณก็เสียเพียงขั้นตอนการตรวจสอบเดียว DSpark เป็นแนวทางเฉพาะของแนวคิดนี้ จากบทความที่เผยแพร่เมื่อ 2026-07-06 (arXiv 2607.05147, "Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation") ตัวเลือกการออกแบบสองประการทำให้มันโดดเด่น ประการแรก มันเชื่อมแกนหลักแบบร่างขนานเข้ากับโมดูลลำดับแบบเบา เพื่อให้โทเค็นภายในบล็อกที่เสนอต้องพึ่งพากันเอง แทนที่จะมีความแม่นยำลดลงเรื่อย ๆ เมื่อถึงท้ายบล็อก และประการที่สอง มันกำหนดขนาดของการตรวจสอบในแต่ละครั้งตามคำขอจากค่าประมาณความมั่นใจและปริมาณงานของเอนจิน แทนที่จะตรวจสอบบล็อกความยาวคงที่ทุกครั้งไป

ร่าง DSpark ที่ OpenBMB ปล่อยออกมานั้นเป็น Transformer ห้าชั้นที่มีพารามิเตอร์ 323.8 ล้านค่าในรูปแบบ BF16 (ประมาณ 648MB) มันอยู่ในตระกูลสถาปัตยกรรม Q​wen3 แต่มีส่วนเพิ่มเติมเฉพาะของ DSpark: โปรเจกเตอร์ที่อ่าน hidden states จาก MiniCPM5-2B จากห้าชั้นของเป้าหมาย (ชั้น 1, 10, 20, 30 และ 39), หัวความเชื่อมั่น (confidence head), และหัวมาร์คอฟขนาดเล็กที่จำลองการกระจายของโทเค็นถัดไป คอนฟิกของมันเสนอให้ประมวลผลเจ็ดโทเค็นต่อรอบไปข้างหน้า ด้วยขนาดประมาณหนึ่งในแปดของพารามิเตอร์ 2.5 พันล้านค่าของ MiniCPM5-2B มันจึงเป็นหนึ่งในร่างโมเดลที่เล็กที่สุดที่ปล่อยมาสำหรับ checkpoint โอเพนซอร์สกระแสหลัก — ซึ่งเป็นประเด็นสำคัญสำหรับโมเดลที่เน้นขอบอุปกรณ์ (edge) ที่ร่างต้องมีต้นทุนต่ำพอจนการรันสองโมเดลบนอุปกรณ์เครื่องเดียวยังดีกว่าการรันโมเดลเดียว

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark, captured September 7, 2026, showing the OpenBMB org, the model name, the Apache-2.0 licence, tags including Transformers, Safetensors, text-generation, edge-ai and custom_code, the linked arxiv papers, the MiniCPM5 target reference, and the opening card line "MiniCPM5-2B-DSpark is a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer."

ที่เก็บโค้ดข้างต้นคือพื้นผิวสาธารณะทั้งหมดของโมเดลฉบับร่าง ประกอบด้วยไฟล์ README, ไฟล์ config, ไฟล์ safetensors ไฟล์เดียว และ model card ซึ่งคำอธิบายการฝึกอบรมระบุว่ามีซีเควนซ์จำนวน 1,959,525 รายการ (7.05 พันล้านโทเคน) ที่สร้างขึ้นโดย MiniCPM5-2B จากพรอมป์ด้านทั่วไป คณิตศาสตร์ และโค้ด ฝึกอบรมเป็นเวลาหก epochs โดยใช้วัตถุประสงค์ร่วมระหว่าง cross-entropy, L1 และ confidence เช็คพอยต์นี้ไม่ได้ถูกใช้เป็นโมเดลเชิงสร้าง (generative model) ด้วยตัวเองแต่อย่างใด

ตัวเลขที่ OpenBMB เผยแพร่ออกมา ซึ่งมีการติดฉลากอย่างตรงไปตรงมา

การ์ดของโมเดลดราฟต์รายงานตัวเลขสำคัญหนึ่งค่า นั่นคือความยาวการยอมรับ (acceptance length) ซึ่งคือจำนวนเฉลี่ยของโทเคนที่ถูกเสนอซึ่งโมเดลเป้าหมายยอมรับจากบล็อกขนาดเจ็ดโทเคนแต่ละบล็อก การประเมินนี้ดำเนินการบนเอาต์พุตของ MiniCPM5-2B ในสามโดเมน ด้วยโทเคนที่สร้างสูงสุด 4,096 โทเคน:

คณิตศาสตร์ — แบบ greedy (T=0) ยอมรับโดยเฉลี่ย 6.05 โทเคน; แบบสุ่มตัวอย่าง T=1.0 ยอมรับ 4.61

• โค้ด — 6.11 greedy; 4.44 sampled.

• ทั่วไป — 4.16 แบบ greedy; 3.10 แบบสุ่ม

• โดยรวม — 5.52 แบบ greedy; 4.05 แบบ sampled จากคะแนนเต็ม 7

ตัวเลขเหล่านี้เป็นค่าที่ vendor รายงานไว้ใน model card และยังไม่มีการทำซ้ำผลการทดลองโดยอิสระ ทั้งนี้ ตัวเลขดังกล่าวบ่งชี้เพียง hit rate ของดราฟต์ (draft) เท่านั้น ไม่ใช่การเร่งความเร็วแบบ wall-clock กล่าวคือ ความเร็วเป็นค่าที่วัดในระบบ serving ซึ่งขึ้นอยู่กับว่าต้นทุนของ verification pass ของโมเดลเป้าหมายเทียบกับ proposal pass ของโมเดลดราฟต์เป็นเท่าใด ขึ้นอยู่กับ batch occupancy และขึ้นอยู่กับการที่ confidence scheduler ของ DSpark ตัดทอนความยาวของขั้นตอนการตรวจสอบลง OpenBMB ไม่ได้เผยแพร่ตัวเลข tokens-per-second สำหรับโมเดลคู่นี้ เพื่อให้เห็นภาพว่าเพดานของวิธีนี้อยู่ตรงไหน รายงานของ DSpark ระบุว่าที่ throughput เท่ากัน การสร้างผลลัพธ์ต่อผู้ใช้ (per-user generation) ทำได้เร็วกว่า 60–85% เมื่อเทียบกับ baseline MTP-1 ในระบบ serving ที่ใช้งานจริงของ Deep​Seek — ซึ่งเป็นจุดอ้างอิงที่มีประโยชน์ว่าอัลกอริทึมนี้เคยทำผลงานได้ดีเพียงใดในสภาพแวดล้อมอื่น ไม่ใช่ข้อกล่าวอ้างเกี่ยวกับ MiniCPM5-2B บนฮาร์ดแวร์ของคุณ

A generated single-column scoreboard for MiniCPM5-2B-DSpark listing Draft params 323.8M, 5 layers; Draft tokens per forward pass 7; Target model MiniCPM5-2B, 42 layers; Greedy acceptance length 5.52 of 7; Confidence + Markov heads enabled; License Apache-2.0, with the footer "Acceptance figures from OpenBMB's model card; not independently reproduced" and the OrcaRouter logo composited in the bottom-right corner.

ตารางคะแนนด้านบนคือสเปกชีตของตัว release เอง ให้อ่านค่าการยอมรับเป็นอัตราการตรงเบื้องต้น (draft hit-rate) ส่วนตัวคูณของปริมาณงานจริงนั้นคือสิ่งที่การรัน SGLang อย่างอิสระยังคงต้องวัดผล

แบบจำลองที่ร่างเร่งความเร็ว

MiniCPM5-2B เป็น Transformer แบบ dense ที่มีพารามิเตอร์ 2.5 พันล้าน — รวมทั้งหมด 2,516,756,480 พารามิเตอร์ — มี 42 เลเยอร์, 16 query heads และ 2 KV heads, คำศัพท์ 130,560 โทเคน, และหน้าต่างบริบท 131,072 โทเคน, ในรูปแบบ BF16 ขนาดประมาณ 5GB ในเชิงสถาปัตยกรรมมันจงใจให้ธรรมดา: เป็น LlamaForCausalLM มาตรฐาน ไม่มี custom kernels และไม่มีการ fork โค้ดโมเดล ซึ่งเป็นเหตุผลที่ทำให้มันพอร์ตไปยังรันไทม์และชิปเป้าหมายได้หลากหลาย ในชุดเกณฑ์มาตรฐานภายในของ OpenBMB เอง การ์ดระบุค่าเฉลี่ย 53.9 ในงานด้านการให้เหตุผล การทำตามคำสั่ง ความรู้ บริบทยาว การใช้เครื่องมือ การเขียนโค้ด และงาน search-agent — สูงกว่า Qwen3.5-4B ที่ 51.1 และ granite-4.2-3B ที่ 42.7 ในตารางเดียวกัน โดยมีหลายเซลล์ (GPQA-Diamond 70.2, HLE 8.9 และแถวเกี่ยวกับบริบทยาวและ agentic ต่างๆ) ที่ระบุว่ามาจาก Artificial Analysis มิได้ทำซ้ำใน-house เซลล์เด่นรายงานต่องาน ได้แก่ MATH-500 ที่ 94.6, AIME 2025 และ 2026 ที่ 86.5, IFEval ที่ 86.7, MMLU-Pro ที่ 70.8 และ SWE-bench Verified ที่ 46.4 ตัวเลขเหล่านี้เป็นตัวเลขของผู้ขายบนชุดทดสอบของผู้ขายเอง และการ์ดก็ระบุชัดว่าบางแถวมาจากแหล่งที่สาม ดังนั้นควรปฏิบัติต่อข้อมูลที่ผสมกันนี้ตามนั้น

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B, captured September 7, 2026, showing the OpenBMB org, the model name, the Apache-2.0 licence, tags including Transformers, Safetensors, English, Chinese, long-context, tool-calling and edge-ai, the arxiv links, and the opening Highlights line "We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B."

ในการเปิดตัวเดือนกรกฎาคม เอกสารเปิดตัวของ ModelBest อ้างอิงดัชนี Artificial Analysis Index ที่ 17 — เป็นอันดับหนึ่งในบรรดาโมเดลที่มีพารามิเตอร์ต่ำกว่า 4B — และรายงานข่าวในเดือนกรกฎาคมกล่าวถึงหน้าต่างขนาด 512K โทเคน เช็คพอยต์ที่จัดส่งจริงมีการกำหนดค่าบริบทที่ 131,072 โทเคน ในกรณีที่ตัวเลขทางการตลาดในวันเปิดตัวไม่ตรงกับค่าที่จัดส่งจริง ค่าที่จัดส่งจริงคือตัวเลขที่กำหนดว่าคุณสามารถรันอะไรได้ และช่องว่างนี้เป็นสิ่งที่ควรทราบก่อนที่คุณจะวางแผนงานที่ใช้บริบทยาวโดยอ้างอิงจากตัวเลขทางการตลาด

รัน MiniCPM5-2B ด้วยดราฟต์ของมัน

เส้นทางที่ตั้งใจคือ SGLang ซึ่งรองรับอัลกอริทึม DSpark ในต้นน้ำตั้งแต่ v0.5.16 — เวอร์ชันขั้นต่ำที่การ์ดโมเดลกำหนด คำสั่ง serving แบบเต็มจากการ์ด:

python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7

ภายใต้การถอดรหัสแบบ greedy (T=0) การตรวจสอบ DSpark เป็นแบบ lossless กล่าวคือเอาต์พุตที่ได้จะเหมือนกับการเสิร์ฟ MiniCPM5-2B เพียงอย่างเดียว ซึ่งหมายความว่าดราฟต์มีบทบาทเพียงเพื่อลด latency เท่านั้น เมื่อเปิดใช้งาน sampling DSpark ของ SGLang จะตั้งค่าเริ่มต้นเป็นการสุ่มตัวอย่างจากโมเดลเป้าหมายเท่านั้น (target-only sampling) โดยมีตัวเลือกเป็นการสุ่มตัวอย่างแบบปฏิเสธ (rejection sampling) นอกจากนี้ OpenBMB ยังได้บันทึกวิธีการโหลด Transformers แบบธรรมดา (transformers ≥ 5.6) และการเสิร์ฟโมเดลเป้าหมายด้วยตนเองผ่าน vLLM ≥ 0.21 รวมถึงตัวแยกวิเคราะห์การเรียกใช้เครื่องมือ (tool-call parser) ของ minicpm5 สำหรับงานที่ใช้เอเจนต์ (agentic workloads) โดยเฉพาะเส้นทาง speculative ของ DSPARK นั้นเป็นของ SGLang

การคำนวณทางฮาร์ดแวร์คือเรื่องราวที่แท้จริงสำหรับคู่โมเดลระดับเอจ: MiniCPM5-2B ในรูปแบบ BF16 ใช้พื้นที่ประมาณ 5GB บวกกับดราฟต์อีกประมาณ 0.65GB การรวมกันของดราฟต์กับโมเดลเป้าหมายพอดีที่จะทำงานได้ในทุกที่ที่โมเดล 2B เพียงอย่างเดียวเคยทำงานได้ ซึ่งเป็นเหตุผลทั้งหมดที่ต้องจัดส่งดราฟต์ขนาดเล็กขนาดนี้ แทนที่จะเป็นโมเดลที่ใหญ่กว่าตัวที่สอง

สิ่งที่ไม่ได้รับการยืนยัน

• ไม่มีการประกาศใดๆ ที่เราสามารถค้นหาได้ — ไม่มีบล็อกจาก OpenBMB หรือ ModelBest ไม่มีโพสต์บนโซเชียลทั้งในภาษาอังกฤษหรือจีน การเรียกมันว่า "quietly shipped" นั้นเป็นความหมายตรงตามตัวอักษร และจุดเปิดเผยสาธารณะเพียงอย่างเดียวคือคอลเลกชันบน Hugging Face

• ไม่มีการประเมินโดยอิสระ ความยาวที่ยอมรับได้ในร่างเอกสารและค่าเฉลี่ยชุดทดสอบ 53.9 ของ MiniCPM5-2B เป็นค่าที่ผู้ผลิตรายงานมาเองและยังไม่มีการทำซ้ำเพื่อยืนยันผล ส่วนเซลล์ที่ทำเครื่องหมาย AA ไว้นั้นเป็นข้อมูลจากบุคคลที่สาม แต่เป็นเพียงค่าแบบ snapshot ณ เวลาหนึ่ง ไม่ใช่ผลจากการรันด้วยน้ำหนักชุดเดียวกันนี้จริง

• เราไม่พบ hosted API ที่ไหนเลย ดังนั้นการนำไปใช้ในปัจจุบันจึงต้องรันเช็คพอยต์ด้วยตัวเอง ส่วนมิเรอร์ของ ModelScope ที่ให้คำมั่นไว้ในรายงานข่าวการเปิดตัวเดือนกรกฎาคมก็ยังไม่ปรากฏให้เห็น ณ เวลาที่เขียนบทความนี้

• ไม่มีตัวเลขความเร็วตามนาฬิกาจริง (wall-clock speedup) สำหรับคู่ DSPARK ความยาวการยอมรับที่ 5.52 คืออัตราการยอมรับที่แข็งแกร่ง แต่ "เร็วกว่าเท่าใด" บน GPU ที่กำหนดคือตัวเลขที่ OpenBMB ไม่ได้เผยแพร่

• ความกำกวมของ context window ที่กล่าวข้างต้น: สื่อการตลาดระบุว่า 512K, คอนฟิกที่จัดส่งจริงระบุว่า 131,072 และไม่มีสิ่งใดใน repos ที่เชื่อมสองค่านี้เข้าด้วยกัน

โมเดล open-weight ที่ปล่อยออกมาอย่างเงียบๆ ควรอยู่ในจุดใดของสแตก

การอ่าน MiniCPM5-2B อย่างตรงไปตรงมาในวันนี้ก็คือ มันคือการเดิมพัน: ตัวเลขจากผู้จำหน่ายแข็งแกร่ง ไม่มีการรันโดยอิสระแม้แต่ครั้งเดียว ไม่มีประวัติการให้บริการ และเป็นโมเดลร่างที่ความเร่งในโลกจริงยังไม่เคยถูกวัดค่า นั่นคือสถานการณ์ที่ชั้นการจัดเส้นทาง (routing layer) ถูกสร้างขึ้นมาเพื่อรับมือโดยเฉพาะ ทีมที่ต้องการทดสอบว่าเอาต์พุตของโมเดลโอเพนซอร์สขนาดเล็กจะแทนที่โมเดลโฮสต์ที่กำลังเรียกใช้อยู่แล้วได้หรือไม่ ก็สามารถรันการเปรียบเทียบนั้นได้จาก API เดียว — OrcaRouter ทำหน้าที่เป็นหน้าด่านให้โมเดลโฮสต์กว่า 200 รุ่นในราคารายการของผู้ให้บริการโดยไม่คิดมาร์กอัป ดังนั้นสัปดาห์การประเมินจึงไม่มีค่าใช้จ่ายในการตั้งต้น และการเฟลโอเวอร์อัตโนมัติหมายความว่าเช็คพอยต์ที่สร้างเมื่อสองสามวันก่อนไม่ต้องจับเส้นทางการผลิตเป็นตัวประกันในขณะที่มันพิสูจน์ตัวเอง ทั้งหมดนี้ไม่จำเป็นต้องให้ MiniCPM5-2B ถูกโฮสต์ไว้ที่ใด มันคือตาข่ายนิรภัยรอบโมเดลที่คุณพึ่งพาอยู่แล้ว ในขณะที่คุณตัดสินใจว่าโมเดล 2B แบบโฮสต์เองนั้นคุ้มกับ GPU หรือไม่

จงจับตาดู ตามลำดับความสำคัญ: การรัน SGLang DSPARK อย่างอิสระที่รายงานค่า tokens ต่อวินาทีจริงของคู่โมเดล เนื่องจากความยาวที่ยอมรับได้ (acceptance length) เป็นเพียงตัวแทน (proxy) ไม่ใช่เกณฑ์วัด (benchmark); การประกาศอย่างเป็นทางการหรือมิเรอร์บน ModelScope ที่ยืนยันว่ารีลีสดังกล่าวเป็นเวอร์ชันสุดท้าย; และผู้ให้บริการโฮสติ้งที่รับ MiniCPM5-2B ไปให้บริการ — หากมีผู้ให้บริการรายใดรับ ราคาที่คุณจ่ายในฝั่งเราก็คือราคาลิสต์ (list price) ของผู้ให้บริการรายนั้นเองในวันเดียวกัน เพราะนั่นคือความหมายของ pass-through ในระหว่างนี้ โมเดลร่าง (draft model) คือชิ้นงานที่น่าสนใจมากกว่าจากสองสิ่งนี้ โมเดล proposer จำนวนห้าชั้นที่โมเดลเป้าหมายยอมรับ 5.5 โทเคนจากทั้งหมด 7 โทเคน คือความแตกต่างระหว่างโมเดลเอดจ์ขนาดเล็กที่ให้ความรู้สึกว่าเล็ก กับโมเดลที่ให้ความรู้สึกเหมือนโมเดลขนาดใหญ่กว่าซึ่งทำงานบนอุปกรณ์เดียวกัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube