การ์ดไตเติลสำหรับ 'dots-note-3.0: โมเดล IMO 42/42 เพิ่งหลุดผ่าน vLLM PR': พาดหัวขนาดใหญ่ 'dots-note-3.0', คำบรรยาย 'สิ่งที่เรารู้จนถึงตอนนี้', และการ์ดไอคอนแบบแบนสองใบ — 'IMO 2026 · 42/42' พร้อมไอคอนถ้วยรางวัลแบบเส้นและป้าย 'การให้คะแนนอย่างเป็นทางการ', และ 'vLLM PR #51255' พร้อมไอคอนไฟล์โค้ดแบบเส้นและป้าย 'สถาปัตยกรรมหลุด' โลโก้ OrcaRouter ประกอบที่มุมล่างขวา
Guides & Insights

dots-note-3.0: โมเดล IMO 42/42 ที่หลุดจาก PR ของ vLLM กลายเป็นโอเพนซอร์สแล้ว

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 14 สิงหาคม 2026 dots-note-3.0 เลิกเป็นเพียงข้อมูลรั่วไหลแล้ว Dots Model Lab ของ Xiaohongshu เปิดโอเพนซอร์สโมเดลสาธารณะตัวแรกในตระกูล dots3 ในชื่อ dots3-note preview — มีพารามิเตอร์ 280 พันล้านตัว (ใช้งานจริง 16 พันล้านตัว) หน้าต่างบริบท 512K อยู่ภายใต้สัญญาอนุญาต Apache-2.0 — แปดวันหลังจากคำขอ pull request ของ vLLM ทำให้สถาปัตยกรรมของโมเดลรั่วไหลออกมาก่อนการเปิดตัว น้ำหนักโมเดลอยู่บน Hugging Face โค้ดอยู่บน GitHub และ checkpoint ที่ทำคะแนนอย่างเป็นทางการ 42/42 ในการแข่งขันคณิตศาสตร์โอลิมปิกนานาชาติ 2026 เป็นครั้งแรกที่ใครก็สามารถนำไปรันได้

การเปิดตัวครั้งนั้นตอบคำถามค้างคาทุกข้อที่บทความเรื่องข้อมูลรั่วไหลเมื่อวันที่ 6 สิงหาคมของบล็อกนี้ทิ้งไว้ — ขนาด, ความยาวบริบท, ใบอนุญาต, เส้นทางบน Hugging Face, วันวางจำหน่าย — และเปลี่ยนเรื่องราวแบบ "สิ่งที่เรารู้เท่าที่ผ่านมา" ให้กลายเป็นเรื่องที่ตรวจสอบได้ ต่อไปนี้คืออัปเดต: สิ่งที่วางจำหน่ายจริง, สิ่งที่คอนฟิกรุ่นที่ปล่อยออกมายืนยันเกี่ยวกับสถาปัตยกรรมที่ PR เผยให้เห็นเป็นครั้งแรก, สิ่งที่ตอนนี้สามารถตรวจสอบได้โดยอิสระ, และสิ่งที่ยังคงเป็นการกล่าวอ้างของทางผู้จำหน่ายเอง

จาก PR ฉบับร่างสู่จุดเช็คพอยต์สาธารณะ

เรื่องรั่วไหล โดยสรุป: วันที่ 6 สิงหาคม 2026 ผู้มีส่วนร่วมที่ใช้ชื่อว่า KurodaKanbei — ผู้ซึ่งบรรยายตนเองว่าเป็นนักศึกษาปริญญาเอก ETH Zürich ไม่ใช่พนักงานของ Xiaohongshu — ได้เปิด pull request #51255 ใน vllm-project/vllm เพื่อเพิ่มการรองรับโมเดลภาษา "Dots3 NOTE" แฟลกร่างถูกถอดออกเมื่อวันที่ 7 สิงหาคม เวลา 13:55 UTC และบันทึกการตรวจสอบของ PR เองคือสิ่งที่บอกใบ้: ผู้เขียนได้รันบริการ DP8/EP8 บน GPU 8 ตัว "ด้วยเช็คพอยต์ FP8 ของ Dots3 NOTE" คุณไม่สามารถตรวจสอบเช็คพอยต์ FP8 ที่คุณไม่มีได้ — ไม่ว่าใครก็ตามที่เขียน PR นั้นย่อมมีโมเดลจริงอยู่ มันแตะไฟล์ 14 ไฟล์ รวมถึงโมดูลใหม่ vllm/models/dots3_note และติดป้ายกำกับ new-model และ verified

ในสี่สัญญาณที่เราได้ระบุไว้เมื่อวันที่ 8 สิงหาคม ทุกสัญญาณได้เกิดขึ้นแล้ว ยกเว้นสัญญาณที่สำคัญที่สุด รีโพของ Hugging Face ปรากฏขึ้น — dots-studio/dots3-note-prev, Apache-2.0 ประกาศอย่างเป็นทางการก็ออกมาแล้ว — การปล่อยซอร์สเปิดเองในวันนี้ สแตกสำหรับการอนุมานไม่ได้เป็นแค่ฉบับร่างอีกต่อไป: การรองรับ vLLM เป็นแบบเนทีฟบน main และทั้ง transformers และ SGLang ต่างก็รองรับ dots3-note สัญญาณที่สี่ ซึ่งก็คือการตรวจสอบผลลัพธ์คณิตศาสตร์ 42/42 อย่างอิสระ ยังคงเป็นรายการที่ค้างอยู่ — และตอนนี้มันเป็นไปได้ในแบบที่ไม่เคยเป็นมาก่อน เพราะน้ำหนัก (weights) ถูกเปิดเผยสู่สาธารณะ

Screenshot of the vLLM GitHub pull request #51255 titled 'Draft: [Model] Add Dots3 NOTE language model support', opened August 6, 2026 by KurodaKanbei — the draft PR that first revealed the dots-note-3.0 architecture (hybrid DSA full-attention + sliding-window MLA layers).

สิ่งที่ส่งมอบจริง

โมเดลการ์ดที่เผยแพร่ออกมาเปลี่ยนข้อสรุปจาก PR ให้เป็นเอกสารข้อมูลจำเพาะ — และตัวเลขมาจากคอนฟิกของเช็คพอยต์เอง ไม่ใช่จากบทสรุปของบุคคลที่สาม {{1}}dots3-note preview{{/1}} เป็นโมเดลแบบ mixture-of-experts:

• รวม 280B / พารามิเตอร์ที่ใช้งาน 16B — มีผู้เชี่ยวชาญแบบ routed 256 ตัว บวกผู้เชี่ยวชาญร่วมอีก 1 ตัว, ใช้การจัดเส้นทางแบบ top-8, บนเลเยอร์ dense 1 ชั้น + เลเยอร์ MoE 45 ชั้น ด้วยขนาด hidden 5,120

• หน้าต่างบริบท 512K โทเคน คำศัพท์ 152K ความแม่นยำ BF16 และ FP8

โมดูลการทำนายหลายโทเค็น (MTP) — เลเยอร์ร่วมหนึ่งชั้นซึ่งมีพารามิเตอร์ 1.13B ทำนายโทเค็นเพิ่มเติมได้สูงสุดสามโทเค็นแบบขนาน ซึ่งเป็นกลไกที่ขับเคลื่อน speculative decoding โดยไม่ต้องใช้โมเดลร่างแยกต่างหาก

• การนำเข้าหลายรูปแบบ — ข้อความ รูปภาพ วิดีโอ และเสียง — ให้ผลลัพธ์เป็นข้อความ ตัวเข้ารหัสภาพเป็น MoE ViT (รวม 7B / ใช้งาน 1.2B) และตัวเข้ารหัสเสียงเป็นแบบ dense 800M

หมายเหตุขอบเขตของ PR ระบุว่างาน vLLM ครอบคลุมเฉพาะ "LLM" เท่านั้น โดยส่วนประกอบ multimodal อยู่นอกขอบเขต นั่นเป็นเรื่องของแพตช์การอนุมาน ไม่ใช่ตัวโมเดล: checkpoint ที่เผยแพร่ออกมาพร้อมกับตัวเข้ารหัสภาพและเสียงควบคู่กับแกนภาษา หากคุณต้องการเวอร์ชัน multimodal คุณกำลังดูที่ repo เดียวกัน ซึ่งให้บริการผ่านเส้นทาง transformers และ SGLang แทนที่จะเป็นเส้นทาง vLLM ที่รองรับเฉพาะ LLM ซึ่งหลุดออกมาก่อน

ความพร้อมใช้งาน อย่างเป็นรูปธรรม: น้ำหนักของโมเดลอยู่ที่ dots-studio/dots3-note-prev บน Hugging Face ภายใต้สัญญาอนุญาต Apache-2.0; โค้ดและสูตรการให้บริการอยู่ในคลังเก็บ studio-dots-ai/dots3-note-prev บน GitHub; และการเข้าถึงแบบโฮสต์นั้นผ่านพอร์ทัล API ของผู้จำหน่ายเอง รวมถึงแพลตฟอร์มบุคคลที่สามหลายราย นี่คือการเผยแพร่แบบ open-weight ครั้งแรกของตระกูล dots3 — ภาษาที่ Xiaohongshu ใช้มาเป็นเวลาสองสัปดาห์ว่า "open-sourcing soon" (近期将开源) ตามคำแถลงภาษาจีนของบริษัท ได้สำเร็จแล้ว

สถาปัตยกรรมที่การรั่วไหลระบุได้ถูกต้อง

PR อธิบายว่า dots-note-3.0 “มีความเกี่ยวข้องเชิงโครงสร้างกับ DeepSeek-V3.2” แต่ผสมเรขาคณิตของ attention สองแบบไว้ในสแต็กเดียวกัน คอนฟิกที่เผยแพร่ออกมายืนยันสิ่งนี้ การ์ดโมเดลแบ่งเลเยอร์ attention 46 ชั้นออกเป็นเลเยอร์ sparse-attention แบบ DeepSeek (DSA) 13 ชั้น — ด้วยการจัดทำดัชนีแบบ top-2048 — และเลเยอร์ sliding-window attention (SWA) 33 ชั้น โดยคร่าวๆ มีเลเยอร์ sparse หนึ่งชั้นต่อเลเยอร์ dense สามชั้น นั่นคือโครงสร้าง “การสลับระหว่าง global แบบ sparse กับ local แบบ dense” ที่ชื่อ branch note-hopper สื่อเป็นนัย บัดนี้ถูกเขียนไว้ใน checkpoint เองแล้ว

ในเชิงกลไก มันเป็นแนวคิดเดียวกันกับที่ DeepSeek เปิดตัวใน V3.2: ส่วน DSA เป็นตัวจัดทำดัชนีน้ำหนักเบาที่ให้คะแนนคีย์ที่แคชไว้ทุกตัวเทียบกับคำค้นหา เก็บรายการสั้น top-k และคำนวณความสนใจเหนือรายการนั้นแทนที่จะเป็นบริบททั้งหมด ซึ่งลดต้นทุนแบบกำลังสองของลำดับยาวให้เป็นเส้นตรงโดยประมาณ ส่วนหน้าต่างเลื่อนเป็นตัวถ่วงดุล: ช่วงขอบเขตจำกัดของความสนใจเฉพาะที่แบบหนาแน่นที่รับประกันว่าโทเค็นล่าสุดจะได้รับการใส่ใจอย่างเต็มที่เสมอ ไม่ว่าตัวจัดทำดัชนีแบบเบาบางจะตัดสินใจอย่างไร การมีทั้งความสนใจแบบเบาบางทั่วโลกและแบบหนาแน่นเฉพาะที่ในโมเดลเดียวกัน ถือเป็นส่วนที่ผิดปกติอย่างแท้จริงของการรั่วไหล — และตอนนี้ก็เป็นส่วนที่ได้รับการยืนยันแล้ว

ส่วนที่เหลือของพิมพ์เขียวเป็นกลไกตระกูล DeepSeek ที่คุ้นเคย ตามที่ PR กล่าวไว้: MoE router แบบไม่จัดกลุ่ม, MoE แบบ sequence-parallel, chunked prefill สำหรับบริบทยาวที่ตรวจสอบแล้วจนถึงหน้าต่าง 512K เต็ม และชั้น MTP ที่ค่าเริ่มต้นเป็นประเภท sliding-window attention สำหรับ speculative decoding

สถิติ 42/42 — และสิ่งที่ตอนนี้ตรวจสอบได้แล้ว

ผลการแข่งขัน IMO เองไม่เปลี่ยนแปลง และการติดฉลากก็ไม่เปลี่ยนแปลงเช่นกัน เมื่อวันที่ 25 กรกฎาคม 2026 Xiaohongshu ประกาศว่าโมเดลดังกล่าวทำคะแนนได้เต็ม 42/42 ในการให้คะแนนอย่างเป็นทางการของการแข่งขันคณิตศาสตร์โอลิมปิกนานาชาติครั้งที่ 67 ที่เซี่ยงไฮ้ โดยมีผู้เข้าแข่งขันที่เป็นมนุษย์เพียง 7 คนจาก 666 คนที่ทำคะแนนได้เท่ากัน และคะแนนขั้นต่ำสำหรับเหรียญทองคือ 29 — สูงกว่าเกณฑ์เหรียญทอง 13 คะแนน และสูงกว่า 35/42 ของ Gemini Deep Think อยู่ 7 คะแนน ซึ่งเป็นผลงาน AI ที่ดีที่สุดก่อนหน้านี้ในการให้คะแนนอย่างเป็นทางการของ IMO นั่นยังคงเป็นคำบอกเล่าของบริษัทเกี่ยวกับการแข่งขันที่มีการให้คะแนนอย่างเป็นทางการ: คะแนนนั้นเป็นจริงและผ่านการตรวจสอบจากคณะกรรมการ แต่ข้อกล่าวอ้างโดยรอบ — ว่าข้อสอบถูกเข้าถึงได้อย่างไร การสุ่มตัวอย่างและการให้คะแนนถูกควบคุมอย่างไร — ไม่เคยถูกตรวจสอบอย่างเป็นอิสระ เพราะไม่มีใครนอกห้องแล็บสามารถรันโมเดลได้

นั่นคือส่วนที่การเปิดตัวครั้งนี้เปลี่ยนแปลงไป เมื่อน้ำหนักถูกเปิดเผยต่อสาธารณะ คะแนน 42/42 จึงไม่ใช่ตัวเลขที่ต้องเชื่อถือโดยไม่มีหลักฐาน หรือเชื่อตามคำกล่าวใน pull request อีกต่อไป แต่มันเป็นผลลัพธ์ที่บุคคลที่สามสามารถพยายามสร้างซ้ำได้ และนั่นคือสิ่งที่ตรวจสอบได้ที่มีคุณค่าสูงสุดเกี่ยวกับการเปิดตัวครั้งนี้ นอกจากนี้ยังคงเป็นที่โต้แย้งในรายละเอียดปลีกย่อยในลักษณะเดียวกับเมื่อสองสัปดาห์ก่อน: สื่อจีนรายงานว่า Celia ของ Huawei ก็ได้คะแนน 42/42 ในการให้คะแนนเดียวกันเช่นกัน ดังนั้น dots-note-3.0 จึงเป็นหนึ่งในกลุ่มแรก มากกว่าเป็นรายแรก และคำกล่าวบน X ของหุ้นส่วนจาก Menlo Ventures ที่ว่า OpenAI, Anthropic, Axiom Math และ Kimi K3 ของ Moonshot ก็ทำคะแนน 42/42 ได้ในปีนี้ ยังคงเป็นโพสต์บนโซเชียลที่ไม่ได้รับการยืนยัน และไม่มีบันทึกการให้คะแนนรองรับ

บริษัทยังได้เผยแพร่การอ้างสิทธิ์ด้านเกณฑ์มาตรฐานชุดใหม่ควบคู่ไปกับการเปิดตัว โดยทั้งหมดเป็นข้อมูลที่รายงานโดยผู้จำหน่ายเองและยังไม่มีการตรวจสอบซ้ำ ในเกณฑ์มาตรฐาน ARC-AGI 3 นั้น Dots ระบุว่า dots3-note preview ทำคะแนนได้ประมาณ 0.35 โดยมีต้นทุนการทดสอบที่รายงานไว้ต่ำกว่า 500 ดอลลาร์สหรัฐ สำหรับชุดทดสอบด้านการให้เหตุผลและเอเจนต์ อาทิ WebShop, HotpotQA และ ALFWorld บริษัทอ้างว่าโมเดลดังกล่าวมีประสิทธิภาพเทียบเท่าหรือดีกว่าโมเดลที่มีจำนวนพารามิเตอร์ที่ใช้งานจริงมากกว่าหลายเท่า พร้อมกับความสามารถด้านวิทัศน์ที่โดดเด่นในขนาดโมเดลเดียวกัน ตัวเลขเหล่านั้นเป็นตัวเลขที่ Dots รายงานเกี่ยวกับโมเดลของตนเอง — ควรถือตามนั้นจนกว่าห้องปฏิบัติการที่เป็นกลางจะทำการทดสอบซ้ำ

Dots ยังได้เผยแพร่ชุดทดสอบการประเมิน (evaluation harnesses) สองชุดที่บริษัทสร้างขึ้นสำหรับงานประเภทนี้ และการเปิดซอร์สโค้ดชุดทดสอบเหล่านี้ก็มีประโยชน์แทบไม่แพ้ตัวโมเดลเอง VibeLifeBench ทำงาน 200 งานบนบริการจำลอง 22 บริการและอินเทอร์เฟซเครื่องมือ 288 รายการ โดยตรวจสอบเงื่อนไขเชิงอะตอมิก 1,247 เงื่อนไขว่าเอเจนต์ยังคงความสอดคล้องหรือไม่เมื่อสภาพแวดล้อมเปลี่ยนแปลงกลางงาน ตามผลลัพธ์ของ Dots เอง โมเดลที่แข็งแกร่งที่สุดที่ทดสอบมาจนถึงตอนนี้ได้คะแนนเพียง 32.5 avg@3 และโมเดล closed-weight ชั้นนำส่วนใหญ่ล้มเหลวโดยสิ้นเชิง VibeSearchBench มีขอบเขตแคบกว่า — 20 โดเมน 200 งาน ทดสอบว่าเอเจนต์ขอความชัดเจนหรือไม่เมื่อคำขอมีความคลุมเครือ ทั้งสองชุดมีป้ายกำกับที่รายงานโดยผู้ขายเช่นเดียวกับตัวเลข ARC-AGI แต่ชุดทดสอบเป็นแบบสาธารณะ ซึ่งทำให้ตัวเลข 32.5 สามารถพิสูจน์หักล้างได้ มากกว่าเป็นเพียงวาทกรรม

ทำไมนี่ถึงเป็นโมเดลตัวแทน ไม่ใช่โมเดลคณิตศาสตร์

ทั้งการรั่วไหลและคะแนน IMO ไม่ควรทำให้คุณเข้าใจผิดว่าโมเดลนี้สร้างมาเพื่ออะไร การวางตำแหน่งของการเปิดตัวไม่ใช่คณิตศาสตร์ — แต่เป็นงานระยะยาวแบบปลายเปิด: การวางแผนท่องเที่ยวเฉพาะบุคคล ขั้นตอนการเตรียมงานแต่งงาน การบริหารร้านค้าขนาดเล็ก การปรับปรุงบ้าน งานที่ไม่มีคำตอบที่ถูกต้องเพียงข้อเดียว เป้าหมายที่เปลี่ยนไประหว่างทำงาน และช่วงเวลาตั้งแต่ชั่วโมงจนถึงวัน นี่คือชุดเกณฑ์ชี้วัดที่ตั้งใจให้แตกต่างจากกระดานผู้นำด้านคณิตศาสตร์และการเขียนโค้ดโดยเจตนา และนี่คือจุดที่ตัวเลือกการออกแบบ dots3-note — บริบท 512K, ไฟล์หน่วยความจำ, วงจรการวิจารณ์ตนเอง — ให้ผลตอบแทนจริงๆ

เทคนิคสามอย่างโดดเด่นขึ้นมาจากสื่อที่เผยแพร่ ประการแรก โมเดลจะเก็บไฟล์หน่วยความจำ (memory.md) ไว้เป็นบทสรุปสภาพแวดล้อมที่อัปเดตเรื่อย ๆ ซึ่งเป็นวิธีที่มันคงสถานะข้ามเซสชันที่ยาวและเปิดกว้าง ประการที่สอง มันใช้กลไก "การวิจารณ์ตนเอง" — การทบทวนตนเองแบบเรียกซ้ำแบบเดียวกับที่กล่าวว่าโซลูชัน IMO ใช้ — เพื่อชี้จุดและแก้ไขขั้นตอนกลางของตนเอง ประการที่สาม สูตรการฝึกตั้งชื่อว่า TEMPO (Test-time-scaled Value Estimation with Macro-step Policy Optimization): โมเดลแบ่งวิถียาว ๆ ออกเป็นขั้นตอนมหภาค และสลับบทบาทระหว่าง actor กับ critic เพื่อสร้างสัญญาณการฝึกของตัวเอง ซึ่งเป็นเหตุผลที่รายงานว่ามันสามารถถูกปรับให้เหมาะสมกับงานที่ไม่มีคำตอบที่เป็นจริง

การสาธิตแบบลงมือทำของผู้ขายคือแก่นของคำกล่าวอ้าง: การเล่นเกมเด็คบิลเดอร์ Slay the Spire II ไปถึงชั้น 33, การแก้ปริศนา ARC-AGI 3 ทั้งหกระดับใน 320 ขั้นตอน, การเดินผ่านโจทย์เชิงเหตุผลเชิงพื้นที่เกี่ยวกับการปรับปรุงบ้าน, และการสร้างแอป visionOS ตั้งแต่ต้นจนจบ (ไฟล์ Swift 12 ไฟล์, 1,876 บรรทัด, "BUILD SUCCEEDED") จงมองสิ่งเหล่านี้เป็นการสาธิต ไม่ใช่การวัดประสิทธิภาพ — แต่มันคือการสาธิตสิ่งหนึ่งที่เฉพาะเจาะจง: โมเดลที่จดจ่อกับเป้าหมายเดียวและทำหลายขั้นตอนโดยไม่หลุดประเด็น ซึ่งเป็นความสามารถที่ตลาดเอเจนต์ขาดแคลนมากที่สุดในขณะนี้

ค่าใช้จ่าย การโฮสต์ด้วยตนเอง และวิธีลองใช้

น้ำหนักเปิดนั้นฟรี; ต้นทุนของ {{1}}dots3-note preview{{/1}} อยู่ที่ว่าคุณให้บริการมันที่ใด สูตรอ้างอิง vLLM สำหรับ checkpoint แบบ FP8 รันบน NVIDIA H100 จำนวน 8 ตัว ด้วย tensor parallelism 8 และ expert parallelism 8 — ซึ่งเป็นเส้นงบประมาณที่แท้จริง ไม่ใช่โมเดลสำหรับแล็ปท็อป ทีมที่มีฮาร์ดแวร์ระดับนั้นจะได้ทั้งสแตก รวมถึง speculative decoding แบบ 3 โทเคน MTP และตัวแยกการเรียกใช้เครื่องมือของ {{2}}dots{{/2}} ที่มาพร้อมกับรันไทม์ สำหรับคนอื่นๆ ทั้งหมด มันจะเป็นแบบ hosted: พอร์ทัล API ของผู้จำหน่ายเปิดให้บริการแล้ว และ hosted preview endpoints ก็เริ่มใช้งานบนแพลตฟอร์มบุคคลที่สามในวันเดียวกันกับที่ปล่อยน้ำหนักโมเดล — 14 สิงหาคม ระดับพรีวิวถูกระบุราคาไว้ที่ $0 ต่อโทเคนบนแพลตฟอร์มที่ให้บริการ โดยอ้างอิงจากรายการของแพลตฟอร์มเหล่านั้นเอง ไม่ใช่หน้าประกาศราคาของผู้จำหน่าย ดังนั้นต้นทุนเริ่มต้นในการลองใช้ {{3}}dots3-note preview{{/3}} ในการผลิตจริงขณะนี้จึงเป็นศูนย์ในทางปฏิบัติ ตราบใดที่แท็กพรีวิวยังคงอยู่

สำหรับนักพัฒนา ข้อโต้แย้งเมื่อสองสัปดาห์ก่อนเกี่ยวกับการเดิมพันกับโมเดลที่ยังไม่ผ่านการพิสูจน์ในราคาถูก บัดนี้กลายเป็นข้อโต้แย้งเกี่ยวกับการประเมินโมเดลที่เพิ่งปล่อยออกมา — รูปแบบเหมือนกันทุกประการ ชี้ทราฟิกส่วนหนึ่งไปยังโมเดลใหม่ โดยมีระบบ failover อัตโนมัติคอยรองรับ เพื่อให้โหมดความล้มเหลวที่ไม่คาดคิดทำให้เส้นทางทดสอบล่มแทนที่จะเป็นเส้นทางจริง (production) นั่นคือสิ่งที่เราเตอร์มีไว้สำหรับ และมันคือเวอร์ชันที่ตรงไปตรงมาของข้อเสนอ: {{1}}dots3-note preview{{/1}} ยังไม่ได้ถูกโฮสต์บน {{2}}OrcaRouter{{/2}} ณ เวลาที่เขียนบทความนี้ และไม่มีใครควรแสร้งว่าเป็นอย่างอื่น แต่แนวทางการจัดเส้นทางที่เราเขียนถึงในบทความเรื่องการรั่วไหลจะนำมาใช้ได้ในวันที่มันถูกโฮสต์จริง — API เดียวที่สามารถเข้าถึงโมเดลใหม่ได้ทันทีที่ผู้ให้บริการโฮสต์มัน โดยส่งผ่านราคารายการของผู้ให้บริการด้วยมาร์กอัป 0% และกำหนดค่า failover ในแต่ละคำขอ ในระหว่างนี้ โมเดลตระกูล DeepSeek ที่โมเดลนี้มีความเกี่ยวข้องเชิงโครงสร้างด้วยนั้นสามารถเรียกใช้ด้วยวิธีนั้นได้แล้ว: {{3}}DeepSeek V4 Flash{{/3}} และ {{4}}DeepSeek V4 Pro{{/4}} ต่างก็ทำงานอยู่เบื้องหลังคีย์เดียว โดยมีราคาแบบส่งผ่านเดียวกันและ failover ในแต่ละคำขอ — ซึ่งเป็นจุดอ้างอิงที่สมเหตุสมผลสำหรับการตัดสินว่าโมเดลเอเจนต์ที่มีพารามิเตอร์แอคทีฟ 16B อย่าง {{5}}dots3-note preview{{/5}} จริงๆ แล้วทำงานอย่างไรในสภาพแวดล้อมการผลิตจริง

Screenshot of the OrcaRouter model page for DeepSeek V4 Flash (www.orcarouter.ai/models/deepseek/deepseek-v4-flash-0731), the released DeepSeek-generation model whose MLA + sparse-attention family dots-note-3.0 is structurally related to.

สิ่งที่ควรดูต่อไป

สี่สิ่ง เรียงตามลำดับคร่าวๆ ว่ามันจะเปลี่ยนแปลงภาพรวมได้มากน้อยแค่ไหน:

• การทำซ้ำอย่างอิสระของผล 42/42 น้ำหนักถูกปล่อยออกมาแล้ว; การรันซ้ำโดยบุคคลที่สามอย่างจริงจังครั้งแรกของผล IMO — หรือชุดประเมินที่เป็นกลางที่ขัดแย้งกับมัน — คือจุดข้อมูลที่มีมูลค่าสูงสุดเพียงจุดเดียวที่รีลีสนี้สามารถสร้างได้ จนกว่าจะถึงตอนนั้น ผล 42/42 ยังคงเป็นคะแนนที่ได้รับการให้เกรดอย่างเป็นทางการและรายงานโดยบริษัท

• พี่น้องที่ใหญ่กว่าคือ jazz และ aria dots3-note พรีวิวคือการเปิดตัวสาธารณะครั้งแรก และตามที่บริษัทกล่าว มันคือสมาชิกที่เบาที่สุดของตระกูล dots3 หาก 280B รวม / 16B แอ็กทีฟคือรุ่นเล็ก รุ่นใหญ่สองรุ่นนั้นคือจุดที่คำกล่าวอ้างเรื่องความเป็นแนวหน้าจะถูกทดสอบจริง

• ข้อจำกัดของโฮสต์และเงื่อนไขการแสดงตัวอย่าง ขณะนี้ราคาเปิดเผยต่อสาธารณะแล้ว — ระดับแสดงตัวอย่างฟรีต่อโทเคนบนแพลตฟอร์มที่ให้บริการ — แต่การจำกัดอัตราการใช้งานและไม่ว่าป้ายแสดงตัวอย่างจะมาพร้อมเงื่อนไขพิเศษหรือไม่ จะยังคงเป็นตัวตัดสินว่าใครจะโฮสต์เองเทียบกับใครจะเรียกใช้

• อันดับที่มันไปอยู่บนลีดเดอร์บอร์ดอิสระ ข้อกล่าวอ้างเรื่อง ARC-AGI และชุดทดสอบเอเจนต์ที่ผู้จำหน่ายรายงานไว้ จำเป็นต้องมีการวัดผลที่เป็นกลางจึงจะกลายเป็นข้อเท็จจริงที่ใช้ได้ — นั่นคือกระบวนการเดียวกับที่แยก hype ออกจากความจริงในการเปิดตัวแบบโอเพนทุกครั้งในปีนี้

เมื่อเราครอบคลุมข่าวการรั่วไหลในเดือนสิงหาคม บทสรุปที่ตรงไปตรงมานั้นสั้น: สถาปัตยกรรมจริง บันทึกจริง ไม่มีน้ำหนัก ไม่มีวันที่ สามในสี่คุณสมบัติเหล่านั้นหายไปแล้ว สถาปัตยกรรมเปิดเผยต่อสาธารณะ บันทึกถูกแนบมากับ checkpoint ที่ดาวน์โหลดได้ และวันนั้นมาถึงแล้ว สิ่งที่เหลืออยู่คือการตรวจสอบ — และตอนนี้ที่ dots3-note preview สามารถรันได้แทนที่จะแค่อ่านเกี่ยวกับมัน คำตอบว่า Xiaohongshu สร้างโมเดลเอเจนต์ตามที่อ้างหรือไม่ จะมาจากใครก็ตามที่มี H100 แปดตัวและชุดทดสอบมาตรฐาน ไม่ใช่จาก pull request

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube