สร้างการ์ดหัวเรื่องหลักสำหรับบทความเกี่ยวกับ K-EXAONE-2.0-750B-A37B-DSpark ข้อความหัวเรื่องขนาดใหญ่คือ 'K-EXAONE-2.0-750B-A37B-DSpark' พร้อมป้ายแบบแคปซูลที่อ่านว่า 'VLLM PR · LEAK / สิ่งที่เรารู้จนถึงตอนนี้' คำบรรยายคือ 'MoE เกาหลี 750B ของ LG กำลังได้รับ DSpark ของ DeepSeek ใน vLLM' และชิปสเปกสามรายการ: '750B รวม · 37B แอ็กทีฟ', 'ดราฟต์เลเยอร์ DSpark 5 ชั้น', 'คอนเท็กซ์ 262,144 โทเคน' ในสไตล์ B2B สีน้ำเงิน-ไซอันของแบรนด์ พร้อมลวดลายโหนดเล็ก ๆ จากโมเดลดราฟต์ไปยังโมเดลใหญ่ และโลโก้ OrcaRouter วางประกอบที่มุมขวาล่าง
Guides & Insights

K-EXAONE-2.0-750B-A37B-DSpark: LG เตรียมนำโมเดล MoE ภาษาเกาหลีขนาด 750B สู่ vLLM

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 9 สิงหาคม 2026 มีการเปิด pull request ในรีโพซิทอรี vLLM เพื่อเพิ่ม K-EXAONE-2.0-750B-A37B-DSpark ซึ่งเป็นตัวแปร speculative-decoding ของโมเดลเรือธงภาษาเกาหลีขนาด 750 พันล้านพารามิเตอร์ของ LG AI Research สี่วันต่อมา ในวันที่ 13 สิงหาคม PR ที่สองซึ่งเป็นพื้นฐานมากกว่าได้ทำให้การรั่วไหลเป็นรูปธรรม: ตอนนี้ vLLM มีเส้นทางคอนฟิก DSparkDraftModel ทั่วไป ซึ่งแมปเช็คพอยต์ Hugging Face ใดก็ตามที่ระบุ architectures=DSparkDraftModel พร้อม model_type=qw​en​3 ไปยัง Qw​en3DSparkModel ที่รู้จัก พร้อมกับแผนการทดสอบที่จริง ๆ แล้วเสิร์ฟดราฟเตอร์ RadixArk Qw​en​3.8-2.4T-A95B-DSpark ผ่านเมธอด dspark spec โมเดลพื้นฐาน K-EXAONE-2.0-750B-A37B เปิดตัวเมื่อวันที่ 31 กรกฎาคมภายใต้ Apache 2.0 และในตอนเปิดตัว vLLM สามารถเสิร์ฟมันได้ด้วยเมธอด MTP draft แต่ไม่ใช่กับ DSpark — ซึ่งเป็นดราฟเตอร์ที่ LG เปิดตัวด้วยและอ้างว่าช่วยเพิ่มความเร็วในการถอดรหัส 3–5 เท่า DSpark เองเป็นเมธอดของ DeepSeek ซึ่งเป็นดราฟเตอร์แบบ semi-autoregressive ตัวเดียวกับที่ทำงานบน DeepSeek-V4-Pro-DSpark และ DeepSeek-V4-Flash-DSpark ดังนั้น PR ทั้งสองรวมกันจึงเป็นสัญญาณที่ชัดเจนที่สุดว่า speculative-decoding stack ของ DeepSeek กำลังกลายเป็นค่าเริ่มต้นสำหรับ open-weights

นี่คือบทความแนว “สิ่งที่เรารู้จนถึงตอนนี้” ไม่ใช่เรื่องเล่าการเปิดตัว พูลรีเควสต์ทั้งสองยังเปิดอยู่และยังไม่ได้รวมเข้ากัน ตัวเช็กพอยต์ DSpark ยังไม่มีเกณฑ์วัดอิสระ และตัวเลขความเร็วที่ LG อ้างนั้นเป็นเพียงคำกล่าวของผู้ขาย ทุกอย่างด้านล่างถูกระบุไว้เช่นนั้น สิ่งที่เป็นจริงในวันนี้: น้ำหนักโมเดลอยู่บน Hugging Face โมเดลฐานวางออกจำหน่ายแล้ว ดีโค้ดเดอร์แบบ spec-decoder ของ vLLM สำหรับ DSpark ให้บริการเช็กพอยต์ของ Deep​Seek และ Kim​i อยู่แล้ว และเส้นทางคอนฟิกทั่วไปที่จะทำให้ DSpark drafter จากบุคคลที่สามโหลดขึ้นมาได้ ซึ่งเป็นชิ้นส่วนที่การรั่วไหลครั้งนี้รอคอย — ตอนนี้อยู่ในพูลรีเควสต์สาธารณะ โดยผ่านการทดสอบแล้วแต่ยังไม่ได้เผยแพร่

เวอร์ชันสั้น

• PR #51558 เปิดเมื่อวันที่ 9 สิงหาคม 2026 เพิ่ม K-EXAONE-2.0-750B-A37B-DSpark ลงใน vLLM โดยยังคงเปิดอยู่และยังไม่มีการอนุมัติ

• PR #52197 เปิดเมื่อวันที่ 13 สิงหาคม 2026 เพิ่มการรองรับการกำหนดค่า DSparkDraftModel ทั่วไป — architectures=DSparkDraftModel พร้อม model_type=qw​en​3 ซึ่งปรับให้เป็นมาตรฐานเป็น Qw​en3DSparkModel — และแผนการทดสอบจะรัน drafter RadixArk Qw​en​3.8-2.4T-A95B-DSpark ด้วยเมธอด dspark spec และ spec tokens เจ็ดตัว ยังเปิดอยู่และยังไม่ได้ merge เช่นกัน

• DSpark เป็น drafter ในตระกูล EAGLE ที่ Deep​Seek เปิดซอร์ส และมาพร้อมกับ Deep​Seek-V4-Pro-DSpark และ Deep​Seek-V4-Flash-DSpark; LG เป็นการนำไปใช้ที่โดดเด่นที่สุดโดยห้องแล็บอื่นจนถึงตอนนี้ และ RadixArk's Qw​en​3.8 drafter ก็เป็นอีกหนึ่งตัวที่พัฒนาอิสระเป็นลำดับที่สอง

• ตัวแปร DSpark คือโมเดล MoE ขนาด 750B จำนวน 78 ชั้น บวกกับเลเยอร์ draft เพิ่มอีก 5 ชั้น; ทาง LG อ้างว่า DSpark และ MTP ต่างให้ความเร็วในการถอดรหัสเพิ่มขึ้นประมาณ 3–5 เท่า โดยมุ่งเป้าไปที่เวิร์กโหลดแบบ agentic ที่ใช้ระยะเวลายาวนาน

• ในการเปิดตัวครั้งแรก vLLM รองรับ MTP สำหรับ K-EXAONE 2.0 แต่ไม่รองรับ DSpark; PR เฉพาะโมเดลและเส้นทาง config ทั่วไปคือจุดที่การรองรับ DSpark จะเกิดขึ้น

• ไม่มีผู้ให้บริการรายใดโฮสต์ K-EXAONE 2.0 checkpoint ในปัจจุบัน และทุก benchmark บนการ์ดเป็นของ LG เอง

pull requests คืออะไร (และไม่ใช่อะไร)

vLLM PR #51558, "[Model] Add K-EXAONE-2.0-750B-A37B-DSpark" ถูกเปิดโดย lkm2835 ซึ่งเป็นผู้มีส่วนร่วมคนเดียวกันกับที่ทำการรองรับ K-EXAONE เวอร์ชันก่อนหน้าใน vLLM (#50524 สำหรับโมเดลพื้นฐาน) และใน SGLang (#33648) เป็น fork PR ที่ติดแท็ก new-model มีการขอรีวิวจากเจ้าของโค้ด vLLM และยังไม่ได้รับการอนุมัติใด ๆ คำอธิบายมีสามบรรทัด: เพิ่มการรองรับ DSpark checkpoint ที่ "พัฒนาโดย LG AI Research" เชื่อมโยงโมเดลการ์ด Hugging Face และรายงานทางเทคนิค K-EXAONE 2.0 (arXiv 2608.04505) และอ้างอิงงาน vLLM ก่อนหน้าใน #50524

Screenshot of vLLM pull request #51558, '[Model] Add K-EXAONE-2.0-750B-A37B-DSpark', captured August 9, 2026. It shows the PR opened by lkm2835 targeting the add-k-exaone2-dspark branch, the description noting the model was 'developed by LG AI Research' with links to the Hugging Face model card and the K-EXAONE 2.0 technical report (arXiv 2608.04505), the open review state with 'At least 1 approving review is required to merge', code-owner reviewers, and the new-model label. English UI.

PR เมื่อวันที่ 13 สิงหาคมมีความแตกต่างในเชิงลักษณะ #52197 "Support DSpark configs with architectures=DSparkDraftModel + model_type=qw​en​3" เพิ่มเลเยอร์การทำให้เป็นมาตรฐานทั่วไป: จุดตรวจสอบแบบร่างของ Hugging Face ที่ประกาศตัวเองเป็น DSparkDraftModel บนประเภทโมเดล qw​en​3 จะถูกแมปใหม่เป็น Qw​en3DSparkModel ที่ตัวถอดรหัสสเปกเดิมของ vLLM สามารถโหลดได้ โมเดลอ้างอิงในแผนการทดสอบคือ RadixArk/Qw​en​3.8-2.4T-A95B-DSpark — ตัวคาดเดาสเปก DSpark สำหรับเป้าหมายระดับสูงสุด Qw​en​3.8-2.4T-A95B — ให้บริการด้วยเมธอดสเปก dspark และหน้าต่างสเปกเจ็ดโทเคน ข้อความคอมมิตคือแนวคิดทั้งหมด: "architectures=DSparkDraftModel+model_type=qw​en​3" ประเด็นของการเปลี่ยนแปลงนี้คือ ตัวร่าง DSpark จากบุคคลที่สามควรโหลดได้ผ่านการกำหนดค่า แทนที่จะต้องใช้โค้ดเฉพาะต่อโมเดล ซึ่งเป็นวิธีที่จุดตรวจสอบ DSpark ที่รองรับทุกตัวถูกเชื่อมต่อในปัจจุบัน มันเปิดอยู่และยังไม่ได้รวม เช่นเดียวกับ #51558

อ่านสถานะนั้นตามตัวอักษร "กำลังเพิ่มการสนับสนุน" ไม่ใช่ "พร้อมใช้งาน": จนกว่า PR ตัวใดตัวหนึ่งจะถูก merge และปล่อยในรีลีส บิลด์ vLLM มาตรฐานก็ยังโหลด DSpark variant ไม่ได้ การ์ดโมเดลเองกล่าวว่าการให้บริการ K-EXAONE 2.0 ด้วย DSpark ไม่ได้รับการสนับสนุนบน vLLM ในขณะนี้ ซึ่งใช้ MTP แทน PR ทั้งสองนี้คือขั้นตอนที่จะเปลี่ยนประโยคนั้น — ถ้าและเมื่อมันถูกรวมเข้าจริง

ทำไม DSpark ถึงเป็นเรื่องจริงที่นี่

ชื่อโมเดลนี้บอกอะไรได้หลายอย่าง "A37B" หมายถึงพารามิเตอร์ที่ใช้งานจริง 37 พันล้านตัวต่อโทเคน ส่วน "DSpark" คือดราฟเตอร์แบบ speculative-decoding ที่ Deep​Seek เปิดตัวในปีนี้: โมเดลดราฟต์ตระกูล EAGLE แบบกึ่งออโตรีเกรสซีฟ (semi-autoregressive) ที่เสนอโทเคนเป็นบล็อกในครั้งเดียว แล้วให้โมเดลเป้าหมายตรวจสอบความถูกต้อง ทำให้คุณภาพเอาต์พุตไม่เปลี่ยนแปลง ในขณะที่การสร้างข้อความเร็วขึ้น Deep​Seek เปิดซอร์สโมเดลดังกล่าว และมาพร้อมเช็คพอยต์ Deep​Seek-V4-Pro-DSpark และ Deep​Seek-V4-Flash-DSpark ของตัวเอง โดยชุมชนรายงานความเร็วที่เพิ่มขึ้นในช่วง 60–85% สำหรับ Flash และ 57–78% สำหรับ Pro เมื่อเทียบกับพื้นฐาน MTP แบบโทเคนเดียว

สิ่งที่ PR ใหม่ทำให้เห็นชัดคือ การสนับสนุน DSpark ใน vLLM ไม่เคยเป็นประเด็นที่ยังไม่มีคำตอบ เอกสารของ vLLM เองก็ระบุโมดูล DSpark สำหรับเช็คพอยต์ Deep​Seek-V4, Kimi K3 และ Gem​ma​4 อยู่แล้ว และทีมงานก็เขียนอธิบายการออกแบบไว้ในโพสต์วิศวกรรมเมื่อเดือนกรกฎาคม อย่างไรก็ตาม การผสานรวมแต่ละรายการเหล่านั้นถูกเขียนเชื่อมต่อด้วยมือทั้งหมด — เป็นรายการเช็คพอยต์ที่ได้รับการรับรอง ไม่ใช่เส้นทางที่ใครก็ใช้ได้ เช็คพอยต์ K-EXAONE ไม่ได้อยู่ในรายการนั้น #52197 คือความพยายามที่จะทำให้เส้นทางนี้เป็นแบบทั่วไป: การแมปคอนฟิกหนึ่งชุด (DSparkDraftModel บวกกับ qw​en​3) แทนที่จะเป็นคลาสโมเดลเฉพาะอีกคลาสหนึ่ง และใช้ตัวดราฟต์จากบุคคลที่สามเป็นกรณีทดสอบอ้างอิง แทนที่จะเป็นโมเดล Deep​Seek นั่นคือเหตุผลที่เรื่องราวของเช็คพอยต์ดราฟต์ที่หลุดออกมาจึงเป็นเรื่องราวของโครงสร้างพื้นฐานจริง ๆ

K-EXAONE-2.0-750B-A37B-DSpark ยังคงชั้น 78 ชั้นของโมเดลฐานและเพิ่มชั้นร่าง DSpark อีกห้าชั้น และการ์ดโมเดลของ LG อ้างว่าทั้ง DSpark และ MTP เร่งการสร้างเอาต์พุตได้ประมาณ 3–5 เท่า — ตัวเลขของบริษัทเอง ซึ่งมุ่งเป้าไปที่ "ภาระงานระยะยาว เช่น งานแบบเอเจนต์" ซึ่งความหน่วงของการถอดรหัสเป็นคอขวด สองสิ่งตามมา ประการแรก การถอดรหัสแบบคาดเดากำลังกลายเป็นคุณสมบัติระดับหนึ่งของโมเดลแนวหน้าที่เป็นโอเพนซอร์ส แทนที่จะเป็นเทคนิคการให้บริการที่คุณเพิ่มเติมทีหลัง ประการที่สอง สแตกการร่างของ Deep​Seek กำลังกลายเป็นค่าเริ่มต้น — ซึ่งเป็นเหตุผลว่าทำไมเรือธงอธิปไตยที่ได้รับการสนับสนุนจากรัฐบาลเกาหลีใต้ที่มาพร้อมกับมันจึงมีความสำคัญเกินกว่าการรายงานข่าว "โมเดลใหม่" ทั่วไป

โมเดลที่อยู่เบื้องหลัง PR

K-EXAONE-2.0-750B-A37B-DSpark เป็นเวอร์ชันหนึ่งของ K-EXAONE 2.0 ภาคต่อของไลน์ K-EXAONE ขนาด 236B ของ LG และเป็นโมเดลพื้นฐานที่พัฒนาในประเทศที่ใหญ่ที่สุดของเกาหลีใต้ สร้างขึ้นภายใต้โครงการซอฟต์แวร์ AI แบบอธิปไตยของรัฐบาล โมเดลพื้นฐาน — พารามิเตอร์รวม 750B พารามิเตอร์แอ็กทีฟ 37B Mixture-of-Experts ที่มีผู้เชี่ยวชาญ 256 ตัวและทำงานพร้อมกัน 8 ตัวต่อโทเคน หน้าต่างบริบท 262,144 โทเคน รองรับสิบภาษา ใบอนุญาต Apache 2.0 — เผยแพร่บน Hugging Face เมื่อวันที่ 31 กรกฎาคม 2026 โดยอัปไซเคิลจากรุ่นก่อนหน้าขนาด 236B แทนที่จะฝึกจากศูนย์

Screenshot of the Hugging Face model card for LGAI-EXAONE/K-EXAONE-2.0-750B-A37B-DSpark, captured August 9, 2026. It shows a 751B-parameter Mixture-of-Experts model under Apache 2.0 with F32/BF16 tensors, ten languages, 659 downloads in the last month, the notice that the model is not deployed by any inference provider, and a link to the K-EXAONE 2.0 technical report. English UI.

ค่าเฉลี่ยการทดสอบมาตรฐานของ LG เอง (24 การทดสอบ, 70.1 โดยรวม) แสดงรูปร่างที่คาดหวังสำหรับโมเดลอธิปไตยของเกาหลี: ผลลัพธ์ที่รายงานอย่างแข็งแกร่งในการดึงข้อมูลบริบทยาว, ความปลอดภัยทางสังคมของเกาหลี, และการเขียนโค้ดแบบเอเจนต์ พร้อมกับตัวเลขที่ตามหลัง Qw​en​3.5 ของ Alibaba ในการให้เหตุผลทั่วไป (เช่น 83.5 เทียบกับ 89.8 บน MMLU-Pro) ยังไม่มีสิ่งใดได้รับการตรวจสอบอย่างเป็นอิสระ ตัวแปร DSpark ไม่ได้เปลี่ยนคะแนนเหล่านั้นเลย — มันเป็นสิ่งที่ใช้สำหรับให้บริการ, วิธีที่เร็วกว่าในการรันโมเดลเดียวกัน — ซึ่งเป็นเหตุผลว่าทำไมมันจึงปรากฏใน pull requests ของเฟรมเวิร์กการอนุมานมากกว่าการประกาศ

ความเป็นจริงเบื้องหลังการให้บริการโมเดล MoE ขนาด 750B

นี่คือจุดที่การรองรับ DSpark มีความสำคัญจริง ๆ K-EXAONE-2.0-750B-A37B-DSpark เป็นเช็คพอยต์ที่มีพารามิเตอร์ 751 พันล้านในรูปแบบ BF16/F32 และคำแนะนำของ LG คือต้องใช้อย่างน้อยสองโหนดที่มี NVIDIA H200 GPU แปดตัวต่อโหนด (รวม 16 GPU, tensor-parallel 16) ในระดับขนาดนั้น ปริมาณงาน decode คือทุกสิ่งทุกอย่าง — โทเคนต่อวินาที และต้นทุนของเทิร์นแบบ agentic ที่ยาวนาน — และนั่นคือสิ่งที่ speculative decoding โจมตีอย่างแม่นยำ ความเร็ว decode ที่เพิ่มขึ้น 3–5 เท่า หากยังคงเป็นจริงนอกกรอบการทดสอบของ LG คือความแตกต่างระหว่างคลัสเตอร์ H200 ที่คุ้มค่าทางเศรษฐกิจหรือไม่ LG ยังบันทึกปัญหา generation collapse บน GPU B200 ซึ่งต้องใช้วิธีแก้ไขชั่วคราว --disable-prefill-cuda-graph จนกว่าจะได้รับการแก้ไข — เป็นเครื่องเตือนใจว่านี่คือการเสิร์ฟที่ล้ำสมัย ไม่ใช่ระบบพร้อมใช้งานทันที

Generated single-model scoreboard for K-EXAONE-2.0-750B-A37B-DSpark: Parameters 750B total / 37B active; Draft layers 5 DSpark on 78 main; Context 262,144 tokens; Spec decode DSpark + MTP (3-5x, LG-claimed); License Apache 2.0; Independent score none yet. Footer reads 'All figures LG AI Research model card, August 2026 (vendor-reported). vLLM support pending PR #51558.' OrcaRouter logo composited bottom-right.

ราคาเท่าไหร่ และคุณจะลองใช้มันจริงๆ ได้อย่างไร

ไม่มี API ใดให้บริการ K-EXAONE 2.0 ในวันนี้ การ์ด Hugging Face สำหรับเวอร์ชัน DSpark ยังคงอ่านว่า "โมเดลนี้ไม่ได้ถูกปรับใช้โดยผู้ให้บริการอินเฟอเรนซ์ใดๆ" และฟุตพรินต์ 16×H200 หมายความว่ามันจะเข้าถึงโฮสต์ API ได้ก็ต่อเมื่อมีคนที่มีฮาร์ดแวร์นั้นตัดสินใจโฮสต์มัน นั่นคือจุดเสียดทานที่แท้จริง: ขอบเขตของ open-weights กลายเป็นปัญหาด้านการให้บริการมากขึ้น ไม่ใช่ปัญหาด้านความพร้อมใช้งาน

เมื่อผู้ให้บริการนำมาใช้จริง ความเร็วที่เพิ่มขึ้นจากการถอดรหัสเชิงคาดการณ์ (speculative decoding) จะสะท้อนอยู่ในราคาต่อโทเคน และต้นทุนในการสลับมาลองใช้ควรใกล้เป็นศูนย์ หากแอปพลิเคชันของคุณไม่ยึดติดกับโมเดลเฉพาะอยู่แล้ว บน OrcaRouter — เอนด์พอยต์ที่เข้ากันได้กับ OpenAI เพียงหนึ่งเดียวที่ครอบคลุมโมเดลกว่า 200 รายการ โดยส่งผ่านราคารายการของผู้ให้บริการที่มาร์กอัป 0% — โมเดลที่ไปอยู่บนผู้ให้บริการต้นทางรายใดก็ตามจะกลายเป็นเพียงการเปลี่ยนเส้นทาง (routing) แทนที่จะเป็นการบูรณาการใหม่ และการเฟลโอเวอร์อัตโนมัติทำให้โมเดล MoE ขนาด 750B ใหม่เอี่ยมที่กลับกลายเป็นช้าหรือไม่เสถียร ถอยกลับไปใช้โมเดลที่รู้จักดีโดยไม่มีเหตุการณ์ผิดปกติเกิดขึ้น เพื่อให้ชัดเจน: OrcaRouter ไม่ได้โฮสต์ K-EXAONE-2.0-750B-A37B-DSpark ในปัจจุบัน และ API อื่นใดที่เราหาได้ก็ไม่ได้โฮสต์เช่นกัน จุดประสงค์ของเลเยอร์การกำหนดเส้นทางคือการเตรียมพร้อมไว้สำหรับวันที่หนึ่งในนั้นนำมาใช้

สิ่งที่เรากำลังดู

• PR ทั้งสองที่กำลังจะ merge กัน #51558 (เฉพาะโมเดล) และ #52197 (คอนฟิกทั่วไป) ต่างก็เปิดอยู่และยังไม่มีการอนุมัติ การ merge แล้ว release ต่างหากที่จะเปลี่ยน "DSpark support" จาก pull requests ให้เป็นแฟล็กที่คุณสามารถส่งผ่านได้จริง

• ขอบเขตของพาธทั่วไป หาก #52197 ถูกผสาน โมเดล DSparkDraftModel ชนิด qwen3 บน Hugging Face จะสามารถโหลดได้โดยการกำหนดค่า — ความแตกต่างระหว่าง DSpark ที่เป็นรายการของเช็คพอยต์ที่ได้รับการรับรอง กับ DSpark ที่เป็นมาตรฐานเปิด

• คะแนนอิสระแรก ทุกเกณฑ์วัดบนการ์ดดำเนินการโดย LG จุดข้อมูลแรกจาก Artificial Analysis หรือ arena บน MoE เกาหลีขนาด 750B จะเป็นตัวเลขแรกที่ไม่ได้พิมพ์โดยผู้จำหน่าย

• DSpark เหนือกว่า Deep​Seek ตอนนี้ LG และ RadixArk ต่างก็เป็นผู้เปลี่ยนวิธีแบบร่างของ Deep​Seek ให้เป็นผลิตภัณฑ์อย่างอิสระสองราย และแนวทาง vLLM ทั่วไปก็เป็นสัญญาณที่สามที่บ่งบอกว่าสแตกกำลังรวมเป็นหนึ่ง

• การให้บริการแบบ quantized LG จัดส่ง checkpoint รุ่น FP8 และ NVFP4 ของโมเดลพื้นฐาน; ตัวแปร DSpark ที่ถูก quantized ซึ่งสามารถทำงานบน GPU น้อยลงจะเปลี่ยนแปลงความคุ้มทุนได้เร็วกว่า benchmark ใดๆ

คำถามที่พบบ่อย

K-EXAONE-2.0-750B-A37B-DSpark เปิดตัวแล้วหรือยัง?

น้ำหนักของโมเดลอยู่บน Hugging Face ภายใต้ Apache 2.0 แต่นี่ไม่ใช่เรื่องราวการเปิดตัว: การรองรับ vLLM คือ pull request ที่เปิดอยู่และยังไม่ได้รวมเข้าสองรายการ (#51558 และ #52197) ตัวเลขความเร็วที่เพิ่มขึ้นเป็นของ LG เอง และไม่มีผู้ให้บริการรายใดโฮสต์โมเดลนี้ สิ่งที่ "ยืนยัน" หมายถึงในที่นี้คือเส้นทางให้บริการ (serving path) — การรองรับการกำหนดค่า DSparkDraftModel ทั่วไปตอนนี้มีอยู่ใน PR สาธารณะพร้อมแผนการทดสอบที่รันได้ — ไม่ใช่ว่าบิลด์ vLLM ที่เผยแพร่แล้วจะให้บริการมันได้ในตอนนี้

K-EXAONE-2.0-750B-A37B กับ DSpark variant ต่างกันอย่างไร?

78 เลเยอร์ของโมเดลฐาน บวกกับ DSpark draft layers อีก 5 ชั้นสำหรับ speculative decoding — น้ำหนักข้างใต้เดียวกัน เกณฑ์มาตรฐานเดียวกัน และเป็น serving artifact ที่ถอดรหัสได้เร็วขึ้น แทนที่จะเป็นโมเดลที่แตกต่างออกไป

DSpark เป็นของ LG หรือของ Deep​Seek?

DSpark คือวิธีการ speculative decoding แบบโอเพนซอร์สของ Deep​Seek ซึ่งมาพร้อมกับ Deep​Seek-V4-Pro-DSpark และ Deep​Seek-V4-Flash-DSpark; LG เป็นผู้ที่นำไปใช้ที่มีชื่อเสียงที่สุดในตอนนี้ และ Qw​en​3.8-2.4T-A95B-DSpark ของ RadixArk เป็นดราฟเตอร์อิสระตัวที่สองที่สร้างขึ้นจากวิธีการเดียวกัน การ์ดโมเดลของ LG อ้างว่ามีช่วงการเร่งความเร็ว 3–5× เท่าเท่ากัน

ฉันสามารถรัน K-EXAONE-2.0-750B-A37B-DSpark บนฮาร์ดแวร์ของตัวเองได้ในตอนนี้หรือไม่

โดยการโฮสต์ด้วยตนเองเท่านั้น: คำแนะนำของ LG คือต้องใช้ NVIDIA H200 GPU อย่างน้อยสิบหกตัว และเวอร์ชันมาตรฐานของ vLLM, SGLang, และ Transformers ยังคงต้องใช้ fork ที่ยังไม่ได้รวม หรือเส้นทาง config ทั่วไปที่ยังรออยู่ เพื่อให้รู้จักสถาปัตยกรรมดังกล่าว การสนับสนุน DSparkDraftModel ใน #52197 เป็นสิ่งที่ใกล้เคียงกับเส้นทางร่วมมากที่สุด แต่ก็ยังเป็น pull request ที่เปิดอยู่

สิ่งที่ทำให้เรื่องนี้น่าติดตามไม่ใช่ตัว pull requests เอง — แต่เป็นสิ่งที่พวกมันส่งสัญญาณ โมเดลเรือธงอธิปไตยของเกาหลีใต้ที่มีพารามิเตอร์ 750 พันล้านตัวภายใต้ไลเซนส์ Apache-2.0 เลือกที่จะมาพร้อมกับ speculative-decoding stack ของ Deep​Seek บริษัทอินเฟอเรนซ์อิสระได้สร้าง DSpark drafter สำหรับ Qw​en​3.8 ระดับ max-class และ vLLM ตอบสนองด้วย generic config path แทนที่จะเป็น per-model patch นั่นคือวิธีที่ frontier open models กลายเป็นของจริง — ไม่ใช่ตอนที่ weights ถูกปล่อยลงมา แต่เป็นตอนที่ drafters ถูกรวมเข้าด้วยกัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube