การ์ดชื่อเรื่องที่เปรียบเทียบ Ling-3.0-flash-VL โมเดลภาษา-ภาพขนาด 124B พารามิเตอร์ ที่มี 5.5B พารามิเตอร์ทำงาน ภายใต้ MIT พร้อมดัชนี Intelligence Index อิสระที่ 25 และเส้นทางการให้บริการ NVIDIA CUDA กับ InternLumina U2 โมเดล diffusion แบบ multi-codebook ขนาด 16B พารามิเตอร์ ที่มี 1B พารามิเตอร์ทำงาน ภายใต้ Apache-2.0 ซึ่งเช็คพอยต์ที่เผยแพร่เพียงตัวเดียวได้รับการฝึกบน Ascend ครอบคลุมความเข้าใจพร้อมการสร้าง การแก้ไข และ 3D
Guides & Insights

Ling-3.0-flash-VL กับ InternLumina U2: ทั้งคู่เปิดตัวแล้ว แต่ใช้ซิลิคอนต่างกัน

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ทั้งสองโมเดลนี้ตอนนี้เป็นของจริง รันได้ และดาวน์โหลดได้แล้ว ซึ่งเมื่อสองสัปดาห์ก่อนยังไม่เป็นเช่นนั้น — และความแตกต่างระหว่างทั้งสองแทบไม่เกี่ยวข้องกับเบนช์มาร์กเลย Ling-3.0-flash-VLจากห้องแล็บ inclusionAI ของ Ant Group ได้อัปโหลดน้ำหนัก BF16 และ FP8 ขึ้น Hugging Face ระหว่างวันที่ 4 ถึง 8 กันยายน 2026 พร้อมเผยแพร่สูตรการให้บริการ SGLang และ vLLM ควบคู่กันไป และได้คะแนนอิสระ 25 จาก Artificial Analysis Intelligence Index v4.3 InternLumina U2จากทีม InternLM ของ Shanghai AI Laboratory ปล่อยโค้ดสำหรับการอนุมานก่อน จากนั้นจึงเผยแพร่น้ำหนักโมเดลที่ฝึกบน Ascendขึ้น Hugging Face เมื่อวันที่ 10 กันยายน — ไฟล์ safetensors เจ็ดชิ้นในโฟลเดอร์ย่อย ascend/ทำให้ที่เก็บข้อมูลมีไฟล์รวมทั้งหมดสิบหกไฟล์

ประเด็นคือweight drops ทั้งสองนั้นถูกสร้างขึ้นมาเพื่ออะไร เส้นทางที่เผยแพร่ของ Ling-3.0-flash-VL คือเส้นทาง CUDA ที่ทุกคนมีอยู่แล้ว: โหนดที่มีแปดตัวเร่งความเร็วรันบิลด์ FP8 และสแตกสำหรับเสิร์ฟเองก็เป็นตัวที่คุณใช้งานอยู่แล้ว เช็กพอยต์ที่เผยแพร่ของ InternLumina U2 คือเวอร์ชัน Ascend และ README ระบุชัดเจนว่าคุณดาวน์โหลดเช็กพอยต์ตัวไหนก็ได้ที่ตรงกับวิธีที่คุณวางแผนจะรัน inference — โดยเช็กพอยต์ที่เทรนด้วย NVIDIA ยังถูกระบุว่ากำลังจะมาในเร็ว ๆ นี้ สองโมเดลที่เปิดตัวในสัปดาห์เดียวกัน และมีเพียงหนึ่งในนั้นที่รันบนฮาร์ดแวร์ที่ทีมส่วนใหญ่มีอยู่ตรงหน้าอยู่แล้ว

การจัดกรอบใหม่แบบนี้ทำให้การเปรียบเทียบมีประโยชน์ขึ้น นี่ไม่ใช่ชิ้นงานแบบเปิดตัวจริงเทียบกับ vaporware อีกต่อไป และใครก็ตามที่ยังคงบรรยายว่า InternLumina U2 กำลังรอเวตส์อยู่นั้นกำลังอ้างอิงจาก README ที่เก่าไปหนึ่งสัปดาห์ มันเป็นชิ้นงานเกี่ยวกับการออกแบบ unified-visual สองแบบที่แตกต่างกันอย่างมาก ซึ่งมาสู่ระบบนิเวศซิลิคอนสองแบบที่ต่างกัน และเกี่ยวกับว่าส่วนใดของแต่ละการเปิดตัวที่เสร็จสมบูรณ์จริง

สิ่งที่แต่ละรุ่นเปิดตัวมีในตอนนี้

Ling-3.0-flash-VL เป็นโมเดล sparse mixture-of-experts ขนาด 124B พารามิเตอร์ ที่เปิดใช้งานพารามิเตอร์ราว 5.5B ต่อโทเคน บนโครงหลักแบบไฮบริด 42 เลเยอร์ที่สลับระหว่าง Kimi Delta Attention กับบล็อก gated MLA ในอัตราส่วน 5:1 ตัวเข้ารหัสภาพแบบความละเอียดอิสระและตัวฉาย MLP สองเลเยอร์ป้อนเข้าสู่โครงหลักนั้น โดยมี VideoRoPE จัดการตำแหน่งเชิงพื้นที่และเชิงเวลา โมเดลรับข้อความ รูปภาพ และวิดีโอ แล้วส่งคืนข้อความ ทั้งเวอร์ชัน BF16 (64 shard) และ FP8 (ประมาณ 126 GB โดยตั้งใจให้ vision tower อยู่ในความแม่นยำสูงกว่าน้ำหนัก expert) เผยแพร่สู่สาธารณะภายใต้สัญญาอนุญาต MIT และการเปิดตัวนี้สมบูรณ์พอที่ชุมชน benchmarking อิสระจะให้คะแนนได้ — 25 คะแนนบน Intelligence Index v4.3 อยู่อันดับ #2 จาก 64 ในกลุ่มขนาดเดียวกัน เทียบกับค่ามัธยฐานของกลุ่มที่ 8 สิ่งที่ยังไม่เปิดเผยคือราคาต่อโทเคนของโมเดลวิชัน และตัวอย่าง API ของมันมีตัวระบุ -rc1 ซึ่งทำให้ยังไม่ชัดเจนว่า checkpoint ที่ให้บริการตรงกับน้ำหนักที่เปิดให้ดาวน์โหลดหรือไม่

InternLumina U2 เป็น sparse mixture-of-experts ขนาด 16B พารามิเตอร์ ที่มีพารามิเตอร์ที่ทำงานจริงประมาณ 1B สร้างขึ้นบนแกนหลักของโมเดลภาษาแบบ diffusion ชื่อ LLaDA-2.0 MoE ครอบคลุมงาน 6 กลุ่มในโมเดลเดียว ได้แก่ การถาม-ตอบจากข้อความ การสร้างภาพจากข้อความ การทำความเข้าใจภาพ การแก้ไขภาพ การทำความเข้าใจวิดีโอ และการทำความเข้าใจ 3D โค้ดสำหรับการอนุมาน (inference) ของทั้งหมดนั้นเปิดเผยต่อสาธารณะอยู่บน main เช็กพอยต์ที่ฝึกบน Ascend เปิดเผยต่อสาธารณะแล้วบน Hugging Face สิ่งที่ยังค้างอยู่ ตาม roadmap ของที่เก็บโค้ดเอง ได้แก่ เช็กพอยต์ที่ฝึกบน NVIDIA โค้ดสำหรับการฝึก (ซึ่งเป็นที่เก็บโค้ดแยกต่างหาก) และรายงานทางเทคนิค roadmap ติ๊กถูกไปแล้วสี่ช่อง และเหลือช่องที่ยังไม่ปิดอีกสองช่อง — โค้ด inference น้ำหนัก Ascend และสแตกการฝึกและการอนุมานบน Ascend เสร็จแล้ว ส่วนโค้ดการฝึกและรายงานทางเทคนิคยังไม่เสร็จ

รายละเอียดในทางปฏิบัติหนึ่งอย่างอยู่ระหว่างสองย่อหน้านั้น การรันเส้นทางวิชันของ U2 ต้องใช้น้ำหนักโทเคไนเซอร์ AToken ที่ atoken_inference/checkpoints/atoken-sod.pt และไดรเวอร์ที่เผยแพร่แล้วคาดหวังไดเรกทอรีเช็กพอยต์แบบแยกที่เก็บโมเดลแอสเซตไว้ด้วยกัน โค้ดนี้มีอยู่จริงและติดตั้งกับ Python 3.11, PyTorch 2.6.0 และบนเส้นทาง CUDA ใช้ flash-attn 2.7.2 การรองรับ Ascend อยู่บนแบรนช์ ascend-npu-support แยกต่างหาก และต้องมี CANN พร้อมบิลด์ torch_npu ที่เข้ากันแทนชุดเครื่องมือ CUDA ไม่มีส่วนใดถูกซ่อน ทั้งหมดมีเอกสารกำกับ มันเป็นเพียงเส้นทางที่ยาวกว่าการ pip install และสตริงโมเดล

สองคำตอบสำหรับคำถามที่ว่า visual token คืออะไร

สถาปัตยกรรมทั้งสองแตกต่างกัน ณ จุดที่ลึกกว่าจำนวนพารามิเตอร์ และความแตกต่างนี้เองคือสิ่งที่น่าสนใจที่สุดของการนำสองสิ่งนี้มาวางเคียงข้างกัน

Ling-3.0-flash-VL คงไว้ซึ่งสัญญามาตรฐาน ภาพหนึ่งภาพจะกลายเป็นลำดับของโทเค็นผ่านวิชันเอนโคเดอร์และโปรเจกเตอร์ โทเค็นเหล่านั้นเข้าสู่ส่วนหลักของทรานส์ฟอร์มเมอร์ และทุกอย่างทำงานแบบออโตรีเกรสซีฟ ความใหม่ไม่ได้อยู่ที่ว่าวิชันถูกแทนค่าอย่างไร แต่อยู่ที่ความประหยัดในการทำงานของส่วนหลัก — พารามิเตอร์แอคทีฟ 5.5B ต่อโทเค็น จากทั้งหมด 124B ซึ่งเป็นเหตุผลทั้งหมดที่โมเดลนี้ปรากฏอยู่บนพรมแดนความฉลาดเทียบกับพารามิเตอร์แอคทีฟ VideoRoPE ให้การเข้ารหัสตำแหน่งเชิงพื้นที่และเชิงเวลาที่สอดคล้องกันชุดเดียว วิดีโอจึงไม่ต้องมีกลไกแยกต่างหาก

InternLumina U2 เปลี่ยนการแทนข้อมูลเอง โดยใช้ตัวตัดคำ AToken ของ Apple ซึ่งแต่ละตำแหน่งภาพถูกอธิบายด้วย โค้ดบุ๊กเสริมแปดชุด — พื้นผิวเฉพาะที่ ข้อความที่ฝัง เรขาคณิต และรายละเอียดความถี่สูง เป็นสตรีมแยกกัน แทนที่จะเป็นเวกเตอร์ที่ยุบรวมเป็นหนึ่งเดียว โค้ดบุ๊กแต่ละตัวเก็บ embedding ของตัวเองไว้ในขั้นตอนขาเข้า และ embedding ต่อตำแหน่งทั้งแปดจะถูกนำมาต่อกันและฉายลดลงเป็นโทเคนแกนหลักเพียงหนึ่งเดียว ในขั้นตอนขาออก การทำนายเป็นสิ่งที่ทีมเรียกว่า spatial-parallel, codebook-depth autoregressive: แบ็กโบนการแพร่จะขจัดสัญญาณรบกวนจากตำแหน่งเชิงพื้นที่ที่ถูกมาสก์หลายตำแหน่งพร้อมกัน จากนั้นหัวออโต้รีเกรสซีฟแบบหลายโค้ดบุ๊กจะทำนายรหัสทั้งแปดสำหรับแต่ละตำแหน่งตามลำดับ ความเข้าใจและการสร้างทำงานผ่านกลไกเดียวกัน — ซึ่งนั่นคือข้ออ้างที่แท้จริง ข้อโต้แย้งของทีมคือ โค้ดบุ๊กเดียวจำกัดปริมาณข้อมูลที่โทเคนภาพหนึ่งตัวสามารถบรรจุได้ ในขณะที่ไฮบริดแบบไม่ต่อเนื่อง-ต่อเนื่องแยกความเข้าใจและการสร้างออกเป็นรูปแบบการแทนและเส้นทางการถอดรหัสที่ต่างกัน และการไปสู่แบบไม่ต่อเนื่องเต็มรูปแบบด้วยโค้ดบุ๊กหลายตัวคือวิธีที่คุณจะได้โมเดลที่เป็นเอกภาพอย่างแท้จริง แทนที่จะเป็นสองสแต็กที่ถูกยึดติดกัน

ทั้งสองอย่างล้วนเป็นจุดยืนที่สอดคล้องกัน และมาพร้อมต้นทุนที่ตรงกันข้าม การแทนค่าด้วยหลายโค้ดบุ๊กสามารถเก็บรายละเอียดภาพได้ละเอียดกว่า แต่ยังเพิ่มงบโทเค็นต่อภาพเป็นทวีคูณตามจำนวนโค้ดบุ๊ก และทำให้การถอดรหัสซับซ้อนยิ่งขึ้น ซึ่งน่าจะเป็นส่วนหนึ่งของเหตุผลที่ 16B-A1B เป็นสเกลที่ถูกเลือก ความเบาบางของ Ling ให้การอนุมานต่อโทเค็นที่ถูก และยังหมายถึงความจุที่ใช้งานได้น้อยลงต่อการส่งผ่านไปข้างหน้าหนึ่งครั้ง ซึ่งเป็นการแลกเปลี่ยนที่ค่ามัธยฐานของกลุ่มที่ 8 บนดัชนีความฉลาดแสดงให้เห็นอย่างเงียบ ๆ — Ling-3.0-flash-VL ผ่านได้อย่างสบายที่ 25 แต่ก็ไม่ได้แข่งกับโมเดล frontier แบบ dense ในด้านการให้เหตุผลดิบ

พื้นผิวของงานทับซ้อนกันเพียงบางส่วน

การจัดทั้งสองอย่างไว้ในหมวด "multimodal model" เดียวกันนั้นเป็นการกล่าวเกินจริงถึงความทับซ้อนที่มี การรู้ว่ามันสิ้นสุดตรงไหนช่วยป้องกันการเปรียบเทียบแบบผิด ๆ ได้มาก

• อินพุต — Ling-3.0-flash-VL รับข้อความ รูปภาพ และวิดีโอ สูงสุด 40 รูปภาพต่อคำขอ และส่งคืนข้อความ; InternLumina U2 รับข้อความ รูปภาพ วิดีโอ และแอสเซต 3D และส่งคืนข้อความ รูปภาพที่สร้างขึ้น หรือรูปภาพที่แก้ไขแล้วbr /> • การสร้างรูปภาพ — Ling-3.0-flash-VL ไม่สามารถสร้างหรือแก้ไขรูปภาพได้เลย; ข้ออ้างหลักของ InternLumina U2 คือมันทำได้ทั้งสองอย่าง สูงสุด 1024×1024 จากเวตชุดเดียวกับที่อ่านรูปภาพbr /> • 3D — Ling-3.0-flash-VL ไม่มีเส้นทาง 3D; InternLumina U2 มาพร้อมไปป์ไลน์ที่ใช้ Blender ซึ่งเรนเดอร์แอสเซต GLB และ GLTF ให้เป็นวิวสีและความลึกแบบจับคู่กัน 64 วิว เพื่อให้โมเดลใช้ในการให้เหตุผลbr /> • วิดีโอ — Ling-3.0-flash-VL จัดการวิดีโอผ่านการเข้ารหัสเชิงเวลาของ VideoRoPE; InternLumina U2 สุ่มตัวอย่าง 64 เฟรมbr /> • คอนเท็กซ์และเอาต์พุต — Ling-3.0-flash-VL มีหน้าต่างคอนเท็กซ์ 262K โทเค็น เมื่อเทียบกับ 256K ที่การ์ดโมเดลระบุ และมีเอาต์พุตสูงสุดที่ค่อนข้างสั้น; InternLumina U2 ยังไม่เผยแพร่ตัวเลขทั้งสองค่าbr /> • พารามิเตอร์ที่ใช้งานอยู่ — Ling-3.0-flash-VL เปิดใช้งานประมาณ 5.5B ต่อโทเค็น; InternLumina U2 เปิดใช้งานประมาณ 1B ซึ่งคิดเป็นหนึ่งในห้าของจำนวนนั้น

อ่านรายการนั้นแล้ว ข้อสรุปก็คือ สองตัวนี้เป็นตัวแทนที่ใช้แทนกันได้สำหรับงานเพียงหนึ่งอย่างเท่านั้น — การอ่านภาพและตอบคำถามเกี่ยวกับภาพนั้น — และเป็นส่วนเติมเต็มกันในแทบทุกอย่างอื่น ถ้าคุณต้องใช้โมเดลที่สร้างหรือแก้ไขภาพ Ling-3.0-flash-VL ไม่ใช่ตัวเลือก และไม่มีเบนช์มาร์กใดเปลี่ยนข้อเท็จจริงนี้ได้ ถ้าคุณต้องใช้โมเดลตัวเดียวที่อ่านแผนภูมิ สร้างเวอร์ชันตัวแปร และให้เหตุผลกับแอสเซต 3D ได้ InternLumina U2 ถูกออกแบบมาเพื่อสิ่งนั้น และ Ling-3.0-flash-VL ไม่ได้ตอบโจทย์นั้น

The GitHub repository page for InternLM/InternLumina-U2 showing the Apache-2.0 license, a commit titled Document weight downloads and mark Ascend checkpoint released from two days earlier, a file listing including infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py, 52 stars, and the Releases panel reading No releases published.

เบนช์มาร์ก: คะแนนอิสระหนึ่งค่าที่เทียบกับตัวเลขจากผู้ขายเต็มหน้าหนึ่ง

คุณภาพของหลักฐานไม่ได้ใกล้เคียงกันเลย และเป็นเรื่องที่ควรอธิบายให้ชัดเจนว่าทำไมจึงเป็นเช่นนั้น แทนที่จะฟันธงหาผู้ชนะ

คะแนน 25 ของ Ling-3.0-flash-VL บน Intelligence Index v4.3 เป็นการรันโดยบุคคลที่สามบนโปรโตคอลที่เผยแพร่แล้ว โดยมีค่ามัธยฐานของคลาสที่ 8 เพื่อเป็นบริบท รวมถึงปริมาณงานที่วัดได้ 142.9 โทเคนเอาต์พุตต่อวินาที เทียบกับค่ามัธยฐานของคู่เทียบที่ 105.1 และเวลาถึงโทเคนแรก 2.21 วินาที การ์ดผู้ขายของมันระบุแยกต่างหากว่าได้ 42 บน v4.1.1 ที่เลิกใช้แล้ว ซึ่งเป็นโปรโตคอลคนละสเกลและไม่สามารถวางเทียบข้าง 25 ราวกับว่าโมเดลมีผลงานลดลงได้; ดัชนีนี้ถูกประกาศใหม่ในเดือนกันยายน 2026 และให้คะแนนใหม่ทั้งหมด ผู้ขายยังรายงานชัยชนะใน Image-to-WebDev Arena ด้วยคะแนน 1,441 ต่อ 1,440 เหนือ GPT-5.4 ภายใต้นามแฝง "linthium" — เป็นส่วนต่างหนึ่งคะแนนซึ่งอยู่ในความคลาดเคลื่อนของ Elo และเป็นการรายงานโดยผู้ขายเอง

ตัวเลขของ InternLumina U2 เป็นของทางแล็บเอง โดยติดป้ายว่าเป็นข้อมูลเบื้องต้นและยังไม่สมบูรณ์ ขณะที่ตารางเปรียบเทียบฉบับเต็มและรายงานทางเทคนิคยังอยู่ระหว่างดำเนินการ ตอนนี้ตัวเลขเหล่านั้นอยู่ในตารางบน README ของ repository แทนที่จะอยู่บนกระดานจัดอันดับ benchmark และยังไม่สามารถตรวจสอบยืนยันได้อย่างเป็นอิสระเนื่องจากยังไม่มีบุคคลที่สามเผยแพร่การรัน ตามที่ทางแล็บระบุไว้:

• ความเข้าใจ — ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15, MMMU-Pro 36.13, MathVision 33.22, DynaMath 56.37br /> • วิดีโอ — Video-MME 51.26, MVBench 59.74, MLVU 57.03br /> • การสร้างและการแก้ไข — GenEval 0.81, DPG 87.10, TIIF Short 84.60, TIIF Long 85.95, ImgEdit 3.83br /> • แหล่งที่มา — ตัวเลขทุกตัวของ InternLumina U2 เป็นข้อมูลที่ผู้ขายรายงานและเป็นข้อมูลเบื้องต้น; ตัวเลขทุกตัวของ Ling-3.0-flash-VL เป็นข้อมูลที่ผู้ขายรายงาน ยกเว้น Intelligence Index ซึ่งมาจาก Artificial Analysis

สองรายการนั้นควรค่าแก่การตั้งข้อสังเกต GenEval 0.81 ตามหลัง 0.89 ของคู่แข่งที่ระบุชื่อ ตามตารางของห้องแล็บเอง — เป็นกรณีหายากที่ผู้ขายเผยแพร่ผลที่แพ้ และเป็นเหตุผลให้เชื่อถือส่วนที่เหลือของตารางนั้นมากขึ้นเล็กน้อย และ ImgEdit ที่ 3.83 ก็ไม่มีความหมายหากไม่มีตารางประกอบ ซึ่งเป็นส่วนหนึ่งของสิ่งที่รายงานทางเทคนิคที่ยังค้างอยู่จะนำเสนอ ให้ถือว่ารายการ InternLumina U2 เป็นผลลัพธ์ที่ห้องแล็บตั้งใจจะปกป้อง ไม่ใช่ผลลัพธ์ที่คุณนำไปใช้ตัดสินใจได้ โปรดทราบด้วยว่าคะแนนความเข้าใจของมันกับคะแนนดัชนีของ Ling-3.0-flash-VL ไม่ใช่ปริมาณที่เปรียบเทียบกันได้: อย่างหนึ่งคือชุดตัวเลขเฉพาะงานของผู้ขาย อีกอย่างหนึ่งคือดัชนีรวมจากบุคคลที่สาม

A two-column comparison scoreboard for Ling-3.0-flash-VL and InternLumina U2 across six shared dimensions: Intelligence Index 25 on v4.3 versus none yet, active parameters 5.5B versus 1B, total parameters 124B versus 16B, license MIT versus Apache-2.0, published checkpoint NVIDIA CUDA versus Ascend only, and task surface understanding only versus plus generation, editing and 3D, with a footer noting the Ling figure is per Artificial Analysis and InternLumina U2 figures are vendor-reported preliminary.

ไลเซนส์ ฮาร์ดแวร์ และค่าใช้จ่ายที่แท้จริงของการเดิมพันในแต่ละอย่าง

Ling-3.0-flash-VL อยู่ภายใต้ MIT ในทั้งสองรูปแบบความแม่นยำ ซึ่งถือว่าสะอาดที่สุดเท่าที่น้ำหนักเปิดจะทำได้ — ไม่มีเงื่อนไขพ่วง ไม่มีข้อจำกัดขอบเขตการใช้งาน ไม่มีความคลุมเครือเรื่องการนำไปใช้งานเชิงพาณิชย์ บิลด์ FP8 ที่มีขนาดประมาณ 126 GB พอดีกับโหนดหนึ่งที่มีตัวเร่งความเร็วระดับ 80GB จำนวนแปดตัว; BF16 มีขนาดประมาณสองเท่าของจำนวนนั้น การรองรับการให้บริการมีอยู่แล้วใน SGLang และฟอร์ก vLLM ที่ Ant ดูแล ความเสี่ยงที่เหลืออยู่เป็นเรื่องเชิงพาณิชย์มากกว่าทางกฎหมาย: Ant ไม่เผยแพร่อัตราค่าบริการต่อโทเคนสำหรับโมเดลวิชัน การเข้าถึงฟรีบน Ling Studio เป็นโปรโมชันมากกว่าอัตราค่าบริการตามจริง และ Artificial Analysis ระบุไว้ที่ $0.00 ต่อ 1 ล้านโทเคนทั้งขาเข้าและขาออก เพียงเพราะปลายทางที่มองเห็นได้คือปลายทางฟรี

InternLumina U2 เป็น Apache-2.0 บนรีพอซิทอรีหลัก โดยมีข้อยกเว้นสองประการที่ควรอ่าน: ที่รวมมาด้วย VeOmni/ ซึ่งเป็นไดเรกทอรีที่ยังคงใช้สิทธิ์ Apache-2.0 จากต้นทางเดิม และ atoken_inference/ ได้มาจาก ml-atoken ของ Apple และเผยแพร่ต่อภายใต้เงื่อนไขดั้งเดิมของ Apple ข้อกล่าวอ้างด้านโครงสร้างพื้นฐานนี้เป็นเรื่องจริงจัง — รองรับทั้ง GPU ของ NVIDIA และ NPU Ascend ของ Huawei โดยมีการจัดแนวตัวเลขระดับโอเปอเรเตอร์ระหว่างแบ็กเอนด์ทั้งสอง และทีมงานรายงานว่าฝึกแบบ end-to-end บนคลัสเตอร์ Ascend จำนวนหนึ่งพันการ์ด ด้วยประสิทธิภาพการฝึกที่ดีขึ้น 1.85× จากการใช้โอเปอเรเตอร์แบบฟิวส์ การชาร์ด HSDP ที่ปรับแต่งแล้ว และ gradient checkpointing นั่นคือวิศวกรรมของจริง แต่ก็ไม่เกี่ยวข้องกับคำถามว่าโมเดลจะดีหรือไม่: ประสิทธิภาพการฝึกบน Ascend ไม่ได้บอกอะไรเกี่ยวกับคุณภาพของเอาต์พุต และเช็กพอยต์ที่มีอยู่ในปัจจุบันคือเช็กพอยต์ที่มุ่งเป้าไปที่สแต็กนั้น

ดังนั้นความไม่สมดุลในทางปฏิบัติจึงไม่ใช่เรื่องเปิดเทียบกับปิด ทั้งคู่เป็นโอเพนซอร์ส ทั้งคู่มีสัญญาอนุญาตแบบผ่อนปรน และทั้งคู่สามารถดาวน์โหลดได้ในวันนี้ สิ่งที่ต่างกันคือโมเดลที่ปล่อยมาหนึ่งตัวสมมติฮาร์ดแวร์ที่คุณน่าจะมี ส่วนอีกตัวสมมติฮาร์ดแวร์ที่คุณน่าจะไม่มี ถ้าฟลีตของคุณเป็น NVIDIA, Ling-3.0-flash-VL ก็เป็นงานแค่บ่ายเดียว และ InternLumina U2 ก็ต้องรอ ถ้าฟลีตของคุณเป็น Ascend — ซึ่งพบได้บ่อยขึ้นเรื่อย ๆ ในตลาดจีนที่โมเดลนี้สร้างมาเพื่อ — สมการนั้นจะกลับด้านทั้งหมด และ InternLumina U2 คือตัวที่มีเส้นทางที่เสร็จสมบูรณ์ ขณะที่สูตรของ Ling-3.0-flash-VL สมมติว่าใช้ CUDA

คำถามที่ผู้คนถามกันจริง ๆ เกี่ยวกับการจับคู่นี้

น้ำหนักของ InternLumina U2 ดาวน์โหลดได้แล้วหรือยัง?

ใช่แล้ว เช็กพอยต์ที่เทรนบน Ascend นั้นมี — ไฟล์ safetensors เจ็ดชาร์ดที่เผยแพร่ภายใต้ ascend/บน Hugging Face พร้อมกับไฟล์ config, tokenizer และ modeling ส่วนเช็กพอยต์ที่เทรนบน NVIDIA นั้นอยู่ในโฟลเดอร์ย่อยแยกต่างหาก และยังระบุว่ากำลังจะมาเร็ว ๆ นี้ ขณะที่โค้ดสำหรับการเทรนและรายงานทางเทคนิคยังไม่เปิดเผย

Ling-3.0-flash-VL ดีกว่าอย่างแท้จริงหรือไม่ เพราะ它具有คะแนนอิสระ

ไม่ — มันมีหลักฐานรองรับดีกว่าและรันบนฮาร์ดแวร์ทั่วไปได้ง่ายกว่า ซึ่งเป็นข้อกล่าวอ้างที่แตกต่างออกไป Ling-3.0-flash-VL ไม่สามารถสร้างหรือแก้ไขภาพ ไม่สามารถประมวลผลแอสเซต 3D และไม่มีราคาที่เปิดเผย หากงานของคุณคือการสร้างภาพ การแก้ไขภาพ หรือการทำความเข้าใจ 3D แล้ว InternLumina U2 ตอบโจทย์สิ่งนั้น ส่วน Ling-3.0-flash-VL ไม่ตอบโจทย์เลย ไม่ว่าโมเดล Ling จะมีเบนช์มาร์กมากแค่ไหนก็ตาม

เลข 42 บนการ์ดโมเดลของ Ling-3.0-flash-VL ขัดแย้งกับเลข 25 จาก Artificial Analysis หรือไม่

ไม่ใช่โดยตรง ค่า 42 วัดเทียบกับ Intelligence Index protocol v4.1.1 และค่า 25 วัดเทียบกับ v4.3 ดัชนีนี้ถูกประกาศใหม่ในเดือนกันยายน 2026 และให้คะแนนใหม่ทั้งหมด โดยทั้งสองเวอร์ชันสร้างจากชุดการประเมินที่แตกต่างกัน สิ่งที่กล่าวได้คือ ค่า 42 ไม่เคยถูกทำซ้ำโดยอิสระ และค่า 25 ถูกสร้างขึ้นโดยอิสระแล้ว

ที่ซึ่งอย่างใดอย่างหนึ่งในสองสิ่งนี้สามารถถูกเรียกได้

ทั้ง Ling-3.0-flash-VL และ InternLumina U2 ต่างก็ไม่ได้อยู่ในแค็ตตาล็อกโมเดลของเรา และการพูดเป็นอย่างอื่นจะเป็นการอ้างที่ผู้อ่านสามารถตรวจสอบได้ภายในสิบวินาที Ling-3.0-flash-VL นั้นเข้าถึงได้ผ่านแพลตฟอร์มของ Ant เอง ซึ่งเผยแพร่เอนด์พอยต์ที่เข้ากันได้กับ OpenAI และอีกอันที่เข้ากันได้กับ Anthropic ผ่านการทดลองใช้ฟรีบน Ling Studio และผ่านน้ำหนักโมเดลแบบเปิดหากคุณให้บริการมันเอง InternLumina U2 เข้าถึงได้ผ่าน checkpoint บน Hugging Face และไดรเวอร์สำหรับการอนุมานของรีโป บนฮาร์ดแวร์ที่ checkpoint นั้นมุ่งเป้า

สิ่งที่เราเลือกเป็นเส้นทางคือโมเดลด้านภาพที่คู่นี้มักถูกนำมาเทียบเคียงกันในทางปฏิบัติ: DeepSeek V4 Flash Vision Exp ซึ่งใช้งานอยู่บนแค็ตตาล็อกด้วยหน้าต่างบริบท 1M โทเคนและมีอัตราค่าบริการที่ประกาศไว้ บนเอนด์พอยต์ที่เข้ากันได้กับ OpenAI แบบเดียวกับส่วนที่เหลือของแค็ตตาล็อก เมื่อห้องแล็บเปิดเผยน้ำหนักโมเดลแบบเปิด เลเยอร์จัดเส้นทางมักสามารถเสนอโมเดลได้โดยไม่ต้องรอให้บริการโฮสต์ของห้องแล็บเองเสถียร — ซึ่งนั่นคือความแตกต่างในทางปฏิบัติระหว่างโมเดลที่อ้างราคาได้กับโมเดลที่เรียกใช้ได้ ความแตกต่างนี้เกิดขึ้นจริงสำหรับ Ling-3.0-flash-VL และในตอนนี้เป็นเพียงเชิงวิชาการสำหรับ InternLumina U2 ซึ่งเรื่องราวการเปิดตัวเป็นเส้นทางฮาร์ดแวร์มากกว่าคำถามเรื่องการโฮสต์

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class rank of #2 of 64 against a class median of 8, 124B total and 5.5B active parameters, a 262K-token context window, an MIT license and 142.9 output tokens per second.

คำตัดสินนั้นแตกเป็นสองฝ่ายจริง ๆ และมันแยกตามฮาร์ดแวร์กับงาน มากกว่าคุณภาพ Ling-3.0-flash-VL คือรุ่นที่เปิดตัวครบถ้วน: MIT, รองรับทั้งสองรูปแบบความแม่นยำ, ถูกให้คะแนนโดยบุคคลที่สาม, CUDA-first และจำกัดอยู่ที่การทำความเข้าใจ InternLumina U2 เป็นดีไซน์ที่ทะเยอทะยานกว่า และเป็นการเปิดตัวที่ยังไม่สมบูรณ์กว่า: มีการเผยแพร่เช็กพอยต์ของฮาร์ดแวร์สแต็กหนึ่ง, ชุดงานหกประเภทแบบรวมเป็นหนึ่งซึ่งรวมถึงการเจนเนอเรตและ 3D, และยังมีรายงานทางเทคนิคที่ยังค้างส่ง ถ้าคุณต้องการโมเดลวิชันบนฮาร์ดแวร์ NVIDIA ในสัปดาห์นี้ ทางเลือกก็ชัดเจนโดยตัวมันเอง ถ้าดีไซน์ multi-codebook ของ InternLumina U2 คือสิ่งที่คุณสนใจ สิ่งที่ต้องจับตาคือเช็กพอยต์ของ NVIDIA — และจุดยืนที่ซื่อตรงจนถึงตอนนั้นก็คือ ตาราง benchmark ของมัน รวมถึงแถวที่มันแพ้ กำลังอธิบายโมเดลที่ครึ่งหลังยังไม่ถูกปล่อยออกมา

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube