การ์ดไตเติลฮีโร่สำหรับการเปรียบเทียบ 'Ling-3.0-flash-VL vs Ling 3.0 Flash' พร้อมคำบรรยายย่อย 'สมอง 124B หนึ่งเดียว ตอนนี้มีดวงตาแล้ว' เหนือพาดหัวมีไอคอนเส้นสไตล์แบนสองอัน — เอกสารข้อความทางซ้าย และดวงตาซ้อนบนกรอบรูปทางขวา — และใต้คำบรรยายย่อยมีป้ายสองป้ายคั่นด้วยเส้นแบ่งบาง ๆ: 'แกนหลัก Hybrid-Linear MoE เดียวกัน' และ 'อีกหนึ่งเพิ่มอินพุตรูปภาพและวิดีโอแบบเนทีฟ' ไม่มีตัวเลขหรือราคาปรากฏ โลโก้ OrcaRouter ถูกประกอบไว้ที่มุมขวาล่าง
Guides & Insights

{{1}}Ling-3.0-flash-VL เทียบกับ Ling 3.0 Flash: สมอง 124B เดียวกัน ตอนนี้มีดวงตาแล้ว{{/1}}

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Ling-3.0-flash-VL และ Ling 3.0 Flash ไม่ใช่คู่แข่งกัน และการมองคู่โมเดลนี้เป็นการประลองโมเดลจะนำคุณไปสู่บทสรุปที่ผิด Ling-3.0-flash-VL คือเช็คพอยต์ด้านวิทัศน์-ภาษา (vision-language) ที่ห้องแล็บ inclusionAI ของ Ant Group ปล่อยออกมาในสัปดาห์นี้ — โดยน้ำหนักโมเดลอยู่บน Hugging Face ภายใต้ไลเซนส์ MIT ตั้งแต่วันที่ 4 กันยายน 2026 — และมันถูกสร้างบน Ling 3.0 Flash โดยตรง ซึ่งเป็นโมเดลข้อความแบบเปิดน้ำหนักขนาด 124B พารามิเตอร์ของห้องแล็บที่ทำหน้าที่เป็นแกนหลักของระดับความเร็วสูง (fast tier) มาตั้งแต่ปลายเดือนกรกฎาคม ทั้งสองใช้ดีไซน์ MoE แบบไฮบริดเชิงเส้นเดียวกัน หลักเศรษฐศาสตร์การเปิดใช้งานแบบเบาบาง (sparse activation) เดียวกัน สูตรการเสิร์ฟคอนเทกซ์ 256K เดียวกัน และไลเซนส์ MIT เดียวกัน สิ่งที่เช็คพอยต์ VL เพิ่มเข้ามาคือสิ่งเดียวที่โมเดลข้อความไม่เคยมี นั่นคือการรับอินพุตภาพและวิดีโอแบบเนทีฟ ซึ่งส่งผ่าน ViT encoder, ตัวฉายภาพ MLP สองชั้น และการเข้ารหัสเชิงเวลาของ VideoRoPE (VideoRoPE temporal encoding) ดังนั้นการเปรียบเทียบจึงลดเหลือคำถามเชิงปฏิบัติข้อเดียว — หากปริมาณงานของคุณไม่เคยต้องดูรูปภาพ โมเดลที่มีตาจะคุ้มค่าต่อการเปลี่ยนหรือไม่?

เหตุผลที่คำถามนี้น่าถามก็คือ inclusionAI ไม่ได้นิยาม Ling-3.0-flash-VL ว่าเป็นสายผลิตภัณฑ์แยกต่างหาก การ์ดโมเดลของมันเรียกโมเดลนี้ว่า “โมเดลมัลติโมดัลเนทีฟรุ่นถัดไปของเรา” ซึ่งสร้างบน Ling-3.0-flash สืบทอดความสามารถด้านภาษา การให้เหตุผล และบริบทระยะยาวของโมเดลดังกล่าว แล้วขยายด้วยความสามารถด้านการมองเห็นที่เข้ามามีส่วนร่วมในวงจรเต็มของการทำความเข้าใจ การให้เหตุผล การลงมือทำ และการตรวจสอบ — ไม่ใช่การมองเห็นที่ถูกต่อพ่วงเป็นเพียงอินพุตเสริม สำหรับตระกูลโมเดลที่รุ่นเรือธงก่อนหน้านี้ประกาศไว้ชัดเจนว่าเป็นแบบข้อความเท่านั้น นี่คือการเปลี่ยนแปลงครั้งใหญ่ และมันเปลี่ยนจุดเช็คพอยต์ที่ทีมที่ทำงานบนข้อความและเครื่องมือควรยึดเป็นมาตรฐาน

สองจุดตรวจสอบ หนึ่งแกนหลัก

Ling 3.0 Flash คู่แข่งในการเปรียบเทียบครั้งนี้ เป็นรุ่นที่พัฒนาเต็มที่กว่าของทั้งสองรุ่น ประกาศเปิดตัวในช่วงปลายเดือนกรกฎาคม 2026 และเปิดซอร์สโค้ดภายใต้สัญญา MIT เมื่อวันที่ 7 สิงหาคม เป็นโมเดลแบบ hybrid-linear mixture-of-experts ที่มีพารามิเตอร์รวม 124B และพารามิเตอร์ที่ทำงานจริงประมาณ 5.1B ต่อโทเคน — มีเลเยอร์ KDA 35 ชั้นและเลเยอร์ Gated MLA 7 ชั้นเรียงซ้อนกันในอัตราส่วน 5:1 มี routed experts 512 ตัวโดยเปิดใช้งาน 8 ตัว รองรับบริบทดั้งเดิม 256K ที่ให้บริการที่ 262,144 โทเคน รองรับเฉพาะข้อความพร้อมการเรียกใช้เครื่องมือ เปิดใช้งานการคิดเป็นค่าเริ่มต้นผ่าน chat template และมีต้นทุนต่ำอย่างผิดปกติเมื่อเทียบกับขนาดของมัน นอกจากนี้ยังเป็นฝ่ายที่มีเอกสารประกอบครบถ้วนของทั้งคู่: Artificial Analysis จัดอันดับไว้ในลีดเดอร์บอร์ดสด โดยครองอันดับหนึ่งจาก 63 โมเดลในคลาสเดียวกัน และวัดความเร็วเอาต์พุตได้ประมาณ 313 โทเคนต่อวินาทีบน API ของผู้ให้บริการ

Ling-3.0-flash-VL คงสถาปัตยกรรมนั้นไว้และเพิ่มชุดประมวลผลภาพ (visual stack) ขึ้นด้านบน การ์ดโมเดลอธิบายถึงตัวเข้ารหัสภาพแบบ ViT ซึ่งฟีเจอร์ต่าง ๆ ถูกจัดแนวให้เข้ากับพื้นที่ข้อความผ่านโปรเจกเตอร์ MLP สองชั้น โดย VideoRoPE เข้ารหัสทั้งตำแหน่งเชิงพื้นที่และลำดับเวลา เพื่อให้โมเดลสามารถระบุตำแหน่งเหตุการณ์และให้เหตุผลกับวิดีโอยาวได้ กระดูกสันหลังหลักยังเป็นโมเดลไฮบริด KDA-to-MLA อัตราส่วน 5:1 เหมือนเดิม ครั้งนี้มีพารามิเตอร์รวม 124B / เปิดใช้งาน 5.5B ต่อโทเคน โดยมีโครงหลัก 42 ชั้น อินพุตรองรับข้อความ รูปภาพ และวิดีโอ ส่วนเอาต์พุตเป็นข้อความ บริบทถูกโฆษณาสูงสุด 1 ล้านโทเคน โดยสูตรแนะนำของ SGLang รองรับการให้บริการ 256K ผ่านการปรับสเกลแบบ YaRN เช่นเดียวกับเวอร์ชันข้อความ โมเดลนี้มาพร้อมระบบคิด (thinking) เปิดไว้ตามค่าเริ่มต้น (สามารถปิดได้ตามคำขอผ่าน chat_template_kwargs) และทำงานได้ทั้งบน SGLang หรือ vLLM fork แบบกำหนดเองของ inclusionAI เวอร์ชัน BF16 ที่ปล่อยออกมามีขนาดประมาณ 250 GB บนดิสก์ กระจายอยู่ใน 64 ชาร์ด safetensor ซึ่งจัดอยู่ในกลุ่มขนาดประมาณหนึ่งในสี่เทราไบต์เดียวกันกับน้ำหนักของโมเดลข้อความ

มันสดใหม่แค่ไหน? ในขณะที่เขียนบทความนี้ รีพอสิทอรีของ VL มียอดดาวน์โหลดเป็นหลักสิบ โมเดลการ์ดของมันยังอยู่ในระหว่างการอัปเดต และ Artificial Analysis ยังไม่ได้จัดอันดับโมเดลนี้ ทุกอย่างด้านล่างนี้ที่ไม่ได้ระบุอย่างชัดเจนว่าเป็นของ Artificial Analysis คือการรายงานของ inclusionAI เอง

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash-VL, showing the header '@inclusionAI Ling-3.0-flash-VL', the 'Model card' and 'Files and versions' tabs, the introduction text 'We are introducing Ling-3.0-flash-VL, our next-generation native multimodal model' together with the 124B total / 5.5B activated / up to 1M context summary, and the right-hand sidebar noting License: mit, 42 downloads last month, Safetensors ~125B params, and 'This model isn't deployed — ask for provider support'.

กระดานคะแนน

ความไม่สมมาตรตรงนี้ไม่ใช่เรื่องของคุณภาพ หากแต่เป็นเรื่องของโมดาลิตี้ (modality) มีหกมิติที่กำหนดการตัดสินใจ:

ความฉลาด (การ์ดข้อมูลผู้จำหน่าย, AA Index v4.1.1) — Ling-3.0-flash-VL: 42 (รายงานโดยผู้จำหน่าย) ส่วน Ling 3.0 Flash: 38 ซึ่งเป็นค่าดัชนีก่อนหน้าที่การ์ดอ้างถึง

กระดานสด AA วันนี้ (v4.3) — Ling-3.0-flash-VL: ยังไม่ถูกจัดอันดับ. Ling 3.0 Flash: คาดไว้ที่ 25 ติดอันดับ #1 จาก 63 ในกลุ่มเดียวกัน.

อินพุต — Ling-3.0-flash-VL: ข้อความ รูปภาพ และวิดีโอ. Ling 3.0 Flash: ข้อความเท่านั้น

บริบท — ทั้งคู่อ้างว่ารองรับได้ถึง 1M โทเคน; ทั้งคู่ให้บริการจริงที่ 256K (262,144) ในปัจจุบัน

ราคาLing-3.0-flash-VL: ยังไม่มีราคาจำหน่าย; มีเฉพาะน้ำหนักโมเดลแบบเปิดภายใต้ใบอนุญาต MIT เท่านั้น Ling 3.0 Flash: ประมาณ $0.07 ต่อ 1M อินพุต และ $0.22 ต่อ 1M เอาต์พุตบน API โดยตรงของผู้ให้บริการ

เลือกใช้สำหรับ — Ling-3.0-flash-VL: เอกสาร ภาพหน้าจอ แผนภูมิ วิดีโอ และเอเจนต์ที่ทำงานผ่าน GUI ส่วน Ling 3.0 Flash: การเรียกใช้เครื่องมือที่ใช้ข้อความเป็นหลักและไปป์ไลน์เอเจนต์ระยะยาว

A two-column scoreboard titled 'Ling-3.0-flash-VL vs Ling 3.0 Flash — the scoreboard'. Left column 'Ling-3.0-flash-VL': 'Intelligence (vendor card, AA Index v4.1.1): 42 — vendor-reported', 'AA live board today (v4.3): not listed yet', 'Inputs: text, image, video', 'Context: up to 1M; 256K recipe', 'Price: no list price — MIT open weights', 'Pick it for: documents, video, GUI agents'. Right column 'Ling 3.0 Flash': 'Intelligence (vendor card, AA Index v4.1.1): 38 — earlier AA figure', 'AA live board today (v4.3): 25 estimated, #1 of 63 in class', 'Inputs: text only', 'Context: 256K native; 1M claimed', 'Price: $0.07 / $0.22 per 1M (vendor API)', 'Pick it for: text-heavy agentic pipelines'. Footer reads 'VL figures vendor-reported; Flash figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

กระดานคะแนนที่โมเดลข้อความไม่สามารถเข้าไปได้

นี่คือจุดที่ทั้งสองแยกออกจากกันจริง ๆ และความแตกต่างนั้นเป็นเชิงโครงสร้าง มากกว่าเชิงการแข่งขัน: ในเกณฑ์ชี้วัดด้านภาพและวิดีโอ Ling 3.0 Flash แบบข้อความล้วนไม่มีรายการผลคะแนนเลย เพราะมันไม่สามารถรับอินพุตดังกล่าวได้ ส่วนแผนภูมิของ Ling-3.0-flash-VL เอง — การประเมินของ inclusionAI ที่ไม่มีการทำซ้ำเพื่อยืนยันผล ดำเนินการบางส่วนภายในบริษัท และบางส่วนเทียบกับ API ของคู่แข่งภายใต้การตั้งค่าการทดสอบอย่างเป็นทางการ — แสดงตัวเลขในสามกลุ่มที่การ์ดเน้นย้ำ ในด้านความเข้าใจภาพที่ซับซ้อน มันได้ MMMU-Pro ที่ 79.0 และ MathVision ที่ 84.87 โดยมีคะแนน 19.88 ที่ต่ำกว่ามากใน Humanity's Last Exam-Multimodal ซึ่งสะท้อนว่าชุดนั้นยากเพียงใดสำหรับทุกคน ในด้านเอกสารและแผนภูมิ มันแข็งแกร่ง: OmniDocBench1.5 ที่ 91.35 และ CharXiv_RQ ที่ 81.30 และในชุดการประเมินแบบเอเจนต์-มัลติโมดัลที่ทำให้การเปิดตัวครั้งนี้น่าสนใจ — ClawEval-MM ที่ 59.9, WebVoyager ที่ 90.83, Vision2Web ที่ 57.69 — มันถูกขอให้อ่านอินเทอร์เฟซแล้วลงมือทำกับมัน ซึ่งก็คืองานของเอเจนต์ GUI ที่โมเดลข้อความไม่สามารถทำได้

เมื่ออ่านสิ่งเหล่านั้นในบริบท ภาพที่สอดคล้องกันก็ปรากฏชัด: นี่ไม่ใช่โมเดลที่ถูกปรับแต่งเพื่อชนะคำถามความรู้ทั่วไปเกี่ยวกับรูปภาพ แต่เป็นโมเดลที่ถูกปรับแต่งให้เปลี่ยนพิกเซลให้เป็นการกระทำ — อ่านเค้าโครง ตามแผนภูมิ ใช้งานหน้าเว็บ บนแผนภูมิของผู้จำหน่ายเอง โมเดลนี้เป็นผู้นำในกลุ่มการเปรียบเทียบแบบสามทาง (Qwen3.8-27B ที่ความพยายามในการใช้เหตุผลระดับสูง, Gemini 3.5 Flash-Lite และ Kimi-K2.6) บน OmniDocBench, WebVoyager และ ClawEval-MM และตามหลังในชุดข้อมูลความรู้และการใช้เหตุผลที่ยาก เช่น MathVision และ HLE-MM จงถือว่าตัวเลขเหล่านั้นทุกตัวเป็นเพียงการอ้างสิทธิ์ของ inclusionAI จนกว่าห้องปฏิบัติการที่เป็นกลางจะยืนยัน — แต่ทิศทางของการปรับแต่งนั้นชัดเจนและสอดคล้องกัน

ตัวเลขเพียงหนึ่งเดียวที่ควรค่าแก่การถกเถียง: 42 กับ 38

ข้อกล่าวอ้างที่น่าจะทำให้ทีมที่ใช้ข้อความล้วนเปลี่ยนใจหันมาใช้มากที่สุดคือข้อกล่าวอ้างในพาดหัว: inclusionAI รายงานว่า Ling-3.0-flash-VL ทำคะแนนได้ 42 บน Artificial Analysis Intelligence Index (v4.1.1) ซึ่งสูงกว่าคะแนน 38 ที่บริษัทระบุว่าเป็นของ Ling 3.0 Flash บนดัชนีเวอร์ชันเดียวกันอยู่ 4 คะแนน โปรดสังเกตว่าดัชนีนี้วัดอะไร: องค์ประกอบรวม (composite) ในเวอร์ชัน v4.1.1 ดึงมาจากชุดทดสอบด้านข้อความและเอเจนต์ ได้แก่ GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam และอื่นๆ ในทำนองเดียวกัน ซึ่งไม่มีงานด้านภาพอยู่เลย ดังนั้นผู้ให้บริการจึงอ้างว่าการเพิ่มการฝึกด้วยข้อมูลภาพให้กับแกนหลักร่วม (backbone) ทำให้ความฉลาดด้านข้อความของโมเดลสูงขึ้น 4 คะแนน ไม่ใช่เพียงแค่ว่าตอนนี้มันสามารถอธิบายรูปภาพได้เท่านั้น นี่เป็นข้อกล่าวอ้างที่สะดุดตาและน่าเชื่อถือโดยสิ้นเชิง — การปรับจูนด้วยคำสั่งแบบมัลติโมดัลนั้นโดยทั่วไปแล้วช่วยยกระดับความสามารถด้านข้อความ

ข้อควรระวังสองข้อเกี่ยวกับแหล่งข้อมูลช่วยให้ตัวเลขนี้อยู่ในมุมมองที่พอดี ประการแรก เลข 38 เป็นค่าจากดัชนีรุ่นก่อนหน้า: Artificial Analysis ได้ย้ายกระดานสดของตนไปเป็นดัชนีรุ่นใหม่กว่า (v4.3) แล้ว ซึ่งปัจจุบันระบุ Ling 3.0 Flash ไว้ที่ประมาณ 25 ขณะที่ยังจัดให้อยู่อันดับหนึ่งในบรรดา 63 โมเดลในคลาสของมัน คู่ตัวเลข 42 กับ 38 ของผู้พัฒนาอยู่บนสเกลที่เก่ากว่า จึงไม่ควรตีความว่า “สูงกว่าคะแนนที่ AA ให้โมเดลข้อความในปัจจุบันสี่จุด” ประการที่สอง เลข 42 เป็นตัวเลขที่ inclusionAI คำนวณเองสำหรับโมเดลที่ Artificial Analysis ยังไม่ได้ลงรายการ และ inclusionAI ยังไม่ได้เผยแพร่ผลลัพธ์ของ VL checkpoint ต่อชุดทดสอบข้อความแต่ละชุด (SWE-Bench, Terminal-Bench) ซึ่งแผนภูมิของโมเดลข้อความของตัวเองแจกแจงไว้ สี่จุดเป็นขนาดของผลต่างที่คุณควรจะลองจำลองให้ได้ก่อนที่จะย้ายไปป์ไลน์ที่รองรับข้อความเท่านั้นโดยอาศัยค่าดังกล่าว

A screenshot of the Artificial Analysis model page for Ling 3.0 Flash, showing the heading 'Ling 3.0 Flash — Intelligence, Performance & Price Analysis', 'Released August 2026', an estimated 25 on the Artificial Analysis Intelligence Index with a #1-of-63 rank in its class, pricing near $0.07 per 1M input and $0.22 per 1M output tokens, roughly 313 output tokens per second, and technical specs listing text-only input, a 262k context window, and 124B total / 5.1B active parameters.

ราคา: ตัวหนึ่งมีราคาปลีก ส่วนอีกตัวหนึ่งไม่มี

การเปรียบเทียบต้นทุนปัจจุบันยังคงเป็นการเปรียบเทียบที่มีราคาเพียงราคาเดียวอยู่ในนั้น Ling 3.0 Flash เรียกใช้ได้แล้ววันนี้ผ่าน API ของผู้ให้บริการเอง ในราคาประมาณ $0.07 ต่ออินพุต 1M และ $0.22 ต่อเอาต์พุต 1M ซึ่งเป็นราคาที่ผู้ให้บริการกำหนดและยืนยันได้จากรายการของ Artificial Analysis โดยอินพุตแบบแคชมีราคาถูกกว่า และส่วนลดช่วงเปิดตัวได้สิ้นสุดลงแล้ว สำหรับ Ling-3.0-flash-VL ยังไม่มีราคา API เผยแพร่ที่ใด คุณยังไม่สามารถจ่ายต่อโทเค็นสำหรับโมเดลนี้ได้ หากต้องการใช้ภายในสัปดาห์นี้ คุณต้องโฮสต์ด้วยตัวเอง โดยใช้น้ำหนักโมเดลภายใต้สัญญาอนุญาต MIT ขนาดประมาณ 250 GB ในรูปแบบ BF16 บนฮาร์ดแวร์ระดับเดียวกับที่โมเดลข้อความต้องการอยู่แล้ว กล่าวคือ GPU ขนาด 141GB จำนวน 4 ตัว (H20-3e หรือ H200) หรือโหนด Blackwell แบบ 4 GPU ที่ tensor-parallel 4 หรือ H100/H800 ขนาด 80GB จำนวน 8 ตัวที่ TP8

นั่นเปลี่ยนมุมมองทางเศรษฐศาสตร์สำหรับทีมที่ใช้ข้อความอย่างเดียว หากคุณซื้อโทเคน โมเดลข้อความที่ราคา $0.07/$0.22 นั้นถูกและพิสูจน์แล้วว่าใช้งานได้จริง หากคุณโฮสต์โมเดลข้อความ 124B ด้วยตัวเองอยู่แล้ว VL checkpoint ไม่ใช่การลงทุนซื้อโครงสร้างพื้นฐานครั้งที่สอง — มันเป็นเพียงน้ำหนักโมเดลอีกประมาณ 250 GB บนเครื่องประเภทเดียวกัน ซึ่งจะคุ้มค่าก็ต่อเมื่อเวิร์กโหลดที่ใช้จริงต้องกินพิกเซลเท่านั้น โมเดลที่มีตาจะคุ้มค่ากับการใช้งานก็ต่อเมื่อมี "ตา" อยู่ในกระบวนการจริง ๆ

ใครควรเลือกอันไหน

ข้อความล้วนและปริมาณงานสูง — ให้ใช้ Ling 3.0 Flash ต่อไป คุณจะได้โมเดลที่ได้รับการพิสูจน์แล้วและอยู่ในรายชื่อ AA ราคาต่อโทเค็นที่แท้จริง และการเรียกใช้เครื่องมือที่สมบูรณ์แบบ การเพิ่มขึ้นสี่จุดของดัชนีในโมเดล VL ยังไม่มีการทำซ้ำผล และปริมาณงานฝั่งข้อความของมันไม่ได้รับการวัด ยังไม่มีหลักฐานว่าโมเดลดังกล่าวเป็นโมเดลข้อความที่ดีกว่า มีเพียงคำกล่าวอ้างว่าเป็นเช่นนั้นเท่านั้น

วิทัศน์เข้าสู่ลูป — เอกสาร สกรีนช็อต แผนภูมิ ภาพถ่าย เฟรมวิดีโอ หรือ UI ที่เอเจนต์ของคุณต้องอ่านและคลิก — Ling-3.0-flash-VL เป็นตัวเลือกที่ชัดเจน เพราะมันคือแกนหลักการให้เหตุผลแบบเดียวกับที่คุณคุ้นเคย เพียงแต่เพิ่มสแตกวิทัศน์เข้าไป ไม่ใช่โมเดลมัลติโมดัลแยกต่างหากที่คุณต้องประเมินใหม่ตั้งแต่ต้น.

ทราฟฟิกแบบผสม ยังไม่ได้ข้อสรุป — การเคลื่อนไหวที่เสี่ยงต่ำคือการทำให้ทั้งสองฝั่งเข้าถึงได้และเลือกเส้นทางตามคำขอ แทนที่จะออกแบบสถาปัตยกรรมใหม่เพื่อยึดตามแบบใดแบบหนึ่ง นั่นคือคุณสมบัติที่โมเดลเกตเวย์มีไว้ให้คุณ: API เดียวที่ครอบคลุมโมเดลมากกว่า 200 รายการ, ราคารายการของผู้ให้บริการถูกส่งผ่านโดยมาร์กอัป 0% และการเฟลโอเวอร์อัตโนมัติเมื่อผู้ให้บริการมีประสิทธิภาพลดลง ยังไม่มี Ling checkpoint ตัวใดเชื่อมต่อกับ OrcaRouter endpoint เลย — ราคาของโมเดลข้อความมาจากผู้ขายโดยตรง และโมเดล VL ยังไม่มีราคาแบบโฮสต์เลย — แต่เมื่อโมเดล VL มีราคาดังกล่าว การย้ายทราฟฟิกบางส่วนไปยังโมเดลนั้นแล้ววัดผลคือการเปลี่ยนคอนฟิกูเรชัน ไม่ใช่โปรเจกต์การผสานระบบ

ยังขาดอะไรอีก

• การรัน Ling-3.0-flash-VL อย่างอิสระบน Artificial Analysis Intelligence Index เวอร์ชันปัจจุบัน — 42 คือตัวเลขที่ inclusionAI ให้ไว้สำหรับเวอร์ชันดัชนีที่เก่ากว่า

• ราคา API แบบโฮสต์สำหรับโมเดล VL ซึ่งเป็นอุปสรรคใหญ่ที่สุดเพียงประการเดียวต่อการนำไปใช้โดยผู้ใช้งานทั่วไป

• เผยแพร่สปลิตสำหรับข้อความเท่านั้น (SWE-Bench Pro, Terminal-Bench 2.1) สำหรับ VL checkpoint เพื่อให้ทีมที่เน้นงานด้านข้อความสามารถตรวจสอบได้ว่าวิสัยทัศน์สแตกไม่ได้ทำให้ความสามารถลดลงแต่อย่างใด

ตัวชี้วัด latency แบบ end-to-end หรือ throughput สำหรับ VL ภายใต้โหลดรูปภาพ — ความเร็วของโมเดลข้อความถูกวัด แต่ของโมเดลวิทัศน์ไม่ได้ถูกวัด

• การยืนยันอย่างเป็นกลางของแผนภูมิเกณฑ์มาตรฐานวิทัศน์ ซึ่งบางส่วนถูกดำเนินการบนชุดทดสอบของ inclusionAI เอง และเกณฑ์มาตรฐานภายในองค์กรอย่างน้อยหนึ่งรายการมีกำหนดเผยแพร่ในภายหลัง

คำตัดสิน

นี่ไม่ใช่การแข่งขันคุณภาพโมเดล แต่คือการตัดสินใจเชิงโมดอลลิตีที่มีข้อกล่าวอ้างสี่จุดติดมาด้วย หากอินพุตของคุณเป็นข้อความ ให้ใช้ Ling 3.0 Flash ต่อไป — มันถูกกว่า ติดอันดับ AA และผ่านการวัดผลแล้ว ส่วนข้อได้เปรียบของโมเดล VL เหนือมันในตอนนี้เป็นเพียงตัวเลขจากผู้จำหน่ายบนมาตราดัชนีรุ่นเก่า หากปริมาณงานของคุณเริ่มต้นจากหน้าจอ — หน้าเอกสาร ภาพหน้าจอ แผนภูมิ เฟรมวิดีโอ หรือ GUI ที่เอเจนต์ของคุณต้องใช้งาน — Ling-3.0-flash-VL คือสมอง 124B ตัวเดียวกับที่คุณเข้าใจอยู่แล้ว ตอนนี้เพิ่มความสามารถในการมองเห็น และนี่คือตัวเลือกใหม่ที่มีจริง ซึ่งไม่มีอยู่ใน Ling fast tier เมื่อสัปดาห์ก่อน จงนำไปใช้ในงานที่วิทัศน์เป็นของจริง ตรวจสอบค่า 42 ก่อนโยกย้ายอะไรโดยอาศัยตัวเลขนั้น และคงทางเลือกที่ย้อนกลับได้ที่ชั้นการจัดเส้นทาง (routing layer) ไว้จนกว่าจะมีคะแนนจากบุคคลที่สามและราคาประกาศอย่างเป็นทางการออกมา

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube