การ์ดไตเติลแบบฮีโร่ที่สร้างขึ้นสำหรับ Ling-3.0-flash-VL โดยมีคำบรรยายใต้ไตเติลว่า “Ant เปิดซอร์สโมเดลมัลติโมดัลบนไลน์ Ling ความเร็วสูง” แสดงไอคอนอินพุตสามไอคอนที่ติดป้ายว่า ข้อความ รูปภาพ และวิดีโอสั้น ลำเลียงผ่านชิปที่ระบุว่า “124B sparse MoE · 5.5B active” ไปยังไอคอนเอาต์พุตข้อความ พร้อมชิปส่วนท้าย “MIT weights”, “Live API” และ “FP8” และหมายเหตุ “เผยแพร่น้ำหนักโมเดลเมื่อวันที่ 4 กันยายน 2026” และโลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Guides & Insights

Ling-3.0-flash-VL: Ant เปิดตัวโมเดลมัลติโมดัลรุ่นความเร็วสูงในไลน์ Ling

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เมื่อวันที่ 4 กันยายน ค.ศ. 2026 ห้องปฏิบัติการ inclusionAI ของ Ant Group ได้เผยแพร่ค่าน้ำหนักที่ได้รับอนุญาตภายใต้ MIT สำหรับ Ling-3.0-flash-VL บน Hugging Face และในวันเดียวกันก็ได้อัปเดตเอกสารสำหรับนักพัฒนาของแพลตฟอร์ม Ling ของ Ant ให้สอดคล้องกัน Ling-3.0-flash-VL เป็น checkpoint แรกที่รองรับภาพในตระกูล Ling-3.0-flash: สถาปัตยกรรมหลักแบบ sparse mixture-of-experts ที่มีพารามิเตอร์ประมาณ 124 พันล้านตัวเดียวกันกับที่ทำให้ Ling-3.0-flash แบบข้อความเท่านั้นกลายเป็นหนึ่งในโมเดลใช้เหตุผลราคาถูกที่ถูกพูดถึงมากที่สุดในช่วงปลายฤดูร้อน ซึ่งตอนนี้สามารถอ่านภาพและคลิปวิดีโอสั้น ๆ ได้เช่นเดียวกับข้อความ การควอนไทซ์แบบ FP8 ตามมาในวันที่ 8 กันยายน ซึ่งเป็นเช้าของวันที่เขียนบทความนี้ ดังนั้นภายในสี่วัน การเผยแพร่ครั้งนี้ได้สร้างช่องทางที่ผู้อ่านสามารถใช้ประโยชน์ได้สามช่องทาง ได้แก่ ค่าน้ำหนักแบบเปิด (open weights), API อย่างเป็นทางการบนแพลตฟอร์ม Ling ของ Ant, และคะแนน 42 ที่รายงานโดยผู้พัฒนาตามโปรโตคอล Artificial Analysis Intelligence Index เวอร์ชัน 4.1.1 ซึ่งสูงกว่าคะแนน 38 ที่วัดโดยอิสระของโมเดลพี่น้องที่รองรับเฉพาะข้อความถึงสี่จุด สิ่งที่ยังไม่มีคือการประกาศอย่างเป็นทางการ: การ์ดบน Hugging Face และบทช่วยสอนสำหรับนักพัฒนาเท่านั้นคือทั้งหมดของการเปิดตัวครั้งนี้ ซึ่งเป็นเหตุผลที่บทความนี้แยกแยะสิ่งที่ผู้พัฒนาระบุออกจากสิ่งที่บุคคลภายนอกสามารถตรวจสอบได้

การเปิดตัวครั้งนี้มีความสำคัญเนื่องจากผลกระทบต่อแผนที่ผลิตภัณฑ์ของ Ant จนถึงกลางปี 2026 งานมัลติโมดัลในพอร์ตโฟลิโอโมเดลของ Ant อยู่ในไลน์แยกต่างหากที่ชื่อ Ming ในขณะที่ Ling-3.0-flash ถูกวางตำแหน่ง — รวมถึงในบทความอธิบายของบล็อกนี้เองสำหรับโมเดลข้อความ — เป็นระดับที่รวดเร็วสำหรับข้อความและเครื่องมือ สำหรับเอเจนต์ การเขียนโค้ด และการวิจัยเชิงลึก Ling-3.0-flash-VL ทลายขอบเขตนั้น: มันนำข้อมูลภาพเข้าสู่โมเดลการให้เหตุผลที่สร้างขึ้นรอบ ๆ พื้นที่พารามิเตอร์ที่เปิดใช้งานขนาดเล็กผิดปกติและการรันแบบเอเจนต์ที่ยาวนาน และมอบผลลัพธ์ให้แก่นักพัฒนาสามช่องทางพร้อมกัน นั่นทำให้เป็นการตัดสินใจที่แตกต่างอย่างแท้จริงจากเวอร์ชันที่ปรับแต่งเฉพาะโดเมนก่อนหน้านี้ (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante) ซึ่งเปิดให้บริการเป็น API ฟรีโดยไม่มีน้ำหนักโมเดล รุ่นนี้เป็นแบบเปิด ทำงานบนแพลตฟอร์มแบบชำระเงินของ Ant และยังใหม่อยู่มากจนไม่มีใครนอกเหนือจากผู้จำหน่ายเผยแพร่ผลการรันอิสระออกมา ข้อเท็จจริงข้อสุดท้ายนี้เป็นสิ่งที่สำคัญที่สุดในบทความ

จัดส่งอะไรไปบ้าง และเมื่อใด

ทุกวันที่ระบุด้านล่างสามารถตรวจสอบได้จากคลังเก็บ (repositories) และเอกสารประกอบ ไม่มีข้อมูลใดอ้างอิงจากข่าวประชาสัมพันธ์ที่ไม่มีอยู่จริง

• 4 กันยายน — คลังข้อมูล Hugging Face ชื่อ inclusionAI/Ling-3.0-flash-VL ถูกสร้างขึ้นเมื่อเวลา 15:24 UTC พร้อมน้ำหนัก bf16 จำนวน 64 ชาร์ด และสแตกโค้ดแบบกำหนดเองเต็มรูปแบบสำหรับ bailing_moe_v3_vl ซึ่งเป็นสถาปัตยกรรม ที่มีเทมเพลตแชทซึ่งเปิดใช้การคิดเป็นค่าเริ่มต้น และใช้ใบอนุญาต MIT จำนวนดาวน์โหลดมีเพียงหลักสิบในขณะที่เขียนบทความนี้: นี่คือการปล่อยที่เฉพาะผู้ที่เฝ้าดู repo เท่านั้นที่จะจับได้ในวันแรก

• 4 กันยายน — พอร์ทัลนักพัฒนาของ Ling-platform ของ Ant เพิ่มบทช่วยสอนเกี่ยวกับความเข้าใจมัลติโมดัลซึ่งอธิบายโมเดลบน API อย่างเป็นทางการ (ตราประทับ "อัปเดตล่าสุด" ของหน้านั้นเองระบุวันที่ 4 กันยายน 2026) สื่อนักพัฒนาจีนรายงานความสามารถดังกล่าวในวันถัดมา โดยนำเสนอว่าเป็นความเข้าใจภาพและวิดีโอสั้นสำหรับการตอบคำถามเชิงภาพและการวิเคราะห์เนื้อหา

• ตั้งแต่วันที่ 5 กันยายนเป็นต้นไป — การสนับสนุนด้านการให้บริการและการปรับใช้ปรากฏขึ้นอย่างรวดเร็ว: คู่มือการปรับใช้ SGLang สำหรับโมเดล, vLLM fork ที่กำหนดเองซึ่งดูแลโดยองค์กร inclusionAI, และรายการไลบรารีการปรับใช้แบบนำน้ำหนักมาเอง (bring-your-own-weights) พร้อม endpoint chat-completions ที่เตรียมไว้แล้ว สิ่งเหล่านี้คือรันไทม์และโครงสร้างพื้นฐาน ไม่ใช่การประกาศ แต่บอกให้รู้ว่าโมเดลนี้ถูกสร้างมาเพื่อให้บริการ ไม่ใช่แค่เผยแพร่เท่านั้น

• 8 กันยายน — การควอนไทซ์ FP8 ของ inclusionAI/Ling-3.0-flash-VL-fp8 ได้เปิดตัวแล้ว (64 ชาร์ด, ประมาณ 126 GB) โดยที่ vision tower ถูกตั้งค่าให้มีความแม่นยำสูงกว่าโดยเจตนา ขณะที่น้ำหนัก MoE ถูกบีบอัดเป็น FP8 E4M3 สำหรับการโฮสต์เองบน GPU ที่มีจำนวนน้อยลงหรือมีขนาดเล็กลง นี่คือ checkpoint ที่คนส่วนใหญ่จะดาวน์โหลดจริงๆ

An English screenshot of the Hugging Face model page for inclusionAI/Ling-3.0-flash-VL (captured September 8, 2026), showing the model tags text-generation, safetensors, bailing_moe_v3_vl, conversational and custom_code, a 'License: mit' badge, 'Downloads last month 42', model size 125B params, and an Inference Providers note that the model is not deployed by any provider. The card text introduces Ling-3.0-flash-VL as a 'next-generation native multimodal model' built on Ling-3.0-flash with 124B total parameters, only 5.5B activated per token, image and video inputs, and a context window of up to 1M tokens.

การ์ดโมเดลด้านบนคือสิ่งที่ใกล้เคียงที่สุดที่รีลีสนี้มีต่อโพสต์ประกาศเปิดตัว — มีคำอธิบายโมเดล สถาปัตยกรรม ลิงก์ไปยังสูตรใช้งานของ SGLang และ vLLM และไม่มีการประกาศที่อื่นใดที่เราหาเจอเลย โปรดสังเกตความไม่ตรงกันที่ควรชี้ให้เห็นแต่เนิ่นๆ: การ์ดโมเดลระบุว่า "เปิดใช้งานเพียง 5.5B พารามิเตอร์ต่อโทเคน" ขณะที่คู่มือ SGLang ที่เขียนขึ้นในช่วงเวลาเดียวกับการรีลีสอธิบายโมเดลที่มี "แอ็กทีฟ 5.1B" กรณีเช็กพอยต์ใหม่เอี่ยม ความแตกต่างนี้น่าจะมาจากการนับวิวชันทาวเวอร์มากกว่าจะเป็นคนละโมเดล แต่มันคือรายละเอียดประเภทที่ควรติดป้ายว่า "ยังไม่ยุติ" มากกว่าจะทำให้ดูเรียบเนียน

โมเดล 124B ที่เปิดใช้งาน 5.5B — ตอนนี้มีตาแล้ว

Ling-3.0-flash-VL ยังคงสูตรสถาปัตยกรรม sparse-MoE แบบไฮบริดที่ใช้ในรุ่นข้อความพี่น้อง การ์ดระบุว่าเป็น backbone 42 ชั้นสลับระหว่างเลเยอร์ Kimi-Delta-Attention และ Gated-MLA ในอัตราส่วน 5:1 — จังหวะโครงสร้างเดียวกันกับ Ling-3.0-flash — มีพารามิเตอร์รวมประมาณ 124.8 พันล้าน และมีการเปิดใช้งานเพียงเศษเสี้ยวเล็กน้อยต่อโทเคน สิ่งที่ใหม่คือชุดการรับรู้: ตัวเข้ารหัสภาพ ViT ป้อนเข้าสู่โปรเจกเตอร์ MLP สองชั้นก่อนเข้า backbone ภาษา พร้อมกับ VideoRoPE ที่ใช้เข้ารหัสตำแหน่งทั้งเชิงพื้นที่และเชิงเวลา เพื่อให้เฟรมวิดีโอมาพร้อมลำดับที่โมเดลสามารถใช้เหตุผลได้ อินพุตคือข้อความ รูปภาพ และวิดีโอ ส่วนเอาต์พุตคือข้อความ

• พารามิเตอร์ — รวม 124B, เปิดใช้งานประมาณ 5.5B ต่อโทเคนตามบัตรข้อมูลผู้จำหน่าย (ดูหมายเหตุเกี่ยวกับการนับบัญชีด้านบน)

บริบท — โฆษณาไว้ว่า “รองรับได้สูงสุด 1M tokens”; แต่สูตรการปรับใช้ที่มีอยู่ในปัจจุบันทดสอบที่ 256K ผ่าน YaRN rope scaling ซึ่งเป็นตัวเลขตามจริงในทางปฏิบัติที่สุดสำหรับใช้เป็นแนวทางวางแผน จนกว่าจะมีผู้เผยแพร่ผลการรันที่ยาวกว่านั้นที่ผ่านการตรวจสอบแล้ว

• Thinking — การให้เหตุผลเปิดใช้งานโดยค่าเริ่มต้นผ่านเทมเพลตแชท; ทั้งตัวอย่าง API อย่างเป็นทางการและสูตรการให้บริการต่างแสดงสวิตช์ enable_thinking: false แบบต่อคำขอสำหรับการเรียกที่ไวต่อเวลาแฝง

• สัญญาอนุญาต — MIT ทั้งสองรูปแบบความแม่นยำ ไม่มีเงื่อนไขเพิ่มเติม นี่คือสัญญาอนุญาตที่สะอาดแบบเดียวกันที่ทำให้การเปิดเผยซอร์สโค้ดของโมเดลข้อความในเดือนสิงหาคมมีความโดดเด่น และเป็นเหตุผลทั้งหมดที่ทำให้การโฮสต์ด้วยตนเองเป็นทางเลือกที่สมจริง ไม่ใช่พื้นที่สีเทา

ความตั้งใจในการออกแบบมีความสำคัญพอ ๆ กับสเปกชีต Ant จัดวางตำแหน่ง Ling-3.0-flash-VL ในฐานะโมเดลที่ "นำข้อมูลภาพเข้าสู่กระบวนการทั้งหมดของการทำความเข้าใจ การให้เหตุผล การลงมือทำ และการตรวจสอบยืนยัน" — ซึ่งเป็นภาษาของงานแบบเอเยนต์ (agentic) ไม่ใช่การบรรยายภาพ โมเดลที่สามารถดูการบันทึกหน้าจอ 30 วินาที เก็บเซสชันการเรียกใช้เครื่องมือยาว ๆ ไว้ในบริบท และรักษาต้นทุนการทำงานที่ใกล้เคียง 5 พันล้านพารามิเตอร์ ถูกออกแบบมาสำหรับเอเยนต์ที่ใช้คอมพิวเตอร์และเอเยนต์ที่อิงวิดีโอสั้นโดยตรง นั่นคือผลิตภัณฑ์ที่แตกต่างจากโมเดลภาษาเชิงวิทัศน์ (vision-language) ที่ปรับให้เหมาะกับการตอบคำถามจากภาพเดี่ยว และนี่คือกรอบที่ควรใช้อ่านเกณฑ์วัดทุกข้อด้านล่าง

สิ่งที่ API อย่างเป็นทางการยอมรับจริงๆ

บทช่วยสอนแพลตฟอร์ม Ant Ling อธิบาย Ling-3.0-flash-VL เกี่ยวกับ API สองรูปแบบ: endpoint ที่เข้ากันได้กับ OpenAI ที่ api.ant-ling.com/v1/chat/completions และตัวที่เข้ากันได้กับ Anthropic ที่ api.ant-ling.com/anthropic/v1/messages. ข้อจำกัดเหล่านี้ควรทราบก่อนที่คุณจะพัฒนาโดยใช้มัน:

• รูปภาพ — JPEG และ PNG, ใช้ base64 เท่านั้น, สูงสุด 40 รูปต่อคำขอ, แต่ละรูปมีขนาดสูงสุด 16,384 × 784 พิกเซล และสตริง base64 แต่ละอันสูงสุด 32 MB. พารามิเตอร์ที่เข้ากันได้กับ OpenAI image_url.detail จะถูกละเว้น; เอนจินจะตัดสินความละเอียดภายใน

• วิดีโอ — MP4, MOV หรือ WMV, หนึ่งคลิปต่อคำขอ, จำกัดที่ 30 วินาที, สุ่มตัวอย่างที่อัตราคงที่ 2 เฟรมต่อวินาที สูงสุด 32 เฟรม, base64 สูงสุด 32 MB วิดีโอใช้งานได้เฉพาะกับเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เท่านั้น; เอนด์พอยต์ที่เข้ากันได้กับ Anthropic รองรับข้อความและรูปภาพ แต่ไม่รองรับวิดีโอ

• ตัวระบุโมเดล — ตัวอย่างคำสั่ง curl ในบทช่วยสอนเรียกโมเดลนี้ว่า Ling-3.0-flash-VL-rc1 แทนที่จะเป็น Ling-3.0-flash-VL ซึ่ง -rc1 เป็นเครื่องหมายบ่งชี้รุ่นที่กำลังจะเผยแพร่ (release candidate) และเป็นคำถามที่ยังไม่มีคำตอบอย่างแท้จริง: ไม่มีอะไรในเอกสารระบุว่าแพลตฟอร์มให้บริการเวต (weights) ชุดใด หรือจุดตรวจสอบ (checkpoint) ของ API ตรงกับบิลด์เวตเปิดของวันที่ 4 กันยายนหรือไม่ หากคุณกำลังประเมิน API เทียบกับเวตเปิด นั่นคือสิ่งแรกที่ต้องทดสอบ ไม่ใช่สิ่งที่ควรคาดเดา

An English screenshot of Ant's Ling-platform developer tutorial 'Multimodal Understanding' (captured September 8, 2026, cropped to the article column), which opens 'Ling-3.0-flash-VL is a vision-language model that supports multimodal inputs and understands text, images, and video', then lists the image-understanding limits: JPEG and PNG formats, each image up to 16,384 × 784 pixels, each base64 string up to 32 MB, up to 40 images per request and a 32 MB maximum request body, with OpenAI Chat Completions and Anthropic Messages API columns.

หน้าด้านบนคือที่ระบุข้อจำกัดของอินพุต — รูปแบบรูปภาพและวิดีโอ ข้อจำกัดต่อคำขอ และโครงสร้างเอนด์พอยต์ทั้งสองแบบ นอกจากนี้ ยังเป็นที่ยืนยันว่าโมเดลดังกล่าวเป็นบริการ API เชิงพาณิชย์ที่ใช้งานได้จริง มิใช่เพียงเอกสารจำลองเท่านั้น

ตัวเลข — และผู้ที่รายงานตัวเลขเหล่านั้น

A generated single-column scoreboard titled 'Ling-3.0-flash-VL — the scoreboard', with rows 'Released: Sep 4 2026 — MIT weights plus live API', 'Architecture: 124B sparse MoE, ~5.5B active per token', 'Inputs: text, images, short video', 'Context: up to 1M tokens', 'AA Intelligence Index: 42 (vendor-reported)' and 'Text sibling Ling-3.0-flash: 38 (AA-measured)', with the footer 'VL figure per Ant model card; 38 measured by Artificial Analysis.' and the OrcaRouter logo bottom-right.

ตัวเลขหลักบนการ์ดคือ 42 ตามโปรโตคอล Artificial Analysis Intelligence Index เวอร์ชัน 4.1.1 ซึ่ง Ant ระบุว่าเหนือกว่าคะแนน 38 ของ Ling-3.0-flash แบบข้อความล้วนอยู่ 4 จุด ความแตกต่างในประโยคนั้นมีความสำคัญ คะแนน 38 เป็นค่าที่วัดโดย Artificial Analysis — ดำเนินการอย่างอิสระ เผยแพร่บนลีดเดอร์บอร์ดของพวกเขา และถูกอ้างอิงอย่างให้การยอมรับในรายงานของอุตสาหกรรมเกี่ยวกับโมเดลข้อความ ส่วนคะแนน 42 เป็นการอ้างสิทธิ์บนโมเดลการ์ดของ Ant เอง ซึ่งทำขึ้นภายใต้โปรโตคอล AA index แต่ยังไม่ถูกลงรายการโดย Artificial Analysis ซึ่งไม่มีหน้าสำหรับ Ling-3.0-flash-VL ณ เวลาที่เขียนนี้ ยังไม่มีใครนอกเหนือจาก Ant รัน checkpoint นี้ ควรถือว่า 42 เป็นตัวเลขจากผู้จำหน่ายในสายเดียวกันกับที่ผลิตคะแนนจริง 38 ของโมเดลข้อความ — เป็นเหตุผลให้ลองดู ไม่ใช่ตัวเลขที่จะอ้างเป็นที่ยอมรับแล้ว

สิ่งอื่นๆ ในรีลีสนี้เป็นเชิงคุณภาพหรือเชิงวิธีการ การ์ดโมเดลอธิบายความสามารถของโมเดลผ่านแผนภูมิสมรรถนะ "เข้าใจ ให้เหตุผล ลงมือทำ" (understand, reason, act) และอ้างถึงการประเมิน Terminal-Bench แบบเอเจนต์ภายใต้โปรโตคอลสไตล์ AA แต่ไม่มีการเผยแพร่ผลตัวเลขเชิงข้อความที่เราสามารถนำมาอ้างอิงซ้ำได้ที่นี่ คู่มือการปรับใช้ระบุค่าความแม่นยำ (MMMU-Pro, GSM8K) ที่ผูกกับรูปแบบการให้บริการเฉพาะซึ่งน่าอ่าน แต่เป็นการวัดที่เกี่ยวข้องกับโครงสร้างพื้นฐาน ไม่ใช่การประเมินอิสระ สรุปอย่างตรงไปตรงมาก็สั้นๆ ว่า: โมเดลให้เหตุผลที่ใช้งานได้จริง เสิร์ฟได้ในราคาถูก รองรับวิสัยทัศน์ แต่ยังไม่มีกระดานคะแนนอิสระจากสาธารณะ

ราคาเท่าไร และประวัติครอบครัวบ่งบอกอะไร

บทช่วยสอนมัลติโมดัลของ Ant ไม่ได้ระบุราคาต่อโทเค็นสำหรับ Ling-3.0-flash-VL ดังนั้นทุกอย่างในที่นี้จึงเป็นการคาดเดา ซึ่งระบุไว้อย่างชัดเจนเช่นนั้น จุดยึดที่มีประโยชน์คือโมเดลพี่น้องสายข้อความบนแพลตฟอร์มเดียวกัน: ราคารายการอย่างเป็นทางการของ Ling-3.0-flash อยู่ที่ประมาณ $0.075 ต่ออินพุต 1 ล้านโทเค็น และ $0.22 ต่อเอาต์พุต 1 ล้านโทเค็น โดยการอ่านแคชมีราคาถูกลงประมาณ 80% และคอนโซลจีนคิดราคาเป็นหยวน (อินพุต ¥0.40 / เอาต์พุต ¥1.20 ต่อ 1 ล้านโทเค็น) หลังจากโปรโมชันลด 75% ในช่วงแรกซึ่งสิ้นสุดในวันที่ 31 สิงหาคม โมเดลมัลติโมดัลขนาด 124B-A5.5B มีต้นทุนการให้บริการสูงกว่าโมเดลข้อความขนาด 124B-A5.1B — วิสันทาวเวอร์ (vision tower) เป็นแบบ dense และทำงานทุกโทเค็นรูปภาพ — ดังนั้นราคาที่เท่ากับหรือสูงกว่าแถบราคานั้นเล็กน้อยจึงเป็นค่าก่อนหน้า (prior) ที่สมเหตุสมผล ประวัติตระกูลโมเดลก็ชี้ไปอีกทางหนึ่งเช่นกัน: ตัวแปรโดเมน Fin และ Sante เปิดตัวเป็น API ฟรี ดังนั้น Ant ได้แสดงให้เห็นแล้วว่าจะใช้ราคาเป็นศูนย์เพื่อกระตุ้นการนำไปใช้สำหรับตัวแปร Ling ที่ต้องการผลักเข้าสู่ตลาด ยังไม่เป็นที่เปิดเผยว่า VL จะทำตามแถบราคาโมเดลข้อความแบบเสียเงินหรือรูปแบบตัวแปรฟรี

สำหรับเส้นทาง self-host ตัวเลขมีความเป็นรูปธรรมเพราะไฟล์เปิดเผยต่อสาธารณะ เวอร์ชัน bf16 มีขนาดดาวน์โหลดประมาณ 250 GB กระจายอยู่ใน 64 ชาร์ด ซึ่งเป็นเรื่องที่ต้องใช้ GPU หลายตัวบนโหนดเดี่ยวที่ใหญ่ที่สุดเท่านั้น ในขณะที่เวอร์ชัน FP8 (~126 GB โดยที่ vision tower ยังคงเป็น bf16) พอดีกับโหนดที่มีตัวเร่งความเร็วระดับ 80 GB จำนวน 8 ตัว และเป็นเวอร์ชันที่ทีมส่วนใหญ่จะใช้งานจริง มีการอ้างสิทธิ์เรื่องปริมาณงาน (throughput) จาก serving cookbook อยู่ แต่ก็เป็นข้อมูลที่ใกล้ชิดกับผู้จำหน่าย คาดหวังข้อควรระวังตามปกติว่า token/s จริงขึ้นอยู่กับฮาร์ดแวร์และ batch ของคุณ

เลเยอร์การกำหนดเส้นทางเหมาะกับตรงไหน — พูดตามตรง

ในตอนเปิดตัว เกตเวย์โมเดลของบุคคลที่สามรายใหญ่ที่เราตรวจสอบแล้ว ไม่มีรายใดระบุ Ling-3.0-flash-VL ในรายการ และ OrcaRouter ซึ่งเป็นแพลตฟอร์มจัดเส้นทางที่บล็อกนี้สังกัดอยู่ ก็ไม่ได้ให้บริการโมเดลนี้เช่นกัน ไม่มีข้อความใดในบทความนี้ที่ควรอ่านแล้วเข้าใจว่าเป็นเช่นนั้น นั่นคือสถานะตามจริงของโมเดลที่เพิ่งถือกำเนิดมาได้สี่วัน และสมควรพูดออกมาตรง ๆ เพราะตัวเลือกที่ผู้อ่านมีอยู่จริงในวันนี้มีเพียงสองทางเท่านั้น: เรียกใช้ API อย่างเป็นทางการของ Ant หรือโฮสต์น้ำหนักโมเดล MIT เอง ในแง่ของการจัดเส้นทาง นั่นคือก้าวถัดไปที่จะเกิดขึ้น เมื่อโมเดลแบบนี้เข้าสู่การให้บริการผ่านบุคคลที่สาม เศรษฐศาสตร์ของเราเตอร์แบบส่งผ่านคือเหตุผลที่ควรเลือกใช้เพื่อการประเมิน: ราคารายการของผู้ให้บริการถูกส่งต่อโดยไม่บวกเพิ่ม 0% ดังนั้นการลดราคาของผู้ขาย (หรือการทดลองระดับใช้งานฟรีอย่างการเปิดตัว Fin และ Sante) จึงมีผลในวันเดียวกับที่ประกาศ และการสลับระบบอัตโนมัติช่วยให้คุณส่งปริมาณงานจริงไปยังโมเดลเปิดที่เพิ่งออกมาไม่กี่วันได้ โดยไม่ต้องเดิมพันสแตกทั้งหมดของคุณกับเวลาทำงานของผู้ขายรายใดรายหนึ่งหรือพฤติกรรมของเช็คพอยต์ใดเช็คพอยต์หนึ่ง สำหรับตระกูลโมเดลที่ปรับราคาตัวเองมาแล้วครั้งหนึ่งและแตกแขนงเป็นสี่เวอร์ชันภายในหกสัปดาห์ นี่ไม่ใช่เรื่องสมมุติ — มันคือความแตกต่างระหว่างการทดสอบซ้ำด้วยมือทุกครั้งที่ Ant ขยับตัว กับการทดสอบซ้ำเพียงครั้งเดียวผ่าน API เดียว

ดูอะไรดี

การเปิดตัวครั้งนี้ยังใหม่พอที่สัญญาณที่มีประโยชน์ส่วนใหญ่คือการตรวจสอบที่ใคร ๆ ก็สามารถทำได้ ประการแรก ไม่ว่า Artificial Analysis (หรือห้องปฏิบัติการอิสระแห่งอื่น) จะระบุ Ling-3.0-flash-VL ในรายการและยืนยันหรือแก้ไขตัวเลข 42 — จุดข้อมูลจุดเดียวนี้แยก "โมเดลที่ดีที่สุดของตระกูล" ออกจาก "หมายเลขของผู้ขายรายอื่น" ประการที่สอง ว่า -rc1เป็นตัวระบุบน API ทางการที่ตรงกับน้ำหนักเปิดเมื่อวันที่ 4 กันยายนหรือไม่; ถ้าไม่ตรง API และเส้นทาง self-host จะเป็นโมเดลคนละตัว และทุกการเปรียบเทียบที่คุณอ่านต้องระบุว่าใช้ตัวไหน ประการที่สาม ราคา: อัตรา VL ที่เผยแพร่บนแพลตฟอร์ม Ling และไม่ว่าจะเป็นไปตามช่วงที่ต้องชำระเงินของโมเดลข้อความหรือตามแนวทาง API ฟรีของ Fin/Sante ประการที่สี่ ไม่ว่าเช็คพอยต์ FP8 จะรักษาความแม่นยำของการ์ดในการให้บริการจริง — ทาวเวอร์วิทัศน์ที่เก็บใน bf16 เป็นสัญญาณที่ดี แต่การอ้างสิทธิ์เกี่ยวกับวิทัศน์แบบควอนไทซ์ต้องมีการรันจริง ไม่ใช่แค่คอนฟิก ประการที่ห้า คำถามแผนที่ผลิตภัณฑ์: เมื่อวิทัศน์อยู่ในสาย Ling ที่เร็วแล้ว ให้สังเกตว่า Ant จะรักษา Ming ไว้เป็นแบรนด์มัลติโมดัลแยกต่างหากหรือปล่อยให้ทั้งสองรวมกัน

สำหรับนักพัฒนา คำตอบในระยะใกล้นั้นสั้น หากคุณต้องการสร้างบนสิ่งนี้ในวันนี้ API อย่างเป็นทางการคือเส้นทางที่ไม่มีโครงสร้างพื้นฐาน และน้ำหนัก FP8 คือเส้นทางโฮสต์ด้วยตนเอง และทั้งคู่เป็นของจริงตั้งแต่สัปดาห์นี้ หากคุณต้องการสร้างบนหมายเลข 42 ให้รอคนนอก Ant มาทำซ้ำ ทุกอย่างที่มีประโยชน์อย่างแท้จริงเกี่ยวกับ Ling-3.0-flash-VL — น้ำหนัก MIT สถาปัตยกรรมที่เป็นไปได้ การออกแบบราคาต่อการเปิดใช้งานที่จริงจัง และคะแนนผู้ขายที่ควรให้ความสำคัญ — มีอยู่แล้ว; ทุกอย่างที่จะทำให้เป็นค่าเริ่มต้นที่ปลอดภัยยังคงค้างอยู่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube