
Ling-3.0-flash-VL: Ant เปิดตัวโมเดลมัลติโมดัลรุ่นความเร็วสูงในไลน์ Ling
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
เมื่อวันที่ 4 กันยายน ค.ศ. 2026 ห้องปฏิบัติการ inclusionAI ของ Ant Group ได้เผยแพร่ค่าน้ำหนักที่ได้รับอนุญาตภายใต้ MIT สำหรับ Ling-3.0-flash-VL บน Hugging Face และในวันเดียวกันก็ได้อัปเดตเอกสารสำหรับนักพัฒนาของแพลตฟอร์ม Ling ของ Ant ให้สอดคล้องกัน Ling-3.0-flash-VL เป็น checkpoint แรกที่รองรับภาพในตระกูล Ling-3.0-flash: สถาปัตยกรรมหลักแบบ sparse mixture-of-experts ที่มีพารามิเตอร์ประมาณ 124 พันล้านตัวเดียวกันกับที่ทำให้ Ling-3.0-flash แบบข้อความเท่านั้นกลายเป็นหนึ่งในโมเดลใช้เหตุผลราคาถูกที่ถูกพูดถึงมากที่สุดในช่วงปลายฤดูร้อน ซึ่งตอนนี้สามารถอ่านภาพและคลิปวิดีโอสั้น ๆ ได้เช่นเดียวกับข้อความ การควอนไทซ์แบบ FP8 ตามมาในวันที่ 8 กันยายน ซึ่งเป็นเช้าของวันที่เขียนบทความนี้ ดังนั้นภายในสี่วัน การเผยแพร่ครั้งนี้ได้สร้างช่องทางที่ผู้อ่านสามารถใช้ประโยชน์ได้สามช่องทาง ได้แก่ ค่าน้ำหนักแบบเปิด (open weights), API อย่างเป็นทางการบนแพลตฟอร์ม Ling ของ Ant, และคะแนน 42 ที่รายงานโดยผู้พัฒนาตามโปรโตคอล Artificial Analysis Intelligence Index เวอร์ชัน 4.1.1 ซึ่งสูงกว่าคะแนน 38 ที่วัดโดยอิสระของโมเดลพี่น้องที่รองรับเฉพาะข้อความถึงสี่จุด สิ่งที่ยังไม่มีคือการประกาศอย่างเป็นทางการ: การ์ดบน Hugging Face และบทช่วยสอนสำหรับนักพัฒนาเท่านั้นคือทั้งหมดของการเปิดตัวครั้งนี้ ซึ่งเป็นเหตุผลที่บทความนี้แยกแยะสิ่งที่ผู้พัฒนาระบุออกจากสิ่งที่บุคคลภายนอกสามารถตรวจสอบได้
การเปิดตัวครั้งนี้มีความสำคัญเนื่องจากผลกระทบต่อแผนที่ผลิตภัณฑ์ของ Ant จนถึงกลางปี 2026 งานมัลติโมดัลในพอร์ตโฟลิโอโมเดลของ Ant อยู่ในไลน์แยกต่างหากที่ชื่อ Ming ในขณะที่ Ling-3.0-flash ถูกวางตำแหน่ง — รวมถึงในบทความอธิบายของบล็อกนี้เองสำหรับโมเดลข้อความ — เป็นระดับที่รวดเร็วสำหรับข้อความและเครื่องมือ สำหรับเอเจนต์ การเขียนโค้ด และการวิจัยเชิงลึก Ling-3.0-flash-VL ทลายขอบเขตนั้น: มันนำข้อมูลภาพเข้าสู่โมเดลการให้เหตุผลที่สร้างขึ้นรอบ ๆ พื้นที่พารามิเตอร์ที่เปิดใช้งานขนาดเล็กผิดปกติและการรันแบบเอเจนต์ที่ยาวนาน และมอบผลลัพธ์ให้แก่นักพัฒนาสามช่องทางพร้อมกัน นั่นทำให้เป็นการตัดสินใจที่แตกต่างอย่างแท้จริงจากเวอร์ชันที่ปรับแต่งเฉพาะโดเมนก่อนหน้านี้ (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante) ซึ่งเปิดให้บริการเป็น API ฟรีโดยไม่มีน้ำหนักโมเดล รุ่นนี้เป็นแบบเปิด ทำงานบนแพลตฟอร์มแบบชำระเงินของ Ant และยังใหม่อยู่มากจนไม่มีใครนอกเหนือจากผู้จำหน่ายเผยแพร่ผลการรันอิสระออกมา ข้อเท็จจริงข้อสุดท้ายนี้เป็นสิ่งที่สำคัญที่สุดในบทความ
จัดส่งอะไรไปบ้าง และเมื่อใด
ทุกวันที่ระบุด้านล่างสามารถตรวจสอบได้จากคลังเก็บ (repositories) และเอกสารประกอบ ไม่มีข้อมูลใดอ้างอิงจากข่าวประชาสัมพันธ์ที่ไม่มีอยู่จริง
• 4 กันยายน — คลังข้อมูล Hugging Face ชื่อ inclusionAI/Ling-3.0-flash-VL ถูกสร้างขึ้นเมื่อเวลา 15:24 UTC พร้อมน้ำหนัก bf16 จำนวน 64 ชาร์ด และสแตกโค้ดแบบกำหนดเองเต็มรูปแบบสำหรับ bailing_moe_v3_vl ซึ่งเป็นสถาปัตยกรรม ที่มีเทมเพลตแชทซึ่งเปิดใช้การคิดเป็นค่าเริ่มต้น และใช้ใบอนุญาต MIT จำนวนดาวน์โหลดมีเพียงหลักสิบในขณะที่เขียนบทความนี้: นี่คือการปล่อยที่เฉพาะผู้ที่เฝ้าดู repo เท่านั้นที่จะจับได้ในวันแรก
• 4 กันยายน — พอร์ทัลนักพัฒนาของ Ling-platform ของ Ant เพิ่มบทช่วยสอนเกี่ยวกับความเข้าใจมัลติโมดัลซึ่งอธิบายโมเดลบน API อย่างเป็นทางการ (ตราประทับ "อัปเดตล่าสุด" ของหน้านั้นเองระบุวันที่ 4 กันยายน 2026) สื่อนักพัฒนาจีนรายงานความสามารถดังกล่าวในวันถัดมา โดยนำเสนอว่าเป็นความเข้าใจภาพและวิดีโอสั้นสำหรับการตอบคำถามเชิงภาพและการวิเคราะห์เนื้อหา
• ตั้งแต่วันที่ 5 กันยายนเป็นต้นไป — การสนับสนุนด้านการให้บริการและการปรับใช้ปรากฏขึ้นอย่างรวดเร็ว: คู่มือการปรับใช้ SGLang สำหรับโมเดล, vLLM fork ที่กำหนดเองซึ่งดูแลโดยองค์กร inclusionAI, และรายการไลบรารีการปรับใช้แบบนำน้ำหนักมาเอง (bring-your-own-weights) พร้อม endpoint chat-completions ที่เตรียมไว้แล้ว สิ่งเหล่านี้คือรันไทม์และโครงสร้างพื้นฐาน ไม่ใช่การประกาศ แต่บอกให้รู้ว่าโมเดลนี้ถูกสร้างมาเพื่อให้บริการ ไม่ใช่แค่เผยแพร่เท่านั้น
• 8 กันยายน — การควอนไทซ์ FP8 ของ inclusionAI/Ling-3.0-flash-VL-fp8 ได้เปิดตัวแล้ว (64 ชาร์ด, ประมาณ 126 GB) โดยที่ vision tower ถูกตั้งค่าให้มีความแม่นยำสูงกว่าโดยเจตนา ขณะที่น้ำหนัก MoE ถูกบีบอัดเป็น FP8 E4M3 สำหรับการโฮสต์เองบน GPU ที่มีจำนวนน้อยลงหรือมีขนาดเล็กลง นี่คือ checkpoint ที่คนส่วนใหญ่จะดาวน์โหลดจริงๆ

การ์ดโมเดลด้านบนคือสิ่งที่ใกล้เคียงที่สุดที่รีลีสนี้มีต่อโพสต์ประกาศเปิดตัว — มีคำอธิบายโมเดล สถาปัตยกรรม ลิงก์ไปยังสูตรใช้งานของ SGLang และ vLLM และไม่มีการประกาศที่อื่นใดที่เราหาเจอเลย โปรดสังเกตความไม่ตรงกันที่ควรชี้ให้เห็นแต่เนิ่นๆ: การ์ดโมเดลระบุว่า "เปิดใช้งานเพียง 5.5B พารามิเตอร์ต่อโทเคน" ขณะที่คู่มือ SGLang ที่เขียนขึ้นในช่วงเวลาเดียวกับการรีลีสอธิบายโมเดลที่มี "แอ็กทีฟ 5.1B" กรณีเช็กพอยต์ใหม่เอี่ยม ความแตกต่างนี้น่าจะมาจากการนับวิวชันทาวเวอร์มากกว่าจะเป็นคนละโมเดล แต่มันคือรายละเอียดประเภทที่ควรติดป้ายว่า "ยังไม่ยุติ" มากกว่าจะทำให้ดูเรียบเนียน
โมเดล 124B ที่เปิดใช้งาน 5.5B — ตอนนี้มีตาแล้ว
Ling-3.0-flash-VL ยังคงสูตรสถาปัตยกรรม sparse-MoE แบบไฮบริดที่ใช้ในรุ่นข้อความพี่น้อง การ์ดระบุว่าเป็น backbone 42 ชั้นสลับระหว่างเลเยอร์ Kimi-Delta-Attention และ Gated-MLA ในอัตราส่วน 5:1 — จังหวะโครงสร้างเดียวกันกับ Ling-3.0-flash — มีพารามิเตอร์รวมประมาณ 124.8 พันล้าน และมีการเปิดใช้งานเพียงเศษเสี้ยวเล็กน้อยต่อโทเคน สิ่งที่ใหม่คือชุดการรับรู้: ตัวเข้ารหัสภาพ ViT ป้อนเข้าสู่โปรเจกเตอร์ MLP สองชั้นก่อนเข้า backbone ภาษา พร้อมกับ VideoRoPE ที่ใช้เข้ารหัสตำแหน่งทั้งเชิงพื้นที่และเชิงเวลา เพื่อให้เฟรมวิดีโอมาพร้อมลำดับที่โมเดลสามารถใช้เหตุผลได้ อินพุตคือข้อความ รูปภาพ และวิดีโอ ส่วนเอาต์พุตคือข้อความ
• พารามิเตอร์ — รวม 124B, เปิดใช้งานประมาณ 5.5B ต่อโทเคนตามบัตรข้อมูลผู้จำหน่าย (ดูหมายเหตุเกี่ยวกับการนับบัญชีด้านบน)
บริบท — โฆษณาไว้ว่า “รองรับได้สูงสุด 1M tokens”; แต่สูตรการปรับใช้ที่มีอยู่ในปัจจุบันทดสอบที่ 256K ผ่าน YaRN rope scaling ซึ่งเป็นตัวเลขตามจริงในทางปฏิบัติที่สุดสำหรับใช้เป็นแนวทางวางแผน จนกว่าจะมีผู้เผยแพร่ผลการรันที่ยาวกว่านั้นที่ผ่านการตรวจสอบแล้ว
• Thinking — การให้เหตุผลเปิดใช้งานโดยค่าเริ่มต้นผ่านเทมเพลตแชท; ทั้งตัวอย่าง API อย่างเป็นทางการและสูตรการให้บริการต่างแสดงสวิตช์ enable_thinking: false แบบต่อคำขอสำหรับการเรียกที่ไวต่อเวลาแฝง
• สัญญาอนุญาต — MIT ทั้งสองรูปแบบความแม่นยำ ไม่มีเงื่อนไขเพิ่มเติม นี่คือสัญญาอนุญาตที่สะอาดแบบเดียวกันที่ทำให้การเปิดเผยซอร์สโค้ดของโมเดลข้อความในเดือนสิงหาคมมีความโดดเด่น และเป็นเหตุผลทั้งหมดที่ทำให้การโฮสต์ด้วยตนเองเป็นทางเลือกที่สมจริง ไม่ใช่พื้นที่สีเทา
ความตั้งใจในการออกแบบมีความสำคัญพอ ๆ กับสเปกชีต Ant จัดวางตำแหน่ง Ling-3.0-flash-VL ในฐานะโมเดลที่ "นำข้อมูลภาพเข้าสู่กระบวนการทั้งหมดของการทำความเข้าใจ การให้เหตุผล การลงมือทำ และการตรวจสอบยืนยัน" — ซึ่งเป็นภาษาของงานแบบเอเยนต์ (agentic) ไม่ใช่การบรรยายภาพ โมเดลที่สามารถดูการบันทึกหน้าจอ 30 วินาที เก็บเซสชันการเรียกใช้เครื่องมือยาว ๆ ไว้ในบริบท และรักษาต้นทุนการทำงานที่ใกล้เคียง 5 พันล้านพารามิเตอร์ ถูกออกแบบมาสำหรับเอเยนต์ที่ใช้คอมพิวเตอร์และเอเยนต์ที่อิงวิดีโอสั้นโดยตรง นั่นคือผลิตภัณฑ์ที่แตกต่างจากโมเดลภาษาเชิงวิทัศน์ (vision-language) ที่ปรับให้เหมาะกับการตอบคำถามจากภาพเดี่ยว และนี่คือกรอบที่ควรใช้อ่านเกณฑ์วัดทุกข้อด้านล่าง
สิ่งที่ API อย่างเป็นทางการยอมรับจริงๆ
บทช่วยสอนแพลตฟอร์ม Ant Ling อธิบาย Ling-3.0-flash-VL เกี่ยวกับ API สองรูปแบบ: endpoint ที่เข้ากันได้กับ OpenAI ที่ api.ant-ling.com/v1/chat/completions และตัวที่เข้ากันได้กับ Anthropic ที่ api.ant-ling.com/anthropic/v1/messages. ข้อจำกัดเหล่านี้ควรทราบก่อนที่คุณจะพัฒนาโดยใช้มัน:
• รูปภาพ — JPEG และ PNG, ใช้ base64 เท่านั้น, สูงสุด 40 รูปต่อคำขอ, แต่ละรูปมีขนาดสูงสุด 16,384 × 784 พิกเซล และสตริง base64 แต่ละอันสูงสุด 32 MB. พารามิเตอร์ที่เข้ากันได้กับ OpenAI image_url.detail จะถูกละเว้น; เอนจินจะตัดสินความละเอียดภายใน
• วิดีโอ — MP4, MOV หรือ WMV, หนึ่งคลิปต่อคำขอ, จำกัดที่ 30 วินาที, สุ่มตัวอย่างที่อัตราคงที่ 2 เฟรมต่อวินาที สูงสุด 32 เฟรม, base64 สูงสุด 32 MB วิดีโอใช้งานได้เฉพาะกับเอนด์พอยต์ที่เข้ากันได้กับ OpenAI เท่านั้น; เอนด์พอยต์ที่เข้ากันได้กับ Anthropic รองรับข้อความและรูปภาพ แต่ไม่รองรับวิดีโอ
• ตัวระบุโมเดล — ตัวอย่างคำสั่ง curl ในบทช่วยสอนเรียกโมเดลนี้ว่า Ling-3.0-flash-VL-rc1 แทนที่จะเป็น Ling-3.0-flash-VL ซึ่ง -rc1 เป็นเครื่องหมายบ่งชี้รุ่นที่กำลังจะเผยแพร่ (release candidate) และเป็นคำถามที่ยังไม่มีคำตอบอย่างแท้จริง: ไม่มีอะไรในเอกสารระบุว่าแพลตฟอร์มให้บริการเวต (weights) ชุดใด หรือจุดตรวจสอบ (checkpoint) ของ API ตรงกับบิลด์เวตเปิดของวันที่ 4 กันยายนหรือไม่ หากคุณกำลังประเมิน API เทียบกับเวตเปิด นั่นคือสิ่งแรกที่ต้องทดสอบ ไม่ใช่สิ่งที่ควรคาดเดา

หน้าด้านบนคือที่ระบุข้อจำกัดของอินพุต — รูปแบบรูปภาพและวิดีโอ ข้อจำกัดต่อคำขอ และโครงสร้างเอนด์พอยต์ทั้งสองแบบ นอกจากนี้ ยังเป็นที่ยืนยันว่าโมเดลดังกล่าวเป็นบริการ API เชิงพาณิชย์ที่ใช้งานได้จริง มิใช่เพียงเอกสารจำลองเท่านั้น
ตัวเลข — และผู้ที่รายงานตัวเลขเหล่านั้น

ตัวเลขหลักบนการ์ดคือ 42 ตามโปรโตคอล Artificial Analysis Intelligence Index เวอร์ชัน 4.1.1 ซึ่ง Ant ระบุว่าเหนือกว่าคะแนน 38 ของ Ling-3.0-flash แบบข้อความล้วนอยู่ 4 จุด ความแตกต่างในประโยคนั้นมีความสำคัญ คะแนน 38 เป็นค่าที่วัดโดย Artificial Analysis — ดำเนินการอย่างอิสระ เผยแพร่บนลีดเดอร์บอร์ดของพวกเขา และถูกอ้างอิงอย่างให้การยอมรับในรายงานของอุตสาหกรรมเกี่ยวกับโมเดลข้อความ ส่วนคะแนน 42 เป็นการอ้างสิทธิ์บนโมเดลการ์ดของ Ant เอง ซึ่งทำขึ้นภายใต้โปรโตคอล AA index แต่ยังไม่ถูกลงรายการโดย Artificial Analysis ซึ่งไม่มีหน้าสำหรับ Ling-3.0-flash-VL ณ เวลาที่เขียนนี้ ยังไม่มีใครนอกเหนือจาก Ant รัน checkpoint นี้ ควรถือว่า 42 เป็นตัวเลขจากผู้จำหน่ายในสายเดียวกันกับที่ผลิตคะแนนจริง 38 ของโมเดลข้อความ — เป็นเหตุผลให้ลองดู ไม่ใช่ตัวเลขที่จะอ้างเป็นที่ยอมรับแล้ว
สิ่งอื่นๆ ในรีลีสนี้เป็นเชิงคุณภาพหรือเชิงวิธีการ การ์ดโมเดลอธิบายความสามารถของโมเดลผ่านแผนภูมิสมรรถนะ "เข้าใจ ให้เหตุผล ลงมือทำ" (understand, reason, act) และอ้างถึงการประเมิน Terminal-Bench แบบเอเจนต์ภายใต้โปรโตคอลสไตล์ AA แต่ไม่มีการเผยแพร่ผลตัวเลขเชิงข้อความที่เราสามารถนำมาอ้างอิงซ้ำได้ที่นี่ คู่มือการปรับใช้ระบุค่าความแม่นยำ (MMMU-Pro, GSM8K) ที่ผูกกับรูปแบบการให้บริการเฉพาะซึ่งน่าอ่าน แต่เป็นการวัดที่เกี่ยวข้องกับโครงสร้างพื้นฐาน ไม่ใช่การประเมินอิสระ สรุปอย่างตรงไปตรงมาก็สั้นๆ ว่า: โมเดลให้เหตุผลที่ใช้งานได้จริง เสิร์ฟได้ในราคาถูก รองรับวิสัยทัศน์ แต่ยังไม่มีกระดานคะแนนอิสระจากสาธารณะ
ราคาเท่าไร และประวัติครอบครัวบ่งบอกอะไร
บทช่วยสอนมัลติโมดัลของ Ant ไม่ได้ระบุราคาต่อโทเค็นสำหรับ Ling-3.0-flash-VL ดังนั้นทุกอย่างในที่นี้จึงเป็นการคาดเดา ซึ่งระบุไว้อย่างชัดเจนเช่นนั้น จุดยึดที่มีประโยชน์คือโมเดลพี่น้องสายข้อความบนแพลตฟอร์มเดียวกัน: ราคารายการอย่างเป็นทางการของ Ling-3.0-flash อยู่ที่ประมาณ $0.075 ต่ออินพุต 1 ล้านโทเค็น และ $0.22 ต่อเอาต์พุต 1 ล้านโทเค็น โดยการอ่านแคชมีราคาถูกลงประมาณ 80% และคอนโซลจีนคิดราคาเป็นหยวน (อินพุต ¥0.40 / เอาต์พุต ¥1.20 ต่อ 1 ล้านโทเค็น) หลังจากโปรโมชันลด 75% ในช่วงแรกซึ่งสิ้นสุดในวันที่ 31 สิงหาคม โมเดลมัลติโมดัลขนาด 124B-A5.5B มีต้นทุนการให้บริการสูงกว่าโมเดลข้อความขนาด 124B-A5.1B — วิสันทาวเวอร์ (vision tower) เป็นแบบ dense และทำงานทุกโทเค็นรูปภาพ — ดังนั้นราคาที่เท่ากับหรือสูงกว่าแถบราคานั้นเล็กน้อยจึงเป็นค่าก่อนหน้า (prior) ที่สมเหตุสมผล ประวัติตระกูลโมเดลก็ชี้ไปอีกทางหนึ่งเช่นกัน: ตัวแปรโดเมน Fin และ Sante เปิดตัวเป็น API ฟรี ดังนั้น Ant ได้แสดงให้เห็นแล้วว่าจะใช้ราคาเป็นศูนย์เพื่อกระตุ้นการนำไปใช้สำหรับตัวแปร Ling ที่ต้องการผลักเข้าสู่ตลาด ยังไม่เป็นที่เปิดเผยว่า VL จะทำตามแถบราคาโมเดลข้อความแบบเสียเงินหรือรูปแบบตัวแปรฟรี
สำหรับเส้นทาง self-host ตัวเลขมีความเป็นรูปธรรมเพราะไฟล์เปิดเผยต่อสาธารณะ เวอร์ชัน bf16 มีขนาดดาวน์โหลดประมาณ 250 GB กระจายอยู่ใน 64 ชาร์ด ซึ่งเป็นเรื่องที่ต้องใช้ GPU หลายตัวบนโหนดเดี่ยวที่ใหญ่ที่สุดเท่านั้น ในขณะที่เวอร์ชัน FP8 (~126 GB โดยที่ vision tower ยังคงเป็น bf16) พอดีกับโหนดที่มีตัวเร่งความเร็วระดับ 80 GB จำนวน 8 ตัว และเป็นเวอร์ชันที่ทีมส่วนใหญ่จะใช้งานจริง มีการอ้างสิทธิ์เรื่องปริมาณงาน (throughput) จาก serving cookbook อยู่ แต่ก็เป็นข้อมูลที่ใกล้ชิดกับผู้จำหน่าย คาดหวังข้อควรระวังตามปกติว่า token/s จริงขึ้นอยู่กับฮาร์ดแวร์และ batch ของคุณ
เลเยอร์การกำหนดเส้นทางเหมาะกับตรงไหน — พูดตามตรง
ในตอนเปิดตัว เกตเวย์โมเดลของบุคคลที่สามรายใหญ่ที่เราตรวจสอบแล้ว ไม่มีรายใดระบุ Ling-3.0-flash-VL ในรายการ และ OrcaRouter ซึ่งเป็นแพลตฟอร์มจัดเส้นทางที่บล็อกนี้สังกัดอยู่ ก็ไม่ได้ให้บริการโมเดลนี้เช่นกัน ไม่มีข้อความใดในบทความนี้ที่ควรอ่านแล้วเข้าใจว่าเป็นเช่นนั้น นั่นคือสถานะตามจริงของโมเดลที่เพิ่งถือกำเนิดมาได้สี่วัน และสมควรพูดออกมาตรง ๆ เพราะตัวเลือกที่ผู้อ่านมีอยู่จริงในวันนี้มีเพียงสองทางเท่านั้น: เรียกใช้ API อย่างเป็นทางการของ Ant หรือโฮสต์น้ำหนักโมเดล MIT เอง ในแง่ของการจัดเส้นทาง นั่นคือก้าวถัดไปที่จะเกิดขึ้น เมื่อโมเดลแบบนี้เข้าสู่การให้บริการผ่านบุคคลที่สาม เศรษฐศาสตร์ของเราเตอร์แบบส่งผ่านคือเหตุผลที่ควรเลือกใช้เพื่อการประเมิน: ราคารายการของผู้ให้บริการถูกส่งต่อโดยไม่บวกเพิ่ม 0% ดังนั้นการลดราคาของผู้ขาย (หรือการทดลองระดับใช้งานฟรีอย่างการเปิดตัว Fin และ Sante) จึงมีผลในวันเดียวกับที่ประกาศ และการสลับระบบอัตโนมัติช่วยให้คุณส่งปริมาณงานจริงไปยังโมเดลเปิดที่เพิ่งออกมาไม่กี่วันได้ โดยไม่ต้องเดิมพันสแตกทั้งหมดของคุณกับเวลาทำงานของผู้ขายรายใดรายหนึ่งหรือพฤติกรรมของเช็คพอยต์ใดเช็คพอยต์หนึ่ง สำหรับตระกูลโมเดลที่ปรับราคาตัวเองมาแล้วครั้งหนึ่งและแตกแขนงเป็นสี่เวอร์ชันภายในหกสัปดาห์ นี่ไม่ใช่เรื่องสมมุติ — มันคือความแตกต่างระหว่างการทดสอบซ้ำด้วยมือทุกครั้งที่ Ant ขยับตัว กับการทดสอบซ้ำเพียงครั้งเดียวผ่าน API เดียว
ดูอะไรดี
การเปิดตัวครั้งนี้ยังใหม่พอที่สัญญาณที่มีประโยชน์ส่วนใหญ่คือการตรวจสอบที่ใคร ๆ ก็สามารถทำได้ ประการแรก ไม่ว่า Artificial Analysis (หรือห้องปฏิบัติการอิสระแห่งอื่น) จะระบุ Ling-3.0-flash-VL ในรายการและยืนยันหรือแก้ไขตัวเลข 42 — จุดข้อมูลจุดเดียวนี้แยก "โมเดลที่ดีที่สุดของตระกูล" ออกจาก "หมายเลขของผู้ขายรายอื่น" ประการที่สอง ว่า -rc1เป็นตัวระบุบน API ทางการที่ตรงกับน้ำหนักเปิดเมื่อวันที่ 4 กันยายนหรือไม่; ถ้าไม่ตรง API และเส้นทาง self-host จะเป็นโมเดลคนละตัว และทุกการเปรียบเทียบที่คุณอ่านต้องระบุว่าใช้ตัวไหน ประการที่สาม ราคา: อัตรา VL ที่เผยแพร่บนแพลตฟอร์ม Ling และไม่ว่าจะเป็นไปตามช่วงที่ต้องชำระเงินของโมเดลข้อความหรือตามแนวทาง API ฟรีของ Fin/Sante ประการที่สี่ ไม่ว่าเช็คพอยต์ FP8 จะรักษาความแม่นยำของการ์ดในการให้บริการจริง — ทาวเวอร์วิทัศน์ที่เก็บใน bf16 เป็นสัญญาณที่ดี แต่การอ้างสิทธิ์เกี่ยวกับวิทัศน์แบบควอนไทซ์ต้องมีการรันจริง ไม่ใช่แค่คอนฟิก ประการที่ห้า คำถามแผนที่ผลิตภัณฑ์: เมื่อวิทัศน์อยู่ในสาย Ling ที่เร็วแล้ว ให้สังเกตว่า Ant จะรักษา Ming ไว้เป็นแบรนด์มัลติโมดัลแยกต่างหากหรือปล่อยให้ทั้งสองรวมกัน
สำหรับนักพัฒนา คำตอบในระยะใกล้นั้นสั้น หากคุณต้องการสร้างบนสิ่งนี้ในวันนี้ API อย่างเป็นทางการคือเส้นทางที่ไม่มีโครงสร้างพื้นฐาน และน้ำหนัก FP8 คือเส้นทางโฮสต์ด้วยตนเอง และทั้งคู่เป็นของจริงตั้งแต่สัปดาห์นี้ หากคุณต้องการสร้างบนหมายเลข 42 ให้รอคนนอก Ant มาทำซ้ำ ทุกอย่างที่มีประโยชน์อย่างแท้จริงเกี่ยวกับ Ling-3.0-flash-VL — น้ำหนัก MIT สถาปัตยกรรมที่เป็นไปได้ การออกแบบราคาต่อการเปิดใช้งานที่จริงจัง และคะแนนผู้ขายที่ควรให้ความสำคัญ — มีอยู่แล้ว; ทุกอย่างที่จะทำให้เป็นค่าเริ่มต้นที่ปลอดภัยยังคงค้างอยู่
