
Ling-3.0-flash-VL: โมเดลวิชันแบบ 5.5B-Active ของ Ant ติดอันดับ 25 ใน Intelligence Index
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
ตอนนี้ Ling-3.0-flash-VL มีตัวเลข benchmark ที่ไม่มีใครที่ Ant Group เป็นคนพิมพ์ และนั่นแหละคือข่าว โมเดลมัลติโมดัลแบบเนทีฟตัวแรกจากแล็บ inclusionAI ของ Ant ได้คะแนนอยู่ที่ 25 บน Artificial Analysis Intelligence Index — เป็นการรันโดยอิสระ บนสเกล v4.3 ปัจจุบัน เผยแพร่พร้อมกับหน้าข้อมูลโมเดลที่ระบุความเร็ว เวลาแฝง และราคา โดยออกมาสามสัปดาห์หลังจากที่การ์ดโมเดลของผู้ขายเองอ้างว่าได้ 42 บนดัชนีเดียวกัน และสิ่งที่มีประโยชน์ที่สุดที่ผู้อ่านทำได้กับตัวเลขสองตัวนั้นก็คือการเข้าใจว่าทำไมมันจึงไม่ใช่เรื่องขัดแย้งกัน: Ant วัดเทียบกับโปรโตคอล Intelligence Index v4.1.1 ส่วน Artificial Analysis วัดเทียบกับ v4.3 และนั่นคือไม้บรรทัดคนละอันที่สร้างจากชุดการประเมินที่ต่างกัน ตัวเลขของผู้ขายไม่ได้รอดพ้นจากการถูกตรวจสอบโดยบุคคลที่สาม แต่เป็นการถูกวัดใหม่บนสเกลที่ยังไม่มีอยู่ตอนที่มันถูกเขียนขึ้นต่างหาก
โมเดลที่อยู่เบื้องหลังคะแนนนี้เป็น sparse mixture-of-experts ที่มี พารามิเตอร์รวม 124B และมีพารามิเตอร์ที่ทำงานอยู่ประมาณ 5.5B ต่อโทเคน เปิดตัวภายใต้สัญญาอนุญาต MIT พร้อมน้ำหนัก BF16 และ FP8 รองรับข้อความ รูปภาพ และวิดีโอ และส่งคืนข้อความ ตัวเลขพารามิเตอร์ที่ทำงานอยู่นั้นคือเหตุผลทั้งหมดของสิ่งนี้ ที่ 5.5B ที่ทำงานอยู่ Ling-3.0-flash-VL อยู่บนสิ่งที่กลายเป็นเส้นโค้งที่น่าสนใจที่สุดในโมเดลแบบเปิด — พรมแดนของความฉลาดที่พล็อตเทียบกับพารามิเตอร์ที่ถูกกระตุ้น มากกว่าขนาดรวม — และมันอยู่ตรงนั้นเพราะมันทำงานได้ในปริมาณที่เหมาะสมต่อหน่วยคอมพิวต์สำหรับการอนุมาน ไม่ใช่เพราะมันใหญ่โต
บทความนี้ครอบคลุมว่าอะไรที่ออกจริงและเมื่อใด ผลการรันทดสอบอิสระบอกว่าอย่างไร ทำไมข้อกล่าวอ้างเรื่อง Pareto จึงยืนได้ดีกว่าของ большинство? Wait need Thai only. Let's ensure no English except product. Hmm. Final Thai: บทความนี้ครอบคลุมว่าอะไรที่เปิดตัวจริงและเมื่อใด ผลการทดสอบอิสระบอกว่าอย่างไร ทำไมข้อกล่าวอ้างเรื่อง Pareto จึงยืนได้ดีกว่าของ большинство? No. Need fully Thai. "ทำไมข้อกล่าวอ้างเรื่อง Pareto จึงยืนได้ดีกว่าของเจ้าอื่นส่วนใหญ่" maybe. "what the model costs and where you can actually call it" = โมเดลนี้มีค่าใช้จ่ายเท่าใด และคุณเรียกใช้งานมันได้จริงจากที่ไหน. "The short version, for anyone who wants only that:" = ฉบับย่อ สำหรับใครก็ตามที่ต้องการแค่นั้น: "Ling-3.0-flash-VL is real, open-weight, unusually cheap to serve, measurably above average for its size class, and noticeably more verbose and slower-to-ship than the raw score suggests." = Ling-3.0-flash-VL มีอยู่จริง เป็นแบบเปิดน้ำหนัก (open-weight), ถูกเป็นพิเศษในการให้บริการ, วัดแล้วอยู่เหนือค่าเฉลี่ยของคลาสขนาดเดียวกัน, และเห็นได้ชัดว่ายืดยาวกว่าและเปิดตัว/ส่งมอบช้ากว่าที่คะแนนดิบบ่งชี้. "Its vendor-claimed 42 was never independently reproduced and is not comparable to the 25 now on the board." = ค่า 42 ที่ผู้ขายอ้างไม่เคยถูกทำซ้ำโดยอิสระ และไม่สามารถเทียบได้กับ 25 ที่อยู่บนกระดานตอนนี้. Need "open-weight" maybe keep as "open-weight" because product? It's technical term but can translate. The instruction preserve brand/product names. open-weight isn't brand. Use "แบบเปิดน้ำหนัก" maybe awkward. Could use "โอเพนเวต" but maybe English transliteration. Thai readers: "แบบเปิดน้ำหนัก" is understandable? Actually open-weight model = โมเดลแบบเปิดน้ำหนัก (open-weight). It's okay. "slower-to-ship" maybe "ออกสู่ตลาดช้ากว่า". Better: "และ noticeably more verbose and slower-to-ship" = "และสังเกตได้ชัดว่าพูดมากกว่าและออกช้ากว่า". Let's be precise: "มีความละเอียดยืดยาวกว่าและใช้เวลาส่งมอบ/เปิดตัวนานกว่าที่คะแนนดิบบ่งชี้อย่างเห็นได้ชัด". Hmm. Need output only translated text no preamble. Let's final Thai. Ensure no markers since none.บทความนี้ครอบคลุมว่าอะไรที่เปิดตัวจริงและเมื่อใด ผลการทดสอบอิสระบอกว่าอย่างไร ทำไมข้อกล่าวอ้างเรื่อง Pareto จึงยืนได้ดีกว่าของส่วนใหญ่ โมเดลนี้มีค่าใช้จ่ายเท่าใด และคุณเรียกใช้งานมันได้จริงจากที่ไหน ฉบับย่อ สำหรับใครก็ตามที่ต้องการแค่นั้น: Ling-3.0-flash-VL มีอยู่จริง เป็นแบบเปิดน้ำหนัก (open-weight) ถูกเป็นพิเศษในการให้บริการ วัดแล้วอยู่เหนือค่าเฉลี่ยของคลาสขนาดเดียวกัน และเห็นได้ชัดว่ายืดยาวกว่าและออกช้ากว่าที่คะแนนดิบบ่งชี้ ค่า 42 ที่ผู้ขายอ้างไม่เคยถูกทำซ้ำโดยอิสระ และไม่สามารถเทียบได้กับ 25 ที่อยู่บนกระดานตอนนี้
สิ่งที่ถูกส่งมอบจริง และไทม์ไลน์ที่ถูกทำให้แบนราบอยู่เรื่อย ๆ
การรายงานข่าวเกี่ยวกับการเปิดตัวครั้งนี้มักยุบรวมเหตุการณ์หลายอย่างที่แยกจากกันให้เหลือเป็นวันเปิดตัววันเดียว และวันที่เหล่านั้นสำคัญเพราะมันอธิบายว่าทำไมบทความช่วงแรกจึงบรรยายถึงโมเดลที่ไม่มีใครนอก Ant สามารถให้คะแนนได้ รีพозитори Hugging Face inclusionAI/Ling-3.0-flash-VL ถูกสร้างขึ้นเมื่อ 4 กันยายน 2026 — น้ำหนัก BF16 จำนวน 64 ชาร์ด สัญญาอนุญาต MIT สแตกโค้ดแบบกำหนดเองสำหรับสถาปัตยกรรม bailing_moe_v3_vl และในช่วงสองสามวันแรกแทบไม่มีใครดาวน์โหลดเลย การควอนไทซ์ FP8 ตามมาเมื่อ 8 กันยายน ประมาณ 126 GB กระจายอยู่ใน 64 ชาร์ด โดย vision tower ถูกเก็บไว้ที่ความแม่นยำสูงกว่าน้ำหนักของ expert Artificial Analysis ระบุว่าการเปิดตัวนี้เกิดขึ้นเมื่อ 10 กันยายน 2026 ซึ่งเป็นวันที่หน้าเพจของตัวเองยึดเป็นหลัก และหน้าโมเดลที่แสดงคะแนนก็เปิดใช้งานราวช่วงนั้น
ดังนั้น "เปิดตัวกันยายน 2026" จึงถูกต้องแต่ไร้ประโยชน์ ลำดับที่ใช้ได้จริงคือ เวตในวันที่ 4 รูปแบบความแม่นยำแบบที่สองในวันที่ 8 และการวัดผลอิสระในวันที่ 10 เหตุผลที่เรื่องนี้สำคัญก็คือ โมเดลที่มีเวตอยู่บนดิสก์แต่ไม่มีเอนด์พอยต์ที่โฮสต์ไว้และไม่มีคะแนนจากบุคคลที่สาม สำหรับทีมส่วนใหญ่แล้วยังไม่ใช่สิ่งที่ประเมินได้ — มันเป็นแค่ไฟล์ดาวน์โหลดที่คุณต้องจัดสรรทรัพยากรเพื่อรองรับ Ling-3.0-flash-VL ข้ามเส้นนั้นเมื่อทั้ง API และคะแนนอิสระมีอยู่ทั้งคู่
การรองรับการให้บริการโมเดลมาพร้อมกับน้ำหนักโมเดล ไม่ใช่ตามมาทีหลัง Ant เผยแพร่คู่มือการดีพลอย SGLang และดูแลฟอร์กของ vLLM ที่ปรับจูนสำหรับ Ling สำหรับสถาปัตยกรรมนี้ ซึ่งเป็นส่วนหนึ่งของการเปิดตัวแบบโอเพนซอร์สที่มักล่าช้าออกไปหลายสัปดาห์ แต่ที่นี่ไม่ล่าช้า
หมายเลขบนกระดาน และหมายเลขบนการ์ด
นี่คือภาพรวมอิสระจาก Artificial Analysis ซึ่งเป็นการวัดโดยบุคคลที่สามเพียงรายเดียวของโมเดลนี้ที่มีอยู่ในปัจจุบัน:
• ดัชนี Intelligence Index — 25 บน v4.3 จัดอยู่ในอันดับ #2 จาก 64 ในระดับขนาดเดียวกัน เทียบกับค่ามัธยฐานของคลาสที่ 8br /> • พารามิเตอร์ทั้งหมด — 124Bbr /> • พารามิเตอร์ที่ใช้งาน — 5.5B ต่อโทเคนbr /> • ความเร็วเอาต์พุต — 142.9 โทเคน/วินาที, #10 จาก 64, เทียบกับค่ามัธยฐานของคู่เทียบที่ 105.1br /> • เวลาถึงโทเคนแรก — 2.21 วินาที, เทียบกับค่ามัธยฐานของคู่เทียบที่ 2.29br /> • หน้าต่างบริบท — 262K โทเคน ตามที่วัดโดย Artificial Analysis เทียบกับ 256K ที่การ์ดโมเดลระบุไว้เองbr /> • สัญญาอนุญาต — MIT, น้ำหนักแบบเปิด
และนี่คือตัวเลขจากผู้พัฒนาที่มักถูกพิมพ์คู่กันบ่อยครั้ง: 42 บนโปรโตคอล Artificial Analysis Intelligence Index v4.1.1 ซึ่งสูงกว่าที่แบบข้อความล้วน Ling-3.0-flashทำได้บนโปรโตคอลเดียวกันอยู่สี่คะแนน ข้อกล่าวอ้างนี้อยู่ใน model card ไม่มีร่องรอยการประเมินที่เผยแพร่ไว้ และไม่ใช่ตัวเลขที่ Artificial Analysis รายงาน มีสองสิ่งที่จริงพร้อมกัน คือ 42 นั้นไม่มีการทำซ้ำให้เห็น และมันไม่ใช่หลักฐานของความไม่ซื่อสัตย์ใด ๆ เพราะ v4.1.1 กับ v4.3 ไม่ได้วัดสิ่งเดียวกัน Artificial Analysis ได้นิยามดัชนีของตนใหม่ในเดือนกันยายน 2026 และให้คะแนนกระดานทั้งหมดใหม่ v4.3 รวมการประเมินสิบรายการ ซึ่งรวมถึง AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0 และ Humanity's Last Exam บทความใดก็ตามที่ยังอ้างเลข 42 คู่กับ 25 โดยไม่ระบุเวอร์ชัน กำลังเปรียบเทียบการทดสอบสองชุดที่แตกต่างกัน แล้วเรียกมันว่าการถดถอย

รายละเอียดที่ควรชี้ให้เห็นนอกเหนือจากคะแนนบนพาดหัวคือความละเอียดเกินจำเป็น Artificial Analysis บันทึกว่า Ling-3.0-flash-VL ใช้ โทเคนเอาต์พุต 160M ในการทำ Intelligence Index ให้เสร็จ จัดอยู่อันดับ #8 จาก 64 เทียบกับค่ามัธยฐาน 84M และติดป้ายว่า "ละเอียดมากเกินไป" สำหรับโมเดลที่จุดขายคือการอนุมานราคาถูกผ่านจำนวนพารามิเตอร์ที่ใช้งานน้อย สิ่งนี้ตัดตรงข้ามกับจุดขายนั้นโดยตรง คุณจ่ายต่อโทเคน ไม่ใช่ต่อพารามิเตอร์ โมเดลที่เปิดใช้งาน 5.5B แต่ปล่อยโทเคนเกือบสองเท่าของค่ามัธยฐานเพื่อตอบคำถามเดียวกัน ย่อมคืนข้อได้เปรียบเชิงโครงสร้างนั้นบางส่วนกลับไปที่จุดจ่ายเงิน ซึ่งเป็นปฏิสัมพันธ์แบบที่ตารางราคาต่อโทเคนซ่อนไว้ และการวัดต้นทุนต่องานเปิดเผยให้เห็นพอดี
ข้อกล่าวอ้างเรื่องพาเรโต เมื่อถูกกดดันสักเล็กน้อย
ข้อกล่าวอ้างที่ว่า Ling-3.0-flash-VL ตั้งอยู่บนพรมแดนพาเรโตระหว่างความฉลาดกับพารามิเตอร์ที่เปิดใช้งานนั้น ผิดปกติตรงที่เป็นข้อกล่าวอ้างที่ข้อมูลอิสระสนับสนุน ไม่ใช่เพียงแค่ยอมให้เป็นไปได้ ค่ามัธยฐานของคลาสในดัชนีนี้คือ 8; Ling-3.0-flash-VL ได้ 25; และทำได้เช่นนั้นขณะเปิดใช้งานพารามิเตอร์ 5.5B ต่อโทเคน สำหรับทีมที่ข้อจำกัดผูกมัดคือปริมาณงานที่ให้บริการได้ — ตัวเร่งความเร็วเพียงตัวเดียว งบคำขอที่คงที่ การติดตั้งที่ edge — อัตราส่วนนั้นคือปัจจัยทั้งหมดในการตัดสินใจ และเป็นการแสดงผลงานที่แข็งแกร่งอย่างแท้จริง
มีข้อแม้สองประการที่ทำให้มันไม่ใช่ชัยชนะแบบขาดลอย ข้อแรกคือความไม่ตรงกันของจำนวนพารามิเตอร์: การ์ดโมเดลระบุว่ามีพารามิเตอร์ที่ใช้งานอยู่ประมาณ 5.5B ในขณะที่คู่มือ SGLang อธิบายว่าเป็นโมเดลที่มีพารามิเตอร์ที่ใช้งาน 5.1B ทั้งคู่เป็นเอกสารของ Ant ความแตกต่างนั้นเล็กน้อย และมันเปลี่ยนรูปร่างของเส้นโค้งเพียงเล็กน้อย แทนที่จะเปลี่ยนทิศทาง ข้อที่สองคือ "แนวหน้า" เป็นข้ออ้างเชิงสัมพัทธ์เกี่ยวกับสาขาที่เปลี่ยนแปลงทุกสัปดาห์ การเป็นที่สุดของสติปัญญาต่อพารามิเตอร์ที่ใช้งาน ณ ขนาดที่กำหนด เป็นตำแหน่งที่คุณดำรงไว้จนกว่าโมเดลถัดไปในกลุ่มนั้นจะเปิดตัว และกลุ่มนี้ก็แออัด
การสาธิตชิ้นเอกที่ผู้ขายโฆษณาเอง — ว่า Ling-3.0-flash-VL ซึ่งลงแข่งใน Image-to-WebDev Arena ภายใต้นามแฝง "linthium" ทำคะแนนได้ 1,441 เทียบกับ GPT-5.4ที่ได้ 1,440 — ควรอ่านเป็นเรื่องเรียกความสนใจมากกว่าจะเป็นผลลัพธ์จริง ส่วนต่างหนึ่งคะแนนนั้นอยู่ในระดับความคลาดเคลื่อนของ Elo ใน Arena อีกทั้งยังเป็นตัวเลขที่ผู้ขายรายงานเอง และไม่ใช่ช่องว่างแบบที่ชี้ขาดอะไรได้ ข้ออ้างเรื่องความสามารถที่อยู่เบื้องหลังน่าสนใจกว่าตัวเลขนั้น: โมเดลนี้ถูกสร้างมาเพื่อวงจรป้อนกลับทางภาพ โดยมันสร้างโค้ดฟรอนต์เอนด์จากเลย์เอาต์ เรนเดอร์ผลลัพธ์ของตัวเองออกมา ดูสิ่งที่เรนเดอร์ได้ แล้วแก้ไข — สังเกต ลงมือ ตรวจสอบ แก้ไข แทนที่จะบรรยายภาพครั้งเดียวแล้วจบ

สิ่งที่มันต้องแลกมาด้วย ซึ่งไม่ชัดเจนเท่าที่ดู
หน้าเพจ Artificial Analysis ระบุว่า Ling-3.0-flash-VL อยู่ที่ $0.00 ต่อ 1 ล้านโทเคนอินพุต และ $0.00 ต่อ 1 ล้านโทเคนเอาต์พุต เทียบกับค่ามัธยฐานของคู่เทียบที่ $0.14 และ $0.40 นั่นไม่ใช่ราคา แต่เป็นเพียงรูปลักษณ์ของราคา Artificial Analysis ตั้งราคาให้กับ endpoint ที่มันมองเห็น และ endpoint ที่มันมองเห็นนั้นฟรี — โมเดลนี้รันอยู่บน Ling Studio ของ Ant ในฐานะการทดลองใช้ฟรี และการเข้าถึงแบบโปรโมชันฟรีคือสิ่งที่รายการนี้สะท้อน เอกสารมัลติโมดัลของ Ant เองไม่ได้เปิดเผยราคาต่อโทเคนสำหรับโมเดลวิชันเลย ดังนั้นจึงไม่มีตารางราคาของผู้ขายให้ตรวจสอบว่าค่าศูนย์นั้นถูกต้องหรือไม่ เพื่อให้เห็นขนาดโดยเปรียบเทียบ รุ่นพี่น้องแบบข้อความล้วนอย่าง Ling-3.0-flash ถูกระบุราคาไว้ประมาณ $0.075 ต่อ 1 ล้านโทเคนอินพุต และ $0.22 ต่อ 1 ล้านโทเคนเอาต์พุต และ Ling รุ่นเฉพาะทางของ Ant ก็เปิดตัวเป็น API ฟรีเช่นกัน
จงมองว่าศูนย์นี้เป็นหน้าต่างสำหรับการทดสอบมากกว่าจะเป็นอัตราค่าบริการ แพ็กเกจฟรีบนโมเดลที่เพิ่งเปิดตัวใหม่คือเครื่องมือหาลูกค้า และสมมติฐานการวางแผนที่ซื่อตรงก็คือ Ling-3.0-flash-VL จะมีราคาในที่สุดในระดับใกล้เคียงกับรุ่นพี่ที่เป็นโมเดลข้อความของมัน นอกจากนี้ยังมีความกำกวมที่ยังคงอยู่ซึ่งการมาถึงของปลายทางแบบเสียค่าใช้จ่ายจะไม่ช่วยคลี่คลาย นั่นคือ ตัวอย่าง API ของ Ant เองใช้ตัวระบุโมเดล Ling-3.0-flash-VL-rc1 ซึ่งเป็นเครื่องหมาย release candidate และยังไม่ชัดเจนว่า checkpoint ที่ให้บริการนั้นเหมือนกับน้ำหนักแบบเปิด (open weights) วันที่ 4 กันยายนทุกไบต์หรือไม่ หากคุณกำลังทดสอบพรอมป์ของคุณเองกับ API ที่โฮสต์ไว้ และคาดหวังว่าผลลัพธ์จะถ่ายทอดไปยังบิลด์ BF16 ที่โฮสต์เองได้ นั่นคือสมมติฐานที่คุณควรทดสอบก่อนที่คุณจะสร้างสิ่งใดบนพื้นฐานนั้น
ภาพต้นทุนจะพลิกกลับ ขึ้นอยู่กับว่าคุณอยู่ฝั่งไหน สำหรับทีมที่มีตัวเร่งความเร็วอยู่แล้ว บิลด์ FP8 ที่ขนาดประมาณ 126 GB พอดีอยู่ในโหนดระดับ 80GB แบบ 8 ทาง และจำนวนพารามิเตอร์ที่ใช้งานจริง 5.5B หมายความว่าคุณกำลังจ่ายต้นทุนที่ตัดจำหน่ายแล้วของโหนดนั้น เทียบกับปริมาณการประมวลผลต่อโทเคนที่เล็กมาก — เวอร์ชันที่ถูกที่สุดเท่าที่เป็นไปได้ของโมเดลนี้ คือเวอร์ชันที่คุณให้บริการด้วยตัวเอง สำหรับทีมที่ไม่มีตัวเร่งความเร็ว คำถามคือว่าเอนด์พอยต์แบบเสียค่าใช้จ่ายจะมาถึงก่อนที่ระดับฟรีจะปิดหรือไม่
ที่ที่คุณโทรได้จริง รวมถึงตอนที่เราบอกว่าไม่
Ling-3.0-flash-VL เข้าถึงได้ผ่านแพลตฟอร์มของ Ant เอง — endpoint ที่เข้ากันได้กับ OpenAI ที่ api.ant-ling.com/v1/chat/completions และอีกหนึ่งอันที่เข้ากันได้กับ Anthropic ควบคู่กันไป — รวมถึงการเข้าถึงแบบทดลองใช้ฟรีบน Ling Studio และเวตแบบเปิดที่คุณสามารถให้บริการได้ด้วยตนเอง เกตเวย์อิสระก็เริ่มลงรายการมันเช่นกัน และนั่นคือวิธีที่เร็วที่สุดอย่างแท้จริงในการลองใช้โดยไม่ต้องจัดเตรียมอะไรเลย
สิ่งที่ควรพูดให้ชัดเจนก็คือ ทุกวันนี้ OrcaRouter ยังไม่ให้บริการเส้นทางสำหรับ Ling-3.0-flash-VL และมันไม่ได้อยู่ในแคตตาล็อกโมเดลของเรา ดังนั้นอะไรก็ตามที่คุณอ่านตรงนี้เกี่ยวกับการเรียกใช้มันผ่านเรา ล้วนเป็นเรื่องที่ไม่มีอยู่จริง และเราเลือกที่จะบอกคุณตั้งแต่แรกจะดีกว่า สิ่งที่เราให้บริการเส้นทางอยู่คือโมเดลวิชันที่เทียบเคียงได้ใกล้เคียงที่สุดกับมัน: DeepSeek V4 Flash Vision Exp ซึ่งเป็นบิลด์มัลติโมดัลแบบทดลองของ DeepSeek ที่เปิดใช้งานจริงอยู่ในแคตตาล็อกของเรา พร้อมหน้าต่างบริบท 1M โทเคนและอัตราค่าบริการที่ประกาศไว้อย่างชัดเจน หากความต้องการจริงของคุณคือโมเดลวิชันที่มีความสามารถ อยู่เบื้องหลังเอนด์พอยต์เดียวที่เข้ากันได้กับ OpenAI — โดยตั้งค่าลูกโซ่สำรอง (fallback chain) ไว้ เพื่อให้เมื่อผู้ให้บริการสะดุด ระบบจะลองใหม่ก่อนที่คำตอบของคุณจะเริ่มส่งออก และคิดตามราคาต่อรายการของผู้ให้บริการโดยไม่บวกเพิ่มใด ๆ ดังนั้นเมื่อผู้ขายปรับราคา คุณจะได้รับผลในวันเดียวกับที่ราคาเปลี่ยน — นั่นคือโมเดลที่ควรลองเป็นอันดับแรก ระหว่างที่ Ling-3.0-flash-VL ยังอยู่นอกแคตตาล็อก

สิ่งที่ต้องจับตาจากนี้ไป
สามสิ่งจะตัดสินว่าในอีกหกเดือน การเปิดตัวนี้จะดูมีความสำคัญหรือไม่ สิ่งแรกคือการรันอิสระรอบที่สอง: คะแนนหนึ่งค่าจากผู้ประเมินหนึ่งรายเป็นเพียงข้อมูลหนึ่งจุด และคำถามที่น่าสนใจคือตำแหน่งของ Ling-3.0-flash-VL บนเส้นโค้งความฉลาดเทียบกับจำนวนพารามิเตอร์ที่แอ็กทีฟจะคงอยู่ได้หรือไม่เมื่อใช้ฮาร์เนสที่แตกต่างออกไป สิ่งที่สองคือราคาจริง จนกว่า Ant จะเผยแพร่ตารางราคาสำหรับโมเดลวิชัน ทุกการเปรียบเทียบต้นทุนที่เกี่ยวข้องกับมันก็เป็นเพียงการประมาณการที่แต่งตัวเป็นตัวเลข และระดับฟรีก็กำลังทำหน้าที่แทนสิ่งที่ราคาควรจะทำ สิ่งที่สามคือส่วนต่างคุณภาพของ FP8 — vision tower ถูกกำหนดให้คงความแม่นยำสูงกว่าน้ำหนักของ expert ในบิลด์นั้นอย่างจงใจ และคำถามว่าเวอร์ชันควอนไทซ์ให้ผลเทียบเท่า BF16 ในงานด้านภาพที่มีรายละเอียดปลีกย่อยหรือไม่ ก็เป็นคำถามประเภทที่ว่าจะปรากฏขึ้นก็ต่อเมื่อมีคนนำไปใช้งานจริงในโปรดักชัน มากกว่าจะแค่ทำเบนช์มาร์กเท่านั้น
คำตัดสินที่มีให้เห็นในวันนี้แคบกว่าที่การรายงานข่าวตอนเปิดตัวบอกเป็นนัย และมีประโยชน์มากกว่าตัวคะแนนเพียงลำพัง Ling-3.0-flash-VL เป็นโมเดลวิชันจริงที่ใช้สัญญาอนุญาต MIT โฮสต์เองได้ โดยเปิดใช้งานเพียงเศษเสี้ยวเล็ก ๆ ของพารามิเตอร์ 124B ได้คะแนน 25 บนดัชนีอิสระฉบับปัจจุบัน เทียบกับค่ามัธยฐานของคลาสที่ 8 และคืนข้อได้เปรียบนั้นบางส่วนไปเพราะความเยิ่นเย้อ นั่นเป็นโมเดลที่ดีที่มีรูปทรงตรงไปตรงมา เลข 42 บนการ์ดคือตัวเลขจากไม้บรรทัดที่ไม่มีอยู่อีกแล้ว
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
