
Ornith-1.5: กลุ่มโมเดลโอเพนเวตที่เขียนหลักสูตรการฝึกฝนของตัวเอง — และอ้างว่าเหนือกว่า Claude Opus 4.8
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B Uncensored (Aggressive)2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekใหม่DeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokใหม่SpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0957ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0961ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0856ความฉลาด72การเขียนโค้ด
Ornith-1.5 วงศ์ตระกูลโมเดลแบบเปิดน้ำหนักจาก Ornith AI ที่อ้างว่าชนะ Claude Opus 4.8 ในสี่ benchmarks เปิดตัวเมื่อวันที่ 19 สิงหาคม 2026 — และสิ่งที่ควรจอดดูคือ training loop ไม่ใช่จำนวนพารามิเตอร์ วงศ์ตระกูลนี้มีสามโมเดล: Ornith-1.5-397B โมเดลเรือธงแบบ mixture-of-experts ขนาด 397 พันล้านพารามิเตอร์; Ornith-1.5-35B-A3B โมเดล MoE ขนาด 35B ที่เปิดใช้งาน 3 พันล้านพารามิเตอร์ต่อ token; และ Ornith-1.5-9B โมเดล dense ขนาด 9B พร้อมบิลด์มือถือแบบ quantized คะแนนทุกตัวที่เห็นในที่นี้เป็นข้อมูลที่ผู้ผลิตแจ้งเอง: ตัวเลขมาจากชุดการประเมินของ Ornith AI เอง เฉลี่ยจากห้าครั้ง และตัวติดตามบุคคลที่สามเพียงรายเดียวที่มีโปรไฟล์ — BenchLM — ระบุว่าทั้ง 18 แถว benchmark เป็นข้อมูลที่ผู้ให้บริการรายงาน และคงวงศ์ตระกูลนี้ไว้แบบไม่มีอันดับจนกว่าจะมีรายงานอิสระ นี่คือสิ่งที่เปิดตัวจริง 'self-improving' หมายถึงอะไรกันแน่ และสิ่งที่คุณสามารถรันได้ในวันนี้
สิ่งที่เผยแพร่: สามสเกล, ใบอนุญาต MIT, ไม่มี API
กลุ่ม Ornith AI — ผู้อยู่เบื้องหลังโมเดลโอเพนเวต Ornith-1.0 และมีความเกี่ยวข้องกับงาน DeepReinforce ด้านระบบมัลติเอเจนต์สำหรับการเขียนโปรแกรมเชิงแข่งขัน (GrandCode) รวมถึงการปรับแต่งประสิทธิภาพ GPU เคอร์เนล (CUDA-L2) — ได้ปล่อยตระกูลโมเดลดังกล่าวบน Hugging Face ภายใต้สัญญาอนุญาต MIT พร้อม quantization แบบ FP8, GGUF, MLX และ NVFP4 ควบคู่ไปกับ checkpoint ดิบ หน้าต่างบริบทขนาด 256K (262,144 โทเคน) ใช้ได้กับทั้งตระกูลโมเดล ไม่มี hosted API จากฝั่งผู้พัฒนาเองและไม่มีราคาต่อโทเคน นี่คือการเผยแพร่แบบ self-host หรือ local-runtime และรายงานการเปิดตัวก็ระบุไว้อย่างชัดเจน
มาตรวัดทั้งสามมุ่งเป้าไปที่ความเป็นจริงที่แตกต่างกันสามประการ:
• Ornith-1.5-397B — "การท้าชิงแนวหน้าแบบเปิด": โมเดล MoE 397B ที่มุ่งเป้าไปที่แนวหน้าปิดในงานด้านเอเจนต์และการเขียนโค้ด
Ornith-1.5-35B-A3B — โมเดล MoE ขนาด 35B ที่เปิดใช้งานพารามิเตอร์เพียง 3B ต่อโทเคน เป็นจุดกึ่งกลาง: ความสามารถใกล้เคียงกับโมเดลระดับเรือธง ในขณะที่ต้นทุนการอนุมานต่อโทเคนเป็นเพียงเศษเสี้ยวของโมเดล dense ขนาด 35B
• Ornith-1.5-9B — โมเดล dense ขนาด 9B สำหรับใช้งานในเครื่องและบนอุปกรณ์ พร้อมกับ Ornith-1.5-9B-Mobile แบบควอนไทซ์ที่ผู้ขายระบุว่าพร้อมใช้งานบน iPhone และ Android

หน้าประกาศเปิดตัวด้านบนคือประกาศทั้งหมด: เป็นรายงานทางเทคนิคมากกว่าโพสต์การตลาด ซึ่งสอดคล้องกับโปรไฟล์ของห้องปฏิบัติการ
ถอดรหัสข้ออ้างเรื่องการพัฒนาตนเอง
Ornith-1.0 ซึ่งเปิดตัวในเดือนมิถุนายน 2026 สอนแบบจำลองให้สร้างโครงสร้างรองรับรอบๆ งานเขียนโค้ด — ฮาร์เนส การแยกส่วนประกอบ และการประสานงาน Ornith-1.5 ขยายวงรอบนั้นไปสู่การสร้างงานตัวมันเอง ในการฝึกฝน แบบจำลองตอนนี้ทำสามสิ่ง:
• เสนองานฝึกอบรมใหม่ที่ยากขึ้น
• สร้างโครงร่างเฉพาะงานที่ใช้ในการแก้ไขและประเมินงานเหล่านั้น
• สร้างการนำโซลูชันไปใช้ที่จะกลายเป็นชุดข้อมูลฝึกอบรมรอบถัดไป
รางวัลจะไหลผ่านทั้งสามขั้นตอน โดยถูกปรับให้เหมาะสมร่วมกับ GRPO งานที่เสนอแต่ละงานจะถูกให้คะแนนในด้านความถูกต้อง (ต้องสามารถดำเนินการได้และตรวจสอบได้) ความยากระดับแนวหน้า (อัตราความสำเร็จของโซลูชันเป้าหมายตั้งไว้ที่ 0.2 — งานที่โมเดลมักจะล้มเหลวแต่ยังสามารถเรียนรู้ได้) และความใหม่ (ความหลากหลายจากทุกสิ่งที่เคยเห็นแล้ว) โครงสร้างรองรับจะได้รับรางวัลของตัวเองสำหรับการจัดวางความสอดคล้อง ความเที่ยงตรงของรางวัล และความต้านทานต่อการแฮ็กรางวัล และไปป์ไลน์มีมาตรการป้องกันการแฮ็ค: ข้อจำกัดในการแตะต้องสภาพแวดล้อมการทดสอบ การตรวจสอบการเข้าถึงเส้นทางที่ถูกจำกัด และโมเดลตัดสินที่ถูกแช่แข็งซึ่งจะแทนที่ผลลัพธ์ที่ผิดปกติ
ข้อควรระวังที่สำคัญอยู่ในคำว่า {{1}}การพัฒนาตนเอง{{/1}}: มันอธิบายถึงขั้นตอนการฝึกฝน ไม่ใช่ตัวโมเดลที่ได้ โมเดลที่ดาวน์โหลดมาไม่ได้ฝึกฝนตัวเองใหม่บนแล็ปท็อปของคุณ สิ่งที่คุณได้คือโมเดลที่มีข้อมูลการฝึก ซึ่งผิดปกติตรงที่ถูกสร้างขึ้นโดยเวอร์ชันก่อนหน้าของตัวมันเอง — ซึ่งเป็นข้อกล่าวอ้างประเภทที่ควรค่าแก่การทดสอบก่อนที่จะกลายเป็นความเชื่อที่ยึดถือ
ข้อกล่าวอ้างของเกณฑ์มาตรฐานที่ติดฉลากอย่างตรงไปตรงมา
ตัวเลขทั้งหมดในส่วนนี้เป็นของ Ornith AI เอง จากรายงานการเปิดตัว ซึ่งคำนวณจากค่าเฉลี่ยของการรันห้าครั้ง และไม่ได้ผ่านการทำซ้ำอย่างอิสระ เรือธงอ้างชัยชนะเหนือ Claude Opus 4.8 อยู่สี่ประการ:
• Terminal-Bench 2.1 (ชุดทดสอบ Terminus-2): Ornith-1.5-397B 86.1 เทียบกับ Claude Opus 4.8 85.0
• SWE-bench Verified: 86.0 เทียบกับ 85.8
• WideSearch: 80.8 เทียบกับ 72.9
• BrowseComp: 86.6 เทียบกับ 84.3
จงอ่านสิ่งเหล่านั้นเป็นคำกล่าวอ้างของผู้ขาย ไม่ใช่ข้อเท็จจริง เกณฑ์มาตรฐานเรือธงหนึ่งเดียวที่ Ornith AI ไม่ได้อ้างชัยชนะคือ DeepSWE ซึ่งได้ 56.0 เทียบกับ 59.0 ของ Claude Opus 4.8 — รายงานระบุว่า "สูสี" ซึ่งเป็นวิธีที่ซื่อสัตย์ในการอ่านความพ่ายแพ้ ตัวเลขเรือธงอื่นๆ จากรายงานเดียวกัน: HLE 44.6 โดยไม่ใช้เครื่องมือ และ 56.1 เมื่อใช้เครื่องมือ, GPQA Diamond 92.8, และ SWE-bench Pro 65.1
สองรุ่นที่เล็กกว่านั้นก็แข็งแกร่งบนกระดาษเช่นกัน: Ornith-1.5-35B-A3B รายงานผล SWE-bench Verified 79.0 และ Terminal-Bench 2.1 (Claude Code harness) 68.5 ขณะที่ Ornith-1.5-9B รายงานผล SWE-bench Verified 70.6 และ Terminal-Bench 2.1 47.0 เมื่อเทียบกับโมเดลโอเพนเวตอื่นๆ ในรายงานเดียวกัน Ornith AI เปรียบเทียบรุ่น 397B ที่ได้ 86.1 Terminal-Bench / 56.0 DeepSWE กับ DeepSeek-V4-Flash-0731 ที่ได้ 82.7 / 54.4 และ GLM-5.2 ที่ได้ 81.0 / 46.2

กระดานคะแนนอิสระเพียงหนึ่งเดียว — และเหตุใดจึงยังเป็นเพียงชั่วคราว
โปรไฟล์ของ BenchLM สำหรับ Ornith-1.5-397B เป็นหน้าบุคคลที่สามเพียงหน้าเดียวบนโมเดลนี้ในตอนนี้ พาดหัวของมันคือคะแนนสาธารณะ 68.5 จาก 100 จัดอันดับที่ #20 จาก 221 โดยหมวด Agentic มีความแข็งแกร่งที่สุดที่อันดับ #13 แต่อ่านรายละเอียดปลีกย่อย เพราะมันกำลังทำหน้าที่สำคัญจริง — ทั้ง 18 แถวเกณฑ์มาตรฐานถูกระบุว่าเป็นข้อมูลที่ผู้ให้บริการรายงาน และโปรไฟล์ระบุว่าโมเดล 'ยังไม่มีแหล่งข้อมูลครอบคลุมเพียงพอสำหรับตำแหน่งที่ได้รับการยืนยัน' การไม่ถูกจัดอันดับในรายการที่ได้รับการยืนยันไม่ใช่คำตัดสินต่อต้านโมเดล แต่เป็นข้อความที่ว่าไม่มีใครทดสอบมันอย่างอิสระเลย ซึ่งเป็นสิ่งที่คุณคาดหวังได้สำหรับการเปิดตัวที่เพิ่งเกิดขึ้นไม่กี่วัน

นี่คือช่องว่างระหว่างตัวเลขสองตัวในบทความนี้: Terminal-Bench 86.1 ของผู้จำหน่ายเป็นเพียงข้อกล่าวอ้าง และ 68.5 ของ BenchLM เป็นคะแนนที่สร้างจากแถวข้อมูลที่ผู้จำหน่ายรายงานทั้งหมด ไม่มีการวัดใดที่เป็นอิสระ ห้องปฏิบัติการแรกที่รัน Ornith-1.5-397B บนแฮร์เนสสาธารณะ — SWE-bench Verified บนชุดที่ควบคุม และ Terminal-Bench บนเวอร์ชันแฮร์เนสที่ตายตัว — จะเป็นผู้สร้างตัวเลขแรกที่นับได้
สิ่งที่คุณสามารถรันได้จริงในวันนี้
นี่คือการเปิดตัวแบบ open-weights ดังนั้น "การรันมัน" จึงหมายถึงการดาวน์โหลดเวต แคตตาล็อก Ollama มี ornith-1.5:9b (บิลด์ ~6.6 GB) และ ornith-1.5:35b (บิลด์ ~23 GB) อยู่แล้ว ทั้งคู่รองรับ 256K context; บิลด์ 9B ยังรองรับอินพุตรูปภาพในรายการแคตตาล็อกด้วย ส่วน 397B เป็นปัญหาคนละประเภท: MoE ที่มีพารามิเตอร์ 397B ไม่ใช่โมเดลสำหรับแล็ปท็อป และการใช้งานในระดับจริงจังต้องใช้ GPU หลายตัวและการจัดการระบบจริง
จุดที่เหมาะสมที่สุดในทางปฏิบัติสำหรับทีมส่วนใหญ่คือ Ornith-1.5-35B-A3B: พารามิเตอร์ที่ทำงาน 3B ต่อโทเคนให้ความสามารถแบบ MoE ในต้นทุนต่อโทเคนเพียงเศษเสี้ยวของ dense 35B และบิลด์ Ollama ขนาด 23 GB รันบนการ์ดจอ VRAM สูงใบเดียวหรือคลัสเตอร์ขนาดเล็ก ส่วนรุ่น 9B คือรุ่นที่คุณใส่ในโทรศัพท์
คุณสมบัติ "3B active" นี้เองก็เป็นจุดที่เศรษฐศาสตร์ของการเลือกเส้นทาง (routing) เริ่มน่าสนใจ โมเดล MoEs แบบ active-parameter มีราคาต่ำกว่าขนาดทั้งหมดของมันมาก และเมื่อผู้ให้บริการนำโมเดลแบบนี้มาใช้ ราคาต่อโทเคนมักจะลดลงอย่างรวดเร็ว — ซึ่งเป็นกรณีของการซื้อผ่านเราเตอร์ที่ส่งผ่านราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม (0% markup) แทนที่จะซื้อจากผู้ขายรายเดียวที่คุณต้องเจรจาครั้งเดียว OrcaRouter ทำแบบนั้นกับโมเดลมากกว่า 200+ รายการ ราคาที่ผู้ให้บริการลดลงบนโมเดล open-weights ตัวใหม่จึงมีผลฝั่งเราในวันเดียวกัน และสำหรับโมเดลที่วางจำหน่ายมาพร้อมแค่ benchmark ของผู้ผลิตเอง ข้อโต้แย้งเรื่อง failover สำคัญที่สุด: ชั้นการเลือกเส้นทางช่วยให้คุณชี้เส้นทางทดสอบไปที่โมเดลใหม่เอี่ยม และถอยกลับไปใช้โมเดลที่ผ่านการพิสูจน์แล้วทันทีที่มันสะดุด — ได้ลองโมเดลที่ยังไม่ผ่านการพิสูจน์โดยไม่ต้องเดิมพันเส้นทางผลิตจริงกับมัน
ยังขาดอะไรอีก
• ไม่มี hosted API หากคุณต้องการใช้ Ornith-1.5 เป็นบริการ ยังไม่มีให้บริการ ทุกตัวเลือกคือ self-host หรือ local
• ไม่มีการประเมินอิสระ BenchLM ยังทำให้ตระกูลไม่ได้รับการจัดอันดับ; ไม่มีห้องแล็บใดเผยแพร่การทดสอบแบบควบคุม
• ไม่มีเรื่องราคาให้ต้องคำนวณ ไม่มีอัตราค่าโทเคน ดังนั้นกรณี "open frontier ราคาถูก" จึงเกี่ยวกับต้นทุน GPU ของคุณเองทั้งหมด
• ชุดทดสอบมีความหลากหลายปนกัน Terminal-Bench มีหลายเวอร์ชัน และตัวเลขในรายงานเองก็ครอบคลุมเวอร์ชันเหล่านั้น: ค่า 86.1 ของรุ่น 397B มาจากชุดทดสอบ Terminus-2 ส่วนค่า 68.5 ของรุ่น 35B มาจากชุดทดสอบ Claude Code ชุดทดสอบที่ต่างกันก็เหมือนเกมที่ต่างกัน ทำให้การเปรียบเทียบแบบเทียบเคียงกันได้ยากกว่าที่ตารางหัวข้อรายงานแสดงให้เห็น
สิ่งที่ควรดูต่อไป
เรื่องราวที่ยั่งยืนไม่ใช่ "โมเดลเปิดชนะ Claude Opus 4.8" — นั่นคือข้อกล่าวอ้างที่ยังไม่ผ่านการตรวจสอบและเพิ่งเกิดขึ้นเพียงวันเดียว แต่มันคือการที่ห้องแล็บปิดวงจรข้อมูลฝึกอบรมที่สร้างขึ้นเองและเผยแพร่ค่าน้ำหนักให้ตรวจสอบ และนั่นคือส่วนที่น่าจับตามอง สิ่งที่จะเปลี่ยนการเปิดตัวครั้งนี้จากผลงานที่น่าจะไปได้ดีเป็นผลงานที่น่าเชื่อถือ ได้แก่ การรันโมเดล 397B อย่างอิสระเป็นครั้งแรกบน SWE-bench Verified พร้อมชุดทดสอบ Terminal-Bench ที่แก้ไขแล้ว โค้ดประเมินผลที่เผยแพร่จริง ๆ และช่องทางให้บริการแบบโฮสต์ที่ปรากฏขึ้น เพื่อให้โครงสร้างต้นทุนของ 35B-A3B ถูกวัดเทียบกับคำกล่าวอ้างได้ หากตัวเลขยังคงเป็นเช่นนั้น Ornith-1.5-35B-A3B จะเป็นเรื่องราวความคุ้มค่าของโมเดลเปิดค่าน้ำหนักประจำไตรมาส หากไม่เป็นเช่นนั้น ส่วนที่จริงใจ — วิธีการปรับปรุงตัวเองและค่าน้ำหนัก MIT — ก็ยังคงอยู่ไม่ว่าจะอย่างไร
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
