
Tavus Griffin vs MiniMax H3: เมื่อโมเดลสนทนาแบบดูเพล็กซ์พบกับเครื่องสร้างวิดีโอที่เปิดให้ใช้งานแล้ว
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 223 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
Tavus Griffin และ MiniMax H3 ต่างก็แสดงมนุษย์ที่เคลื่อนไหวและพูดได้บนหน้าจอ และเมื่อผ่านความประทับใจแรกนั้นไปแล้ว ทั้งสองแทบจะไม่ได้อยู่ในหมวดหมู่ผลิตภัณฑ์เดียวกันเลย Griffin เป็น โมเดลปฏิสัมพันธ์ระหว่างมนุษย์ — ระบบวิดีโอต่อวิดีโอที่สร้างขึ้นเพื่อสนทนาแบบสองทางแบบเรียลไทม์ ประกาศโดย Tavus ในเดือนตุลาคม 2026 และปัจจุบันจำกัดเฉพาะกลุ่มผู้ทดสอบช่วงแรกที่ได้รับการคัดเลือกเท่านั้น MiniMax H3 เป็นเครื่องสร้างวิดีโอแบบออมนิโหมดัล: คุณป้อนพรอมต์พร้อมภาพ วิดีโอ และเสียงอ้างอิงซึ่งไม่บังคับ แล้วระบบจะคืนคลิปที่เสร็จสมบูรณ์ ตัวหนึ่งกำลังถูกประเมินอยู่หลังประตูปิด ส่วนอีกตัวหนึ่งสามารถดาวน์โหลดได้ ให้สิทธิ์ใช้งานได้ และเรียกเก็บค่าบริการได้มาเป็นเวลาหลายเดือน ความแตกต่างนั้น — ไม่ใช่ความละเอียดหรือเฟรมเรต — คือสิ่งที่ตัดสินว่าตัวไหนควรอยู่ในสแต็กของคุณ
แต่ละอย่างจริงๆ แล้วคืออะไร
Griffin เป็นความพยายามของ Tavus ในการสร้างโมเดลที่ทำตัวเหมือนผู้ร่วมสนทนา มากกว่าจะเป็นเพียงตัวเรนเดอร์ บริษัทอธิบายว่ามันเป็น Human Interaction Model ตัวแรก และสถาปัตยกรรมที่เผยแพร่แบ่งงานออกเป็นสองส่วน ได้แก่ Continuous Conversational Modeling ซึ่งตัดสินใจว่าเพอร์โซนาควรทำอะไรในแต่ละขณะ และ Audio-Visual Generation ซึ่งสตรีมคำพูดและใบหน้าที่สอดคล้องกัน สิ่งสำคัญคือมันเป็น full duplex — มันเฝ้าดูและฟังในขณะที่กำลังพูด ดังนั้นจึงสามารถถูกขัดจังหวะได้ สามารถตอบสนองกลางบทพูด และไม่รอสัญญาณสิ้นสุดเทิร์นที่ชัดเจนก่อนจะตอบสนอง กรอบแนวคิดของ Tavus เองคือระบบก่อนหน้าเรียนรู้ที่จะสร้างใบหน้า ส่วน Griffin ถูกสร้างขึ้นเพื่อเรียนรู้พฤติกรรมการสนทนาจากผู้คน
MiniMax H3 คือเจเนอเรชัน Hailuo 3 เปิดตัวเมื่อวันที่ 31 กรกฎาคม 2026 และเปิดซอร์สเมื่อวันที่ 3 สิงหาคม 2026 ภายใต้สัญญาอนุญาต MiniMax H3 Community License โดยมีเวอร์ชันย่อย H3-Base-FL2VA และ H3-Base-Ref2VA ที่เผยแพร่แบบเปิด มันอ่านข้อความ ภาพ วิดีโอ และเสียงอ้างอิงเป็นบริบทเดียวรวมกัน และส่งคืนคลิปความยาว 4 ถึง 15 วินาทีที่ 768P หรือ 2K พร้อมเสียงสเตอริโอแบบเนทีฟ สร้างผ่านไปป์ไลน์สามขั้นตอน (H3-Context-IR จากนั้น H3-Base ที่ 768p จากนั้น H3-Regenerate-2K) มันเป็นเครื่องสร้างที่มีขอบเขตอินพุตกว้างอย่างผิดปกติและมีสัญญาอนุญาตที่ผ่อนปรนอย่างแท้จริง — ทุกสิ่งที่ Griffin ยังไม่ใช่ในตอนนี้
ข้อมูลจำเพาะ เปรียบเทียบเคียงข้างกัน

ทำไม "duplex" ถึงเป็นคำที่น่าสนใจ
ตัวสร้างวิดีโอทุกตัว รวมถึง H3 ถูกตัดสินจากว่าคลิปดูเป็นอย่างไรเมื่อสร้างเสร็จแล้ว ส่วน Griffin ถูกตัดสินจากสิ่งที่คลิปไม่สามารถแสดงให้เห็นได้ นั่นคือสิ่งที่เกิดขึ้นใน 200 มิลลิวินาทีหลังจากที่คุณขัดจังหวะมัน นั่นคือปัญหาที่กรอบแนวคิด Human Interaction Model กำลังชี้ไป และนั่นคือเหตุผลที่ตัวเลขเด่นของ Tavus เป็นเชิงพฤติกรรมมากกว่าเชิงภาพ
ตัวเลขที่มีการอ้างอิงมากที่สุดคือ 48% ของผู้คนเชื่อว่า Griffin เป็นคนจริง หลังจากวิดีโอคอลหนึ่งนาที — 26 จาก 54 ผู้เข้าร่วม — เทียบกับ 2.4% สำหรับสแตกก่อนหน้าของ Tavus อย่าง Phoenix-4.5, Sparrow-2 และ Raven-1 ซึ่งทำได้ 1 จาก 41 Tavus ยังรายงานด้วยว่าผู้ที่ไม่ถูกโน้มน้าวมักเริ่มสงสัยภายใน 20 วินาทีแรก ซึ่งเป็นรายละเอียดที่มีประโยชน์มากกว่าพาดหัวข่าว: นั่นหมายความว่าภาพลวงตานั้นจะยืนระยะได้ตั้งแต่ช่วงต้น หรือไม่ก็พังทลายตั้งแต่ช่วงต้น
ชุดตัวเลขชุดที่สองมาจากเกณฑ์วัด VideoFDB ของ NVIDIA ซึ่งให้คะแนนในเดือนกันยายน 2026 โดย Tavus กล่าวว่า Griffin ได้อันดับหนึ่งในการทดสอบอิสระด้าน AI แบบเผชิญหน้า ในด้านการสร้าง Griffin ได้คะแนน 3.83 เทียบกับ 2.80 สำหรับค่าพื้นฐานที่รายงานว่าแข็งแกร่งที่สุด (การกำหนดค่า Gemini 2.5 ร่วมกับ Anam) โดยมีค่าอ้างอิงจากมนุษย์ที่ 3.92 และอัตราตามวัตถุประสงค์ของงานที่ 62.8% ในด้านการรับรู้ ได้คะแนน 3.73 เทียบกับ 3.44 สำหรับ MiniCPM-o 4.5, 3.17 สำหรับ Gemini 2.5 Flash Native และ 2.97 สำหรับการกำหนดค่า OpenAI gpt-realtime ที่ใช้เสียงเท่านั้น เมื่อเทียบกับค่าอ้างอิงจากมนุษย์ที่ 4.20 และอัตราตามวัตถุประสงค์ของงานที่ 73.8% จากการประเมินทั้งหมด 15 รุ่น Tavus ยังอ้างว่า Griffin นำอยู่ 37% เหนือระบบที่ดีที่สุดรองลงมาในการตอบสนองในขณะนั้น ตัวเลขเหล่านี้เป็นตัวเลขที่ผู้ขายรายงาน โดยอิงจากเกณฑ์มาตรฐานที่ NVIDIA สร้างขึ้น และควรอ่านในลักษณะนั้น — แต่จุดเปรียบเทียบกับมนุษย์เป็นสิ่งที่ควรค่าแก่การจดจำ เพราะ 3.83 เมื่อเทียบกับคะแนนมนุษย์ 3.92 เป็นช่องว่างที่เล็กกว่ามากเมื่อเทียบกับการสร้างวิดีโอที่เคยแสดงให้เห็นในอดีต
สิ่งที่คุณสามารถซื้อได้วันนี้
ตรงนี้เองที่โมเดลทั้งสองไม่สามารถนำมาเปรียบเทียบกันได้อีกต่อไปเลย
MiniMax H3 เป็นผลิตภัณฑ์ มันมีให้บริการแบบโฮสต์ คิดราคาต่อวินาทีของเอาต์พุตที่สร้างขึ้น และเวอร์ชันเปิดของมันก็อยู่บนโมเดลฮับรอให้ดาวน์โหลด ถ้าคุณต้องการคลิปความยาวสิบห้าวินาที ความละเอียด 2K พร้อมเสียงสเตอริโอของสิ่งที่ไม่มีอยู่จริง คุณก็ได้มันภายในบ่ายวันนี้ และคุณสามารถรันเวตต์ด้วยตัวเองได้ ถ้าคุณไม่อยากเช่าใช้งาน
Tavus Griffin ไม่ใช่ผลิตภัณฑ์ Tavus ระบุอย่างชัดเจนในบทความเกี่ยวกับ Griffin ว่า Griffin-Lite ซึ่งเป็นพรีวิวเพื่อการวิจัยนั้นพร้อมให้ใช้งานแล้ววันนี้สำหรับกลุ่มผู้ทดสอบช่วงแรกที่คัดเลือกมา ว่าการเปิดตัวในวงกว้างขึ้นของโมเดลที่ทรงพลังกว่าจะตามมา และว่า Griffin ยังไม่ปรากฏบนแพลตฟอร์มของ Tavus และจะมาถึงก็ต่อเมื่อบริษัทหาวิธีเปิดตัวมันอย่างปลอดภัยได้แล้วเท่านั้น นั่นเป็นความตรงไปตรงมาในระดับที่ผิดปกติจากผู้ขายเกี่ยวกับผลงานที่หวือหวาที่สุดของตนเอง และเรื่องนี้สำคัญต่อการวางแผน: คุณไม่สามารถใส่ Griffin ลงในโรดแมปผลิตภัณฑ์ในฐานะสิ่งที่ต้องพึ่งพา และคุณไม่สามารถกำหนดราคาให้มันได้ เพราะยังไม่มีราคา
ดังนั้น คำถามการวางแผนที่ตรงไปตรงมาจึงไม่ใช่ "อันไหนดีกว่า" แต่คือ "อันไหนมีอยู่จริงในเลเยอร์ที่ฉันต้องการ"

OrcaRouter เหมาะกับที่ใด
MiniMax H3 อยู่ในแคตตาล็อกของเรา หน้าโมเดลอยู่ที่ minimax/minimax-h3 ซึ่งคิดค่าบริการแบบเดียวกับที่ผู้ให้บริการคิด นั่นคือ $0.08 ต่อวินาทีของเอาต์พุตที่สร้างขึ้นที่ 768P และ $0.13 ต่อวินาทีที่ 2K OrcaRouter ส่งผ่านราคาตามรายการของผู้ให้บริการโดยคิด มาร์กอัป 0% ดังนั้นหาก MiniMax เปลี่ยนแปลงราคา การเปลี่ยนแปลงจะปรากฏบนการ์ดของเราในวันเดียวกับที่ประกาศ ไม่ใช่รอบบิลถัดไป Griffin ไม่ได้อยู่ในแคตตาล็อก และจะยังไม่ถูกเพิ่มจนกว่า Tavus จะส่งมอบให้ลูกค้า — เราไม่โฮสต์โมเดลที่เราให้บริการไม่ได้ และการพรีวิวงานวิจัยที่จำกัดเฉพาะผู้ทดสอบที่ได้รับเลือกก็ไม่ใช่สิ่งที่เราเตอร์จะกำหนดเส้นทางไปได้
ผลที่ตามมาในทางปฏิบัติก็คือ หนึ่งในสองโมเดลนี้อยู่ห่างจากแอปพลิเคชันของคุณเพียงโค้ดบรรทัดเดียว ส่วนอีกโมเดลหนึ่งเป็นงานวิจัยที่มีแค่เบอร์โทรศัพท์ให้โทรติดต่อ ถ้าคุณจัดเส้นทางให้โมเดลวิดีโอและโมเดลภาษาหลายตัวอยู่แล้ว การคิดค่าบริการเป็นรายวินาทีของ H3 ยังทำให้มันเป็นเส้นทางแบบที่ควรวางไว้หลังการสลับไปใช้ระบบสำรองอัตโนมัติอยู่ดี: คำขอที่ไปชนผู้ให้บริการที่เต็มความจุจะลองใหม่กับผู้ให้บริการที่ยังทำงานปกติ แทนที่จะโผล่เป็นข้อผิดพลาดหมดเวลา และ DSL สำหรับจัดเส้นทางช่วยให้คุณกำหนดงานระดับ 2K ไปยังผู้ให้บริการรายที่เจาะจงได้ ขณะเดียวกันก็ปล่อยให้ฉบับร่าง 768P ตกไปที่ใดก็ตามที่มีความจุถูกที่สุด การหลอมรวมโมเดล (model fusion) ก็เป็นอีกกลไกหนึ่งที่ควรพูดถึงตรงนี้ — ราคาต่อวินาทีของ H3 ต่ำพอที่การจ่ายให้โมเดลข้อความมาเขียนและตัดแต่งพรอมป์ตใหม่ก่อนการสร้าง จะถูกกว่าวินาทีที่เสียไปจากการลองครั้งแรกที่ล้มเหลว

จุดที่การเปรียบเทียบอาจพลิกผัน
สามสิ่งที่จะเปลี่ยนการเปรียบเทียบนี้ และมีเพียงสามสิ่งเท่านั้น
ประการแรก หาก Tavus นำ Griffin ขึ้นเป็น API เชิงพาณิชย์ที่มีการประกาศอัตราค่าบริการออกมา กรอบความคิดเรื่อง "การสนทนาเทียบกับคลิป" ทั้งหมดก็จะกลายเป็นการตัดสินใจซื้อที่แท้จริง แทนที่จะเป็นการตัดสินใจเรื่องตารางเวลา และตัวเลข 48% ของการเผชิญหน้าแบบตัวต่อตัวก็จะเริ่มแข่งขันโดยตรงกับคุณภาพของผลลัพธ์ที่สร้างขึ้น ประการที่สอง หากเรื่องราวเรียลไทม์ของ H3 ดีขึ้น — และ MiniMax ก็เปิดตัวผลิตภัณฑ์ออกมาอย่างดุดันต่อเนื่อง — เครื่องสร้างแบบคิดค่าบริการรายวินาทีที่สตรีมได้ก็จะบั่นทอนความได้เปรียบหลักของ Griffin ประการที่สาม หาก NVIDIA หรือบุคคลที่สามที่เป็นกลางรายอื่นรัน VideoFDB ใหม่โดยรวม H3 หรือรุ่นสืบทอดของมันเข้าไปด้วย ข้อกล่าวอ้างที่ว่า Griffin เป็นเจ้าแรกใน AI แบบเผชิญหน้าซึ่งหน้า ก็จะไม่ใช่ข้อกล่าวอ้างที่พิสูจน์ให้เป็นเท็จไม่ได้อีกต่อไป Tavus กล่าวว่าคาดว่าจะเปิดตัว Griffin เร็วมากหลังประเด็นด้านความปลอดภัยของมันได้รับการแก้ไข ประโยคนั้นคือไทม์ไลน์ทั้งหมด
ประเด็นสำคัญ
MiniMax H3 กับ Tavus Griffin ไม่ใช่คู่แข่งกันในตอนนี้ เพราะมีเพียงตัวเดียวเท่านั้นที่ซื้อได้ H3 เป็นเครื่องสร้างแบบ omni-modal ที่เปิดให้ใช้แล้ว น้ำหนักเปิด คิดเป็นรายวินาที มีราคาเผยแพร่ และมีหน้าต่างเอาต์พุต 4 ถึง 15 วินาที ส่วน Griffin เป็นโมเดลสนทนาแบบ duplex ที่มีตัวเลขการสนทนาแบบเห็นหน้าต่อหน้าดีที่สุดเท่าที่มีใครเผยแพร่ ไม่มี API ไม่มีราคา และมีคำแถลงชัดเจนจากผู้ขายของตัวเองว่าลูกค้ายังไม่สามารถใช้มันได้ ถ้าคุณต้องการสร้างวิดีโอวันนี้ H3 คือคำตอบ และวัดผลได้เป็นเซนต์ต่อวินาที ถ้าคุณต้องการใบหน้าแบบเรียลไทม์ที่ถูกขัดจังหวะได้ จับตา Tavus ไว้ — แต่สร้างส่วนที่เหลือของผลิตภัณฑ์ก่อน เพราะวันวางจำหน่ายเป็นเพียงประโยค ไม่ใช่วันที่
