
Tavus Griffin vs MiniMax H3: Mô hình hội thoại song công gặp gỡ trình tạo video đã ra mắt
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 223 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Tavus Griffin và MiniMax H3 đều đưa một người đang chuyển động, đang nói lên màn hình, và vượt qua ấn tượng đầu tiên đó, chúng gần như không cùng một loại sản phẩm. Griffin là một Mô hình Tương tác Con người — một hệ thống video sang video được xây dựng để duy trì cuộc trò chuyện hai chiều theo thời gian thực, được Tavus công bố vào tháng 10 năm 2026 và hiện chỉ giới hạn cho một nhóm nhỏ người thử nghiệm sớm. MiniMax H3 là một trình tạo video đa phương thức toàn diện: bạn đưa cho nó một lời nhắc kèm các tham chiếu hình ảnh, video và âm thanh tùy chọn, và nó trả về một đoạn clip hoàn chỉnh. Một cái đang được đánh giá sau cánh cửa đóng kín; cái còn lại đã có thể tải xuống, cấp phép và tính phí trong nhiều tháng. Sự khác biệt đó — không phải độ phân giải hay tốc độ khung hình — là điều quyết định cái nào trong số chúng thuộc về hệ thống của bạn.
Thực tế mỗi thứ là gì
Griffin là nỗ lực của Tavus nhằm xây dựng một mô hình hành xử như một người tham gia thay vì một bộ kết xuất. Công ty mô tả nó là Human Interaction Model đầu tiên, và kiến trúc mà họ công bố chia công việc thành hai phần: Continuous Conversational Modeling, quyết định nhân vật nên làm gì tại từng thời điểm, và Audio-Visual Generation, truyền phát luồng lời nói cùng khuôn mặt tương ứng. Điểm mấu chốt là nó song công toàn phần — nó vừa quan sát vừa lắng nghe trong khi đang nói, nên có thể bị ngắt lời, có thể phản ứng ngay giữa lúc đang phát ngôn, và không chờ một tín hiệu kết thúc lượt nói rõ ràng trước khi hồi đáp. Cách đặt vấn đề của chính Tavus là các hệ thống trước đây đã học cách tạo ra khuôn mặt; Griffin được xây dựng để học hành vi hội thoại từ con người.
MiniMax H3 là thế hệ Hailuo 3, ra mắt ngày 31 tháng 7 năm 2026 và được mã nguồn mở vào ngày 3 tháng 8 năm 2026 theo Giấy phép Cộng đồng MiniMax H3, với các biến thể H3-Base-FL2VA và H3-Base-Ref2VA được công bố công khai. Nó đọc các tham chiếu văn bản, hình ảnh, video và âm thanh như một ngữ cảnh thống nhất và trả về một clip dài từ 4 đến 15 giây ở 768P hoặc 2K với âm thanh stereo gốc, được tạo qua một quy trình ba giai đoạn (H3-Context-IR, rồi H3-Base ở 768p, rồi H3-Regenerate-2K). Đây là một trình tạo với bề mặt đầu vào rộng bất thường và một giấy phép thực sự thông thoáng — mọi thứ mà Griffin hiện tại không có.
Các thông số kỹ thuật, đặt cạnh nhau

Tại sao "duplex" lại là từ thú vị
Mọi trình tạo video, kể cả H3, đều được đánh giá dựa trên việc một clip trông như thế nào sau khi hoàn thành. Griffin được đánh giá dựa trên điều mà một clip không thể hiển thị: chuyện gì xảy ra trong 200 mili giây sau khi bạn ngắt lời nó. Đó là vấn đề mà cách đặt vấn đề của Human Interaction Model đang hướng tới, và đó là lý do tại sao những con số hàng đầu của Tavus mang tính hành vi hơn là thị giác.
Con số được trích dẫn nhiều nhất là 48% người tin rằng Griffin là người thật sau một cuộc gọi video kéo dài một phút — 26 trong số 54 người tham gia — so với 2,4% đối với bộ công nghệ trước đó của Tavus gồm Phoenix-4.5, Sparrow-2 và Raven-1, vốn chỉ đạt 1 trong 41. Tavus cũng báo cáo rằng những người không bị thuyết phục có xu hướng nghi ngờ trong vòng 20 giây đầu tiên, một chi tiết hữu ích hơn cả dòng tít: điều đó có nghĩa là ảo giác hoặc đứng vững sớm, hoặc sụp đổ sớm.
Bộ số thứ hai đến từ bộ đánh giá VideoFDB của NVIDIA, được chấm điểm vào tháng 9 năm 2026, nơi Tavus cho biết Griffin đứng đầu trong một bài kiểm tra độc lập về AI giao tiếp trực diện. Về khía cạnh tạo sinh, Griffin đạt 3,83 so với 2,80 của đường cơ sở mạnh nhất được báo cáo (một cấu hình Gemini 2.5 kết hợp Anam), với tham chiếu từ con người là 3,92 và tỷ lệ đạt mục tiêu nhiệm vụ là 62,8%. Về khía cạnh nhận thức, nó đạt 3,73 so với 3,44 của MiniCPM-o 4.5, 3,17 của Gemini 2.5 Flash Native và 2,97 của một cấu hình OpenAI gpt-realtime chỉ dùng âm thanh, so với tham chiếu từ con người là 4,20 và tỷ lệ đạt mục tiêu nhiệm vụ là 73,8%, trên mười lăm mô hình được đánh giá. Tavus cũng tuyên bố Griffin dẫn trước 37% so với hệ thống tốt thứ hai về khả năng phản ứng tức thời. Đây là những con số do nhà cung cấp báo cáo, dựa trên một bộ đánh giá do NVIDIA xây dựng, và cần được đọc theo đúng tinh thần đó — nhưng những điểm so sánh với con người mới là điều đáng lưu tâm, bởi mức 3,83 so với điểm số 3,92 của con người là một khoảng cách nhỏ hơn nhiều so với những gì mà lĩnh vực tạo sinh video từng thể hiện trong lịch sử.
Những gì bạn có thể mua hôm nay
Ở đây, hai mô hình hoàn toàn không còn so sánh được với nhau nữa.
MiniMax H3 là một sản phẩm. Nó được lưu trữ trên máy chủ, được tính phí theo từng giây đầu ra được tạo, và các biến thể mở của nó đang nằm trên một kho mô hình chờ được tải về. Nếu bạn muốn một clip dài mười lăm giây, 2K, âm thanh stereo về một thứ không tồn tại, bạn có thể có một clip như vậy ngay chiều nay, và bạn có thể tự chạy các trọng số nếu không muốn thuê chúng.
Tavus Griffin không phải là một sản phẩm. Tavus nói rõ trong bài viết về Griffin rằng Griffin-Lite, bản xem trước nghiên cứu, hiện có sẵn ngay hôm nay cho một nhóm nhỏ người thử nghiệm sớm được chọn lọc, rằng một bản phát hành rộng rãi hơn của một mô hình mạnh mẽ hơn sẽ theo sau, và rằng Griffin vẫn chưa có trên nền tảng Tavus và sẽ chỉ xuất hiện sau khi công ty tìm ra cách phát hành nó một cách an toàn. Đó là mức độ thẳng thắn bất thường từ một nhà cung cấp về kết quả hào nhoáng nhất của chính mình, và điều đó quan trọng cho việc lập kế hoạch: bạn không thể đưa Griffin vào lộ trình sản phẩm như một yếu tố phụ thuộc, và bạn không thể định giá nó, vì chẳng có mức giá nào cả.
Vậy nên, câu hỏi hoạch định trung thực không phải là “cái nào tốt hơn” mà là “cái nào tồn tại ở tầng mà tôi cần”.

OrcaRouter phù hợp ở đâu
MiniMax H3 đang có trong danh mục của chúng tôi. Trang của mô hình nằm tại minimax/minimax-h3, và mức phí được tính đúng như cách nhà cung cấp tính: $0.08 mỗi giây đầu ra được tạo ở 768P và $0.13 mỗi giây ở 2K. OrcaRouter chuyển tiếp nguyên giá niêm yết của nhà cung cấp với mức markup 0%, vì vậy khi MiniMax thay đổi giá, con số sẽ hiển thị trên thẻ của chúng tôi ngay trong ngày được công bố thay vì đợi đến chu kỳ thanh toán tiếp theo. Griffin không có trong danh mục và sẽ không có cho đến khi Tavus phát hành nó tới khách hàng — chúng tôi không lưu trữ một mô hình mà mình không thể phục vụ, và một bản xem trước nghiên cứu giới hạn cho một số người thử nghiệm được chọn không phải là thứ mà một router có thể định tuyến tới.
Hệ quả thực tế là một trong hai mô hình này chỉ cách ứng dụng của bạn đúng một dòng mã, còn mô hình kia là một bài báo nghiên cứu kèm theo một số điện thoại. Nếu bạn đã định tuyến nhiều mô hình video và ngôn ngữ, cách tính phí theo giây của H3 cũng khiến nó trở thành kiểu tuyến đáng để đặt phía sau chuyển đổi dự phòng tự động: một yêu cầu gặp nhà cung cấp đã bão hòa sẽ thử lại với một nhà cung cấp khỏe mạnh thay vì trả về lỗi hết thời gian chờ, và một DSL định tuyến cho phép bạn ghim các tác vụ 2K vào một nhà cung cấp cụ thể trong khi để các bản nháp 768P rơi vào bất cứ nơi nào có dung lượng rẻ nhất. Hợp nhất mô hình là đòn bẩy khác đáng nhắc đến ở đây — mức giá theo giây của H3 đủ thấp để việc dùng một mô hình văn bản viết lại và cắt lại prompt trước khi sinh thường rẻ hơn số giây lãng phí từ một lần thử đầu tiên tồi tệ.

Nơi mà sự so sánh có thể đảo ngược
Ba điều sẽ thay đổi sự so sánh này, và chỉ ba mà thôi.
Đầu tiên, nếu Tavus đưa Griffin lên một API thương mại với mức giá được công bố, thì toàn bộ cách đặt vấn đề "hội thoại so với clip" sẽ trở thành một quyết định mua hàng thực sự thay vì một quyết định sắp xếp lịch, và con số 48% gặp mặt trực tiếp bắt đầu cạnh tranh trực tiếp với chất lượng của đầu ra tạo sinh. Thứ hai, nếu câu chuyện thời gian thực của H3 được cải thiện — và MiniMax đã không ngừng tung ra sản phẩm — thì một trình tạo theo từng giây có khả năng phát trực tiếp sẽ làm giảm bớt lợi thế cốt lõi của Griffin. Thứ ba, nếu NVIDIA hoặc một bên trung lập khác chạy lại VideoFDB với H3 hoặc phiên bản kế nhiệm của nó, thì tuyên bố rằng Griffin là số một về AI gặp mặt trực tiếp sẽ không còn là điều không thể bác bỏ nữa. Tavus cho biết họ dự kiến sẽ phát hành Griffin rất sớm sau khi các lo ngại về an toàn được giải quyết; câu đó chính là toàn bộ tiến độ thời gian.
Điểm mấu chốt
MiniMax H3 và Tavus Griffin hiện không phải là đối thủ của nhau, vì chỉ một trong hai là có thể mua được. H3 là một trình tạo đa phương thức toàn phần theo giây, đã phát hành, trọng số mở, với mức giá đã công bố và cửa sổ đầu ra từ 4 đến 15 giây; Griffin là một mô hình hội thoại song công với những con số mặt đối mặt tốt nhất mà bất kỳ ai đã công bố, không có API, không có giá, và một tuyên bố rõ ràng từ chính nhà cung cấp rằng khách hàng chưa thể sử dụng nó. Nếu bạn cần tạo video ngay hôm nay, H3 là câu trả lời và nó có thể đo lường bằng xu mỗi giây. Nếu bạn cần một khuôn mặt thời gian thực có thể bị ngắt lời, hãy theo dõi Tavus — nhưng hãy xây dựng phần còn lại của sản phẩm trước, vì ngày phát hành chỉ là một câu nói, không phải một ngày cụ thể.
