Một thẻ hero cho "Tavus Griffin so với HeyGen Video 1" với ba chip ghi "HeyGen Video — 0,01 USD mỗi giây", "Griffin — không có giá, yêu cầu quyền truy cập" và "HeyGen Video — 5 đến 15 giây ở 768p", nằm trên sáu hàng: HeyGen ra mắt: 30 tháng 9 năm 2026; Griffin công bố: 1 tháng 10 năm 2026; Giá HeyGen: 0,01 USD mỗi giây; Giá Griffin: chưa công bố; Đầu ra HeyGen: clip 5 đến 15 giây; Đầu ra Griffin: một phiên trực tiếp. Chân trang: "HeyGen Video ra mắt ngày 30 tháng 9 năm 2026; Griffin được công bố ngày 1 tháng 10 năm 2026 dưới dạng bản xem trước."
Guides & Insights

Tavus Griffin đối đầu HeyGen Video 1: Cách nhau ba mươi sáu giờ, và chỉ một bên có thể mua được

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai sản phẩm ra mắt chỉ cách nhau trong vòng ba mươi sáu giờ ở cùng một góc của thị trường, và lịch trình mới là điều thú vị nhất ở cặp đôi này. HeyGen Video ra mắt ngày 30 tháng 9 năm 2026 với giá 0,01 đô la mỗi giây trong suốt tháng Mười, được tinh chỉnh từ MiniMax H3 và phát hành dưới mã định danh heygen-video-1. Tavus Griffin được công bố ngày 1 tháng 10 năm 2026 cùng một nghiên cứu trực tiếp mặt đối mặt, trong đó 26 trong số 54 người tham gia tin rằng người đối thoại với họ là người thật, và nó chỉ dành cho một số tester tin cậy được chọn thông qua một biểu mẫu yêu cầu, không có mã định danh, không có endpoint và không có giá. Cả hai đều xoay quanh việc tạo ra một con người thuyết phục. Lý do trung thực để so sánh Tavus Griffin và HeyGen Video 1 không phải là việc người mua sẽ chọn giữa hai sản phẩm — hôm nay chỉ một trong số đó có thể mua được — mà là sự khác biệt giải thích mỗi sản phẩm được xây dựng để làm gì, và một giây người được tạo ra thực sự đáng giá bao nhiêu.

Một người bán clip, người kia bán cuộc trò chuyện.

HeyGen Video là một mô hình video đa dụng mà lại đặc biệt giỏi về con người. Nó nhận một prompt, hoặc một prompt cộng với một hình ảnh, hoặc một prompt cộng với tối đa chín hình ảnh tham chiếu, ba video tham chiếu và ba clip âm thanh tham chiếu, rồi trả về một clip dài từ 5 đến 15 giây ở 480p hoặc 768p, 24 fps, với âm thanh AAC ở 32 kHz stereo mang lời thoại, âm nền và hiệu ứng được tạo. Ba chế độ bao quát phần điều kiện hóa — text_to_video, image_to_video, và reference_to_video, đây là chế độ mặc định — và thứ tự danh sách trở thành nhãn mà bạn gọi trong prompt, vì vậy mục đầu tiên của reference_images là <Picture 1>. Các trường không xác định trong yêu cầu sẽ bị từ chối thay vì bị bỏ qua, và seed là một số nguyên 32-bit không dấu giúp một cảnh quay có thể lặp lại khi bạn giữ nguyên nó và thay đổi từng mệnh đề một. Đây là một công cụ sản xuất với một phạm vi xác định.

Griffin đảo ngược gần như mọi đặc tính trong số đó. Nó tạo 720p thành các đoạn 320 ms ở 25 fps từ một bức ảnh tham chiếu duy nhất và phát từng đoạn ngay khi giải mã, nên không có độ dài clip nào cần chỉ định và không có tệp nào để gửi trả lại. Một engine Continuous Conversational Modeling tiếp nhận âm thanh và video rồi đánh giá lại cuộc trao đổi theo các khoảng dưới một giây, chọn xem nên im lặng, ra tín hiệu, nói đệm (backchannel) hay giành lượt lời, và các điều khiển biểu cảm của nó điều khiển song song một bộ tạo giọng nói dạng luồng và một bộ tạo video dạng luồng. Một quyết định được đưa ra giữa câu sẽ thể hiện trong giọng nói và khuôn mặt ngay trong cùng một mini-turn. Bạn không viết lời nhắc; bạn nói chuyện với nó, và nó phản hồi với một khoảng dừng, một cái nhìn đi chỗ khác, hoặc một sự ngắt lời.

Đó là lý do tại sao hai thứ này không thể thay thế cho nhau mặc dù cả hai đều tạo ra một con người. HeyGen Video được hỏi một khoảnh khắc được mô tả trông như thế nào. Griffin được hỏi điều gì nên xảy ra tiếp theo.

Mỗi giây tốn bao nhiêu, trên chiếc mà bạn có thể mua từng giây.

Giá ra mắt của HeyGen Video là 0,01 đô la mỗi giây cho đến hết tháng Mười, và phần văn bản do chính HeyGen viết mô tả mức đó là giảm 50% so với mức tiêu chuẩn 0,02 đô la. Biểu đồ chi phí trên cùng trang đó, với chú thích là giá niêm yết mỗi giây ở độ phân giải 768p kèm âm thanh trước các chương trình khuyến mãi ra mắt, lại ghi là 0,03 đô la. Đó là khoảng cách 50% giữa phần văn bản và biểu đồ trên chính tài liệu ra mắt của nhà cung cấp, và cho đến khi HeyGen công bố một trang giá API, cách hiểu an toàn là mức 0,01 đô la đã được xác nhận vì nó đang được áp dụng thực tế, còn con số sau tháng Mười nằm đâu đó giữa 0,02 và 0,03 đô la.

Chạy số liệu cho một nghìn giây — một trăm clip mười giây — đơn vị mà một đội bulk thực sự nghĩ theo:

• Video HeyGen trong tháng 10 — $10 với mức $0,01 mỗi giây.

• HeyGen Video sau tháng 10 — $20 ở mức $0.02, hoặc $30 ở mức $0.03 trên biểu đồ.

• MiniMax H3, mô hình cơ sở mà từ đó nó được tinh chỉnh — $80 theo mức giá niêm yết $0.08 mỗi giây của MiniMax.

• Kling 3.0 Pro — $168 với $0,168 mỗi giây.

• Veo 3.1 — 400 đô la ở mức 0,40 đô la mỗi giây.

Lý do bài toán số học trở thành tâm điểm trong màn ra mắt của HeyGen là tỷ lệ loại bỏ. Các đội làm bản cắt ngắn cho mạng xã hội, biến thể quảng cáo và vòng lặp sản phẩm tạo ra nhiều hơn hẳn so với những gì họ phát hành, và với mức 10 xu cho mỗi lần thử mười giây, bài toán kinh tế của việc vứt bỏ các ứng viên thay đổi hoàn toàn. Vấn đề nằm ở giới hạn trần: 768p ở 24 fps không phải là định dạng phân phối 2K, và MiniMax H3 đạt 2K thông qua một mô-đun tái tạo riêng trên API do chính MiniMax vận hành với mức 0,13 đô la mỗi giây, mà không có lựa chọn tương đương trên HeyGen Video. Nếu mục tiêu phân phối của bạn cao hơn 768p, thì giây rẻ không phải là giây bạn cần.

Cột của Griffin trong danh sách đó trống, và trống theo một cách không mấy hứa hẹn. Tavus chưa công bố mức giá, vì Griffin-Lite là bản xem trước nghiên cứu mà chính thông báo của nó nói rằng sẽ không khả dụng cho khách hàng sử dụng vào thời điểm này và không nằm trên nền tảng Tavus. Theo mô hình nghìn giây thì không có gì để điền vào. Bất kỳ ai trích dẫn một con số cho Griffin đều đang bịa ra.

Các con số chất lượng, và ai đang chấm điểm

Không mô hình nào trong hai mô hình này có điểm số độc lập, điều này đáng nói ngay từ đầu vì cả hai nhà cung cấp đều có biểu đồ.

Bảng của HeyGen là một bảng Elo, trong đó HeyGen Video được chuẩn hoá về 1000, tiếp đó Dreamina Seedance 2.0 ở mức 955, dòng H3 Max trải từ 952 xuống 860, Kling 3.0 Pro ở 857 và Veo 3.1 ở 744. Chú thích cuối trang mới là phần gánh vác phần lớn thông tin: các điểm số đến từ một bộ đánh giá nội bộ gồm các truy vấn Artificial Analysis Arena với 4.800 phiếu bầu, và điểm của chính HeyGen được chuẩn hoá về 1000 để việc so sánh đơn giản hơn. Việc một nhà cung cấp tự chuẩn hoá mình lên vị trí dẫn đầu trong bảng xếp hạng của chính họ là một lựa chọn trình bày, chứ không phải bằng chứng cho thấy họ dẫn đầu. Khoảng cách tương đối bên dưới nó mới là phần mang nhiều thông tin.

Hữu ích hơn là phần đối đầu trực tiếp, nơi duy nhất HeyGen thử nghiệm với thứ mà nó không tự xây dựng. HeyGen nói rằng những người kiểm thử mù ưu thích mô hình của mình hơn H3 Max post-train trên biểu đồ trong 55,8% số so sánh, qua 650 lượt bình chọn, với khoảng từ 49–62%. Khoảng đó là chi tiết trung thực: ở đầu thấp, nó nằm sát mốc 50%, nên theo chính số liệu của nhà cung cấp, mức ưu thích so với đối thủ đó không tách bạch rõ ràng khỏi nhiễu. Phân tích theo từng trục thì hỗn hợp theo kiểu trông như một hồ sơ thất bại cụ thể — 65% về việc giữ đúng hình ảnh nguồn và 66% về căn thời gian, so với 43% về tính nhất quán và 45% về âm nhạc.

Các con số của Griffin đến từ một công cụ do người khác xây dựng, và đó chính là điểm khác biệt đáng kể. VideoFDB của NVIDIA là một benchmark cho hội thoại song công toàn phần (full-duplex) cả âm thanh lẫn hình ảnh, được chấm điểm trên hai hạng mục, và NVIDIA đã tự xây dựng nó rồi tiến hành đánh giá bằng giám khảo của riêng mình dựa trên một thang chấm điểm đã công bố. Griffin-Lite đạt 3.83 trên 5 ở phần tạo sinh, so với mức tham chiếu của con người là 3.92 và 2.80 của hệ thống đã công bố có điểm cao thứ hai, cùng 3.73 ở phần cảm nhận so với mức tham chiếu của con người là 4.20. Tavus cũng báo cáo độ trễ thực từ âm thanh sang hình ảnh là 0.43 giây cho bộ tạo sinh, so với bốn baseline khuếch tán dạng streaming đã công bố trên H100. Những lưu ý vẫn còn nguyên giá trị — khoảng cách 0.09 điểm so với con người trên thang điểm 5 do mô hình ngôn ngữ chấm là "gần bằng", chứ không phải "ngang bằng", và một phần lợi thế về cảm nhận được đo so với các hệ thống chạy mà không có đầu vào hình ảnh — nhưng người chấm điểm không phải là nhà cung cấp.

• Điểm chất lượng độc lập — không bên nào có. HeyGen Video không xuất hiện trên bất kỳ bảng video nào trong ba bảng video của Artificial Analysis tính đến ngày 2 tháng 10 năm 2026, và Griffin cũng vậy. Griffin có thể sẽ không bao giờ có: bỏ phiếu ưu tiên theo cặp trên các clip ngắn không thể chấm điểm một cuộc trò chuyện trực tiếp.

Chính những bảng xếp hạng đó cũng có mô hình cơ sở. MiniMax H3 đứng thứ 4 ở hạng mục văn bản-thành-video (có âm thanh) với Elo 1.139 và thứ 2 ở hạng mục hình ảnh-thành-video với 1.181, cả hai đều ở mức 4,80 USD/phút — vậy nên giai đoạn huấn luyện hậu kỳ của HeyGen đang cạnh tranh trên một nền tảng mà một đấu trường độc lập đã đánh giá là gần top đầu, và đây chính là lập luận mạnh mẽ nhất ủng hộ nó mà chính HeyGen đã không công bố.

A screenshot of the top of Artificial Analysis's text-to-video-with-audio board, captured 2 October 2026: Wan 3.0 first at Elo 1,157 and $12.00/min, Utopai X (based on MiniMax H3) second at 1,150, Dreamina Seedance 2.5 third at 1,144, MiniMax H3 (768p) fourth at Elo 1,139 with 7,496 votes and $4.80/min, MiniMax H3 Max (based on MiniMax H3) fifth at 1,134 with 5,510 votes, and FLUX 3 sixth at 1,127, with release months and per-minute API pricing columns visible.

Cả hai đều rẻ hoặc không thể định giá được vì cùng một lý do.

Sự thật mang tính cấu trúc nằm dưới cả hai lần ra mắt là việc tạo ra một con người thuyết phục đã trở nên rẻ, và lợi thế chi phí của cả hai công ty đều không đến từ thứ mà họ đang bán.

HeyGen Video là một bản post-train của MiniMax H3, mà MiniMax đã phát hành với trọng số khả dụng theo giấy phép cộng đồng của riêng mình. Điều đó đã biến H3 thành một nền tảng mà các công ty khác có thể chuyên biệt hóa và bán lại, và HeyGen là sản phẩm thứ hai làm điều đó trong vòng năm tuần cho một lĩnh vực khác — video doanh nghiệp, demo sản phẩm, đào tạo, tham quan bất động sản. Mô hình này là lý do HeyGen có thể định giá thấp hơn bản gốc: nó không phải gánh chi phí của mô hình nền, và bản nền là bản phát hành trọng số mở của người khác.

Griffin là một đặt cược ngược lại. Tavus đã xây dựng toàn bộ hệ thống — codec, bộ tạo giọng nói truyền phát, bộ tạo video truyền phát, mô hình hội thoại — xoay quanh chính tương tác, chưng cất một mô hình giáo viên khuếch tán hai chiều quy mô lớn thành bộ tạo tự hồi quy vài bước trong ba giai đoạn để các lần rollout dài không bị trôi dạt. Đó là nghiên cứu đắt đỏ không có nền tảng mở nào để dựa vào, và đó có thể là một phần lý do khiến bản phát hành bị hạn chế: không có lớp nền rẻ nào bên dưới nó để khấu hao.

Cả hai công ty cũng đều đi đến cùng một điểm khó xử từ những hướng khác nhau. Tài liệu của chính HeyGen liệt kê những gì mô hình làm kém nhất, điều hiếm thấy và đáng đọc: văn bản dài trên màn hình, chuyển động hữu cơ mềm mại như cánh hoa, giấy và tóc, cùng các thao tác tay cận cảnh như lắp ráp hoặc vận hành thiết bị. Nó tốt nhất với những cảnh quay ngắn, gọn — một chủ thể, một địa điểm, một hành động, camera cố định hoặc hầu như không di chuyển. Hạn chế của Griffin không phải là một danh sách các kiểu lỗi mà là một vấn đề an toàn chưa được giải quyết: Tavus nói thẳng rằng những đặc tính khiến một mô hình tương tác con người trở thành giao diện tốt hơn cũng khiến nó giỏi hơn trong việc thuyết phục ai đó rằng họ đang nói chuyện với một con người, và rằng họ đang tạm giữ bản xem trước trong khi xây dựng các cơ chế công bố.

Những gì người mua thực sự có thể làm ngày hôm nay

HeyGen Video hiện đã có thể gọi được. Nó chạy trên POST /v3/models/videos với x-api-key header, chỉ dành cho các API key trả phí, với các liên kết tải xuống được ký và sẽ hết hạn — nên việc polling sẽ làm mới chúng — và callback chỉ được thử một lần cho mỗi job, điều mà chính HeyGen bảo bạn nên coi là một tối ưu về độ trễ chứ không phải một bảo đảm. Nếu bạn đang thử nghiệm nó trong tháng này, mức khuyến mãi $0.01 mỗi giây đang có hiệu lực, giới hạn đầu ra là 768p, và chế độ tăng cường prompt là một đòn bẩy chi phí thực sự: mặc định là turbo, quality cho một lượt xử lý dài hơn, còn disabled để gửi văn bản của bạn đi mà không bị chỉnh sửa gì.

Griffin không thể gọi được. Truy cập là một biểu mẫu yêu cầu và một bản xem trước nghiên cứu. Không có khóa, không có mã định danh, không có endpoint và không có SLA, và tuyên bố duy nhất được công bố về tính khả dụng là nó sẽ ra mắt khi Tavus đã tìm ra cách phát hành nó một cách an toàn.

Một điểm chung giữa cả hai là không mô hình nào trong số đó là thứ mà router có thể giúp bạn truy cập, và với Griffin thì đó là vấn đề về chủng loại chứ không phải tạm thời — một phiên song công toàn phần theo thời gian thực không phải là một lệnh gọi yêu cầu–phản hồi. Điều mà router thực sự giúp ích trong cả hai pipeline là lớp bao quanh video. Mở rộng prompt, kiểm kê ảnh tham chiếu, mô tả cảnh quay, tạo chú thích và tóm tắt đánh giá đều là các lệnh gọi văn bản, và những mô hình từ OpenAI, Google cùng các nhà cung cấp khác nằm trong danh mục OrcaRouter phía sau một endpoint tương thích OpenAI với hơn 200 mô hình trên cùng một key, ở mức giá niêm yết của nhà cung cấp, cộng thêm 0% phụ phí, nên khi nhà cung cấp thay đổi giá thì thay đổi đó có hiệu lực ngay trong cùng ngày. Về bản thân mô hình video, có một thông tin hữu ích: MiniMax H3 — mô hình nền mà HeyGen Video được tinh chỉnh từ đó, và là thứ mà mức 0,01 đô-la mỗi giây của HeyGen đang hạ thấp hơn — được định tuyến ở đây dưới tên minimax/minimax-h3 với giá 0,08 đô-la mỗi giây, còn 2K là 0,13 đô-la. Bản thân HeyGen Video không có trong danh mục của chúng tôi và Griffin cũng vậy; cả hai đều được cung cấp thông qua API của nhà cung cấp riêng và một số nền tảng bên thứ ba.

A screenshot of OrcaRouter's own model page for MiniMax-H3, captured 2 October 2026, showing the model id minimax/minimax-h3 labelled "text + image + video + audio", an Output type of video, a p50 time-to-first-token of 375 ms, and the OrcaRouter navigation and pricing panels alongside.

Cái nào, và cho ai?

• Hãy dùng HeyGen Video nếu sản phẩm bàn giao là cảnh quay ngắn, gọn, lấy con người làm trung tâm, có âm thanh tích hợp và bạn chấp nhận được 768p ở 24 fps. Hãy dự trù mức giá sau tháng 10 trong khoảng $0,02 đến $0,03 mỗi giây thay vì mức khuyến mãi 10 xu, và hãy thử nghiệm kỹ văn bản dài trên màn hình cùng các cảnh cận bàn tay trước khi xây dựng quy trình làm việc dựa trên nó, vì HeyGen đã nói với bạn rằng đó chính là những chỗ nó hỏng.

• Đừng lên kế hoạch dựa vào Griffin. Hãy yêu cầu quyền truy cập nếu câu hỏi của bạn là liệu một người có thể phân biệt con người được tạo ra với người thật trong một cuộc gọi một phút hay không, hoặc nếu bạn cần xem lớp tương tác thời gian thực đang đi theo hướng nào trước khi bạn cam kết một lộ trình cho các đoạn clip đã kết xuất.

• Hãy để mắt đến câu hỏi về công bố thông tin, vì đó là điều duy nhất sẽ tác động đến cả hai. Khách hàng của HeyGen Video có sẵn một câu trả lời thẳng thắn — mô hình là bản hậu huấn luyện từ một nền tảng trọng số mở và đầu ra là một tệp có nguồn gốc đã biết — trong khi Tavus đang giữ lại một mô hình, cụ thể là vì nó chưa có được một câu trả lời như vậy. Công ty nào công bố cơ chế tiết lộ tốt hơn sẽ giải quyết được bài toán giá trị hơn.

A two-column scoreboard titled "Tavus Griffin vs HeyGen Video 1 — the scoreboard". Left column "Tavus Griffin": Status: research preview; Price: none published; Output: live session; Resolution: 720p at 25 fps; Clip length: none - a session; Independent score: none. Right column "HeyGen Video 1": Status: live 30 September 2026; Price: $0.01 per second; Output: video file; Resolution: 768p at 24 fps; Clip length: 5 to 15 seconds; Independent score: none yet. Footer: "HeyGen price per HeyGen's launch page, October 2026. Neither has an independent score."