
GPT-Live-1 vs SeedRealtime: SeedRealtime là mô hình tham vọng hơn, và bạn không thể mua nó
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 trên 1 triệu token
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Việc so sánh GPT-Live-1 và SeedRealtime về năng lực tạo ra một câu trả lời không thoải mái, bởi vì hai mô hình không cạnh tranh trên cùng một tiêu chí. GPT-Live-1 là mô hình giọng nói song công toàn phần của OpenAI, được phát hành trong ChatGPT vào ngày 8 tháng 7 năm 2026 và mở cho nhà phát triển thông qua Live Sessions API vào ngày 10 tháng 9 năm 2026, với 12 giọng nói, mức giá theo phút được công bố, và một lỗ hổng đáng kể: đầu vào hình ảnh và video không được hỗ trợ một cách rõ ràng. SeedRealtime, được phát hành bởi nhóm Seed của ByteDance vào ngày 5 tháng 8 năm 2026, được xây dựng hoàn toàn xoay quanh lỗ hổng đó. Đây là một mô hình song công toàn phần âm thanh-hình ảnh gốc, có khả năng quan sát, lắng nghe và nói trong một kiến trúc đầu-cuối duy nhất — và nó chỉ có sẵn bên trong ứng dụng tiêu dùng Doubao, không có API công khai, không có trọng số mở, không có báo cáo kỹ thuật và không công bố số lượng tham số.
Mỗi thứ thực sự có thể cảm nhận được điều gì
Cách rõ ràng nhất để thấy được khoảng cách là hỏi xem mỗi mô hình biết gì về căn phòng mà nó đang ở trong.
GPT-Live-1 biết nghe. Đó là toàn bộ bề mặt đầu vào. Âm thanh và văn bản đi vào, âm thanh và văn bản đi ra, và tài liệu của OpenAI liệt kê hình ảnh và video là không được hỗ trợ. Nó xử lý cực kỳ tốt các cơ chế hội thoại của việc nghe — nó quyết định nhiều lần mỗi giây xem nên tiếp tục nghe, tạm dừng, ngắt lời hay gọi công cụ, và nó duy trì chế độ song công hoàn toàn nên vẫn tiếp tục xử lý âm thanh đến trong lúc đang nói. Nó cũng trả về bản chép lời nhận dạng giọng nói song song với âm thanh, một chi tiết có vẻ tầm thường nhưng lại tiết kiệm cả tuần công việc tích hợp.
SeedRealtime nghe và thấy, trong một mô hình duy nhất thay vì một pipeline. ByteDance mô tả một kiến trúc thống nhất xử lý âm thanh, video và văn bản cùng nhau, giải quyết sự mơ hồ bằng ngữ cảnh thị giác — phân biệt các từ đồng âm, hiểu "cái này" ám chỉ điều gì từ cảnh vật, cử chỉ, ánh nhìn và hành động trước đó — và vận hành nhận thức, thấu hiểu, ra quyết định và biểu đạt song song thay vì tuần tự. Các minh chứng được ByteDance công bố bao gồm một bữa tối nhóm ồn ào nơi mô hình phải gán giọng nói với danh tính, một chuyến thăm bảo tàng, sửa quy trình pha espresso, và khử nhiễu tại sân bay trong khi vẫn ghi nhớ ngoài màn hình và tra cứu trực tuyến.
• Đầu vào — GPT-Live-1 chỉ có âm thanh và văn bản, còn hình ảnh và video thì không được hỗ trợ rõ ràng, so với SeedRealtime khi âm thanh, video và văn bản được hợp nhất trong một mô hình
• Luân phiên lượt nói — GPT-Live-1 tự quyết định bên trong, nhiều lần mỗi giây, so với SeedRealtime chuyển việc luân phiên lượt nói vào bên trong mô hình và loại bỏ hoàn toàn bộ phát hiện hoạt động giọng nói bên ngoài
• Hành vi chủ động — GPT-Live-1 phản hồi, giao việc và gọi công cụ, trong khi SeedRealtime được mô tả là tự lên tiếng mà không cần nhắc khi một đối tượng mục tiêu xuất hiện trong tầm nhìn
• Khả năng sẵn có — GPT-Live-1 được cung cấp rộng rãi trong API của OpenAI với giá 0,05 USD một phút, so với SeedRealtime miễn phí bên trong Doubao, không có API và không có mốc thời gian nào cho việc đó

Chất lượng bằng chứng đi theo hướng ngược lại với tham vọng
Đây là lúc sự so sánh không còn tâng bốc ByteDance nữa.
OpenAI công bố các con số. Chúng là của chính họ, chúng so sánh GPT-Live-1 với GPT-Realtime-2.1 thay vì so với một đối thủ cạnh tranh, và chưa có phòng thí nghiệm độc lập nào tái lập được chúng — 80,1% về khả năng tương tác song công toàn phần so với 45,4%, độ trễ chuyển lượt giảm từ 1,4 giây xuống 0,8, độ chính xác gọi công cụ từ 60% lên 87%. Việc do nhà cung cấp tự chạy và chưa được tái lập là một hạn chế thực sự, và đó là một hạn chế mà ít nhất bạn có thể gắn với một con số.
ByteDance gần như không công bố gì. Tuyên bố trung tâm về SeedRealtime là một đánh giá đầu-cuối do con người thực hiện, nói rằng nó giảm một nửa các vấn đề về nhịp độ hội thoại nghe-nhìn so với các hệ thống ASR cộng thị giác cộng TTS xếp tầng — ít bị cắt ngang giữa câu hơn, ít phản hồi chậm sau khi tạm dừng hơn, ít kích hoạt nhầm do tiếng nói xung quanh hơn. Không có kích thước mẫu, không có phương pháp luận, không có con số chính xác cho mức cải thiện, và hoàn toàn không có số đo độ trễ. Cũng không có số lượng tham số và không có báo cáo kỹ thuật.
Kết quả là mô hình có kiến trúc thú vị hơn lại chính là mô hình bạn ít có thể đánh giá được nhất. Điều đó không giống với việc nói rằng nó hoạt động kém hơn — các phần trình diễn thực sự gây ấn tượng mạnh, và bài viết kỹ thuật xoay quanh đầu vào nghe nhìn được chia khối cùng việc tạo sinh dạng luồng gợi ý một hệ thống thực sự chứ không phải một bản demo — nhưng điều đó có nghĩa là bất kỳ so sánh nào giữa hai mô hình này về chất lượng hiện tại đều là so sánh giữa một mô hình đã có tài liệu và một video ấn tượng.
Tại sao khoảng cách API không phải là một chi tiết nhỏ
SeedRealtime đã được triển khai đầy đủ trong Doubao kể từ ngày 5 tháng 8 năm 2026, ở cả giọng nói lẫn video, miễn phí. Nó không có endpoint nào của Volcano Engine hay BytePlus, không có gói trả phí, không có hạn mức nào được công bố, và không có mốc thời gian nào được nêu cho việc mở quyền truy cập cho nhà phát triển. Lộ trình của ByteDance có đề cập đến độ trễ thấp hơn, khả năng theo dõi người nói sắc nét hơn và các tác vụ kết nối công cụ; nhưng không đề cập đến ngày cụ thể.
Có một lưu ý về quyền truy cập khiến vấn đề thêm phức tạp. Doubao là sản phẩm ưu tiên thị trường Trung Quốc đại lục và thường yêu cầu số điện thoại di động Trung Quốc đại lục để đăng ký, đồng thời chưa công bố phiên bản tiếng Anh bản địa hóa. Đối với một đội ngũ ngoài Trung Quốc, SeedRealtime không chỉ đơn thuần là chưa ra mắt dưới dạng API — mà còn không thể tiếp cận được như một sản phẩm.
Đặt điều đó bên cạnh gánh nặng tích hợp của chính GPT-Live-1 và sự đánh đổi trở nên cụ thể. API của OpenAI bị thu hẹp theo những cách khiến người ta ngạc nhiên: một model ID, một endpoint tại v1/live/sessions, truyền tải WebRTC với xử lý sự kiện trên một data channel, và không có đường đi qua Chat Completions, Responses, Realtime, Batch hay các endpoint fine-tuning. Giới hạn tốc độ được tính theo số phiên đồng thời — 25 ở Tier 1, tăng lên 50, 200, 300 và 500 — thay vì số yêu cầu mỗi phút, và gói Free hoàn toàn không thể gọi model này. Đó là một tích hợp mới, và nó vẫn là một tích hợp bạn có thể bắt đầu ngay chiều nay.

Hai câu trả lời cho cùng một vấn đề delegation
Cả hai mô hình đều bác bỏ thiết kế xếp tầng cũ, nơi nhận dạng giọng nói, một mô hình ngôn ngữ và tổng hợp giọng nói chạy tuần tự với khoảng 1,7 giây im lặng chết giữa các lượt. Chúng bác bỏ nó theo những cách khác nhau, và sự khác biệt đó cho bạn biết cái nào được xây dựng cho một cuộc gọi điện thoại và cái nào được xây dựng cho một căn phòng.
GPT-Live-1 chia công việc theo chiều dọc. Một lớp thoại nhanh giữ hội thoại; bất cứ thứ gì nặng hơn — tìm kiếm web, suy luận sâu hơn, công việc tác tử — được chuyển cho một mô hình suy luận riêng qua Responses API trong khi cuộc trò chuyện vẫn tiếp tục. Ví dụ WebRTC đã công bố của OpenAI kết nối backend đó với GPT-5.6 Terra. Hệ quả là nửa suy nghĩ là một lời gọi mô hình văn bản thông thường, được tính giá theo token, và do đó là thứ bạn có thể chọn, hoán đổi và định tuyến độc lập với lớp thoại. Đối với một đường dây hỗ trợ, đó là hình dạng đúng: giọng nói là giao diện và suy luận là sản phẩm.
SeedRealtime giữ mọi thứ trong một mạng duy nhất, và chính điều đó cho phép nó quan sát một cử chỉ khi câu còn đang nói dở. Đó cũng là điều khiến nó không thể bị phân rã — bạn không thể hoán đổi nửa suy luận, vì không có nửa suy luận nào, và bạn không thể chạy nó ở bất cứ đâu, vì chẳng có nơi nào để chạy nó.
Nếu bạn đang xây dựng một voice agent ngay hôm nay, thì sự khác biệt đó chính là toàn bộ quyết định. Chỉ một trong hai thứ này là thành phần bạn có thể đưa vào một kiến trúc. GPT-5.6 Terra, backend trong ví dụ delegation của OpenAI, được cung cấp qua OrcaRouter với mức 2,00 USD cho mỗi triệu token đầu vào và 12,00 USD cho mỗi triệu token đầu ra, cùng cửa sổ ngữ cảnh 1M token và cả /v1/chat/completions lẫn /v1/responses đều được mở — song song với khoảng 190 mô hình khác trên một key duy nhất, nhờ đó tầng reasoning phía sau một voice agent có thể được tách riêng, định giá và chuyển đổi dự phòng mà không cần chạm vào luồng âm thanh. Cả GPT-Live-1 lẫn SeedRealtime đều không được OrcaRouter cung cấp; chúng chỉ đến từ một nguồn duy nhất là nhà cung cấp của chính mình, và không router nào có thể thay đổi điều đó.

Điều gì sẽ làm thay đổi câu trả lời
Ba điều, theo thứ tự khả năng xảy ra.
• Một API dành cho nhà phát triển của ByteDance. Nếu SeedRealtime xuất hiện trên Volcano Engine hoặc BytePlus với mức giá được công bố, nó không còn là một nghiên cứu điển hình nữa mà trở thành một sản phẩm thực sự khác biệt — song công toàn phần âm thanh-hình ảnh mà không có đối thủ cạnh tranh nào cung cấp dịch vụ hosted ở phương Tây. Đó là tín hiệu cần theo dõi, và nó vẫn chưa xuất hiện.
• Thị giác đang xuất hiện trong một API giọng nói được host. Tài liệu của GPT-Live-1 nói rõ rằng hình ảnh và video không được hỗ trợ, điều này khiến người ta thấy đó không hẳn là một sự sơ suất mà đúng hơn là một ranh giới có chủ đích của bản phát hành đầu tiên. Nếu OpenAI phát hành bề mặt video mà hãng đã trình diễn ở nơi khác trong ChatGPT, khoảng cách năng lực vốn khiến SeedRealtime trở nên thú vị sẽ thu hẹp đáng kể.
• Bất kỳ phép đo độc lập nào về SeedRealtime. Một con số độ trễ từ bên thứ ba hoặc số lượng tham số sẽ cho phép so sánh cả hai dựa trên thứ gì đó khác ngoài tham vọng.
Phán quyết thực tiễn dành cho bất kỳ ai đang xây dựng ngay lúc này thì ngắn gọn. GPT-Live-1 là mẫu duy nhất trong hai mẫu mà bạn có thể triển khai, và với mức 0,05 đô la một phút, tính phí theo từng giây, cùng mười hai giọng nói và một endpoint có tài liệu đầy đủ, nó là lựa chọn mặc định hợp lý cho giọng nói đàm thoại. SeedRealtime là mô hình thú vị hơn và rất có thể cũng là mô hình có năng lực mạnh hơn; nhưng ở thời điểm hiện tại, nó cũng chỉ là một minh họa cho việc một kiến trúc âm thanh-hình ảnh hội tụ trông như thế nào, chứ không phải là một sản phẩm bạn có thể đưa ra trước mặt khách hàng. Hãy xếp nó vào mục những gì cần theo dõi, chứ không phải những gì để xây dựng dựa trên.
