Một thẻ tiêu đề hero ghi 'GPT-Live-1 vs SeedRealtime' với phụ đề 'Mô hình tham vọng hơn mà bạn không thể gọi' và dòng 'Có sẵn rộng rãi trong API so với chỉ trên ứng dụng Doubao', phía trên hai bảng: bên trái hiển thị một ô cửa mở với ký hiệu ngoặc API và huy hiệu 'API', bên phải hiển thị cùng ô cửa đó với một ổ khóa vắt ngang qua và huy hiệu 'NO API', mỗi bên mang một biểu tượng âm thanh và máy ảnh kết hợp dạng sóng với khẩu độ, với logo OrcaRouter được ghép ở góc.
Guides & Insights

GPT-Live-1 vs SeedRealtime: SeedRealtime là mô hình tham vọng hơn, và bạn không thể mua nó

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Việc so sánh GPT-Live-1 và SeedRealtime về năng lực tạo ra một câu trả lời không thoải mái, bởi vì hai mô hình không cạnh tranh trên cùng một tiêu chí. GPT-Live-1 là mô hình giọng nói song công toàn phần của Ope​nAI, được phát hành trong ChatGPT vào ngày 8 tháng 7 năm 2026 và mở cho nhà phát triển thông qua Live Sessions API vào ngày 10 tháng 9 năm 2026, với 12 giọng nói, mức giá theo phút được công bố, và một lỗ hổng đáng kể: đầu vào hình ảnh và video không được hỗ trợ một cách rõ ràng. SeedRealtime, được phát hành bởi nhóm Seed của ByteDance vào ngày 5 tháng 8 năm 2026, được xây dựng hoàn toàn xoay quanh lỗ hổng đó. Đây là một mô hình song công toàn phần âm thanh-hình ảnh gốc, có khả năng quan sát, lắng nghe và nói trong một kiến trúc đầu-cuối duy nhất — và nó chỉ có sẵn bên trong ứng dụng tiêu dùng Doubao, không có API công khai, không có trọng số mở, không có báo cáo kỹ thuật và không công bố số lượng tham số.

Mỗi thứ thực sự có thể cảm nhận được điều gì

Cách rõ ràng nhất để thấy được khoảng cách là hỏi xem mỗi mô hình biết gì về căn phòng mà nó đang ở trong.

GPT-Live-1 biết nghe. Đó là toàn bộ bề mặt đầu vào. Âm thanh và văn bản đi vào, âm thanh và văn bản đi ra, và tài liệu của OpenAI liệt kê hình ảnh và video là không được hỗ trợ. Nó xử lý cực kỳ tốt các cơ chế hội thoại của việc nghe — nó quyết định nhiều lần mỗi giây xem nên tiếp tục nghe, tạm dừng, ngắt lời hay gọi công cụ, và nó duy trì chế độ song công hoàn toàn nên vẫn tiếp tục xử lý âm thanh đến trong lúc đang nói. Nó cũng trả về bản chép lời nhận dạng giọng nói song song với âm thanh, một chi tiết có vẻ tầm thường nhưng lại tiết kiệm cả tuần công việc tích hợp.

SeedRealtime nghe và thấy, trong một mô hình duy nhất thay vì một pipeline. ByteDance mô tả một kiến trúc thống nhất xử lý âm thanh, video và văn bản cùng nhau, giải quyết sự mơ hồ bằng ngữ cảnh thị giác — phân biệt các từ đồng âm, hiểu "cái này" ám chỉ điều gì từ cảnh vật, cử chỉ, ánh nhìn và hành động trước đó — và vận hành nhận thức, thấu hiểu, ra quyết định và biểu đạt song song thay vì tuần tự. Các minh chứng được ByteDance công bố bao gồm một bữa tối nhóm ồn ào nơi mô hình phải gán giọng nói với danh tính, một chuyến thăm bảo tàng, sửa quy trình pha espresso, và khử nhiễu tại sân bay trong khi vẫn ghi nhớ ngoài màn hình và tra cứu trực tuyến.

• Đầu vào — GPT-Live-1 chỉ có âm thanh và văn bản, còn hình ảnh và video thì không được hỗ trợ rõ ràng, so với SeedRealtime khi âm thanh, video và văn bản được hợp nhất trong một mô hình

• Luân phiên lượt nói — GPT-Live-1 tự quyết định bên trong, nhiều lần mỗi giây, so với SeedRealtime chuyển việc luân phiên lượt nói vào bên trong mô hình và loại bỏ hoàn toàn bộ phát hiện hoạt động giọng nói bên ngoài

• Hành vi chủ động — GPT-Live-1 phản hồi, giao việc và gọi công cụ, trong khi SeedRealtime được mô tả là tự lên tiếng mà không cần nhắc khi một đối tượng mục tiêu xuất hiện trong tầm nhìn

• Khả năng sẵn có — GPT-Live-1 được cung cấp rộng rãi trong API của Ope​nAI với giá 0,05 USD một phút, so với SeedRealtime miễn phí bên trong Doubao, không có API và không có mốc thời gian nào cho việc đó

A two-column comparison scoreboard titled 'GPT-Live-1 vs SeedRealtime - the scoreboard'. The GPT-Live-1 column lists Availability GA, published rate; Price $0.05 / minute; Inputs audio and text; Video understanding not supported; Tool calling delegated to backend model; Evidence vendor benchmarks, unreproduced. The SeedRealtime column lists Availability Doubao app only, no API; Price free in app, no developer price; Inputs audio, video and text; Video understanding core capability; Tool calling tool calls woven into responses; Evidence one human-eval claim, no methodology. A footer reads 'SeedRealtime has no published parameter count, no technical report and no independent benchmarks.'

Chất lượng bằng chứng đi theo hướng ngược lại với tham vọng

Đây là lúc sự so sánh không còn tâng bốc ByteDance nữa.

Ope​nAI công bố các con số. Chúng là của chính họ, chúng so sánh GPT-Live-1 với GPT-Realtime-2.1 thay vì so với một đối thủ cạnh tranh, và chưa có phòng thí nghiệm độc lập nào tái lập được chúng — 80,1% về khả năng tương tác song công toàn phần so với 45,4%, độ trễ chuyển lượt giảm từ 1,4 giây xuống 0,8, độ chính xác gọi công cụ từ 60% lên 87%. Việc do nhà cung cấp tự chạy và chưa được tái lập là một hạn chế thực sự, và đó là một hạn chế mà ít nhất bạn có thể gắn với một con số.

ByteDance gần như không công bố gì. Tuyên bố trung tâm về SeedRealtime là một đánh giá đầu-cuối do con người thực hiện, nói rằng nó giảm một nửa các vấn đề về nhịp độ hội thoại nghe-nhìn so với các hệ thống ASR cộng thị giác cộng TTS xếp tầng — ít bị cắt ngang giữa câu hơn, ít phản hồi chậm sau khi tạm dừng hơn, ít kích hoạt nhầm do tiếng nói xung quanh hơn. Không có kích thước mẫu, không có phương pháp luận, không có con số chính xác cho mức cải thiện, và hoàn toàn không có số đo độ trễ. Cũng không có số lượng tham số và không có báo cáo kỹ thuật.

Kết quả là mô hình có kiến trúc thú vị hơn lại chính là mô hình bạn ít có thể đánh giá được nhất. Điều đó không giống với việc nói rằng nó hoạt động kém hơn — các phần trình diễn thực sự gây ấn tượng mạnh, và bài viết kỹ thuật xoay quanh đầu vào nghe nhìn được chia khối cùng việc tạo sinh dạng luồng gợi ý một hệ thống thực sự chứ không phải một bản demo — nhưng điều đó có nghĩa là bất kỳ so sánh nào giữa hai mô hình này về chất lượng hiện tại đều là so sánh giữa một mô hình đã có tài liệu và một video ấn tượng.

Tại sao khoảng cách API không phải là một chi tiết nhỏ

SeedRealtime đã được triển khai đầy đủ trong Doubao kể từ ngày 5 tháng 8 năm 2026, ở cả giọng nói lẫn video, miễn phí. Nó không có endpoint nào của Volcano Engine hay BytePlus, không có gói trả phí, không có hạn mức nào được công bố, và không có mốc thời gian nào được nêu cho việc mở quyền truy cập cho nhà phát triển. Lộ trình của ByteDance có đề cập đến độ trễ thấp hơn, khả năng theo dõi người nói sắc nét hơn và các tác vụ kết nối công cụ; nhưng không đề cập đến ngày cụ thể.

Có một lưu ý về quyền truy cập khiến vấn đề thêm phức tạp. Doubao là sản phẩm ưu tiên thị trường Trung Quốc đại lục và thường yêu cầu số điện thoại di động Trung Quốc đại lục để đăng ký, đồng thời chưa công bố phiên bản tiếng Anh bản địa hóa. Đối với một đội ngũ ngoài Trung Quốc, SeedRealtime không chỉ đơn thuần là chưa ra mắt dưới dạng API — mà còn không thể tiếp cận được như một sản phẩm.

Đặt điều đó bên cạnh gánh nặng tích hợp của chính GPT-Live-1 và sự đánh đổi trở nên cụ thể. API của OpenAI bị thu hẹp theo những cách khiến người ta ngạc nhiên: một model ID, một endpoint tại v1/live/sessions, truyền tải WebRTC với xử lý sự kiện trên một data channel, và không có đường đi qua Chat Completions, Responses, Realtime, Batch hay các endpoint fine-tuning. Giới hạn tốc độ được tính theo số phiên đồng thời — 25 ở Tier 1, tăng lên 50, 200, 300 và 500 — thay vì số yêu cầu mỗi phút, và gói Free hoàn toàn không thể gọi model này. Đó là một tích hợp mới, và nó vẫn là một tích hợp bạn có thể bắt đầu ngay chiều nay.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Hai câu trả lời cho cùng một vấn đề delegation

Cả hai mô hình đều bác bỏ thiết kế xếp tầng cũ, nơi nhận dạng giọng nói, một mô hình ngôn ngữ và tổng hợp giọng nói chạy tuần tự với khoảng 1,7 giây im lặng chết giữa các lượt. Chúng bác bỏ nó theo những cách khác nhau, và sự khác biệt đó cho bạn biết cái nào được xây dựng cho một cuộc gọi điện thoại và cái nào được xây dựng cho một căn phòng.

GPT-Live-1 chia công việc theo chiều dọc. Một lớp thoại nhanh giữ hội thoại; bất cứ thứ gì nặng hơn — tìm kiếm web, suy luận sâu hơn, công việc tác tử — được chuyển cho một mô hình suy luận riêng qua Responses API trong khi cuộc trò chuyện vẫn tiếp tục. Ví dụ WebRTC đã công bố của OpenAI kết nối backend đó với GPT-5.6 Terra. Hệ quả là nửa suy nghĩ là một lời gọi mô hình văn bản thông thường, được tính giá theo token, và do đó là thứ bạn có thể chọn, hoán đổi và định tuyến độc lập với lớp thoại. Đối với một đường dây hỗ trợ, đó là hình dạng đúng: giọng nói là giao diện và suy luận là sản phẩm.

SeedRealtime giữ mọi thứ trong một mạng duy nhất, và chính điều đó cho phép nó quan sát một cử chỉ khi câu còn đang nói dở. Đó cũng là điều khiến nó không thể bị phân rã — bạn không thể hoán đổi nửa suy luận, vì không có nửa suy luận nào, và bạn không thể chạy nó ở bất cứ đâu, vì chẳng có nơi nào để chạy nó.

Nếu bạn đang xây dựng một voice agent ngay hôm nay, thì sự khác biệt đó chính là toàn bộ quyết định. Chỉ một trong hai thứ này là thành phần bạn có thể đưa vào một kiến trúc. GPT-5.6 Terra, backend trong ví dụ delegation của OpenAI, được cung cấp qua OrcaRouter với mức 2,00 USD cho mỗi triệu token đầu vào và 12,00 USD cho mỗi triệu token đầu ra, cùng cửa sổ ngữ cảnh 1M token và cả /v1/chat/completions lẫn /v1/responses đều được mở — song song với khoảng 190 mô hình khác trên một key duy nhất, nhờ đó tầng reasoning phía sau một voice agent có thể được tách riêng, định giá và chuyển đổi dự phòng mà không cần chạm vào luồng âm thanh. Cả GPT-Live-1 lẫn SeedRealtime đều không được OrcaRouter cung cấp; chúng chỉ đến từ một nguồn duy nhất là nhà cung cấp của chính mình, và không router nào có thể thay đổi điều đó.

A screenshot of ByteDance Seed's official SeedRealtime product page in its English locale, showing the date August 5, 2026, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM', the description that it can jointly understand audio, visual and temporal information to deliver a watch, listen and speak experience, and an EN language toggle active in the header.

Điều gì sẽ làm thay đổi câu trả lời

Ba điều, theo thứ tự khả năng xảy ra.

• Một API dành cho nhà phát triển của ByteDance. Nếu SeedRealtime xuất hiện trên Volcano Engine hoặc BytePlus với mức giá được công bố, nó không còn là một nghiên cứu điển hình nữa mà trở thành một sản phẩm thực sự khác biệt — song công toàn phần âm thanh-hình ảnh mà không có đối thủ cạnh tranh nào cung cấp dịch vụ hosted ở phương Tây. Đó là tín hiệu cần theo dõi, và nó vẫn chưa xuất hiện.

• Thị giác đang xuất hiện trong một API giọng nói được host. Tài liệu của GPT-Live-1 nói rõ rằng hình ảnh và video không được hỗ trợ, điều này khiến người ta thấy đó không hẳn là một sự sơ suất mà đúng hơn là một ranh giới có chủ đích của bản phát hành đầu tiên. Nếu OpenAI phát hành bề mặt video mà hãng đã trình diễn ở nơi khác trong ChatGPT, khoảng cách năng lực vốn khiến SeedRealtime trở nên thú vị sẽ thu hẹp đáng kể.

• Bất kỳ phép đo độc lập nào về SeedRealtime. Một con số độ trễ từ bên thứ ba hoặc số lượng tham số sẽ cho phép so sánh cả hai dựa trên thứ gì đó khác ngoài tham vọng.

Phán quyết thực tiễn dành cho bất kỳ ai đang xây dựng ngay lúc này thì ngắn gọn. GPT-Live-1 là mẫu duy nhất trong hai mẫu mà bạn có thể triển khai, và với mức 0,05 đô la một phút, tính phí theo từng giây, cùng mười hai giọng nói và một endpoint có tài liệu đầy đủ, nó là lựa chọn mặc định hợp lý cho giọng nói đàm thoại. SeedRealtime là mô hình thú vị hơn và rất có thể cũng là mô hình có năng lực mạnh hơn; nhưng ở thời điểm hiện tại, nó cũng chỉ là một minh họa cho việc một kiến trúc âm thanh-hình ảnh hội tụ trông như thế nào, chứ không phải là một sản phẩm bạn có thể đưa ra trước mặt khách hàng. Hãy xếp nó vào mục những gì cần theo dõi, chứ không phải những gì để xây dựng dựa trên.