Thẻ hero được tạo cho 'Gemini 3.8 TTS vs Sesame Preview' trên nền trắng với các điểm nhấn chuyển sắc xanh dương – xanh lam dịu nhẹ. Thẻ bên trái 'Gemini 3.8 Flash TTS' liệt kê Elo 1.260 ở hạng 2, 8 giọng arena, một endpoint API và 16,50 USD cho mỗi 1 triệu ký tự đã chuẩn hoá; thẻ bên phải 'Sesame' chia thành 'Ứng dụng Preview — miễn phí, chỉ tiếng Anh, không có API, không có model ID' và 'Checkpoint CSM-1B — Apache 2.0, 2 tỷ tham số, nền tảng Llama'. Dòng chân trang ghi 'Elo theo Artificial Analysis Provider Voice Arena, tháng 9 năm 2026; chi tiết CSM-1B theo model card của nó.' Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

Gemini 3.8 TTS vs Sesame Preview: Một trong hai là bản tải xuống, cái còn lại là một ứng dụng

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Tìm kiếm so sánh giữa Gemini 3.8 Flash TTSSesame Preview và bạn sẽ thấy vô số bài viết coi chúng như hai sản phẩm cùng một loại. Chúng không phải vậy, và sự khác biệt này không phải là chuyện kỹ thuật vặt. Gemini 3.8 Flash TTS là một endpoint API: nó có mã định danh mô hình, bảng giá được công bố, một dòng trên bảng xếp hạng ở vị trí thứ 2 với Elo 1,260 trên 1,999 mẫu trên Artificial Analysis Provider Voice Arena, và định dạng yêu cầu được ghi lại thành tài liệu. Sesame Preview là một ứng dụng trợ lý giọng nói miễn phí dành cho người tiêu dùng với các tác nhân có tên, hội thoại nhiều lượt và giới hạn cuộc gọi 30 phút. Nó không có API, không có mã mô hình, không có gói thanh toán và không có điểm số trên bảng xếp hạng đó.

Thứ Sesame mà bạn thực sự có thể xây dựng dựa trên lại là một thứ khác nữa: CSM-1B, một checkpoint Apache 2.0 trên Hugging Face tạo mã âm thanh từ văn bản bằng cách dùng bộ khung Llama và bộ giải mã âm thanh Mimi. Đó không phải là giọng mà mọi người đang nói đến khi họ mô tả ứng dụng nghe giống người đến mức nào. Vậy nên phép so sánh quy về một câu hỏi có thể trả lời được: bạn muốn thuê một mô hình giọng nói, hay bạn muốn tải một mô hình về?

A generated comparison scoreboard for Gemini 3.8 Flash TTS and Sesame, showing what each one is (a hosted API against a consumer app), model ID (gemini-3.8-flash-tts against none), Elo (1,260 at rank 2 against not ranked), price ($16.50 per 1M characters against free with no meter), licence (vendor terms against not applicable to the app) and two-speaker support (yes against agents rather than a script).

Hai thứ được gọi là Sesame, và chỉ một trong số chúng có thể build được.

Cách đặt tên là nguồn gốc của phần lớn sự nhầm lẫn, nên hãy tách nó ra trước khi đi tiếp.

• Sesame Preview — ứng dụng. Miễn phí sử dụng, các agent tên là Maya, Miles, Simone và Charlie, hội thoại nhiều lượt với ngữ cảnh được duy trì xuyên suốt các lượt, tìm kiếm web và nhắc nhở như những năng lực, chỉ hỗ trợ tiếng Anh, giới hạn 30 phút cho một cuộc gọi. Không có bề mặt nào dành cho nhà phát triển: không có gì để xác thực, không có gì để đo đếm, không có endpoint nào để gọi.

• CSM-1B — checkpoint. Được công bố trên Hugging Face dưới tên sesame/csm-1b với giấy phép Apache 2.0, backbone Llama và một bộ giải mã nhỏ hơn tạo ra mã âm thanh Mimi. Khoảng 2 tỷ tham số, tiếng Anh, trọng số F32, và nó chạy qua Hugging Face Transformers. Thẻ mô hình ghi nhận biến thể 1B ra mắt vào tháng 3 năm 2025 và hỗ trợ Transformers gốc xuất hiện vào tháng 5 năm 2025.

Hai thứ đó cùng thuộc một công ty và có chung một dòng dõi nghiên cứu, và mối liên hệ gần như chỉ dừng ở đó. Ứng dụng là một sản phẩm; còn checkpoint chỉ là một tạo tác từ quá trình nghiên cứu diễn ra trước đó. Những người đánh giá ca ngợi khả năng ghi nhớ hội thoại của ứng dụng đang mô tả một hệ thống có truy xuất và quản lý trạng thái bao quanh một mô hình giọng nói, chứ không phải một thuộc tính của checkpoint 2B mà bạn có thể tải về.

Thực sự có gì trong checkpoint

CSM-1B là một mô hình chuyển văn bản thành giọng nói theo nghĩa kiến trúc quan trọng đối với bất kỳ ai dự định chạy nó: nó nhận văn bản và ngữ cảnh âm thanh làm đầu vào và phát ra các mã âm thanh RVQ, mà bộ giải mã biến đổi thành dạng sóng. Những thông tin thực tế từ thẻ mô hình:

• Giấy phép — Apache 2.0. Đây là dòng quan trọng nhất trên trang. Không giống như các giấy phép trọng số chỉ dành cho nghiên cứu, Apache 2.0 cho phép sử dụng thương mại mà không cần thỏa thuận riêng, điều này khiến CSM-1B trở thành một trong số ít các checkpoint giọng nói mở thực sự có thể sử dụng được.

• Kích thước — khoảng 2B tham số ở F32. Đủ lớn để cần phần cứng thực sự cho bất kỳ tác vụ đồng thời nào, đủ nhỏ để chạy trên một bộ tăng tốc duy nhất cho việc phát triển.

• Ngôn ngữ — Tiếng Anh, theo thẻ. Không phải mô hình đa ngôn ngữ.

• Độ phổ biến — 141.461 lượt tải xuống trong tháng trước, tính đến thời điểm viết bài, cùng khoảng 245.000 lượt thích trên kho lưu trữ. Đó là một checkpoint được sử dụng rộng rãi theo tiêu chuẩn của các mô hình giọng nói mở, và đây chính là lập luận mạnh mẽ nhất cho thấy sản phẩm này có một cơ sở người dùng thực sự, độc lập với sự đưa tin của truyền thông về ứng dụng.

A screenshot of the Hugging Face model card for sesame/csm-1b, showing the Apache 2.0 licence, the roughly 2 billion parameter F32 weights, the Llama backbone and Mimi audio decoder description, and the repository's download and like counts.

Điều mà thẻ này không mang lại cho bạn là một tuyên bố về chất lượng mà bạn có thể so sánh với bất cứ thứ gì. Không có dòng nào trên bảng xếp hạng arena, không có benchmark nào của nhà cung cấp được bên thứ ba tái lập, và cũng không có đánh giá nào được công bố về mối liên hệ giữa đầu ra của checkpoint và đầu ra của ứng dụng. Bất kỳ ai nói với bạn rằng mô hình có thể tải xuống nghe giống như ứng dụng đều đang suy ra điều đó từ cái tên.

Tại sao không có so sánh đối đầu trực tiếp, và tại sao đó không phải là một khoảng trống nghiên cứu

Không có so sánh Gemini 3.8 TTS với Sesame Preview trên các bảng xếp hạng vì không thể có một so sánh như vậy. Đấu trường xếp hạng các mô hình bằng cách để người nghe so sánh các clip được tạo ra bởi một endpoint được host. Một bên trong cặp đối chiếu này không có endpoint, nên không thể được đưa vào.

Điều đó đáng để nói cho thật chính xác, bởi vì “không tồn tại so sánh đối đầu trực tiếp” thường được viết như thể dữ liệu đang bị thiếu. Nó không hề thiếu. Nó là không xác định. Hai thứ đang được so sánh không có chung một bề mặt đo lường được:

• Gemini 3.8 Flash TTS được chấm điểm dựa trên các giọng nói gốc được host của nó. Sesame Preview không có giọng nói gốc nào để chấm điểm theo nghĩa đó — nó có các agent.

• Gemini 3.8 Flash TTS công bố bảng giá bằng token. Sesame Preview miễn phí và không công bố gì, vì không có gì để tính phí.

• Gemini 3.8 Flash TTS nhận một kịch bản và trả về âm thanh. Sesame Preview nhận một cuộc hội thoại và trả về một cuộc hội thoại, cùng với bất kỳ lớp truy xuất và ghi nhớ nào mà ứng dụng chồng thêm lên trên.

Điều gần nhất với một so sánh hợp lý là giữa Gemini 3.8 Flash TTS và CSM-1B, và ngay cả điều đó cũng khập khiễng: một bên có Elo độc lập và bảng giá của nhà cung cấp, bên kia không có cả hai. Điều bạn có thể so sánh là dạng thức của cam kết — một API tính phí theo mức sử dụng so với một checkpoint có thể tải xuống — và so sánh đó không cần đến bảng xếp hạng.

Mặt duy nhất của thứ này có ghi số

Mọi yếu tố định lượng trong sự kết hợp này đều nằm về phía Google, và bản thân điều đó chính là điểm mấu chốt.

Trên Artificial Analysis Provider Voice Arena, ghi nhận ngày 24 tháng 9 năm 2026, Gemini 3.8 Flash TTS đứng ở vị trí thứ 2 với Elo 1.260 qua 1.999 mẫu và 8 giọng arena, phát hành ngày 23 tháng 9 năm 2026. Mẫu anh em của nó, Gemini 3.8 Flash-Lite TTS, đứng ở vị trí thứ 6 với 1.235. Google tính phí Flash TTS ở mức 0,50 USD mỗi triệu token văn bản đầu vào và 9,00 USD mỗi triệu token âm thanh đầu ra đến ngày 31 tháng 12 năm 2026, sau đó là 18,00 USD, còn Flash-Lite TTS ở mức 0,50 USD và 6,00 USD, sau đó là 12,00 USD; Artificial Analysis chuẩn hóa những mức đó thành 16,50 USD và 11,00 USD mỗi triệu ký tự để chúng có thể dùng chung một bảng với các mô hình tính phí theo đơn vị khác. Việc chuẩn hóa đó là phép tính của bảng xếp hạng, không phải báo giá của Google.

Đối lại, CSM-1B không có giá vì nó không có đồng hồ đo. Nó có số lượt tải, giấy phép và số lượng tham số. Nếu khung quyết định của bạn cần một chỉ số Elo, thì so sánh này sẽ không cung cấp một chỉ số như vậy cho phía Sesame, và kết luận trung thực là hai lựa chọn đang được đánh giá dựa trên các tiêu chí khác nhau, chứ không phải một trong hai là chưa được chứng minh.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, released September 23, 2026, with Gemini 3.8 Flash-Lite TTS at rank 6 and no Sesame row anywhere on the board.

Nếu điều bạn muốn là trải nghiệm ứng dụng

Nhiều người tìm kiếm so sánh này hoàn toàn không phải để chọn một mô hình. Họ đã dùng ứng dụng Sesame, thích cảm giác của cuộc trò chuyện đó, và muốn có điều đó trong sản phẩm của mình. Đó là một vấn đề khác, và bản tải xuống sẽ không giải quyết được nó.

Điều khiến ứng dụng mang lại cảm giác như hiện tại phần lớn không phải là mô hình giọng nói. Ngữ cảnh bền vững xuyên suốt các lượt, quyết định tìm kiếm web ngay giữa cuộc trò chuyện, thời điểm một tác nhân lên tiếng — đó là sự điều phối, và không cái nào trong số đó nằm trong một checkpoint 2B. Tải CSM-1B xuống sẽ cho bạn một giọng nói. Việc xây dựng hành vi của ứng dụng dựa trên nó là phần kỹ thuật của bạn, và giới hạn cuộc gọi 30 phút cùng việc thiếu API nghĩa là bạn cũng không thể thuê phiên bản hoàn chỉnh.

Nếu điều bạn muốn là một mô hình giọng nói mà bạn có thể gọi, thì câu trả lời trung thực là Gemini 3.8 Flash TTS chính là lựa chọn có giao diện được ghi nhận, mức giá được công bố, điểm đánh giá độc lập và khả năng hội thoại hai người nói trong một yêu cầu duy nhất. Nếu điều bạn muốn là trọng số mà bạn có thể giữ, thì CSM-1B theo Apache 2.0 là một trong hai thứ mà bạn thực sự có thể nắm giữ — và cái giá phải đánh đổi là bạn phải tự cung cấp phần cứng, ngăn xếp phục vụ và mọi bảo đảm về chất lượng.

OrcaRouter không lưu trữ cả hai thứ này. Mô hình của Google được gọi thông qua API của chính Google và các bề mặt được nêu trong thông báo ngày 23 tháng 9 của họ; CSM-1B là một checkpoint do bạn tự chạy. Điều OrcaRouter hướng tới là lớp nằm trên lựa chọn đó: hơn 200 mô hình phía sau một khóa duy nhất với giá niêm yết của nhà cung cấp, không đội giá, nên khi nhà cung cấp thay đổi mức giá thì có hiệu lực ngay trong cùng ngày, chuyển đổi dự phòng tự động để một tuyến thử nghiệm không trở thành phụ thuộc của môi trường sản xuất, cùng một DSL định tuyến giúp kết hợp các mô hình vào một lời gọi duy nhất khi một giọng đơn lẻ không đảm nhận toàn bộ công việc.

Bản tóm tắt ngắn gọn của so sánh này là nó thực ra không phải là một so sánh. Một bên có bảng giá và Elo; bên kia có giấy phép và số lượt tải xuống. Hãy chọn bên mà bạn thực sự có thể điền vào cột.