
Muse Voice Transcribe: Mô hình chuyển giọng nói thành văn bản dạng luồng của Meta, được giải thích
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 1009 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- OrcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1189 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 22 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Muse Voice Transcribe là mô hình chuyển giọng nói thành văn bản dạng streaming của Meta. Nó chạy trên Meta Model API với $0.18 mỗi giờ âm thanh, theo model id muse-voice-transcribe-1.0, và giá giữ nguyên như nhau dù bạn stream âm thanh trực tiếp hay đưa vào một bản ghi đã hoàn tất. Điều khiến nó xứng đáng có một trang tham chiếu thay vì chỉ một dòng kiểm tra giá là ở chỗ công việc diễn ra tại đâu: việc gán người nói cho hơn hai mươi giọng và phát hiện kết thúc lời nói đều chạy bên trong mô hình nhận dạng, chứ không phải trong một lượt xử lý theo lô được gắn thêm vào cuối luồng. Đây chỉ là chuyển giọng nói thành văn bản — tài liệu dành cho nhà phát triển của Meta nói đúng y như vậy: nó không tổng hợp giọng nói và không cung cấp API hội thoại giọng nói sang giọng nói.
Đây là trang mà người đọc sẽ đến sau khi tìm kiếm chính tên của mô hình, nên nó được xây dựng để trở thành câu trả lời ổn định cho hai câu hỏi — mô hình này là gì, và một giờ âm thanh tốn bao nhiêu — chứ không phải một thông báo. Có một mốc thời gian cần được ghi nhận trước mọi thứ khác, vì đó là một dữ kiện về mô hình chứ không phải lý do trang này tồn tại: Meta Superintelligence Labs đã giới thiệu Muse Voice Transcribe vào ngày 2026-09-01, trong bài đăng thông báo có ghi ngày Introducing Muse Voice Transcribe — bài đăng mà người đọc vẫn có thể tiếp cận qua mục lục blog của Meta, dù nó không còn phản hồi tại URL riêng của mình nữa. Toàn bộ nội dung bên dưới được đọc trên chính các trang của Meta vào ngày 2026-09-29, chủ yếu là trang mô hình cùng tài liệu speech-to-text và tài liệu tổng quan của API. Ở những chỗ Meta không công bố con số nào, trang này nói rõ điều đó thay vì viện đến một con số thay thế.
Nó là gì, theo thuật ngữ của Meta
Tài liệu của chính Meta mở đầu phần mô tả một cách thẳng thắn: “Muse Voice Transcribe là mô hình chuyển giọng nói thành văn bản của Meta trên Meta Model API. Phiên âm âm thanh trực tiếp hoặc bản ghi có sẵn, với phát hiện lượt nói, nhãn người nói và thiên lệch từ vựng.” Trang tổng quan cô đọng điều tương tự thành một câu — phân tách người nói theo luồng, phát hiện điểm kết thúc và phát hiện hoạt động giọng nói gốc, thiên lệch theo ngữ cảnh và từ khóa, cùng 25 ngôn ngữ đã được đánh giá với chuyển mã. Vì vậy, đầu ra là một luồng bản ghi duy nhất mang ba nhãn cùng lúc: các từ, ai đang nói và liệu phát ngôn đã kết thúc hay chưa. Đó là sự kết hợp mà hầu hết các ngăn xếp production hiện nay phải lắp ghép từ một bộ nhận dạng, cộng với một bộ phát hiện hoạt động giọng nói riêng và một mô hình phân tách người nói riêng, mỗi thứ có ngân sách độ trễ riêng.
Trang mô hình của Meta giới thiệu điều này là "độ trễ cạnh tranh và độ chính xác phiên âm dạng luồng với khả năng gán nhãn trực tiếp cho hơn 20 người nói", và tài liệu dành cho nhà phát triển mô tả trường đầu ra là "Văn bản phiên âm với mốc thời gian theo lượt nói và nhãn người nói tùy chọn". Có hai điều rút ra từ đó, và cả hai đều quan trọng hơn cách giới thiệu:
• Đây là mô hình đầu vào âm thanh, đầu ra văn bản. Nó không phải là mô hình đầu vào văn bản cũng không phải đầu ra văn bản, và Meta nói rõ rằng nó không phải là một trình tạo giọng nói.
• Trước hết, đây là một mô hình streaming. Đường realtime không phải là một lớp bọc quanh đường file; nó là một phiên WebSocket với các sự kiện, chế độ và giới hạn riêng, được mô tả bên dưới.
Chi phí cho một giờ âm thanh là bao nhiêu
Trang mô hình của Meta cho Muse Voice Transcribe ghi giá là "Xây dựng với một mô hình duy nhất ở mức $0.18/giờ", và bảng thông số kỹ thuật của nó liệt kê muse-voice-transcribe-1.0 ở mức $0.18 mỗi giờ âm thanh và $3.00 mỗi 1,000 phút. Đó là hai cách thể hiện đơn vị của cùng một mức giá, và cả hai đều được in trên trang của chính Meta như đọc ngày 2026-09-29. Tài liệu dành cho nhà phát triển nêu cùng mức giá theo cách thứ ba: "Giá là $0.18 mỗi giờ âm thanh được xử lý." Không có số liệu nào trên trang này được lấy từ trang định giá của Meta, vì không có trang định giá Meta nào có thể đọc được: tài liệu liên kết mức giá ra một trang "Định giá và giới hạn tốc độ" trả lời Trang này không khả dụng như đọc ngày 2026-09-29, nên trang mô hình là nguồn ghi nhận cho mức giá, và đó là nguồn duy nhất được dùng ở đây.
Chi tiết về việc tính phí nằm trong tài liệu dành cho nhà phát triển và rất đáng để biết trước khi bạn định cỡ một khối lượng công việc:
• Streaming và không streaming có cùng chi phí. Không có phụ phí nào cho endpoint thời gian thực.
• Xử lý không lưu trữ dữ liệu có mức giá ngang bằng với gói Standard, theo tài liệu — đây không phải là một mục phụ phí.
• Việc tính phí được làm tròn xuống đến giây nguyên, vì vậy một lượt hai giây sẽ được tính là hai giây chứ không phải ba giây.
• Các lỗi xảy ra trước khi bản ghi được tạo ra sẽ không bị tính phí, và cũng không tính phí 429 phản hồi giới hạn tốc độ.
• Tín dụng miễn phí tồn tại ở cấp nền tảng, không phải ở cấp mô hình. Tài liệu chuyển giọng nói thành văn bản của Meta kết thúc đoạn giá bằng câu "Tín dụng của gói miễn phí nền tảng được áp dụng." Đó là cách diễn đạt miễn phí duy nhất trên các trang dành cho mô hình này, và nó cố ý không cụ thể: nó chỉ tới một cơ chế tín dụng ở cấp nền tảng thay vì hứa hẹn một hạn mức miễn phí cho việc chuyển giọng nói thành văn bản, và không có con số, thời hạn hay quy tắc đủ điều kiện nào được in cho nó. Hãy hiểu nó như một khoản tín dụng có thể làm giảm hóa đơn, chứ không phải một gói miễn phí cho mô hình. Tuyên bố hướng đến người tiêu dùng của Meta rằng trợ lý cá nhân của hãng "miễn phí cho hầu hết những gì mọi người cần" là một câu riêng về ứng dụng Muse và không mở rộng đến Model API.
Ví dụ cụ thể, vì mức theo giờ rất khó cảm nhận: một cuộc phỏng vấn ghi âm dài hai giờ tốn 0,36 đô la cho việc chuyển thành văn bản. Một nghìn giờ âm thanh cuộc gọi — xấp xỉ khối lượng hàng tháng của một trung tâm liên hệ cỡ vừa — là 180 đô la. Ở quy mô đó, mức giá chính là toàn bộ lập luận, và mức giá cũng là thứ duy nhất có thể thay đổi ngay dưới chân bạn: trang của Meta là nguồn có thẩm quyền về vấn đề này, và nếu con số thay đổi ở đó, nó sẽ thay đổi ở đây.
Giao diện truyền phát, từng điểm cuối một
This is the part a reference page owes a reader that a launch write-up cannot carry, so here it is in the order you meet it. Base URL for Model API is https://api.meta.ai/v1 with a Bearer token, and Muse Voice Transcribe adds two endpoints on top of it.
• Âm thanh trực tiếp — wss://api.meta.ai/v1/asr/realtime. Truyền tải là WebSocket, và chi tiết xác thực là một cái bẫy: bạn xác thực trong khung handshake, và Authorization header bị bỏ qua. Khung handshake phải là khung văn bản JSON đầu tiên và phải đến trong vòng 10 giây. Một phiên kéo dài tối đa 60 phút, một WebSocket mới sẽ tạo một phiên mới, và không có token khôi phục.
• Bản ghi âm — POST https://api.meta.ai/v1/asr/transcribe. Tải lên dạng multipart, và cái này có xác thực bằng Authorization header. Đầu vào khá hẹp: chỉ WAV PCM 16-bit mono ở 16 hoặc 24 kHz. Giới hạn là 32 MB mỗi body và 10 phút âm thanh mỗi yêu cầu.
Trong phiên thời gian thực, ba chế độ sẽ thay đổi những gì bạn nhận được. PUSH_TO_TALK là chế độ mặc định và thực hiện phiên âm một lượt. ENDPOINTING cung cấp ranh giới lượt do mô hình phát hiện, một lượt cho mỗi đoạn giọng nói được phát hiện, phát ra các sự kiện speechStart, lặp lại transcript, speechEnd và speechComplete — kèm cảnh báo rằng speechEnd không phải là bản phiên âm. DIARIZATION bổ sung tính năng tự động phát hiện và gán người nói, phát ra các sự kiện speaker với nhãn như A và B. Bản phiên âm từng phần có thể là tích lũy, trong đó mỗi phần thay thế phần trước đó, hoặc ở dạng delta.
Hai chi tiết vận hành từ cùng một tài liệu rất dễ bị bỏ sót và tốn kém khi phát hiện trong môi trường production:
• Diarization đánh dấu một người nói mới tiềm năng thay vì một điểm kết thúc đoạn nói sạch, và Meta tuyên bố nó không được tinh chỉnh cho việc sử dụng lệnh thoại có độ trễ thấp. Hãy coi các nhãn là mã định danh theo phạm vi phiên — A trong một phiên không phải là cùng một người như A trong phiên kế tiếp.
• Các lượt có thể chồng lấn, vì vậy trạng thái theo từng lượt nên được khóa theo mã định danh của lượt thay vì theo thứ tự đến.
• Các giới hạn được công bố cho mỗi tenant là 128 luồng đồng thời và 16.000 luồng mỗi giờ.
Điều gì vận hành bên trong mô hình, và điều nó thay thế
Trang mô hình của Meta đưa ra một tuyên bố cụ thể về kiến trúc chứ không phải về điểm số: "Việc gán người nói cho hơn 20 người nói và phát hiện kết thúc phát biểu diễn ra bên trong mô hình nhận dạng" — và nó đối chiếu rõ ràng điều đó với một lượt xử lý theo lô ở cuối luồng âm thanh. Khác biệt thực tế nằm ở chỗ không có giai đoạn thứ hai nào phải chờ đợi. Nhãn người nói và ranh giới lượt đến trên cùng một luồng với các từ, nên một tác nhân thoại phía sau hoặc một giao diện phụ đề trực tiếp sẽ nhận được một lượt hoàn chỉnh cùng một danh tính mà không cần bước xử lý hậu kỳ.
Những khả năng khác mà Meta ghi nhận là nằm trong mô hình:
• Khả năng endpointing và phát hiện hoạt động giọng nói gốc, nên bạn không phải chạy VAD của riêng mình phía trước API. Theo cách diễn đạt trong tài liệu, bạn nhận được một bản chép lời hoàn chỉnh cho mỗi phát ngôn mà không cần chạy phát hiện hoạt động giọng nói của riêng mình, và việc phát hiện kết thúc lời nói không kết thúc phiên.
• Thiên lệch theo ngữ cảnh và từ khóa, không cần tinh chỉnh. Trang mô hình của Meta mô tả độ chính xác được duy trì "thông qua thiên lệch theo ngữ cảnh và từ khóa, không cần tinh chỉnh" — đây chính là tính năng giúp ASR truyền trực tiếp trở nên hữu dụng với từ vựng chuyên ngành — tên thuốc, mã cổ phiếu, mã SKU sản phẩm — thay vì chỉ ở mức trung bình của ngôn ngữ phổ thông. Tài liệu nêu rõ các giới hạn: từ khóa định hướng nhận dạng nhưng không đảm bảo cách viết chính xác, và cả từ khóa lẫn thiên lệch ngôn ngữ đều được cố định ngay khi bắt đầu phiên.
• 25 ngôn ngữ được đánh giá có hỗ trợ chuyển mã. Tài liệu liệt kê chúng: tiếng Ả Rập, tiếng Bengal, tiếng Hà Lan, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Do Thái, tiếng Hindi, tiếng Indonesia, tiếng Ý, tiếng Nhật, tiếng Kannada, tiếng Hàn, tiếng Mã Lai, tiếng Trung Quan Thoại, tiếng Marathi, tiếng Ba Lan, tiếng Bồ Đào Nha, tiếng Tây Ban Nha, tiếng Tagalog, tiếng Tamil, tiếng Telugu, tiếng Thái, tiếng Thổ Nhĩ Kỳ và tiếng Việt. Chuyển mã — giữa câu và giữa phát ngôn mà không được cho biết ngôn ngữ nào sắp xuất hiện — là năng lực mà các bộ nhận dạng đơn ngôn ngữ về mặt cấu trúc không thể cung cấp. Một lưu ý đáng ghi nhớ: thiên lệch ngôn ngữ là một danh sách ngôn ngữ, không phải ngữ cảnh tự do, và nó không buộc mô hình phải sử dụng chúng.
Bài đăng thông báo có ghi ngày còn đi xa hơn: nó nói rằng mô hình được huấn luyện trên hơn 70 ngôn ngữ, trong đó 25 ngôn ngữ được "xác minh kỹ lưỡng" — do nhà cung cấp báo cáo, và danh sách 25 ngôn ngữ đã xác minh chính là tập hợp con mà Meta đứng ra bảo đảm. Đó mới là phạm vi bao phủ để lập kế hoạch dựa vào, chứ không phải con số 70.
Các giới hạn được ghi trong tài liệu
Một trang tham chiếu chỉ tốt bằng những ràng buộc mà nó in ra, và Meta in ra khá nhiều.
• Mốc thời gian ở cấp lượt nói, không phải cấp từ. Cả trang mô hình lẫn tài liệu đều nói rõ điều đó: "Nó trả về mốc thời gian ở cấp lượt nói, nhưng không trả về mốc thời gian ở cấp từ." Mỗi lượt nói mang thời điểm bắt đầu và kết thúc tính bằng mili giây. Nếu sản phẩm của bạn cần tính năng nhấp để tua theo từng từ — làm nổi bật kiểu karaoke, định tuyến theo độ tin cậy của từng từ, căn chỉnh cưỡng bức — thì đây là mô hình sai và không lượng kỹ thuật gợi ý nào có thể thay đổi được điều đó.
• Không có điểm tin cậy, không phát hiện sự kiện âm thanh, không phát hiện cảm xúc, không định dạng lại bản ghi chép. Meta liệt kê cả bốn là không khả dụng. Bạn nhận được từ ngữ, lượt lời, thời gian và nhãn người nói, và không có gì về mức độ chắc chắn của mô hình.
• Không có tổng hợp giọng nói và không có API hội thoại giọng nói sang giọng nói. Nó chỉ có một chiều.
• Các định dạng âm thanh bị giới hạn hẹp trên đường dẫn tệp.WAV PCM 16-bit mono, 16 hoặc 24 kHz. Bất cứ thứ gì khác đều phải được chuyển đổi trước khi tải lên.
Trọng số mở, và sự nhầm lẫn về Muse Glimmer
Muse Voice Transcribe là độc quyền và được cung cấp qua API — đây không phải là bản phát hành trọng số mở, và tài liệu của Meta không bao giờ khẳng định điều ngược lại. Điều này quan trọng vì độc giả định tuyến đường trọng số mở của dòng Muse vào sai tên. Muse Glimmer chính là đường đó: tài liệu của Meta mô tả nó là một mô hình đa phương thức trọng số mở được chưng cất từ Muse Spark, phân phối theo giấy phép Apache 2.0 thoáng, mà bạn tải về và chạy trên phần cứng của riêng mình thông qua một runtime như vLLM, SGLang, llama.cpp hoặc ExecuTorch. Muse Voice Transcribe được xếp cùng nhóm trên cùng trang với Muse Spark, Muse Image và SAM như những mô hình bạn gọi thay vì tải về.
Vậy là: không có trọng số cho Muse Voice Transcribe, không có tùy chọn tự lưu trữ, không có cách nào để kiểm toán hay tinh chỉnh nó. Nếu một trang nào đó nói khác đi, thì trang đó đã nhầm lẫn nó với Muse Glimmer. Khi trọng số của một mô hình không được công bố, nền tảng phục vụ chính là toàn bộ câu chuyện — và đó là nội dung của phần tiếp theo.
Cách một client truy cập nó
Model API của Meta được xây dựng để có thể thả thẳng vào những client bạn đã có. Tuyên bố của nhà cung cấp, được in trên trang tổng quan của API, là Model API "tương thích kiểu drop-in với các thư viện client tương thích OpenAI và tương thích Anthropic, và với các CLI agent tương thích OpenAI. Đặt base URL cho client của bạn, thêm khóa của bạn, và giữ nguyên phần còn lại của mã." Nói chung, đối với Model API, có ba dạng yêu cầu được cung cấp — Responses API, Chat Completions API và Messages API — nên một tích hợp hiện có thường có một bề mặt khớp mà không cần viết lại. Một lưu ý về phạm vi: câu về khả năng tương thích đó và ba dạng đó là các năng lực của toàn bộ Model API, không phải những dòng được in trên trang model riêng của Muse Voice Transcribe. Phần quickstart của chính trang model thì hẹp hơn — nó chỉ nói rằng bạn "trỏ client tương thích OpenAI hiện có của bạn tới Meta Model API", và rằng bạn sẽ có request chạy được đầu tiên trong dưới năm phút.
Một lỗ hổng trung thực đáng để nêu ra trên một trang tham chiếu: tài liệu của Meta cho model này không nêu tên bất kỳ thư viện client chính thức nào cho Muse Voice Transcribe, và trang "Client libraries" của nó nằm trong mục SAM chứ không phải mục Voice. Thay vào đó, hướng dẫn speech-to-text mang đến cho bạn một danh sách phụ thuộc cụ thể — Python 3.9 trở lên cùng với websockets và sounddevice — các gói phụ thuộc — cộng thêm một cookbook về kiến thức nền tảng của voice-API. Vậy nên tuyên bố "drop-in" mô tả bề mặt yêu cầu của Model API nói chung; còn bản thân endpoint ASR thời gian thực là một WebSocket với các quy tắc handshake riêng và không có wrapper nào được tài liệu hóa.

Những gì Meta đã công bố
Việc thiếu một chuẩn đối sánh là một dữ kiện về tài liệu, nên ở đây nó được nêu đúng như vậy. Trang mô hình Muse Voice Transcribe của Meta không có bảng độ chính xác nào được in ra: bằng chứng về độ chính xác của mô hình được cung cấp dưới dạng ba tệp hình ảnh — một bảng xếp hạng tỷ lệ lỗi từ theo luồng, một so sánh tỷ lệ lỗi phân tách người nói và một chỉ số độ chính xác theo luồng — không có số liệu nào trong văn bản có thể trích xuất. Bản thân trang mô hình không đưa ra tỷ lệ lỗi từ, không đưa ra tỷ lệ lỗi phân tách người nói và không có phân tích chi tiết theo từng ngôn ngữ.
Bài đăng thông báo có mang theo các kết quả do nhà cung cấp báo cáo, bao gồm tỷ lệ lỗi từ đối với streaming và tỷ lệ lỗi phân tách người nói trung bình, và đó là những gì chúng tôi đã viết khi mô hình ra mắt; chúng là các phép đo của chính Meta, chưa được bên thứ ba tái tạo. Trang này không chạy lại so sánh đó, vì chạy lại một điểm chuẩn của nhà cung cấp trong ngày ra mắt trên một trang tham chiếu sẽ tô điểm một con số chưa được tái tạo thành một con số đã ngã ngũ. Điều có thể nói một cách thẳng thắn thì hẹp hơn: Meta không công bố đánh giá đối đầu với một đối thủ được nêu tên ở cùng mức độ nỗ lực và cùng khung đánh giá cho mô hình này, nên mọi so sánh bạn thấy ở đâu cũng là so sánh các con số của nhà cung cấp được thu thập trong các điều kiện khác nhau.
Một mốc thời gian cũng được cố ý để ở trạng thái chưa xác định. Trang mô hình hoàn toàn không ghi ngày phát hành — dấu hiệu phiên bản duy nhất của nó là -1.0 trong id mô hình. Ngày 2026-09-01 trong bài viết này đến từ bài đăng thông báo có ghi ngày đó, và ở đây nó được dùng để định ngày cho mô hình chứ không phải để tường thuật một sự kiện.


Ai nên dùng nó, và ai không nên
Lập luận dành cho Muse Voice Transcribe thì hẹp nhưng mạnh: âm thanh trực tiếp nơi bạn cần từ ngữ, danh tính người nói và điểm kết thúc lượt nói trên cùng một luồng, với mức giá đủ thấp để chạy liên tục thay vì theo yêu cầu. Tác nhân thoại, phụ đề trực tiếp, phân tích cuộc họp và cuộc gọi, đọc chính tả và phiên âm khối lượng lớn là những khối lượng công việc mà Meta nêu tên, và chúng là những khối lượng công việc mà giao diện thực sự được thiết kế cho — một WebSocket 60 phút với các chế độ endpointing và nhãn người nói theo phạm vi phiên.
Những lý do phản đối nó cũng cụ thể không kém. Nếu bạn cần dấu thời gian ở cấp độ từ, độ tin cậy theo từng từ, phát hiện sự kiện âm thanh hoặc cảm xúc, hay định dạng lại bản ghi, thì mô hình này không có những thứ đó, và đây là một thiếu sót đã được ghi nhận chứ không phải là lỗi. Nếu âm thanh của bạn đến ở định dạng khác WAV mono 16-bit ở 16 hoặc 24 kHz và bạn đang dùng endpoint tệp, bạn phải trả giá bằng một bước chuyển đổi mà lẽ ra bạn không phải trả ở nơi khác. Và nếu yêu cầu của bạn là phiên âm theo lô các bản ghi lưu trữ, nơi độ chính xác là tiêu chí duy nhất, thì lời chào hàng về streaming chẳng mang lại cho bạn điều gì — giá ở cả hai phương án là như nhau, nên bạn đang trả tiền cho khả năng thời gian thực mà bạn sẽ không dùng đến.
Điều duy nhất cần kiểm tra trước khi bạn chốt một lộ trình sản xuất là con số mà trang này tồn tại để trả lời, và đó là con số duy nhất có thể thay đổi dù mô hình không thay đổi chút nào: $0.18 mỗi giờ âm thanh, như được ghi trên trang mô hình của chính Meta hôm nay. Trang của Meta là nguồn có thẩm quyền về con số đó. Khi nó thay đổi, mọi thứ được tính dựa trên nó — tháng một nghìn giờ, chi phí mỗi cuộc phỏng vấn, phép tính tự xây dựng so với mua — cũng thay đổi theo.
