
HeyGen Video 以每秒 0.01 美元推出:HeyGen 對 MiniMax H3 的後訓練究竟改變了什麼
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 223 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
HeyGen Video 於 9 月 30 日上線,整個 10 月期間每秒 $0.01,而這個數字就是整件事的重點。一段十秒的短片要價一角錢。在 HeyGen 自家的比較圖表上,它所調校依據的基礎生成模型——MiniMax H3,於 2026 年 7 月 31 日發布——在同樣 768p 並帶音訊的條件下,收費為每秒 $0.08,而圖表上其他參考點最高達到 Google 的 Veo 3.1 每秒 $0.40。這次發布沒有任何奇特之處:一個模型、三種提示模式、聲音在同一次呼叫中生成。不尋常的是,一家公司拿一個開放權重的基礎模型,針對自家垂直領域進行後訓練,然後把成果定價得比它所衍生的模型低了將近一個數量級——同時還在同一句話裡說,盲測者將其評為優於那個基礎模型。這兩項說法都出自 HeyGen,而支撐它們的算術,才是買家決策真正落腳之處。
HeyGen Video 究竟是什麼
HeyGen Video 是通用型影片模型,而不是虛擬人像引擎,如果你用過 HeyGen,這個區別就很重要。該公司自家的文件明確劃出這條界線:它的虛擬人像算繪引擎是把你已經擁有的樣貌,依你已經寫好的腳本製作成動畫,而這個模型則是從一段描述同時創造出主體、場景、光線與聲音。它以下列識別碼發布:heygen-video-1,位於 POST /v3/models/videos,以 x-api-key 標頭進行驗證,且只能在付費 API 金鑰上執行。
三種調節模式
• text_to_video —— 僅需提示詞,輸出預設為 16:9。
• image_to_video — 提示詞加上一張圖片,該圖片會成為實際的第一幀,包含其 EXIF 方向;輸出會依循該圖片的比例。
• reference_to_video — 預設模式。提示詞加上最多九張參考圖片、三段參考影片和三段參考音訊片段,總共十二個項目。清單順序會成為你在提示詞中使用的標籤:reference_images的第一個項目是<Picture 1>,第一部影片是<Video 1>,而圖片、影片和音訊會獨立編號。
輸出包絡很緊,值得在價格之前先讀一讀:
• 持續時間 — 從 5 到 15 秒之間的任何整數,預設為 5。
• 解析度 — 480p 或 768p,預設為 768p。在 16:9 比例下為 1344 × 768;在 9:16 比例下則為 768 × 1344。
• 幀率與音訊 — 24 fps,MP4/H.264 容器,搭配 32 kHz 立體聲 AAC 音訊,承載生成的對白、環境音與音效。
• 長寬比 — 21:9、16:9、4:3、1:1、3:4 和 9:16,以及 自適應,用於參考模式,會沿用第一張參考圖片的形狀。
• 提示增強 — turbo為預設選項,quality可進行較長時間的處理,disabled則直接送出你的文字,不做任何修改。
結構描述很嚴格——未知欄位會遭到拒絕,而不是被忽略——而seed 是無號 32 位元整數,只要固定它、一次只改一個子句,就能讓同一顆鏡頭重現。下載連結經過簽章且會過期,因此需靠輪詢來更新;回呼每個作業只會嘗試一次,而 HeyGen 本身也告訴你,應把它們視為延遲最佳化,而非保證。
廠商自家的數字,以及內建於其中的但書
HeyGen 在發布頁面上放了一張比較圖表,而這是整篇文章中唯一的量化說法,因此值得拆解,而不是照樣重複。
這張品質圖表是一張 Elo 表格,HeyGen Video 位居榜首——1000——接著是 Dreamina Seedance 2.0 的 955,H3 Max 系列從 952 一路到 860,Kling 3.0 Pro 為 857,Veo 3.1 則為 744。這則註腳承擔了很大的作用:這些分數來自一組內部評估集,包含 4,800 票的 Artificial Analysis Arena 查詢,而HeyGen 自身的分數被標準化為 1000,以便更簡單地比較。廠商把自己標準化到自家圖表的頂端,並不是它領先的證據;那只是一種呈現方式的選擇。其下方各項之間的相對間距才是有資訊價值的部分。
更有用的是正面對決。HeyGen 表示,盲測者在 650 票中,有 55.8% 的比較偏好它的模型勝過 fal 的 H3 Max,區間為 49–62%。這個區間才是誠實的細節:在低端它橫跨 50%,所以單就 HeyGen 自家的數字來看,對 H3 Max 的偏好並未明顯與雜訊區隔開來。各軸向的細分也呈現分歧——在忠於來源圖像上有 65%、在時序掌握上有 66%,但在一致性上只有 43%、在音樂上只有 45%——這讀起來像是一個能很好地維持單一受控鏡頭、但拉長後就會漂移的模型。

速度是最無可爭議的數字。HeyGen 回報其擴散推論生成一段十秒的圖像轉影片片段需時 3.7 秒,而 H3 Max Turbo 為 4.1 秒、H3 Max 為 8.3 秒;字幕生成時間因模式而異,因此不列入計算。任何低於其產出片段長度的時間,都比即時更快。
價格,以及 HeyGen 自家文案中的一處出入
兩個 HeyGen 來源給出兩種不同的標準費率。上線文案表示,定價自每秒 $0.01 起、優惠至十月,並描述為標準價 $0.02 的 50% 折扣——這使得十月成為促銷價,而 $0.02 才是牌價。同一頁面上的成本圖表,附註為 768p 含音訊的每秒牌價在上線促銷之前,將 HeyGen Video 列為 $0.03。
那不是四捨五入的差異;而是 HeyGen 文字敘述所稱的標準費率,與 HeyGen 圖表所示之間存在 50% 的落差。圖表中其他列與外部定價一致——MiniMax 對基礎版 MiniMax H3 收費為每秒 $0.08,這與 Artificial Analysis 為其記錄的每分鐘 $4.80 相符——因此 H3 系列的數字並不是異類。在 HeyGen 公布 API 定價頁面之前,請把 $0.01 視為已確認,因為那是現行促銷費率;並把十月之後的數字視為每秒 $0.02 到 $0.03 之間。

一秒的代價是多少
以下是真正重要的比較:在 768p 並含音訊的情況下,一千秒的生成影片——一百段十秒的短片:
• 十月的 HeyGen 影片 — 每秒 $0.01,共 $10。
• HeyGen 影片十月之後 — 以 $0.02 計為 $20,或者如果圖表的 $0.03 正確的話則為 $30。
• OrcaRouter 上的 MiniMax H3 — 以供應商牌價每秒 $0.08 計算為 $80,加上 0% 加成,因此任何廠商價格變動都會在同一天即時反映在這裡。
• fal 的 H3 Max — $80,按標示的每秒 $0.08 計算。
• Kling 3.0 Pro — 每秒 $0.168,總計 $168。
• Veo 3.1 — 每秒 $0.40,共 $400。
對於大量生成、並捨棄大部分成品的團隊——社群精簡版、廣告變體、產品循環影片——丟棄率才是真正的成本項目,而當一次十秒的嘗試只要一角美元時,迭代的經濟結構就隨之改變。問題在於上限:768p、24 fps 並不是 2K 的交付格式,而「製作品質」是 HeyGen 的說法,不是規格。基礎版 MiniMax H3 透過 MiniMax 託管 API 上獨立的重新生成模組達到 2K,每秒 0.13 美元,而 HeyGen Video 並沒有對應功能——所以如果你的交付目標高於 768p,那個便宜的一秒並不是你需要的一秒。
對於想要比較這兩者的團隊,MiniMax H3 在 OrcaRouter 上是以minimax/minimax-h3每秒 $0.08 的價格提供,因此基礎模型與後訓練版本可以放在同一把金鑰後面,而不必簽兩份合約。HeyGen Video 本身目前在這裡並不是透過路由提供的模型——它是透過 HeyGen 自家的 API 以及幾個第三方平台來提供服務——而這正是自動容錯移轉存在的理由:你可以對一個推出僅數天的模型進行原型開發,而不必把正式生產路徑押在它身上;而如果它登上某個路由供應商,就會以定價表價格出現,而不是被加價過的價格。

HeyGen 說自己不擅長什麼
HeyGen 文件中,最有用的一段就是列出失效模式的那一段,因為供應商很少會寫這些。用該公司自己的話來說,HeyGen Video 在畫面上長時間出現文字、柔和的有機動態(例如花瓣、紙張和頭髮),以及近距離手部動作(例如組裝或操作設備)方面,最不可靠。它最擅長的是簡短、範圍有限的鏡頭:一個主體、一個地點、一個動作,攝影機固定或幾乎不移動。
那個特徵描述與上方的各軸盲測數字相符——對提供圖像的遵循度良好,一致性偏弱——而這應該影響你測試它的方式。發表影片最仰賴的能力,是在鏡頭內生成的字樣:其中的每個標題都是被繪製、蓋印或壓印到場景中,而非合成上去的。HeyGen 自家的指引是,精確拼寫的簡短短語能可靠地渲染,這是個狹隘的說法,而同一份文件也警告不要使用過長的螢幕文字。如果你的工作流程取決於可讀的字體排版,那就是你該優先測試的界線。
五週內第二次的 MiniMax H3 後訓練
有趣的结构性事实是,HeyGen Video 并非第一个透過微调 MiniMax H3 打造出来的商业产品。fal 于 8 月 27 日推出 H3 Max,那是對同一個基礎模型進行後訓練、並與 fal 的推論堆疊共同最佳化的成果,而且一登場就登上 Artificial Analysis 帶音訊圖像轉影片排行榜榜首。如今 HeyGen 也針對不同的垂直領域做了同樣的事——商業影片、產品展示、員工培訓、房地產導覽——而且定價還低於基礎版本。
那個模式才是真正的訊號。MiniMax 決定以自家社群授權條款釋出 H3 的權重,讓該模型成為其他公司能加以特化並轉售的基礎;而五週內出現第二個這類產品,顯示這種轉換率確實存在。這也意味著「MiniMax H3」正在變成一個家族,而非單一模型:基礎版、fal 的 H3 Max 和 HeyGen Video 如今以不同價格和不同解析度彼此競爭,而買家在將「H3」與其他任何產品比較時,必須說明是哪一個 H3。
Artificial Analysis 的文字轉影片排行榜顯示這能有多大的成效。其排名第二、帶音訊的模型是 Utopai X,Elo 為 1150,並由 Artificial Analysis 以註腳註明其基於 MiniMax H3,領先於本身以 1138 分位居第四的基礎 MiniMax H3。無論基礎模型本身的得分如何,建立於其上的衍生模型在至少一個獨立排行榜的盲測人類偏好中,表現都優於它。
什麼仍未經證實
讀者應該保持敞開的三件事。
首先,HeyGen Video 並沒有獨立的評分。截至 10 月 1 日,它並未出現在 Artificial Analysis 的三個影片排行榜——文生影片、圖生影片或影片剪輯——之中的任何一個,因此目前還沒有針對它的盲測、第三方 Elo 評分。本文中的每一個品質數字都是 HeyGen 自家的,來自一組由 HeyGen 以 4,800 票彙整而成的 Arena 查詢評估集。那是一套站得住腳的方法論,同時也是廠商自有的結果,應該被當作如此來解讀。
第二,關於釋出權重,{{1}}HeyGen{{/1}} 什麼也沒說。它微調所依據的模型是開放權重的,但後訓練是一項新產物,而 {{2}}HeyGen{{/2}} 自家的授權條款也是它自己的;發布資料中沒有任何內容使其承諾採取哪一種做法。
第三,文件本身自相矛盾。API 參考文件指出,提示詞可接受最多 5,000 個 Unicode 字元,而模型頁面上的參數表所列的範圍則是1 到 32,000 個字元——同一個硬性輸入上限竟有 6 倍的落差。較低的數字出現在參考文件與更新日誌摘要中,因此在 HeyGen 整合這兩者之前,請以 5,000 為基準來規劃。
誰應該行動,誰應該等待
如果你的影片作品適合放在封閉式鏡頭裡——長凳上的產品、以緩慢推軌拍攝的房間、單一主體搭配固定機位——而且你以 768p 或更低解析度交付,那麼到十月底為止的費率,就是目前任何人正在發布的內容中,大規模生成有旁白、有配樂影片素材最便宜且可信的方法。趁這個月促銷還在時測試它,並讓測試圍繞 HeyGen 自認不擅長的三件事來設計,而不是圍繞發布影片。
如果你的交付目標高於 768p,如果你需要大量畫面文字,或者重點在於跨鏡頭的可讀一致性,那就先等等。基礎版 MiniMax H3 仍是可路由的 H3,768p 為每秒 $0.08,而其代管的 2K 路徑則是每秒 $0.13——兩者都只要在 OrcaRouter 上用同一把金鑰,就能以供應商的定價取得、不加任何加成,所以如果 HeyGen 十月之後的價格結果是 $0.03 而非 $0.02,你會在事情發生當天就在這裡看到更正,而不是等到一個月之後。最快能改變結論的,是一份獨立的 Elo:一旦 HeyGen Video 出現在第三方的盲測排行榜上,廠商那個 55.8% 要嘛站得住腳,要嘛就站不住。
