一張用於比較的標題卡,將「Grok Imagine Video 1.5 Lite vs Grok Imagine Video」顯示在「每分鐘 $6.60 可得 52 Elo」與「每分鐘 $8.40 vs 每分鐘 $15.00」這行上方,並有兩個由分隔線分隔的扁平輪廓卡片圖形。
Guides & Insights

Grok Imagine Video 1.5 Lite 對比 Grok Imagine Video:每分鐘六美元換來 52 Elo

作者

Magnus Corvin

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

一句話總結整個決定。G​rok Imagine Video 1.5 Lite 每分鐘要價 $8.40,在 Artificial Analysis 的 AA-Video-T2V v2.0 排行榜上得到 Elo 993;G​rok Imagine Video 1.5 每分鐘要價 $15.00,得到 Elo 1045。同一家族、相同介面、相同的 1 至 15 秒片段長度、相同的七種長寬比——以及每分鐘 $6.60 的價差,換來 52 點的偏好分數,還有一個不會出現在兩者任何一個主要數字中的隱藏差異。G​rok Imagine Video 1.5 是原版:x​AI 的快速生成模型,於 2026 年 1 月 29 日首次發布,自 2026 年 6 月 16 日起穩定於 1.5 版,具備原生音訊與原生 1080p。G​rok Imagine Video 1.5 Lite 則是蒸餾版同門,在排行榜上的日期為 2026 年 8 月,在設計上更快也更便宜。這頁要回答的問題不是哪個模型更好——排行榜已經決定了——而是你的輸出實際上需要哪一個。

價目表隱藏的那一項差異

在這些要點之前,先看這句比 Elo 差距更能左右實際部署的話。在 Grok Imagine Video 1.5 Lite 上,1080p 輸出是以 720p 渲染後再升頻。在 Grok Imagine Video 1.5 上,1080p 就是 1080p。

說到底就是這麼一回事。要求 1080p 的 Lite 片段,其實是 720p 的算圖,再疊上一道升頻處理。在手機動態牆上、用社群平台那種位元率、又經過一道反正會把差異抹平的壓縮,這根本看不出來。可是一旦片段進入需要裁切、去背、合成、重新取景或調色的流程,那些缺失的細節就是剪輯師最先察覺、卻最難以補救的地方。完整版模型沒有這個問題,而這也是它每分鐘價格幾乎貴上一倍的主要原因。

逐維度地

• 價格 — G​rok Imagine Video 1.5 為每分鐘 $15.00,相較於 G​rok Imagine Video 1.5 Lite 的每分鐘 $8.40,兩者皆由 Artificial Analysis 在 1080p 預設設定下報價。完整模型的估計每秒費率為 480p 時 $0.096、720p 時 $0.168,以及 1080p 時 $0.300,另加每張輸入圖片 $0.05。

• 排行榜名次 — 在含音訊的 AA-Video-T2V v2.0 排行榜上,完整模型以 Elo 1045 位居第 11,Lite 則以 Elo 993 位居第 17。Lite 的區間為 983 至 1003,即 ±10 的範圍,與上方七列處的父模型位置不重疊。

• 有效解析度——原生 1080p 對比將 720p 渲染升頻至 1080p 容器。這份清單中影響最重大的一列。

• 片段長度 — 兩者皆為 1 至 15 秒,以整秒為單位。在聊天介面中,完整模型預設為 10 秒;較長的時長則是在 API 中。

• 長寬比 — 兩者皆為相同的七種:16:9、9:16、1:1、4:3、3:4、3:2 與 2:3。

• 音訊 — 完整的 Grok Imagine Video 1.5 隨附原生音訊,包含對話、音效與音樂。Lite 自身的產品說明並未另行記載音訊聲道,而公告也把它歸在該產品陣容的無音訊版本上,因此若原聲帶對你的交付成果至關重要,請在投入前先於 Lite 上確認。

• 輸入與條件設定——系列 API 會接收第一幀影像與額外參考影像;完整模型則有文件說明可依最多七張影像進行參考條件生成,以確保角色一致性。Lite 的產品說明指出其支援文字轉影片與圖像轉影片。

• 成熟度 — 完整模型自 2026 年 6 月 16 日起已穩定維持在 1.5,推出時在 Artificial Analysis 競技場的文字轉影片與圖像轉影片兩項均登上榜首,並在 LMArena 以約 1,400 Elo 保持圖像轉影片第 1 名的位置。Lite 登上排行榜的日期為 2026 年 8 月,其分數背後有 5,715 次盲測比較。

A two-column scoreboard comparing Grok Imagine Video 1.5 Lite ($8.40/min, rank #17, Elo 993, 720p upscaled to 1080p, 1–15 second clips, audio not documented) with Grok Imagine Video 1.5 ($15.00/min, rank #11, Elo 1045, native 1080p, 1–15 second clips, native audio), with a footer separating the Artificial Analysis figures from the vendor-reported details.

帳單,算好了

抽象的分鐘計價很難實際運用,所以把它對照一份真實的需求簡報吧。假設你每個月需要二十支製作完成的十秒短片。

• 以 G​rok Imagine Video 1.5 Lite 每分鐘 $8.40 計算,十秒是它的六分之一,因此每個生成的片段為 $1.40。二十個這樣的作品每月是 $28.00,尚未計入重試。

• 在 G​rok Imagine Video 1.5上,以每分鐘 $15.00 計算,同樣的十秒是 $2.50,而二十個片段每月是 $50.00。

• 以每年約一百五十段短片來說,差別是每月 $22.00,也就是每年約 $264。

那就是讓便宜方案看起來像往錯誤方向捨入的誤差的那個數字,而值得直說:在這個用量下,價格差距並不是選擇 Lite 的理由。選擇 Lite 的理由是迭代速度。如果 Lite 能更快回傳草稿,上面那二十段短片實際上就是六十或八十次生成,其中三分之二被丟掉,而同樣的 22 美元算式就會變成截然不同的一個月。每秒價格是可見的槓桿;每次生成的實際耗時才是左右帳單的槓桿。

這會把這個選擇重新框定為工作流程問題,而非價格問題。容錯移轉(failover)是較便宜同系列型號的另一個實際用途:先用 Lite 跑第一輪,再只把值得留下的結果以完整品質重跑一遍,這不過是改動請求中所指名模型的兩行程式碼,也是在不把交付日期賭在這個答案上的前提下,確認 Lite 對你的內容是否夠用的最便宜方式。這兩款模型都不是由 OrcaRouter 提供服務——我們既不託管 Grok Imagine Video 1.5,也不託管 Grok Imagine Video 1.5 Lite,兩者都得透過供應商自家的 API 及數個第三方平台才能使用——但決定要生成什麼、撰寫提示詞,以及歸檔輸出的那一層屬於文字工作,而文字工作正是 OrcaRouter 的守備範圍:一套 API 橫跨 200 多款模型,以供應商定價提供、0% 加成,自動容錯移轉,以及能將多個模型組合為單次呼叫的路由 DSL。

當較便宜的模型是錯誤的選擇時

這個失效模式很具體,值得命名,因為它很容易讓人一腳踩進去。團隊為了成本採用 Lite,在其上累積了一個月的工作,然後在第一個交付成果時才發現,1080p 素材撐不過裁切。

當剪輯的目的地是動態消息、限時動態、社群貼文或內部審閱時——也就是輸出會以生成時尺寸觀看的任何情況——Lite 就是正確的模型。當你正在反覆調整,而最終採用的版本無論如何都會以完整品質重新生成時,它就是正確的模型。當產量很高,而每單位成本才是關鍵限制時,它就是正確的模型。

當片段將以不同的長寬比剪進更長的作品裡、當合成師要拉遮罩或做去背、當素材要進行調色,或當交付成品附有合約明訂的解析度規格時,它就是錯誤的模型。在這些情況下,你每分鐘省下的 6.60 美元,都會在有人得重新生成一切的那一刻全數吐回來,而 Elo 差距根本無關緊要。

A capture of the LMArena text-to-video leaderboard showing grok-imagine-video-1.5-720p in seventh place, behind wan-3.0-720p-audio, gemini-omni-flash, flux-3-video-20260811 and dreamina-seedance-2.5-720p.

誠實地解讀盤面

上述數字有兩點要注意。第一點是競技場分數的常見問題:993 和 1045 是盲測的成對偏好投票,並非衡量某段影片是否符合需求規格的量測。一個模型可能靠色彩贏得投票,卻輸掉這個鏡頭。第二點則是這組配對特有的情況——兩個模型之間的差距小到讀者應將其視為排序,而非距離。五十二 Elo 意味著 Lite 與其母模型對比時,輸的次數比贏的多;這並不表示 Lite 在你的鏡頭上表現差了 5%,當然也絕不表示一段恰好精準命中需求規格的 Lite 影片,會比一段沒命中的完整模型影片更差。

排行榜所確立的,是這筆取捨的方向與幅度。Lite 在其所處的排行榜區段中,既不是最便宜的,也不是最好的模型:PixVerse V6 位於它下一行,Elo 985,每分鐘 6.90 美元;Kling 3.0 1080p(Pro)則位於它上一行,Elo 1000,每分鐘 10.08 美元。不尋常的是它與自家母品牌之間的差距——以 44% 的折扣換得 52 Elo 的落差,這個品質折讓比「旗艦之下那一階」的折扣通常所付出的代價更小,而這個比例正是發表中所謂前沿宣稱所仰賴的依據。這也是為什麼這是一個真實的選擇,而非行銷上的分級。

A capture of the OrcaRouter models page, showing the model catalogue with vendor groupings and model entries.

以輸出而言,是哪一個?

如果你的短片是在生成它們的地方被觀看——社群、行動裝置、審閱、迭代——Gabe Ask Video 1.5 Lite 就是該從它開始的版本,而每分鐘 $8.40 的費率意味著一百次實驗的成本低於二十支成品。若有任何一支晉級,就用完整模型重新生成那些存活下來的。

如果你的片段是要交付的成品,而不只是拿來看的——經過裁切、調色、交到客戶手上——那就完全跳過 Lite,直接付 $15.00。G​Imagine Video 1.5 是兩者中唯一能產出原生 1080p 的模型,而無論省下多少每秒成本,都撐不過一個必須重新生成的交付成品。

幾乎沒有人需要同時使用兩者。每個大量生成的人最終都會依序用到兩者——先用 Lite 找到那個畫面,再用完整模型把它留住。