
TwIL-LM3-Pro 對比 Qwen 3.8:一場錯配,以及真正重要的比較
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 219 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAI新Grok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
TwIL-LM3-Pro 與 Qwen3.8-Max 不該被放在同一頁,而原因並不是其中一個比較好。原因在於,webAI 為其 3.66B 形式邏輯模型所發表的論據,是建立在與一個 Qwen 模型的比較之上——而那個 Qwen 模型,並不是標題所指名的那一個。webAI 的 Track A 與 Track B 表格,是以 TwIL-LM3-Pro 對上 Qwen3-8B——一個來自較早世代、稠密的 8B 開放權重模型——並且完全沒有理會 Qwen3.8-Max:不是因為 TwIL-LM3-Pro 會贏,而是因為 Qwen3.8-Max 是阿里巴巴的旗艦託管系統,一個稀疏的混合專家模型,據報導擁有 2.4 兆參數、每 token 約 950 億活躍參數、一百萬 token 的多模態上下文視窗,以及每百萬輸入 token 2.00 美元、每百萬輸出 token 6.00 美元的價目表。把一個 2.09 GiB 的筆電 GGUF 擺在它旁邊,是把範疇錯誤包裝成一張對比頁。
這篇文章做了兩件事。它修正了搜尋結果弄錯的比較,然後回答讀者可能真正想問的那個問題版本:既然前沿模型只差一次 API 呼叫,而形式邏輯專家在你自己的機器上執行,那麼它們各自在什麼時候才值得佔有一席之地?
這張卡實際測量到的型號
相關的比較是對比 Qwen3-8B,而 webAI 自己對此的摘要比二手報導所暗示的更為保守。TwIL-LM3-Pro 的域內巨觀閘門為 0.5539,對上 Qwen3-8B 的 0.5336,而模型卡中包含了一句行銷頁面會刪掉的話:閘門領先幅度為 0.020,「小於每 lane n = 200 時的抽樣雜訊——所以那項應解讀為持平,而非勝出。」
在比較結果並非靠擲硬幣決定的地方:strict-7,0.2879 對 0.2093,這一列完全沒有使用任何寬鬆匹配分數,因此無法靠格式化製造出來。嚴格多選題,0.4100 對 0.0000。規則歸納,0.4195 對 0.3680。以及參數比例——3.66B 對大約 8B——這正是「規模不到一半」這項主張的全部依據。
在留出測試套件上,webAI 說得更直白:「TwIL-LM3-Pro 並未領先它。」十個資料集的巨集平均為 0.7901,與自家 Granite 基礎模型持平,並落後 Qwen3-8B 的 0.8493。一個小型專門模型在形式邏輯上與規模兩倍的通用模型打成平手,卻在通用能力上輸給對方,這正是預期中的形態;而如實這樣報告,才讓 strict-7 的數字顯得可信。
Qwen3.8-Max 究竟是什麼
Qwen3.8-Max 並非 Qwen3-8B 的迭代版本。它是阿里巴巴的頂級層級,在 OrcaRouter 目錄頁面上以 `qwen/qwen3.8-max` 顯示,發佈日期為 2026 年 8 月 3 日,具備一百萬 token 的上下文視窗,支援文字、圖像與影片輸入、文字輸出,並完整支援思考模式、函式呼叫、內建工具與結構化輸出。它在五個地區透過相容於 OpenAI、相容於 Anthropic 以及原生儀表板提供服務,而思考模式則以 `enable_thinking` 參數切換。費率為每百萬個輸入 token 2.00 美元,每百萬個輸出 token 6.00 美元。
一個標註日期的快照,`qwen/qwen3.8-max-0902`,於 2026 年 9 月 2 日發布,具備相同的能力與相同的定價;特別發布這個快照,是為了讓行為能被鎖定,以進行可重現的執行。如果你要針對 Qwen3.8-Max 建構任何長期使用的東西,該放進設定裡的是那個快照識別碼,而不是會變動的別名。
注意那段描述裡少了什麼:你可以下載的參數量、授權檔案,以及任何讓你自己跑起來的途徑。Qwen3.8-Max 是託管式產品。發表時的媒體報導提到,開放權重承諾會在接下來一週推出,而 techsy 的說法——「2.4T 參數、1M 上下文、尚無權重」——是讀者應該自行查證而非逕自假設的現況,因為發表時所報導的承諾並不等于已發布的檢查點。
四個維度,而它們之中沒有一個是接近的。
• 參數 — TwIL-LM3-Pro 3.66B 稠密、全數啟用,對比 Qwen3.8-Max 據報在稀疏混合專家設計中總量為 2.4T,每個 token 約有 95B 啟用。總量相差三個數量級,啟用量相差兩個數量級。
• 執行環境 —— TwIL-LM3-Pro 以 bf16 形式下載為 6.82 GiB,或提供 2.09 GiB 的 Q4_K_M GGUF 供 CPU 或 4 GB VRAM 使用;相較之下,Qwen3.8-Max 僅以託管端點的形式存在。
• 背景脈絡 — TwIL-LM3-Pro 具備 131,072 個詞元,繼承自其 Granite 基礎模型,且在自身與 Qwen3.8-Max(1,000,000 個詞元)的評估對比中,從未驗證超過 8,192。
• 模態 — 文字輸入、文字輸出 對比 文字、圖像和影片輸入、文字輸出。
• 授權 — webAI Non-Commercial License ver. 1.0;用於產生營收時需另行簽訂協議,相較之下,託管的商業 API 則沒有可供授權的權重。
• 成本 — TwIL-LM3-Pro:沒有按 token 計費,也沒有託管端點,對比 Qwen3.8-Max 每百萬輸入 token 收費 $2.00、每百萬輸出收費 $6.00,快取輸入的價格則約為每百萬 $0.25。
3.66B 模型之所以便宜,是因為它小;它之所以小,是因為它只做一件事。Qwen3.8-Max 之所以昂貴,是因為它通用,而且採用託管服務。這兩種價格都不是定論。
問題背後的問題
把命名上的混淆剝除之後,剩下的是一個工程問題,而且是個好問題:如果前沿的託管模型能夠對形式邏輯進行推理,那到底為什麼還要運行一個窄域專家?
有三個理由站得住腳。第一個是授權與網路:非商業研究團隊、氣隙環境,或必須在沒有連線的筆電上執行的批次標註作業,都無法呼叫託管端點,而 2.09 GiB 的 GGUF 直接回應了這項限制。第二個是隨規模變化的成本結構——一項涵蓋百萬筆短輸入的形式邏輯標註工作,在託管的前沿模型上要按 token 付費,在本地模型上則只需付出實際耗時。第三個是輸出形態:TwIL-LM3-Pro 經過調校,會輸出可機器檢查的結構,而非自然語言文字;對於蘊含標籤與語意剖析而言,這比提示通用模型再解析其答案的流程更精簡。
相較之下,Qwen3.8-Max 的情況很簡單。它能看懂圖像與影片,可容納一百萬個 token,透過有文件記載的 API 處理工具與結構化輸出,背後還有已發表的基準測試與獨立評估。狹隘的專門模型並不會對這點構成威脅;兩者回應的是不同的限制條件。
同時使用兩者的堆疊
能在真實管線中存活的模式是雙層架構,而且它並不奇特。前沿的託管模型讀取雜亂的輸入——掃描的教科書頁面、混合模態的來源、冗長的規格書——並將其轉換成乾淨的結構化文字。那段文字接著會送到本地的形式邏輯模型,其全部工作就是在你自己擁有的硬體上輸出標籤、剖析結果或 Lean 評論。至於第二層是否值得其維護成本的裁決,靠的是嚴格 7 分制式的比較,而不是那道關卡,因為專家模型是在指標毫無寬容給分空間的賽道上掙得自己的一席之地。
還有一點值得從 webAI 自己的卡片中借鑑:該流程在五個不同的基礎模型上運行,每個模型只改變合併係數,而 webAI 報告了每個模型的結果,包括變化最小的那些。這比任何單一的基準測試數據更能證明一套配方,而且這種證據能告訴你一個方法具有通用性,而不是某個檢查點運氣好。
這裡什麼是可路由的,什麼不是?
這是唯一一個讓這兩個模型誠實地並列在同一句話裡的地方。Qwen3.8-Max 是一條路由:它透過 OrcaRouter 以 `qwen/qwen3.8-max` 提供服務,而因為平台將供應商定價以 0% 加成原樣轉嫁,$2.00/$6.00 的費率是供應商自家的,供應商降價當天就生效,而不是等到一個合約週期之後。帶日期的 `qwen/qwen3.8-max-0902` 快照可與它並行路由,因此鎖定一個可重現的模型 ID 是設定上的選擇,而不是另立一段供應商關係。
TwIL-LM3-Pro 不是一條路由,若暗示它是,那會是不誠實的。它採用非商業授權,且沒有公開的託管端點,目前使用它的方式是下載檢查點並自行執行。對於圍繞它建構的管線而言,路由器負責的是周邊的文字工作——提示詞擴展、語料生成、過濾階段——這些都在同一個與 OpenAI 相容的端點上執行,對接 200 多個模型,因此把生成評估資料的模型換成負責評分的模型,只需修改設定,毫無额外成本,並具備自動容錯移轉,讓長時間批次在供應商出狀況時仍能持續運作。
兩者結合最站得住腳的用法正是如此:由可路由的前沿層級負責一般推理與結構化擷取,由下載的專用模型負責形式邏輯判斷,而中間的一切則共用單一金鑰。
要比較哪個模型,以及何時
若你正在評估小型形式邏輯模型,值得與 TwIL-LM3-Pro 並列考慮的 Qwen 是 Qwen3-8B,而 webAI 已發布該比較,並附上相關注意事項。若你正在選擇要在何處執行正式生產工作負載,Qwen3.8-Max 則完全是另一項決定——那是一套託管式前沿系統,有費率表且無法下載——此時正確的問題不是哪一個更好,而是哪一項限制會先綁住你:一邊是連線能力與授權條款,另一邊是上下文、模態與規模。大多數真實系統最終兩種答案都需要。



本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
