一張生成的 hero 卡片,標題為「Space Bunny —— 參考頁」,副標題為「一個模型,兩個名稱:space-bunny 和 space-bunny-alpha」。左側卡片標題為「Envelope」,列出 Context:1,000,000 tokens、Max output:524,288 tokens、Inputs:text、image、video。右側卡片標題為「Rate card」,帶有一列大字「每 1M 為 $0 in / $0 out」,並附一行「營運方:未披露。刊登中介資料,未經審核。」底部橫幅寫著「同一個模型 —— 裸名稱就是簡稱」。OrcaRouter 標誌位於右下角。
Guides & Insights

Space Bunny:亦列為 Space Bunny Alpha 的 Stealth Model 參考頁面

作者

Elias Hawthorne

發佈日期

最新模型 · 20查看全部模型 →
基準測試:Artificial Analysis · 每日更新
返回全部文章

Space Bunny 與 Space Bunny Alpha 是同一個模型。先把這點確定下來,因為這兩個名稱會把人拉往不同方向:不帶版本的名稱是多數人會輸入的,而帶版本的名稱則是每個刊登資訊與每篇報導都會使用的。並沒有第二個 Space Bunny——沒有更小的兄弟型號,也沒有被 Alpha 取代的較早發行版。不帶版本的名稱是簡稱;Alpha是這類匿名刊登資訊在操作者仍未具名時所帶的預覽階段標記。Space Bunny 是在第三方平台上提供的隱匿預覽:一百萬個詞元的上下文、524,288 個詞元的輸出上限、文字、圖像與影片輸入,以及標價為每百萬個詞元零美元,且供應商身分未揭露。本頁是它的參考資料——是給搜尋該模型本身名稱的人的目的地,而不是第二則宣布它存在的公告。

關於如何閱讀接下來內容,有兩點要先說明。在信封標題之下的所有內容,都是營運方提供的刊登中繼資料:匿名供應商自己的數字,發佈在託管該預覽的平台上,並於今天,2026 年 9 月 28 日,再次讀取。這些內容均未經獨立驗證,而當數字出現時,我會再次這樣說明。基準測試部分則是分開的,且全程皆有第三方來源。另一點要說明的是,這個頁面究竟為何存在。這則刊登的日期是 2026 年 9 月 23 日,也就是五天前,因此沒有時效問題需要繞著爭論——但這裡的依據並不是那個日期。而是我們自行測得的第一方搜尋需求:截至 9 月 25 日為止的 28 天內,查詢「space bunny」獲得 1,668 次曝光與 238 次點擊,排名為 4.8。這是關於人們會輸入什麼的事實,而不是關於該模型的事實。讀者早已點擊進入我們當時碰巧排名到的任何頁面;只是根本沒有關於該模型本身的頁面可供他們落腳。填補這個缺口,就是本文所立足的條款——於 2026 年 9 月 28 日測得的持續性需求,而刊登日期則用來標定該模型的日期,而不是當成可供報導的事件。

名稱,妥善定下

「同一個模型」的證據是一種缺席,因此值得精確說明究竟檢查了什麼。託管該預覽的平台在該系列下只列出恰好一筆條目,識別碼為 stealth/space-bunny-alpha/,顯示名稱為「Space Bunny Alpha」;其旁沒有單純的 space-bunny/ 條目。模型自己的實地指南——一個第三方網站,明確表示它與該平台或開發者沒有關聯——將它介紹為「Space Bunny Alpha, also written space-bunny-alpha」,並將其列出的日期標為 2026 年 9 月 23 日。為這個系列託管配套儲存庫的 Hugging Face 組織有一個 bunny 儲存庫,以 alpha 命名。若尋找單純的「Space Bunny」作為獨立模型,只會找到同一個模型以其較短名稱出現,除此之外別無他物。

實際上:把這兩個字串當作別名。「Space Bunny」是主要詞彙,也是點擊表現較好的那個;space-bunny-alpha/ 是你放入請求中的識別碼。這個裸名稱唯一不暗示的,就是版本——沒有已記載的 1.0、沒有更小的變體、沒有非預覽版發行。任何暗示並非如此的刊登或貼文,都是在編造紀錄未顯示的系列。

該後綴確實帶有真實資訊:該模型處於預覽階段,由一家選擇在此期間不具名的供應商營運,而平台的隱蔽通知指出,提示與補全內容可能由該供應商保留,但不會用於訓練。請仔細閱讀該條款,因為它是資料保留聲明,而非零資料保留聲明。如果你讀過我們對這個上架項目的發布前報導——Space Bunny Alpha 外洩頁面——該頁面的功能已經達成:它當時預期的情況如今就只是該模型的狀態,而當前待解的問題已從身分轉向範圍、成本與吞吐量。

信封,如清單所述

今日已於線上刊登頁面重新閱讀。由操作人員提供,未經重現。

• 上下文視窗 —— 1,000,000 個 token。與本系列先前的匿名預覽同屬 1M 等級。

• 最大輸出 — 524,288 個詞元。這佔上下文視窗的一半,無論價格為何都是極大的上限,而且沒有第三方對其在極限長度下的連貫性做過壓力測試。

• 輸入與輸出——文字、圖像與影片進;文字出。影片輸入是這一代匿名發布有別於一般多模態發布的最顯著細節。

• 推理 —— 強制且無法關閉,具五種投入程度:low、medium、high、xhigh 與 max。今日的即時列表顯示供應商預設值為 max,而第三方實地指南也獨立記載相同的預設值。透過 API 隱藏推理文字並不會停用運算;它仍會消耗輸出預算。

• 工具使用與結構化輸出 —— tools/ 與 tool_choice/ 均受支援,因此可使用函式呼叫。response_format/ 能輸出 JSON,但不強制執行 JSON schema,這是這一系列預覽版本一路以來都有的相同但書。若你的流程需要取回經驗證的物件,請自行驗證。

• 未披露——供應商名稱、參數量、活躍參數、架構、分詞器系列(僅歸類為「Other」)、知識截止點、量化、授權條款,以及究竟是否存在任何可發布的權重。隨附的儲存庫表示,GGUF 檔案會在「模型權重可供取得時」出現——這是對未來檔案的承諾,而非權重目前已存在的證據。

• 可運作,且明顯資訊單薄——該列表未公布吞吐量數據,也未公布延遲數據。這兩個欄位都是空的。它回報單一服務供應商,標記為 stealth,量化方式不明。

最後那一點,才是對「它有多快」的誠實答案:發表過數字的人,沒有一個擁有那個端點;而該端點的營運者什麼都沒發表。這不是避開這個模型的理由,而是在你第一次呼叫時就實際測量它,而不是相信描述裡某個形容詞的理由。

A generated single-column scoreboard titled 'Space Bunny — the scoreboard' with six rows: Context window 1,000,000 tokens, Max output 524,288 tokens, Modalities text + image + video in text out, Reasoning mandatory low to max default max, Listed price $0 in / $0 out per 1M, and Independent score: no leaderboard entry. A footer reads 'Envelope and price are operator-supplied listing metadata, unaudited; there is no independent evaluation on a public leaderboard.' The OrcaRouter logo sits bottom-right.

費率表:零,以及零在這裡的含義

該列表將此模型定價為每百萬輸入 token 0 美元、每百萬輸出 token 0 美元——免費預覽,且出自營運商自家的列表,於今日查閱所得。該條目並未公布任何每請求上限,也未公布速率限制政策。

兩點但書。首先,那是營運方今天列出的價格,而非承諾:隱蔽預覽價格是刊登項目的一項屬性,而刊登內容可能未經通知即變更。其次,在此系列中,$0 預覽歷來是評估工具,而非永久方案層級——預覽結束時,免費窗口期便已關閉。任何以零美元費率為基礎的人,都應將這個數字視為當前價格而非長期不變,並且應在需要之前,先了解自己每百萬的回落成本。

端點表面

呼叫者實際取得的內容,係取自清單中支援的參數集,而非來自敘述性文件。

• 聊天補全 — messages/ 可選擇搭配 stream/,也就是一般的串流生成。

• 取樣與限制 — max_tokens/, temperature/, top_p/. 推理詞元會佔用 max_tokens/ 預算,因此上限設得太緊時,會在截斷輸出之前先截斷思考過程。

• 推理控制項 — reasoning/ 與 reasoning_effort/ 涵蓋五個等級,再加上 include_reasoning/ 來顯示或隱藏推理文字。

• 結構與工具 — tools/、tool_choice/(支援 auto;不支援強制指定特定函式),以及 response_format/,用於無須 schema 驗證的 JSON。

這就是全部的介面。沒有獨立的視覺端點,沒有批次處理 API,沒有微調路徑,沒有嵌入向量。多模態輸入會透過同一個聊天呼叫送入,這很方便,也意味著大型影片附件會與對話中其他所有內容競爭同樣的上下文預算。

第三方實際測量了什麼?

這就是搜尋結果不再審慎的地方,所以先談出處。Artificial Analysis 是我們通常引用來進行跨模型比較的獨立權威,但無論用哪個名稱,它都沒有 Space 的條目——今天已透過直接查詢確認。確實存在的兩項第三方量測性質不同,而且並非針對與其並列繪製的模型所做的對等測試框架。

第一個是 AI BENCHY,一個發布各模型執行結果的第三方基準測試網站。其 Space Bunny Alpha 條目在高推理模式下記錄為 10 分中的 7.0 分、嘗試通過率 62.1%、可靠性 10.0、平均回應時間 27.38 秒,以及記錄成本 $0.000,並在該站自己的表中將其列於第 161 名。按類別來看,它最強的結果是資料擷取與工具呼叫,兩者皆為 10 分中的 10.0 分;最弱的是常識問答 3.0 與通用智慧 4.2。那些都是該網站自家測試套件中的數據。值得看的數字是通過率和類別分布,而不是全球排名,那只是別人的排序中的一個位置。

第二個是模型自家的實地指南,它發布了自己的評估結果:在60題的 GPQA Diamond 子集上達到 82.0%,在 MMLU-Pro 上達到 75%,以及在 Humanity's Last Exam 的300題子集上達到 46.1%,近似 95% 信賴區間為 40.4–51.8%。該網站明確表示,這些是它自己的子集執行結果,而旁邊顯示的模型是其各自供應商發布的參考結果——不同的題數、不同的測試框架、不同的設定。那個但書是重要部分,不應被悄悄省略:那些欄位並不是正面對決,而且沒有人對 Space Bunny 與任何與它並列繪製的模型進行過同等投入、同等測試框架的比較。一個把這些數字當作排名來呈現的頁面,正在做來源本身拒絕做的事。

還有兩項第三方結果值得參考,因為它們測試了基準測試所遺漏的事物。《實地指南》報告了一項長上下文檢查,其中隱藏在單一約 200,000 個權杖輸入中的三個不同代碼,在一次試驗中全都按正確順序回傳——這是容量測試,而非能力分數,也是 1M 上下文視窗會引發、卻很少獲得的這類檢查。它還報告了一項權杖效率比較,其中 Space Bunny 在相同基準測試上消耗了 305,989 個輸出權杖,而 Qwen3.8 Flash 為 913,989 個:少了約三分之二,一旦免費視窗關閉,這比聽起來更重要。

整幅圖像中最清楚的一個單一事實,是一個缺口。沒有 Artificial Analysis 的收錄條目,沒有 arena 評分,也沒有任何由第二方重現的基準測試。一個測試套件給出的 7.0/10,以及一個自行發布子集所得的 46.1%,且在任何地方都未獲重現,這只是起點,而非定論。

A generated single-column card titled 'Space Bunny — measured by third parties' with five rows: AI BENCHY (its own suite) 7.0 / 10 at high reasoning, AI BENCHY attempt pass rate 62.1%, Field guide GPQA Diamond subset 82.0% on 60 questions, Field guide MMLU-Pro 75%, Field guide HLE subset 46.1% on 300 questions. Below the rows a bordered strip reads 'No Artificial Analysis entry. No matched-harness comparison against any model shown.' A footer reads 'Third-party figures from AI BENCHY and the model's own field guide; different suites, no replication.' The OrcaRouter logo sits bottom-right.

背後是誰

未披露,而上架資訊本身也這麼寫:該模型由第三方供應商開發與營運,該供應商選擇在預覽期間保持匿名;而代管這份上架資訊的平台表示,它並非開發者、擁有者或供應商。隨附的儲存庫未載明實驗室名稱、沒有授權條款,也沒有權重。

目前有一場活躍的公開猜測討論——提示格式重建、分詞器家族探測、樣本比較——但其中沒有任何一項產生已確認的身分。我們不重複那些假設,理由和這個家族先前的條目還是匿名時我們沒有這樣做一樣:共同的基準測試分數或相符的 token 數量只是一種相似,不是一項身分識別;而把社群猜測包裝成研究發現,對讀者來說比誠實留白更糟。紀錄確實顯示的是,到目前為止,這個系列裡的每一個匿名預覽最終都被某個具名實驗室認領,通常在數天到數週內,且往往附帶價格變動。這是關於這類預覽通常如何收場的基準率,不是對這一個的預測——而這正是為什麼要把今天這個信封裡的內容當作快照,而不是規格書。

評估一個未知模型,而不將某條路徑押注於其上

一個未公開的營運方並不會因此停止測試該模型。它改變的是你能回答哪些問題。有三件事可從這份清單本身推導出來。

• 最該遵守的就是資料保留條款。提示與生成內容可能會被來路不明的供應商保留。公開基準測試、開源程式碼和用完即丟的原型沒問題;客戶資料、專有原始碼,以及任何受合規制度管轄的內容則不行,而免費的價格也改變不了這筆帳。

• 把每一項能力宣稱都當成假設,直到你手上有自己的數據。吞吐量、首個 token 延遲與長輸出連貫性,是沒有人針對這個模型公布過的三項數據,而它們也正是決定它是否適合某種工作負載的三項關鍵。量測它們只需花上一個下午。

• 不要讓它成為路徑中唯一的模型。一個沒有名稱、沒有狀態頁面、也沒有升級途徑的供應商,就是你無法追查其故障的供應商。

最後一條規則,正是路由器展現價值之處,也是我們能直接說明的地方。OrcaRouter 提供200+ 個模型,透過單一 API,且不對手供應商的定價加價——你只需支付供應商自己公布的價格,因此供應商降價時,我們這邊當天就會同步生效——還加上跨供應商的自動容錯移轉,以及一套路由 DSL,讓你宣告一個已知良好的模型,作為實驗性模型背後的備援。對可用性問題,與其從寬帶過,不如精確說明:Space Bunny 目前不在我們的目錄中。我們的模型 API 在兩個名稱下都不會回傳這樣的路由,所以我們不是呼叫這個模型的方法,而這個頁面也不是通往它的路由。我們真正提供的是:在你做決定時,把一個經過實測的模型放在一個未經實測的模型後面——這才是面對一個沒人說得出名字的營運商所提供的免費預覽時,唯一合理的姿態。

什麼會改變這個頁面

四件事,依照它們可能到來的順序排列。一個具名的所有者——在這個系列中,這一直伴隨著授權條款、參數量與價格。由第二方進行的基準測試重現——這將是第一個不與單一測試套件綁定的品質證據。已公布的吞吐量與延遲——這是買家最希望被填補的兩個空白欄位。以及費率表的變更——這是目前該模型最具決定性的單一屬性。

在那之前,誠實的摘要很短。Space Bunny 是一款免費、支援一百萬 token、具影片能力的推理預覽模型,營運者未公開:一次 7.0/10 的第三方測試、一組自行發布的子集評估、沒有獨立排行榜的登錄項目,也完全沒有吞吐量數據。它的裸名和 alpha 名稱是同一個模型。關於它的其餘一切,都是某筆登錄資料帶有日期的快照,而這個頁面就是讓你確認目前哪份快照才是最新的地方。

A generated two-column infographic titled 'Space Bunny — documented vs not documented'. The left card, headed 'Documented on the listing', lists Context 1,000,000 tokens, Max output 524,288 tokens, Inputs text image video, Reasoning mandatory five effort levels, Tools and JSON output accepted, Price $0 per 1M in and out. The right card, headed 'Not documented', lists Provider undisclosed, Parameter count none, Tokenizer filed as Other, Throughput no figure published, Latency no figure published, Weights not available. A footer reads 'Left column is operator-supplied listing metadata, unaudited, read 2026-09-28.' The OrcaRouter logo sits bottom-right.