一张生成的主视觉卡片,标题为"Space Bunny — 参考页面",副标题为"一个模型,两个名称:space-bunny 与 space-bunny-alpha"。左侧卡片标题为 Envelope,列出上下文:1,000,000 tokens,最大输出:524,288 tokens,输入:文本、图像、视频。右侧卡片标题为费率卡,醒目地显示着"每 1M 输入 $0 / 输出 $0"这一大行,并附有说明"运营方:未披露。列表元数据,未经审计。"底部横条写着"同一模型 — 不带后缀的名称即简称"。OrcaRouter 标志位于右下角。
Guides & Insights

Space Bunny:Stealth Model 的参考页,也列为 Space Bunny Alpha

作者

Elias Hawthorne

发布日期

最新模型 · 20查看全部模型 →
基准测试:Artificial Analysis · 每日更新
返回全部文章

Space Bunny 和 Space Bunny Alpha 是同一个模型。先把这一点确定下来,因为这两个名称会把人引向不同方向:不带版本号的名称是大多数人输入的,而带版本号的名称是每份列表和每篇介绍所使用的。不存在第二个 Space Bunny——没有更小的兄弟版本,也没有 Alpha 所取代的更早版本。不带版本号的名称是简称;Alpha 是这类匿名列表在运营方保持匿名期间所带的预览阶段标记。Space Bunny 是在第三方平台上提供的隐身预览:一百万个 token 的上下文、524,288 个 token 的输出上限、文本、图像和视频输入,以及每百万 token 标价为零美元,且提供方身份未披露。本页就是它的参考页——是为搜索该模型自身名称的人准备的目的地,而不是关于它存在的第二次公告。

关于如何阅读下文,有两点说明。信封标题下的一切,都是运营方提供的上架元数据:匿名提供方自己的数字,发布在托管该预览的平台上,并于今天——2026年9月28日——再次读取。这些内容均未经独立核实,而在数字出现之处,我会再次说明这一点。基准测试部分是独立的,且全程采自第三方来源。另一条说明则涉及本页究竟为何存在。该上架信息日期为2026年9月23日,也就是五天前,因此不存在需要绕着争论的时效问题——但这里的依据并不是那个日期。而是我们自己测得的一方搜索需求:截至9月25日的28天内,查询“space bunny”获得1,668次展示和238次点击,排名第4.8位。这是关于人们输入什么的事实,而不是关于该模型的事实。读者已经在点击进入我们当时恰好排名的任何页面;只是根本没有一个关于该模型本身的页面可供他们落地。填补这一空白,正是本文立论所依据的那一条依据——2026年9月28日测得的持续需求,而上架日期被用来给模型标注日期,而不是作为一个要报道的事件。

该名称,已妥善确定

关于“同一模型”的证据是一种缺失,因此值得精确说明实际检查了什么。托管该预览的平台为该系列只列出了一条条目:标识符为 stealth/space-bunny-alpha/,显示名称为“Space Bunny Alpha”;旁边没有仅名为 space-bunny/ 的条目。该模型自己的实地指南——一个明确声明与平台或开发者无关联的第三方网站——将其介绍为“Space Bunny Alpha,也写作 space-bunny-alpha”,并将其条目的日期标为 2026 年 9 月 23 日。为该系列托管配套仓库的 Hugging Face 组织拥有一个以 alpha 命名的 bunny 仓库。寻找仅名为“Space Bunny”的独立模型时,除了同一个模型以较短名称出现外,什么也找不到。

实际使用上:把这两个字符串当成别名处理。"Space Bunny" 是主词条,也是点击表现更好的那个;space-bunny-alpha/ 是你要放进请求里的标识符。光凭这个裸名称所不能暗示的一点,就是版本——没有记录在案的 1.0,没有更小的变体,也没有非预览版发布。任何暗示存在其他版本的列表或帖子,都是在凭空编造一个记录中并不存在的系列。

这个后缀确实承载着真实信息:该模型处于预览状态,由一家选择在此期间不具名的提供商运营,而且平台的隐秘通知称,提示词和补全内容可能会被该提供商保留,但不会用于训练。请仔细阅读该条款,因为这是一项保留声明,而不是零保留声明。如果你已读过我们关于此条目的发布前报道——Space Bunny Alpha 泄露页面——该页面的作用已经完成:它当时预判的内容,如今不过是模型的现状,而当下真正的问题已从身份转向能力边界、成本和吞吐量。

信封,正如列表所述

今日在实时列表中重新读取。由操作员提供,未经复现。

• 上下文窗口 — 1,000,000 个 token。与本系列此前的匿名预览属于同一 1M 级别。

• 最大输出 — 524,288 个 token。这是上下文窗口的一半,无论价格如何,这都是一个非常大的上限,而且没有任何第三方在极端长度下对其连贯性进行过压力测试。

• 输入与输出——文本、图像和视频输入;文本输出。视频输入是这一代匿名发布与普通多模态发布最关键的区别。

• 推理——强制启用且无法关闭,共有五档推理强度:低、中、高、xhigh 和 max。今天的实时列表显示提供商的默认值为 max,第三方实地指南也独立记录了相同的默认值。通过 API 隐藏推理文本并不会禁用计算;它仍然会消耗输出预算。

• 工具使用与结构化输出 — tools/ 和 tool_choice/ 均被接受,因此可以使用函数调用。response_format/ 可输出 JSON,但不进行 JSON-schema 强制校验——这一系列预览版自始至终都带有这一注意事项。如果你的流水线需要返回经过验证的对象,请自行验证。

• 未披露——提供商名称、参数总量、激活参数、架构、分词器家族(仅登记为"Other")、知识截止日期、量化方式、许可证,以及究竟是否存在可发布的权重。配套仓库称,GGUF 文件将在"模型权重可用后"出现——这是对未来文件的承诺,而非权重现已存在的证据。

• 可运行,但信息明显单薄——该条目未公布吞吐量数据,也未公布延迟数据。这两个字段均为空。它仅列出一个服务提供商,标记为 stealth,量化方式未知。

最后那条要点,才是对“它有多快”这个问题最诚实的回答:公布过数字的人都不拥有这个端点,而端点的运营方什么都没公布。这不该成为你回避这个模型的理由,而应成为你在第一次调用时就亲自测量它、而不是轻信描述里某个形容词的理由。

A generated single-column scoreboard titled 'Space Bunny — the scoreboard' with six rows: Context window 1,000,000 tokens, Max output 524,288 tokens, Modalities text + image + video in text out, Reasoning mandatory low to max default max, Listed price $0 in / $0 out per 1M, and Independent score: no leaderboard entry. A footer reads 'Envelope and price are operator-supplied listing metadata, unaudited; there is no independent evaluation on a public leaderboard.' The OrcaRouter logo sits bottom-right.

费率表:零,以及这里零的含义

该上架信息将模型定价为每百万输入 token 0 美元、每百万输出 token 0 美元——这是一次免费预览,见于运营方自己的上架页面,于今日查阅。该条目未公布每请求限制,也未公布速率限制政策。

两项限定。第一,那是运营方今天标出的价格,而非承诺:隐秘预览价是某个上架条目的一项属性,而上架条目会在不另行通知的情况下变更。第二,在本系列中,$0 预览历来是一种评估工具,而非永久档位——预览结束时,免费窗口就已关闭。任何基于零美元费率进行构建的人,都应把这个数字视为当前有效而非持久有效,并且应当在自己需要之前,就清楚其每百万的兜底成本是多少。

端点表面

调用方实际得到的内容,取自清单的受支持参数集,而不是来自文字说明文档。

• 聊天补全 — messages/,并可选用 stream/,即普通的流式生成。

• 采样与限制 — max_tokens/, temperature/, top_p/. 推理 token 会从 max_tokens/ 预算中扣除,因此上限过紧时,会先截断思考内容,然后才截断输出。

• 推理控制项 —— reasoning/ 和 reasoning_effort/ 贯穿五级阶梯,另有 include_reasoning/ 用于显示或隐藏推理文本。

• Structure and tools — tools/, tool_choice/ (auto is supported; forcing a specific function is not), and response_format/ for JSON without schema validation.

这就是全部接口。没有单独的视觉端点,没有批处理 API,没有微调路径,也没有嵌入。多模态输入经由同一个聊天调用传入,这很方便,但也意味着一个大型视频附件会与对话中的其他所有内容争夺同一份上下文预算。

哪些第三方实际测量过?

大多数搜索结果正是在这里不再严谨,所以先说出处。我们通常为跨模型比较而引用的独立排行榜 Artificial Analysis,无论用哪个名称,都没有 Space Bunny 的条目——今天通过直接请求核实过。确实存在的两项第三方测量在性质上不同,而且二者都不是与其并列展示的模型所采用的同一套匹配评测框架。

第一个是 AI BENCHY,一个发布各模型运行结果的第三方基准测试网站。它收录的 Space Bunny Alpha 条目记录如下:在高推理模式下 10 分得 7.0 分,尝试通过率 62.1%,可靠性 10.0,平均响应时间为 27 秒,费用为 $,并在该网站自己的排名中给它排了位。按类别看,它最强的是工具调用和常识问答,均为 10 分中的 10 分,工具调用为 10 分中的 10 分,常识问答为 3 分中的 4 分。这些是该网站自身测试套件中的结果。真正有意义的数字是通过率和类别分布,而不是在别人的排序中的全球排名。

第二个是该模型自己的实地指南,它发布了自己的评估结果:在一个60题的GPQA Diamond子集上为82.0%,在MMLU-Pro上为75%,在Humanity's Last Exam的300题子集上为46.1%,其近似95%置信区间为40.4–51.8%。该网站明确表示,这些是它自己进行的子集运行,而旁边显示的模型是来自各自供应商的已发布参考结果——题目数量不同、测试框架不同、设置也不同。这个限定说明是重点,不应被悄悄忽略:那些列并非一对一的正面比较,也没有人对Space Bunny与它旁边被绘制的任何模型进行过投入匹配、测试框架匹配的比较。一个将这些数字呈现为排名的页面,正在做来源本身拒绝做的事情。

另外两项第三方结果值得关注,因为它们测试了基准测试会遗漏的东西。这份实地指南报告了一项长上下文检查:在一个约 200,000 个 token 的单一输入中隐藏的三个不同代码,在一次试验中全部按正确顺序被返回——这是一项容量测试,而非能力评分,也正是 1M 上下文窗口会引发、却很少得到的那种检查。它还报告了一项 token 效率比较:在同一组基准测试中,Space Bunny 消耗了 305,989 个输出 token,而 Qwen3.8 Flash 消耗了 913,989 个——大约少了三分之二,一旦免费窗口关闭,这一点比听起来更重要。

整幅图景中最清晰的单一事实是一个空白。没有 Artificial Analysis 条目,没有竞技场评分,也没有任何被第二方复现的基准测试。来自一个测试套件的 7.0/10,以及来自一个自行发布子集的 46.1%,在任何地方都没有得到复现,这只是一个起点,而非定论。

A generated single-column card titled 'Space Bunny — measured by third parties' with five rows: AI BENCHY (its own suite) 7.0 / 10 at high reasoning, AI BENCHY attempt pass rate 62.1%, Field guide GPQA Diamond subset 82.0% on 60 questions, Field guide MMLU-Pro 75%, Field guide HLE subset 46.1% on 300 questions. Below the rows a bordered strip reads 'No Artificial Analysis entry. No matched-harness comparison against any model shown.' A footer reads 'Third-party figures from AI BENCHY and the model's own field guide; different suites, no replication.' The OrcaRouter logo sits bottom-right.

谁在它背后?

未披露,而该条目本身也说明了这一点:该模型由一家第三方提供商开发和运营,后者选择在预览期间保持匿名,而托管该条目的平台声明其并非开发者、所有者或提供商。配套仓库未包含实验室名称、许可证或权重。

眼下有一场活跃的公开猜测讨论——提示格式重建、分词器家族探测、样本比较——但其中没有任何一项得出了已确认的身份。我们不重复这些假设,原因和这个家族此前的条目匿名时我们没有重复一样:共享的基准分数或吻合的 token 计数是一种相似,而不是身份确认;把社区猜测包装成发现,对读者来说比诚实的空白更糟。记录确实显示,本系列迄今为止的每一次匿名预览,最终都被某个具名实验室认领,通常在几天到几周内,而且往往伴随着价格变动。这是关于这类预览通常如何收场的基准率,而不是对这一次的预测——也正是应当把今天的这份封套当作快照,而不是规格说明的原因。

在不押注某条路径的情况下评估一个未知模型

未公开的算子并不会阻止你测试该模型。它改变的是你能回答哪些问题。有三件事可以从这份清单本身推出。

• 需要遵守的是保留条款。提示词和补全内容可能会被一个不知名的提供商留存。公开基准测试、开源代码和一次性原型没问题;客户数据、专有源代码以及任何受合规制度约束的内容则不行,而免费的价格并不会改变这笔账。

• 在拿到你自己的数据之前,把每一项能力声明都当作假设。吞吐量、首token延迟和长输出连贯性是这款模型尚未有人公开发布的三项数据,而它们也正是决定其是否适合某一工作负载的三项指标。测出它们只需花一个下午。

• 不要让它成为某个路径中唯一的模型。一个没有名称、没有状态页面、也没有上报途径的提供商,其故障你根本无从追查。

最后一条规则正是路由器体现价值的地方,也是我们能直接说明的部分。OrcaRouter 提供200 多个模型,统一通过一个 API 调用,且不对服务商的标价加价——你支付的是服务商自己公布的价格,因此供应商一降价,我们这边当天就会同步——此外还有跨服务商的自动故障转移,以及一套路由 DSL,让你可以把一个已知可靠的模型声明为实验性模型的回退方案。关于可用性问题,与其说得含糊好听,不如说得准确:Space Bunny 目前不在我们的目录中。我们的模型 API 在任何一个名称下都返回不到这样的路由,所以我们并不是调用该模型的途径,本页面也不是通往它的路径。我们能做的,是在你还在观望时,把一个经过检验的模型放在一个尚未检验的模型后面作为兜底——面对一个连运营方都无从查证的免费预览,这是唯一明智的姿态。

什么会改变这个页面

四件事,按它们可能出现的时间顺序排列。一个具名所有者——在这一系列中,这通常伴随着许可证、参数规模和价格。一份第二方复现的基准测试结果,这将是首个不依附于单一测试套件的质量证据。公布的吞吐量与延迟——这两个空白字段,正是买家最希望被填上的。以及对价目表的调整——目前这是该模型最具决定性的单一属性。

在那之前,诚实概括起来很短。Space Bunny 是一个免费、支持一百万 token、具备视频能力的推理预览版,运营方未披露:一次 7.0/10 的第三方运行、一套自行发布的子集评估、没有独立的排行榜条目,而且完全没有吞吐量数据。它的裸名称和 alpha 名称是同一个模型。关于它的其他一切,都是某个列表带日期戳的快照,而本页就是查看哪个快照为最新版本的地方。

A generated two-column infographic titled 'Space Bunny — documented vs not documented'. The left card, headed 'Documented on the listing', lists Context 1,000,000 tokens, Max output 524,288 tokens, Inputs text image video, Reasoning mandatory five effort levels, Tools and JSON output accepted, Price $0 per 1M in and out. The right card, headed 'Not documented', lists Provider undisclosed, Parameter count none, Tokenizer filed as Other, Throughput no figure published, Latency no figure published, Weights not available. A footer reads 'Left column is operator-supplied listing metadata, unaudited, read 2026-09-28.' The OrcaRouter logo sits bottom-right.