
2026年的开放代码审查:开源工具、自托管与托管之分,以及“免费”的真正代价
- Alibaba新Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens
- z-ai新Z.ai: GLM 5.3 Flash2026-08-2658智能72代码
- DeepSeek新DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 每百万 tokens
- z-ai新Z.ai: GLM 5.32026-08-1860智能75代码
- obsidian新Qwen3.8 27B2026-08-1552智能68代码
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253智能69代码
- grokSpaceXAI: Grok 4.62026-08-1261智能77代码
- metaMeta: Muse Spark 1.22026-08-0557智能72代码
- qwenQwen: Qwen3.8 Max2026-08-0358智能72代码
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69代码
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1653智能71代码
- kimiMoonshotAI: Kimi K32026-07-1560智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71代码
在2026年,开源代码审查已经不再是一个比喻。阿里巴巴今年夏天将其内部AI审查器以open-code-review的名义开源,加入了自托管领域,该领域还包括七牛的ReviewBot和PR-Agent——这些工具使用你自己的模型密钥,在你自己的服务器上运行,接入你自己的CI。许可证是免费的;真正让你花钱的是围绕它的一切:模型令牌、运行环境,以及防止审查器泄露其读取代码的安全管道。我们的推荐是托管路线——在网关上完成审查,直接按提供商标价转售,不加任何加价,并使用你已有的密钥。这正是我们代码审查页面所主张的,本指南将介绍这些工具、成本账目,以及托管方案并不适用的场景。
2026年8月搜索“open code review”时,大部分结果都是open-code-review仓库、文档镜像和一个npm页面。它们只会告诉你这个工具存在以及如何安装。没有哪一个能回答其背后的决策问题:开源和自托管不是同一个选择,“免费”止步于许可证,而且无论你是否自行托管审查器,模型令牌的标价都一样。本页面正是那份缺失的决策指南——而且它是产品指南,而非模型评测。
2026年“开放代码审查”意味着什么
这个术语如今有了具体的指代对象。2026年年中,阿里巴巴以 Apache-2.0 许可证发布了其内部 AI 代码审查助手 open-code-review——两年内部使用、数万名开发者、数百万个被标记的缺陷。它的设计是混合式的:确定性流水线负责文件选择、规则匹配和评论定位,而 LLM 智能体负责推理。你可以通过以下命令安装它: npm install -g @alibaba-group/open-code-review,然后 ocr review 审查工作区, ocr scan 审计不熟悉的代码库,而 ocr config model 可将其指向任何兼容 OpenAI 或 Anthropic 的端点,包括本地端点。它附带一套经过微调的规则集,涵盖 NPE、线程安全、XSS 和 SQL 注入,并且刻意保持保守:在其自己的 AACR-Bench 评估中(50 个热门仓库、200 个真实拉取请求,由 80 多名资深工程师交叉验证),它报告的精确率高于 Claude Code 等通用型智能体,而 token 消耗约为其九分之一——召回率较低,这种取舍偏向于少量精准的评论,而非大量嘈杂的评论。
它周边的开源领域更为广阔。七牛的 ReviewBot 是一款面向 GitHub 和 GitLab 的自托管审查工具,它编排各类 linter(golangci-lint、pylint、shellcheck 等),并增加了一个 AI 层来解释发现的问题并建议修复方案;它可部署在 Docker 或 Kubernetes 中。PR-Agent(MIT)以 GitHub Action 的形式开创了这一类别,支持 /review、/improve 和 /ask 命令,以及一个可在任何地方运行的 CLI。整个领域的共同点是:它们都不附带模型。你自带 API 密钥,选择任意提供商,而真正的成本故事从这里开始。
自托管与托管 — 无人打印的账本
免费许可证并不等于免费工具。一旦你自行托管其中任何一个,你就需要对五件事负责:
• 模型Token。 与通过任何网关支付的标价相同——自托管不为其打折。
• 一个运行它的地方。一台服务器、一个 CI runner,或一个具有足够内存且开放 webhook 端点的容器平台。
• 连接方式。仓库权限、令牌生命周期、webhook → 审阅者 → 评论循环,以及工具或提供方变更时的更新。
• 护栏。阅读你 diff 的审查者可能将机密转发给模型提供商,将 PII 传输到境外,或中招藏在 PR 评论中、指示其批准的提示注入。自托管开源让你自己成为安全团队;没有任何 README 会告诉你这一点。
• 审计。谁审阅了什么、哪个模型、成本如何、标记了哪些内容——由你来构建日志。

输入和输出两侧的token价格相同。一次典型审查大约读取25K输入token,写入4K。按GPT-5.5的标价——输入每百万5美元,输出每百万30美元——一次审查约0.245美元。而在DeepSeek V4 Flash上,输入每百万0.14美元、输出每百万0.28美元,一次筛选只需不到一分钱。自托管并不会降低这笔费用;你仍然要支付提供商的标价。自托管带来的是隐私和控制,代价则是运维和安全工作。
零加价的托管路由 — OrcaRouter
这正是网关型方案的用武之地。OrcaRouter 是一款 0% 加价的 AI 网关:服务商列表价格直接透传——官网明确写着“零加价保证”——并且支持自带密钥,因此你可以使用手中已有的服务商密钥、速率限制和额度。两百多个模型统一放在一个兼容 OpenAI 的端点后面,而代码审查功能直接内建于网关本身,而非作为按席位单独售卖的产品。最后这一点最值得注意:审查是一条运行在你可能已经在付费的基础设施上的路由规则,而不是又一份订阅。
OrcaCode Review 以两阶段配方运行。每次推送都会在数秒内由低成本前沿模型完成筛查;通过筛查的干净推送会被提升到强模型进行深度检查;P0-P1 发现的问题会使 GitHub 检查失败,从而阻止合并,直到问题被修复或豁免。默认配方按标价在 GPT-5.5 上运行;由于它是一个普通的网关配方,任一阶段都可以换成 200 多个模型中的任意一个——也可以拆分,在 DeepSeek V4 Flash 上进行低成本筛查,再由前沿模型进行强力的最终检查。它可作为 GitHub App 一键安装,无需仓库密钥,也无需工作流文件;也可以作为单个工作流文件安装,供希望在自己的 CI 中使用该操作的团队使用。

自托管审查器要求你构建的那些护栏,在网关上默认就是开启的。PII 防护盾和内容策略会在计费之前强制执行——触发它们的请求会在任何 token 被计费之前就被拦截。代理防火墙会在工具和 MCP 调用运行之前对其进行分级。每次调用都会留下请求日志——包含分级、模型、延迟、成本——并且平台带有完整的审计追踪,包括席位、支出上限和 RBAC。具体到代码审查,机密信息、PII 和提示注入会在 token 离开你的代码库之前就被屏蔽。要精确理解这能带来什么:这些是计费前和运行前的门禁,加上一份日志,而不是证明你的代码是安全的。审查会发现候选问题;但严重程度仍由人工来判定。
它的实际成本
算一下 OrcaRouter 在其代码评审页面上发布的估算器数据。一个五人开发团队,每月 40 个拉取请求,每个 PR 四次推送,按 GPT-5.5 标价每次约 25K 输入/4K 输出 token:每月 token 费用约 53.90 美元。相比之下,CodeRabbit Pro 按年计费为每位开发者每月 24 美元——五个席位约 120 美元——而 Greptile 为每个席位 30 美元。Cursor 的 Bugbot 于 2026 年 6 月改为按使用量计费,每次评审约 1.00–1.50 美元。该网关按你实际使用的 token 计费,价格与你直接向提供商支付的标价相同,不加价,而 BYOK 可让这些 token 从你已有的额度中扣除。
按席位计价的产品能带来精致的体验和维护良好的工作流程,其成本随员工人数而非使用量增长。按令牌计价的审查则随审查量增长。在团队规模极小时,按席位计价可能更划算;一旦PR量真正上来了,按令牌计价更便宜,而且随着审查需求增长,差距会越来越大。

当此推荐有误时。
• 您的代码不能离开您的网络。采用气隙隔离的团队应自行托管开源工具——或运行OrcaRouter Enterprise,该产品可在您自己的VPC内部署整个网关、路由器、护栏和审核操作。没有任何托管方案能达到这一标准;这是一条合规红线,而非偏好。
• 您想要零供应商依赖和完全的提示控制。开源工具是可审计、可复刻且归您所有的。OrcaCode Review 的配方可以编辑,但它仍然是托管式的。如果开源是贵公司的政策决定,那么开源工具才是诚实的答案——但这需要您承担上述安全工作。
• 你的 PR 量非常小。每周只有几次审查的话,根本不需要路由。用自己的 key 跑 open-code-review 完全够用;等拉取请求多到足以摊薄成本时,网关才真正物有所值。
• 你使用的是 GitLab 或 Bitbucket。如今,一键式审查应用是 GitHub。ReviewBot 原生支持 GitHub 和 GitLab,因此使用 GitLab 的团队应该考虑这一点——或者将工作流文件路径接入到 GitLab CI。
• 你把 AI 审查当作认证。 大语言模型在不同运行之间会漂移、产生幻觉,且无法证明可利用性。以关键发现作为合并的门槛,修复后重新运行,并让人类对架构与设计评审负责。廉价的筛查和严格的测试能捕获真正的缺陷;但它们不能取代了解系统的评审者。
简短版本
2026年的开源代码审查是真实存在的:开源,且仅在许可范围内免费。阿里巴巴的open-code-review、七牛的ReviewBot和PR-Agent都值得了解——它们都是自带密钥(BYOK),并且都按模型令牌、运维时间和安全工作计费。托管路线看起来更贵,但算清账目后并非如此:在BYOK的0%加价网关上,它按与自托管相同的标价计费,而且安全护栏、代理防火墙和审计跟踪都包含在内。从托管开始,当代码不能离开大楼时再转向自托管。
如果最终选择托管路线,完整演练——以及成本估算器——就在我们的代码审查页面上:0% 加价网关、你自己的模型密钥,以及会阻止合并的 P0-P1 发现。免费安装 GitHub App,无需信用卡。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
