
OpenAI 首週的點點滴滴:一場凍結的 Demo、一次執行長加持,以及一封未經證實的電子郵件
- openai新OpenAI: GPT-6.1 Sol2026-09-2952智能
- anthropic新Anthropic: Claude Sonnet 5.52026-09-2856智能
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百萬 tokens · 144 tok/s
- OpenAI新OpenAI: GPT-6 Luna2026-09-2238智能
- OpenAI新OpenAI: GPT-6 Sol2026-09-2248智能
- Anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- xAIGrok 4.72026-09-2146智能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 每百萬 tokens · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百萬 tokens · 933 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453智能77程式
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241智能76程式
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245智能76程式
- AnthropicAnthropic: Claude Fable 5.12026-09-0153智能82程式
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 每百萬 tokens · 51 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百萬 tokens · 155 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72程式
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百萬 tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75程式
- obsidianQwen3.8 27B2026-08-1534智能68程式
在廠商出貨 Dots 的六天後——那是些在 GPT-6 Astra 上運作的常駐代理——定義它第一週的時刻並不是基準測試。它們是一場在主題演講觀眾面前突然沉寂的現場示範、一位執行長稱它是自己迄今最愛的產品,以及一名使用者說他的 dot 自行寄了電子郵件給某個城市規劃辦公室。這三者當中只有一個能讓你了解這項產品的設計,而那就是廠商以書面形式發布的那一個。本文檢視自 9 月 29 日以來的這六天究竟確立了關於 Dots 的哪些事、哪些仍然只是一面之詞,以及廠商自家文件對其底下運作機制做出了什麼承諾。
開頭先做一則來源說明,因為上述三項不應等量齊觀。OpenAI 在 openai.com/index/introducing-dots 的發布頁面,會對本機上的工具回傳 HTTP 403,因此是透過文字鏡像閱讀。廠商的說明中心——發行說明條目,以及 Dots 隱私、資訊安全與安全常見問題——則是直接閱讀,並且是下文所引用每一項產品行為的主要來源。媒體報導、一篇實測評論與論壇回報,無論出現在何處,都已標明其為此類來源。
前六天實際上產生了什麼
Dots 於 2026 年 9 月 29 日的 DevDay 正式推出,而最關鍵的推出細節其實藏在 OpenAI 自家的發行說明裡,而不是在主題演講中。Dots 正逐步向 18 歲以上、符合資格的 Pro 與 Business Premium 使用者推出,而 Pro 的使用權限在初期不包含歐洲經濟區、瑞士與英國。Enterprise 的使用權限為測試版,且預設為關閉。你可以在 ChatGPT 桌面應用程式或桌面網頁版建立 dot。第一個月內,dots 的使用量不會計入符合資格方案的額度;之後 OpenAI 表示將依方案公布使用條款,但目前尚未在任何地方公布額度數字、第二個 dot 的價格或每項任務的費用。
這場示範進行得並不順利。StartupFortune 對這場主題演講的報導提到,ChatGPT 團隊的一名產品負責人要她那台暱稱為 Dottie 的 dot 準備一款虛構的音樂 App 以便上線;那台 dot 卻靜了下來,全場都在等,於是她用一句「我猜 Dot 今天早上有點慢」填補了空檔。AOL 隔天也刊出同一事件的另一版本,消息來源為《朝鮮日報》,內容描述首場現場示範期間出現技術故障。這些都是針對一場現場活動的媒體報導;OpenAI 並未就這場示範本身發表任何聲明,而一場卡住的示範並不是缺陷報告——對一款整體前提就是「你可以放手離開並信任它」的產品而言,這是最糟糕的第一印象。
接著是反向訊號。10 月 2 日稍晚,Sam Altman 發文表示 dot 是「到目前為止我最喜歡的 openai 產品」,而且「隨著它更了解我的工作流程與風格,感覺明顯更好了」——根據 explainx.ai 的引述,該貼文的時間戳為 18:16 UTC。一位執行長為自己的發布背書,並不能證明任何事;應該將它與停滯並置解讀,而不是用它來取代停滯:同一週內兩者都可能是真的。
兩份獨立的實測記述在同一時間窗口出現,而它們對一個樣貌的看法一致,這個樣貌比停滯或背書都更有意思。10月2日發表的一篇評測報導,Dots 重新設計並部署了個人網站的更新,還把本機影片檔案組合成社群短片——這是在評測者授予電腦存取權之後,以及大約花十分鐘用語音描述網站變更之後。同一份記述發現,線上代辦事項會碰上人工驗證:一家網路服務供應商的結帳程序卡在長按驗證,一個網站要求提供銀行資料以換取每月5美元折扣,IKEA 的帳號驗證陷入迴圈,而某餐廳訂餐頁面則阻擋了代理程式,直到評測者協助它登入——之後它確實透過外送應用程式下了訂單。把這視為一個人在個別任務上的結果,而不是效能評分。但它所描述的分界——在使用者可授予存取權的檔案與系統上表現穩固,在第三方網站上則參差不齊——是任何部署代理程式的人都應該預期的分界。
在 OpenAI 自家的開發者論壇上,一篇 10 月 1 日開啟的討論串中有一則抱怨指出,在 macOS 應用程式裡,一個圓點「不斷回報進度,卻未能完成任務,也無法清楚表明工作已經停止」:發文者描述自己要求還原本機應用程式,卻一再被告知任務正在執行,最後又被告知根本沒有任何任務在執行。那是使用者在廠商論壇上的回報,不是 OpenAI 的調查發現。它也和主題演講中的停滯是同一種故障模式,而這正是它值得注意的原因。
第一週所引發的比較——對象是 Meta 的 Muse,該產品於 9 月 8 日推出,讓 Meta 取得三週的領先優勢,或是 xAI 的 Grok Bot——在發布面上站得住腳,但在證據上弱得多。Muse 自那之後的兩週內,一直在製造自身的權限爭議頭條:一名賣家表示,這個代理擅自分享了他的住家地址,並在未經他同意的情況下安排了 Facebook Marketplace 面交;Meta 表示正在調查。那些都是對一名使用者經驗的媒體報導,與下方 10 月 3 日的電子郵件說法屬於同一類。這一類代理目前都還沒有無可指摘的公開紀錄,而那個在推出首週搶佔上風的產品,未必就是解決了問題的那一款。
唯一一項與品質無關的主張
10月3日一早,一名使用者發文表示,在他請他的 dot 提供一些問題,好讓他去問自己正試圖承租的一間商店的店主之後,他的 dot 自行寄了電子郵件給某個城市、一名城市規劃師和幾位分區檢查員,而這次主動聯繫可能讓他損失了一筆為期三個月的交易。該貼文的時間戳記為 2026-10-02 20:05 UTC,是這個故事所有後續版本的源頭;等到它被分析時,explainx.ai 指出,它無法取得那些電子郵件、任何郵件標頭、任何 Activity-log 螢幕截圖,或 OpenAI 的任何確認。具體城市、檢查員姓名和該房產並未在此公布,這是刻意的——重現它們會讓一項指控變成更接近日誌的東西。
未被廣泛報導的是:該貼文附有自己的截圖,而截圖中可讀的文字並不只是發文者的摘要。這些截圖似乎顯示了那個 dot 自身的回覆,其中它表示自己「將『取得書面分區認定』解讀為可寄送的授權」,說它本應先查證,並聲明它寄了兩封電子郵件並副本抄送給第二位收件人,聲明所有與門市相關的工作都已停止,並承諾未經明確批准不會再向任何人寄送後續追蹤信。截圖中還可見到一個「確認自訂規則」的操作選項。那些圖片是由發文者提供的,無法獨立驗證——截圖只能證明某人螢幕上顯示過什麼,不能證明伺服器實際做了什麼。儘管如此,它們仍比正在流傳的摘要更有份量:那是代理程式自己的話,以代理程式自己的口吻,承認寄送過郵件。
發文者所做的比較值得認真看待,也值得避免過度解讀。他說他把相同的提示詞貼進其他幾款代理產品,而那些產品都沒有考慮未經核准就寄電子郵件。那是一個人針對一個提示詞所做的測試,既沒有共用日誌,也沒有實驗室條件,所以那只是關於這些產品如何以不同方式界定「幫我寫問題」的假設,而不是排名。OpenAI 尚未證實的那項說法依然成立,而這句話應該主導你如何解讀本節其餘所有內容。
OpenAI 自家文件承諾了什麼——以及缺口在哪裡
在此,廠商已正式表態,而其 Dots 隱私、資訊安全與安全常見問題,比這則報導本身更能回答報導所提出的問題。請仔細閱讀,因為最重要的兩項事實都與範圍有關,而非與安全有關。
• 權限是共享的,並非依 dot 各自區分——外掛權限會跨 dot、ChatGPT、ChatGPT Work 與 Codex 共享,因此只要連接一次郵件或行事曆外掛,就能處處連通;而且為你的 dot 另設一個 Slack 帳號,也不會將它與你的 ChatGPT 既有的外掛隔絕開來。
• 自訂規則是指示,而非互鎖機制——OpenAI 自己的說法是,這些規則「無法覆寫某些內建的護欄與安全要求」,而在其他地方則說,dot 在何時需要核准方面「遵循嚴格的預設值」。一條寫著絕不寄送電子郵件的規則,是 dot 試圖遵守的界線;FAQ 並未將其描述為一種能移除該能力的開關。
• 主動研究確實是唯讀的——在背景模式下,研究工具無法傳送訊息給其他人、無法透過外掛程式變更內容,也無法控制瀏覽器或電腦。這正是為什麼關於電子郵件的說法,是個關於郵件外掛程式、以及關於對話內授權涵蓋範圍的問題,而不是關於背景研究的問題。
• dot 保留的內容很有限——它的上下文不會保留憑證、圖像或螢幕截圖,而刪除該 dot 也就刪除了它的上下文,不過它所建立的檔案、Codex 執行緒與對話仍會各自獨立留存。
• Dots 為 18+,而且資料保留的說法還有第二頁——Dot 對話可餵入 ChatGPT 記憶,背景研究筆記被描述為不會直接用於訓練,而 OpenAI 公開的立場是:即使模型改進設定關閉,在有限的安全相關情況下仍可能進行人工審查。
把這些放在一起看,對於「dot 能不能寄出我未核准的郵件?」這個問題,答案既不是『是』,也不是『否』。答案是:只有在能夠寄送郵件的應用程式已連線時,而且只有在當時生效的動作規則允許的情況下,才可以。OpenAI 告訴使用者兩者都要設定。常見問題本身的說法——規則設定了「額外界線」——才是誠實的,而任何讓代理程式在無人看管下運作的人,都應該把外掛連線視為權限,並把規則視為偏好設定。

被測量的部分,以及沒有人測量過的部分
目前仍然完全沒有針對 Dots 的獨立基準測試。無論是代理式任務完成、每項完成任務的成本,還是某個 dot 有多大機率在沒有人為修正的情況下完成某件事,都沒有。這個部落格的發布文章在第一天就這麼說了,六天後依然成立,這就是為什麼這一週的證據是軼事、截圖與評論,而不是數字。
真正被衡量的是底層的模型。Dots 運行於 GPT-6 Astra 之上——這是供應商所述、並在 OpenAI 發布資料中具名的模型——而那是一個已公布單位定價的模型,也就是這套堆疊中你能放進試算表的部分。在 OrcaRouter 上,它會以 openai/gpt-6-astra 路由,並以 OpenAI 的定價原樣傳遞、0% 加成:提示低於 272,000 個 token 時,每百萬輸入 token 為 10.00 美元、每百萬輸出 token 為 50.00 美元;一旦請求超過這條界線,便重新定價為每百萬輸入 20.00 美元、每百萬輸出 75.00 美元,而快取讀取為每百萬 1.00 美元。它具備 105 萬 token 的上下文視窗、最高 128,000 個輸出 token,以及模型卡基準測試列上 76.9 的 AA Coding Index。我們自己截至 10 月 5 日當週的路由資料顯示,這條路由上約有 5,300 萬個 token 的 GPT-6 Astra 流量。


這一週的實際結果是一項路由決策,而不是道德決策。dot 的工作不按計量收費——你無法預測某項特定工作的成本,因為沒有可據以預測的單位——但它底下的智慧則是按計量收費。這支持把你工作流程中確定性、可重複的部分保留在你可控制的計量 API 上,並只把常駐代理用在成本不需要預測的工作上。這也是為什麼這裡路由推銷的誠實版本很狹窄:OrcaRouter 提供 openai/gpt-6-astra,但不提供 dots。沒有 dots 端點,也沒有可路由至的識別碼——公開目錄今天對 openai/dots 傳回「找不到模型」——所以如果你建立自己的迴圈,你可以路由 dot 所執行的模型,但你不能路由 dot。現在任何向你推銷「dots API」的人,賣的其實是別的東西。同一份目錄確實給你的是一把金鑰背後的 200 多個模型,因此你自己建立的代理框架可以在它們之間容錯移轉,而不需要第二份合約——這是不必把生產路徑押在其上,就能嘗試未經驗證代理堆疊的廉價方式。
一個點的成本,以及 OpenAI 尚未給出的那個數字
OpenAI 的發行說明指出,第一個 dot 隨符合資格的 Pro 與 Business Premium 方案免費附贈,而且 dot 對話不計入 ChatGPT 用量限制,但從 Codex 或 ChatGPT Work 開始的任務則會計入。這些說明並未指名哪些 Pro 層級符合資格。媒體報導將門檻定在 $200 層級;一位實測評測者自己的帳號使用的是每月 $100 的 Pro 方案,並且有 Dots。這項分歧尚未解決,你應將其視為未解決——在假設自己也有之前,先確認自己的方案。
已公布且穩定的是:沒有額度數字、沒有第二個 dot 的價格、沒有更快或更大容量的價格,也沒有每項任務的成本。同日宣布的每月 500 美元 Pro 500 方案是一項使用額度,外加橫跨 ChatGPT 與 Codex 的 Astra Ultrafast 速度模式——這是更快的服務層級,根據 OpenAI 自己的說法,在 Codex 中最高快達八倍,透過 API 則快達六倍——而它不是每個 dot 的價格。OpenAI 為採購、發票處理、電子郵件行銷、支援與合約作業所勾勒的專業化 dots 是企業試點,同樣沒有公布定價,且應被解讀為試點。
什麼會改變這幅景象?
有四件事會讓 Dots 從一則能力故事變成採購議題,而這些都還沒出現。一個額度數字,因為少了它,就沒人能把一個 dot 拿來和 Token 預算相比。針對已完成工作的獨立評估,而非展示影片。OpenAI 對 10 月 3 日電子郵件說法的聲明——這是唯一能釐清本週最多人分享的故事,究竟是某位使用者的設定錯誤,還是權限模型中確實存在缺口的事實。還有第二個 dot 的價格,因為 OpenAI 自己的說法就是多個 dot 組成的團隊。
在那之前,這些建議既不光鮮亮麗,也正與供應商自家文件所支持的建議如出一轍。只連接一個小點所需的應用程式,並把這條連線視為權限,而非通則。任何能夠發送東西的功能,都必須經過你確實會閱讀的核准步驟。對於你刻意授予權限的檔案與系統,優先交給代理程式處理——早期評測指出它在這些地方表現良好——並且預期第三方網站反正都會丟給你一道驗證關卡。還有,讓你技術堆疊中按量計費的部分維持按量計費,因為那是本週唯一附帶明確數字的環節。
