Một thẻ tiêu đề hero cho GPT-6.7, flagship chưa phát hành tiếp theo của OpenAI, có tựa đề 'GPT-6.7: câu hỏi kernel', hiển thị một biểu tượng chip GPU phẳng với dấu hỏi đậm phía trên, một mặt đồng hồ đo có kim đỏ chỉ vào nhãn '2x', các biểu tượng đường nét nhỏ về đồng hồ tốc độ/chìa khóa/tài liệu rò rỉ, và một dải phía dưới ghi 'GPT-6.7 · CHƯA PHÁT HÀNH · NHỮNG GÌ CHÚNG TA BIẾT CHO ĐẾN NAY', với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

GPT-6.7 và câu hỏi "Bob": Liệu flagship chưa phát hành của OpenAI có thực sự chạy chậm gấp 2 lần?

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 15 tháng 8, một bài đăng trên X từ tài khoản @Yuchenj_UW đã gói gọn một tin đồn thành một câu: "Bob, vua của các kernel GPU, đã rời công ty? GPT-6.7 sẽ chạy chậm gấp 2 lần…." Hai tuyên bố xoay quanh dấu chấm hỏi đó — rằng kỹ sư kín tiếng nhất của công ty đã rời đi, và rằng sự ra đi của ông làm giảm một nửa tốc độ phục vụ của GPT-6.7, flagship chưa phát hành của công ty (được đổi tên thành GPT-6-7 vào tháng 10 năm ngoái). Cả hai tuyên bố đều chưa được xác minh. Nhưng bài đăng xuất hiện vào thời điểm mà mô hình tiếp theo của công ty đã là câu hỏi khi nào, không phải nếu: cái tên Astra xuất hiện vào ngày 1 tháng 8, một đợt rà soát an toàn đã tạm dừng nó vào ngày 7 tháng 8, và GPT-5.6 Sol — flagship hiện tại, đang chạy trên OrcaRouter — là điểm tham chiếu cụ thể duy nhất mà thế hệ tiếp theo phải vượt qua. Đây là những gì thực sự có thể biết được tính đến hôm nay.

Một điều cần nói rõ ngay từ đầu: chưa có ai bên ngoài OpenAI chạy thử GPT-6.7. Mọi tuyên bố về tốc độ phục vụ token của nó đều chỉ là phép ngoại suy — kể cả con số "chậm gấp 2 lần". Phần sau sẽ tách bạch các sự thật đã được xác minh (việc đổi tên, mốc thời gian phát hành, những sự ra đi được ghi nhận chính thức) khỏi phần truyền thuyết (Bob, kernel, và con số). Toàn bộ tài liệu đồn đoán đều được gắn nhãn rõ ràng như vậy.

"Bob" là ai, và tại sao một kỹ sư duy nhất trở thành huyền thoại.

"Bob" là biệt danh mà các nhân viên OpenAI đặt cho một kỹ sư có danh tính chưa từng được công ty xác nhận. Các báo cáo báo chí từ tháng 9 năm 2025 — bao gồm QbitAI, The Paper và itbear, tất cả đều trích dẫn nhân viên cũ và hiện tại của OpenAI — mô tả một nhà nghiên cứu bí ẩn, người một mình viết các CUDA kernel dùng cho quá trình suy luận (inference), loại mã GPU cấp thấp chuyển đổi phép toán transformer thành token. Kernel chú ý (attention kernel) của anh ta, được gọi là "Bob kernel" trong nội bộ OpenAI, được cho là được thực thi hàng nghìn tỷ lần mỗi ngày trên hàng trăm nghìn GPU, với độ chính xác đi kèm: một lỗi nhỏ sẽ buộc phải quay lại các checkpoint và trải qua chu kỳ huấn luyện lại.

Huyền thoại này nhất quán qua nhiều lời kể. Các nhân viên cũ cho biết Bob đã sửa trong vài phút một vấn đề hiệu suất mà đồng nghiệp đã vật lộn suốt một tuần. Slack nội bộ của OpenAI có một biểu tượng cảm xúc 'Bob magic'. Các ước tính ngành được trích dẫn trong cùng báo cáo cho thấy số người còn sống có thể viết các kernel CUDA đào tạo hiệu suất cao là dưới một trăm — đó là lý do vì sao một sự phụ thuộc vào một người duy nhất như thế này được xem là thực sự rủi ro chứ không phải chỉ là điều đáng có.

Về danh tính, OpenAI chưa bao giờ nói Bob là ai. Giả thuyết hàng đầu, được lặp lại trên cùng các bài báo truyền thông, là Scott Gray — một người tốt nghiệp ngành vật lý và khoa học máy tính, gia nhập OpenAI vào năm 2016, là tác giả chính của bài đăng blog năm 2017 của OpenAI "Block-sparse GPU kernels", và sau đó đồng tác giả báo cáo kỹ thuật GPT-4 và bài báo về scaling laws, với danh mục 51 bài báo và hơn 80.000 trích dẫn. Sự trùng khớp này chỉ mang tính tình huống nhưng được nhắc lại rộng rãi; đó là một suy luận, không phải xác nhận.

Bob có thực sự rời đi không?

Bài đăng trên mạng xã hội là một câu hỏi, không phải một khẳng định. Nhưng sự ra đi mà nó ám chỉ có dấu vết bằng văn bản. Một bản tổng hợp về sự thay đổi nhân sự cấp cao được đăng ngày 15 tháng 8 năm 2026 liệt kê Scott Gray — được mô tả là một "kỹ sư hệ thống GPU lâu năm" gia nhập năm 2016 và từng giúp xây dựng hạ tầng cho sparse transformers, quy luật mở rộng (scaling laws) và GPT-3 — nằm trong số ít nhất mười hai nhân sự cấp cao rời OpenAI trong năm 2026. Danh sách tương tự cũng nêu tên giám đốc doanh thu Denise Dresser, cựu COO Brad Lightcap, CEO mảng ứng dụng Fidji Simo, trưởng bộ phận Sora Bill Peebles, cùng những người đứng đầu bộ phận an toàn, đạo đức, tiếp thị và phần cứng. Đó là một báo cáo thứ cấp, không phải xác nhận chính thức, và nó không đưa ra ngày rời đi của Gray.

Bối cảnh rộng hơn khiến tin đồn bớt bất ngờ. Các bài báo đăng trong cùng tuần đó mô tả sự biến động nhân sự như một cuộc cải tổ trước IPO: đồng sáng lập Greg Brockman đang gom quyền điều hành về phía mình trước kế hoạch niêm yết công khai, và CNBC đưa tin về việc CRO rời đi vào ngày 13 tháng 8. Và "Bob" đã được biết đến như một mục tiêu săn đuổi nhân tài suốt một năm nay — báo cáo từ tháng 9 năm 2025 cho biết Mark Zuckerberg của Meta đã đưa câu hỏi "Bob là ai?" thành một mục thường trực trong các cuộc họp tuyển dụng. Cuộc chiến giành nhân tài xoay quanh bộ kỹ năng cụ thể này là có thật, và đó là một phần lý do khiến tin rò rỉ nghe có vẻ hợp lý.

Tuy nhiên, chuỗi lập luận này có hai mắt xích chưa được xác minh: rằng Scott Gray chính là Bob, và rằng danh sách trong bản tổng hợp là cùng một sự ra đi mà bài đăng tweet đề cập. Hoàn toàn có khả năng bài đăng tweet đang lặp lại một tin đồn có trước bất kỳ sự rời đi thực tế nào. Phần này là tóm tắt trung thực: theo ghi nhận chính thức, một kỹ sư GPU cấp cao tên Scott Gray xuất hiện trong danh sách ra đi năm 2026; không chính thức, người đó có thể là Bob mà bài đăng tweet đề cập, cũng có thể không.

Tại sao "chậm gấp 2 lần" lại đáng quan tâm — và tại sao sự thật có lẽ không đơn giản như vậy

Các kernel quyết định hai con số quyết định kinh tế của một mô hình: token mỗi giây và chi phí mỗi token. Nếu GPT-6.7 được triển khai trên các kernel phục vụ kém hiệu quả bằng một nửa so với phiên bản "Bob-optimized" giả định, thì phần cứng tương tự sẽ phục vụ được một nửa số token và cùng một yêu cầu sẽ mất gấp đôi thời gian — với chi phí biên tế gần như gấp đôi. Đối với một nhà phát triển định tuyến lưu lượng sản xuất, đó là mức tăng gấp 2 lần độ trễ và gấp 2 lần chi phí trên mô hình chủ lực, chính xác là loại con số làm thay đổi lựa chọn mô hình. Đó là lý do tại sao tin đồn này có cơ sở.

Bây giờ, những lý do để không tin tưởng nó:

• "2x" không có cơ sở được nêu rõ. Nó chỉ là một con số trong một bài đăng — một thử nghiệm tư duy, không phải một phép đo, và hình ảnh được liên kết cũng không có con số nào.

• Kernels là mã nguồn, và mã nguồn tồn tại lâu hơn tác giả. Ngăn xếp phục vụ mà Bob (hoặc bất kỳ ai) viết cho các mô hình trước đó không biến mất khi một người rời đi; mô hình tiếp theo kế thừa phần lớn nó.

• Tổ chức hạ tầng của OpenAI rất lớn, và huyền thoại "một người viết mọi thứ" gần như chắc chắn là một sự đơn giản hóa. Rủi ro con người chủ chốt là có thật nhưng hiếm khi mang tính nhị phân.

Ngay cả một sự sụt giảm hiệu suất thực sự cũng không làm thay đổi năng lực. Nó chỉ làm thay đổi chi phí và độ trễ — gây đau đớn, nhưng nhà cung cấp có thể hấp thụ một phần hoặc định giá bù đắp, và OpenAI đã ra mắt một tính năng tốc độ (Ultrafast, nhanh hơn tới 14 lần trên sản phẩm chủ lực hiện tại) nhắm chính xác vào loại áp lực chi phí phục vụ này.

Phiên bản mạnh nhất của tuyên bố này là con số thống kê dưới một trăm. Nếu người viết nhân kernel phục vụ cho sản phẩm chủ lực đã ra đi, việc thay thế không phải là một đợt tuyển dụng theo đầu người — mà là một quá trình leo thang kéo dài nhiều năm. Đó là một rủi ro chính đáng đối với nền kinh tế phục vụ của OpenAI. Nhưng đó là rủi ro về đội ngũ, không phải một sự thật được đo lường về một mô hình chưa ra mắt.

Những gì chúng ta thực sự biết về GPT-6.7

Mô hình mà tin đồn nhắc đến có dấu vết công khai dài hơn những gì bài tweet gợi ý, và phần lớn trong số đó là gần đây:

• 31 thg 10, 2025 — Sam Altman đã công bố trên X rằng "GPT-6" sẽ được đổi tên thành "GPT-6-7," được nhiều người hiểu là sự gật đầu với tiếng lóng "6-7" của Gen-Alpha. Liệu "GPT-6.7" và "GPT-6-7" có thực sự giống nhau hay không vẫn chưa được xác nhận chính thức; dòng tweet coi chúng có thể thay thế cho nhau, và hầu hết các bài đưa tin cũng vậy.

• Tháng 4 năm 2026 — Có báo cáo rằng quá trình tiền huấn luyện của GPT-6 đã hoàn tất, với tin đồn phát hành vào khoảng ngày 14 tháng 4. Ngày đó đã trôi qua mà không có buổi ra mắt nào.

• Tháng 8 năm 2026 — Rò rỉ cho biết việc ra mắt đã được đẩy sớm lên đầu tháng 8, với việc OpenAI bỏ qua các phiên bản GPT-5.7 đến GPT-5.9. Chưa được xác minh.

• Ngày 1 tháng 8 năm 2026 — OpenAI công bố "Astra" là tên của dòng mô hình tiếp theo, thông qua một báo cáo nghiên cứu tuyên bố đã giải được mười bài toán mở. Việc liệu Astra có được phát hành dưới tên GPT-6 hay không vẫn chưa được xác nhận.

• Ngày 7 tháng 8, 2026 — OpenAI đã tạm dừng phát triển Astra và trì hoãn việc ra mắt sau khi một cuộc đánh giá an toàn nội bộ gắn cờ rủi ro an ninh mạng "nghiêm trọng" — mô hình đầu tiên kích hoạt mức đó. Altman cho biết việc phát hành rộng rãi "cần thêm một chút thời gian."

• Thị trường dự đoán — Tính đến giữa tháng 8, các nhà giao dịch đặt khả năng phát hành GPT-6 trước ngày 30 tháng 9 ở mức khoảng 62% và trước ngày 31 tháng 12 là khoảng 90%.

• Thông số kỹ thuật đồn đoán — ngữ cảnh khoảng 2 triệu token, hiệu suất tốt hơn khoảng 40% so với thế hệ hiện tại, bộ nhớ cá nhân hóa, và kiến trúc đa phương thức gốc với tên mã "Symphony." Tất cả chưa được xác minh.

Vậy nên mô hình đứng sau "chậm gấp 2 lần" vẫn chưa được phát hành, chưa có ngày ra mắt chính thức, và đang là đối tượng của một cuộc rà soát an toàn đang diễn ra. Một con số về tốc độ phục vụ gắn với nó mang tính suy đoán gấp đôi — một cho ngày ra mắt, một cho tốc độ.

A timeline infographic titled 'GPT-6.7 — the trail so far' with five milestone cards: Oct 31 2025 (renamed GPT-6-7 by Altman), Apr 2026 (pre-training reported done), Aug 1 2026 (Astra family name announced), Aug 7 2026 (safety pause: critical cyber risk), Aug 15 2026 (Bob departure rumor circulates); footer reads 'Timeline per OpenAI announcements and press reports; model unreleased as of Aug 15 2026.' OrcaRouter logo in the bottom-right corner.

Bảng tỷ số duy nhất trung thực hôm nay

Vì GPT-6.7 chưa tồn tại, một bảng xếp hạng chỉ có thể đối chiếu tin đồn với những gì thực sự đang hoạt động:

• GPT-6.7 (chưa phát hành) — trạng thái: chưa phát hành; ngày ra mắt: đồn đoán vào mùa thu 2026; ngữ cảnh: ~2 triệu token (đồn đoán); tốc độ: "chậm hơn 2 lần?" chưa xác minh; giá: không khả dụng; định tuyến: chưa có.

• GPT-5.6 Sol (live) — trạng thái: đang phát hành; ngữ cảnh: 1,05 triệu token, đầu ra tối đa 128K; tốc độ: ~290 token/giây quan sát được trên thống kê 7 ngày của OrcaRouter; giá: $5,00 đầu vào / $30,00 đầu ra mỗi triệu token ở mức đầu vào tiêu chuẩn; định tuyến được: có, theo giá niêm yết của nhà cung cấp.

Khoảng cách thú vị nằm ở cột giá. Sản phẩm chủ lực hiện tại của OpenAI có giá $5/$30 cho mỗi triệu token thông qua OrcaRouter, và mức giá chuyển qua chính là giá niêm yết của nhà cung cấp với biên lợi nhuận bằng không — vì vậy dù OpenAI định giá GPT-6.7 ở mức nào, con số phía chúng tôi cũng sẽ thay đổi ngay trong ngày nó ra mắt, mà không cần đàm phán lại. Đó là phần hữu ích của bảng theo dõi cho bất kỳ ai đang lên kế hoạch cho mô hình tiếp theo.

A two-column scoreboard titled 'GPT-6.7 vs GPT-5.6 Sol — the scoreboard'. Left column GPT-6.7 (unreleased): Status not shipped, Release rumored autumn 2026, Context ~2M (rumored), Speed 2x slower? (unverified), Price n/a, On OrcaRouter not yet. Right column GPT-5.6 Sol (live): Status shipping, Release live now, Context 1.05M tokens, Speed ~290 tok/s, Price $5.00/$30.00 per M, On OrcaRouter yes at list price. Footer: 'GPT-6.7 figures rumored/unaudited; GPT-5.6 Sol per OrcaRouter model page.' OrcaRouter logo in the bottom-right corner.

Cách xử lý một vết rò rỉ như thế này

Đây là một kiểu quen thuộc: một mẫu sản phẩm chưa ra mắt, một con số ấn tượng, một cái tên cụ thể. Từng phần đều nghe hợp lý và chưa có gì được kiểm chứng. Phản ứng đúng đắn không phải là phớt lờ tin đồn hay đặt cược vào nó — mà là cấu trúc quyết định sao cho bạn không phải lựa chọn.

Đó là trường hợp cho định tuyến. Khi GPT-6.7 ra mắt, cách để đánh giá một tuyên bố chậm gấp 2 lần mà không đặt cược một đường dẫn sản xuất vào nó là đưa nó vào sau cùng một endpoint bạn đã sử dụng: một khóa API, tự động chuyển dự phòng sang GPT-5.6 Sol ngay khi mô hình mới hoạt động kém hiệu quả, và lưu lượng truy cập thực tế sẽ quyết định liệu tin đồn có đúng hay không. Tuyên bố đó khi ấy trở thành một phép đo thay vì một dòng tweet. Nếu bảng giá của OpenAI thay đổi cùng với bản phát hành mới, tỷ lệ chuyển tiếp được cập nhật ngay trong ngày — OrcaRouter chuyển tiếp giá niêm yết của nhà cung cấp qua với biên độ bằng không, vì vậy việc nhà cung cấp giảm giá (hoặc tăng giá) sẽ có hiệu lực ngay tại đây, không cần đàm phán lại.

Trong khi đó, sản phẩm chủ lực hiện tại mới là thứ cụ thể. GPT-5.6 Sol đã hoạt động trên OrcaRouter hôm nay với mức $5/$30 cho mỗi triệu token, với ngữ cảnh 1,05M token và ~290 tok/s như bảng xếp hạng cho thấy. Chế độ Ultrafast được công bố vào ngày 13 tháng 8 — nhanh hơn tới 14 lần, khoảng 750 token mỗi giây trên hạ tầng Cerebras — áp dụng cho mô hình đó, không phải GPT-6.7, và đây là lời nhắc rằng OpenAI có thể tấn công chi phí phục vụ bằng hạ tầng cũng như bằng kernels.

Screen capture of the OrcaRouter model page for GPT-5.6 Sol, showing the OpenAI flagship's pricing ($5.00 in / $30.00 out per million tokens), a 1.05M-token context window, 128K max output, Vision/Tools/JSON/Reasoning capability tags, and a p50 time-to-first-token of 1.87 seconds.

Những gì chúng tôi đang xem ngay bây giờ

• Liệu việc Bob rời đi có được xác nhận hay không. OpenAI không bình luận về việc Bob là ai; sự kiện được ghi nhận gần nhất là tên của Scott Gray trong danh sách rời đi năm 2026. Nếu OpenAI hoặc Gray xác nhận điều đó, mắt xích đầu tiên của chuỗi sẽ trở thành sự thật.

• Liệu con số "chậm gấp 2 lần" có bao giờ có cơ sở thực tế hay không. Nếu GPT-6.7 ra mắt và các phép đo tốc độ độc lập xuất hiện, con số đó không còn là tin đồn nữa — hoặc được xác nhận, hoặc bị loại bỏ. Cho đến lúc đó, nó chỉ là một con số trong một bài đăng.

• Liệu việc tạm dừng vì an toàn của Astra có làm trễ ngày ra mắt hay không. Các thị trường dự đoán đã dời GPT-6 khỏi tháng 8; việc chỉ định "quan trọng" và bài kiểm tra của chính phủ mà OpenAI cho biết họ muốn đều là những nguồn trì hoãn tự nhiên.

• Liệu kernel bench có sắp xếp lại thứ tự hay không. Nếu đội phục vụ của OpenAI hấp thụ tổn thất — hoặc truyền thuyết phóng đại phần đóng góp của một người — thì toàn bộ tin đồn trở nên vô nghĩa, và dấu hiệu đầu tiên sẽ là hiệu suất phục vụ của mô hình tiếp theo so với mô hình tiền nhiệm.

Cách đọc thẳng thắn: "Chậm gấp 2 lần" là một câu chuyện hấp dẫn và, cho đến nay, chỉ vậy thôi. Sự ra đi của chuyên gia kernel là một điểm dữ liệu thực sự với dấu vết tài liệu rõ ràng; còn con số tốc độ chỉ là một con số trong một dòng tweet. Cho đến khi GPT-6.7 ra mắt, lập trường có thể bảo vệ được là lên kế hoạch cho cả hai kịch bản — giả định rằng tin đồn có thể đúng một phần, và xây dựng hệ thống định tuyến sao cho việc kiểm thử một mẫu chủ lực chậm hơn dự kiến không tốn kém gì cho bạn. Đó chính là toàn bộ ý nghĩa của việc định tuyến một mô hình mà bạn chưa từng gặp.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube