
GPT-Rosalind vs Claude Opus 5: Chuyên gia khoa học sự sống đối đầu với mô hình flagship đa năng
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Quyết định ngày 11 tháng 9 năm 2026 đưa GPT-Rosalind — mô hình suy luận chuyên biệt cho khoa học đời sống do OpenAI xây dựng — ra khỏi bản xem trước nghiên cứu là cơ hội thực sự đầu tiên để đặt nó đối đầu trực tiếp với mô hình đa dụng tiên tiến nhất, và đối thủ tự nhiên là Claude Opus 5, mô hình chủ lực của Anthropic cho các công việc suy luận, lập trình và agentic tầm xa đòi hỏi khắt khe. GPT-Rosalind được phát hành thông qua chương trình truy cập tin cậy của OpenAI với mức giá công bố có hiệu lực từ ngày 5 tháng 10 năm 2026, trong khi Claude Opus 5 đã được cung cấp rộng rãi kể từ ngày 24 tháng 7 năm 2026 với mức $5.00/$25.00 mỗi 1 triệu token. Cả hai đều là mô hình tiên tiến, nhưng chúng được xây dựng cho những mục đích khác nhau: Rosalind cho phát hiện thuốc, genomics và lập kế hoạch thí nghiệm; Opus 5 cho toàn bộ phổ suy luận doanh nghiệp. Câu hỏi đặt ra là liệu lợi thế của một chuyên gia trong sinh học có biện minh cho việc từ bỏ bề rộng của một mô hình đa dụng hay không.
Tại sao cuộc đối đầu này lại tồn tại vào lúc này
Trong suốt năm tháng, GPT-Rosalind chỉ tồn tại sau một cổng truy cập tin cậy dành riêng cho Hoa Kỳ, phục vụ một số ít đối tác được nêu tên — Amgen, Moderna, Allen Institute, Thermo Fisher Scientific. Vào ngày 11 tháng 9 năm 2026, OpenAI thông báo mô hình này đang bước ra khỏi giai đoạn xem trước nghiên cứu và được cung cấp trên toàn cầu cho các tổ chức đủ điều kiện thông qua chương trình truy cập tin cậy, với mức tính phí 5,00 USD cho mỗi 1 triệu token đầu vào, 0,50 USD cho đầu vào được lưu đệm, và 25,00 USD cho mỗi 1 triệu token đầu ra, bắt đầu từ ngày 5 tháng 10. Mức giá này thực chất khớp với mức 5,00/25,00 USD của Claude Opus 5, khiến cho việc so sánh trở nên rõ ràng một cách bất thường: hai mô hình tiên phong có cùng mức giá token, một chuyên biệt, một tổng quát.
Rosalind được đặt tên theo Rosalind Franklin, người mà công trình nhiễu xạ tia X đã hé lộ cấu trúc của DNA. Theo OpenAI, bản thân mô hình này được xây dựng để suy luận trên các phân tử, protein, gen, con đường và sinh học liên quan đến bệnh tật, cũng như cho các quy trình nhiều bước như tổng quan tài liệu, diễn giải chuỗi-sang-chức năng, lập kế hoạch thực nghiệm và phân tích dữ liệu. Đây là bản phát hành đầu tiên trong một loạt mô hình khoa học sự sống, với một Plugin Nghiên cứu Khoa học Sự sống mã nguồn mở cho Codex, kết nối nó với hơn 50 công cụ và nguồn dữ liệu khoa học.
Bảng tỷ số
Nhận xét đầu tiên đáng nói là không có một chuẩn đánh giá công khai nào so sánh trực tiếp hai mô hình này trên cùng cơ sở. Những con số nổi bật của GPT-Rosalind là các đánh giá do nhà cung cấp và đối tác báo cáo trên các tác vụ chuyên ngành; Claude Opus 5 có điểm số độc lập từ Artificial Analysis nhưng không có đánh giá lĩnh vực sinh học nào được công bố ở mức độ chuyên sâu này. Vì vậy, bảng điểm dưới đây phân tách rõ ràng hai loại bằng chứng.
• Giá — GPT-Rosalind 5,00 USD / 25,00 USD mỗi 1 triệu token (đầu vào được cache 0,50 USD), có hiệu lực từ ngày 5 tháng 10 năm 2026. Claude Opus 5 5,00 USD / 25,00 USD mỗi 1 triệu token (đọc cache 0,50 USD, ghi cache 10,00 USD). Mức giá niêm yết giống hệt nhau.
• Truy cập — GPT-Rosalind: đơn xin quyền truy cập tin cậy, xét duyệt điều kiện, ưu tiên Hoa Kỳ nhưng nay đã mở rộng toàn cầu cho các tổ chức đủ điều kiện. Claude Opus 5: quyền truy cập API mở cho mọi tài khoản.
• Chỉ số Trí tuệ AA — Claude Opus 5: 50.7, #4 trong số 141. GPT-Rosalind: không được theo dõi (các mô hình chuyên biệt không xuất hiện trên bảng xếp hạng tổng quát).
• AA Coding — Claude Opus 5: 78.0, #2 trong số 138. GPT-Rosalind: không áp dụng — lĩnh vực của nó là lập kế hoạch phòng thí nghiệm ướt, không phải kỹ thuật phần mềm.
• Đánh giá theo lĩnh vực — GPT-Rosalind: dẫn đầu BixBench (do nhà cung cấp báo cáo), 6 trong số 11 tác vụ LABBench2 vượt GPT-5.4 (do nhà cung cấp báo cáo), +53,7% hiệu năng trên mỗi token trên GeneBench (nhà cung cấp), +18,0% trên MedChemBench, +19,6% trên LabWorkBench, +4,42% trên LifeSci Bench (tất cả đều do OpenAI báo cáo). Claude Opus 5: không có bộ đánh giá khoa học sự sống tương đương nào được công bố.
• Cửa sổ ngữ cảnh — Cả hai đều 1 triệu token. Claude Opus 5 hỗ trợ đầu vào văn bản, hình ảnh và tệp với đầu ra văn bản; GPT-Rosalind xử lý đầu vào tệp khoa học thông qua ChatGPT, Codex và API.
• Chế độ suy luận — Claude Opus 5 cung cấp khả năng suy luận thích ứng (tự động, từ thấp đến cao). GPT-Rosalind là một mô hình suy luận lấy việc sử dụng công cụ làm cốt lõi, cùng với điều khiển kiểu reasoning_effort trong API.

Những con số của Rosalind thực sự có ý nghĩa gì
Kết quả Rosalind được trích dẫn nhiều nhất đến từ Dyno Therapeutics: trên một tác vụ dự đoán trình tự RNA chưa được công bố, các kết quả sinh best-of-ten đã vượt phân vị thứ 95 của 57 chuyên gia AI-sinh học là người ở hạng mục dự đoán, và vượt khoảng phân vị thứ 84 ở hạng mục sinh trình tự. Đó là một đánh giá do đối tác thực hiện trên một tác vụ độc quyền, với việc lấy mẫu best-of-ten làm tăng chi phí và độ trễ — nó cho bạn biết mức trần của một mô hình được lấy mẫu dày đặc, chứ không phải trải nghiệm một lần gọi thông thường. Các đánh giá của chính OpenAI trên các benchmark công khai bao gồm hiệu năng dẫn đầu trên BixBench và thắng 6/11 trước GPT-5.4 trên LABBench2, với cùng lưu ý do nhà cung cấp tự báo cáo. Tuyên bố về tỷ lệ ảo giác — thấp hơn 40% so với các mô hình tổng quát nhờ tinh chỉnh tư duy phản biện — là phép đo của chính OpenAI và chưa được tái lập độc lập.
Điều mà những số liệu này thực sự chứng minh là Rosalind được tinh chỉnh dành riêng cho các cơ chế của nghiên cứu sinh học: thiết kế quy trình nhân bản, dự đoán chức năng RNA, ưu tiên mục tiêu. Đó chính xác là lĩnh vực mà Claude Opus 5 không có bằng chứng được công bố, bởi vì nó không được xây dựng cho việc đó. Do đó, việc so sánh phụ thuộc vào việc bạn đang chọn một mô hình cho công việc sinh học cụ thể hay cho toàn bộ các tác vụ suy luận.
Nơi Claude Opus 5 vượt trội

Claude Opus 5 có thành tích độc lập rộng và sâu: 50,7 trên Artificial Analysis Intelligence Index (#4 trong 141), 78,0 AA Coding (#2 trong 138), GPQA Diamond 93,2, Humanity's Last Exam 54,9, và 79,3 Long-Context Recall. Đây là mô hình có năng lực nhất của Anthropic cho kỹ thuật phần mềm end-to-end, đánh giá mã và tìm lỗi, cùng phân tích hình ảnh, được xây dựng để duy trì tính mạch lạc qua các phiên tác tử rất dài, nhiều bước với việc sử dụng công cụ nhiều. Đối với một nhóm có khối lượng công việc chính là phần mềm, quy trình phân tích hoặc suy luận doanh nghiệp tổng quát, Opus 5 là lựa chọn an toàn hơn dựa trên bằng chứng, và nó có sẵn cho bất kỳ ai có API key ngay hôm nay — không cần đánh giá trình độ.
Nơi GPT-Rosalind chiến thắng
Lợi thế của GPT-Rosalind nằm ở chiều sâu lĩnh vực: quá trình huấn luyện và tinh chỉnh của nó tập trung vào 50 quy trình sinh học mà OpenAI liệt kê — tổng hợp bằng chứng, từ chuỗi đến chức năng, thiết kế thí nghiệm, so sánh ứng viên phân tử. Với cùng mức giá trên mỗi token như Opus 5, nó mang đến một mô hình đã được tiếp xúc với lượng tài liệu chuyên biệt về sinh học phân tử, genomics và hóa học nhiều hơn hẳn, cùng plugin Life Sciences cung cấp sẵn hơn 50 công cụ và cơ sở dữ liệu. Đối với một nhà hóa dược hay một nhà nghiên cứu genomics, đó là khác biệt giữa một người đa tài xuất sắc và một chuyên gia lĩnh vực ở cùng mức chi phí token.
Câu hỏi về định tuyến

Có một vướng mắc thực tế trong cuộc đối đầu này: GPT-Rosalind vẫn chưa có mặt trên bất kỳ nền tảng định tuyến bên thứ ba nào. Việc truy cập diễn ra trực tiếp thông qua chương trình truy cập tin cậy của OpenAI. Ngược lại, Claude Opus 5 thì có sẵn trên OrcaRouter với giá niêm yết — 5,00/25,00 USD cho mỗi 1 triệu token, đúng bằng mức giá của nhà cung cấp với 0% phụ phí — thông qua một API duy nhất cùng hơn 200 mô hình khác, kèm tính năng tự động chuyển đổi dự phòng và DSL định tuyến để kết hợp các mô hình. Những nhóm vượt qua được vòng đánh giá điều kiện và nhận được khóa Rosalind vẫn có thể dùng OrcaRouter để định tuyến mọi thứ còn lại, hoặc dùng cơ chế dự phòng để nếu các lệnh gọi miền dài của Rosalind bị treo, yêu cầu sẽ được chuyển sang một mô hình đa dụng đang sẵn sàng. Đó chính là sự phân công lao động trung thực: Rosalind cho câu hỏi sinh học, một lớp định tuyến cho phần còn lại của quy trình.
Bạn nên chọn cái nào?
Nếu công việc của bạn là nghiên cứu khoa học đời sống — phát hiện đích, kỹ thuật protein, genomics, lập kế hoạch thí nghiệm — thì GPT-Rosalind là mô hình tiên tiến duy nhất được xây dựng dành riêng cho lĩnh vực đó, và với cùng mức giá token như một mô hình đa dụng, nó là lựa chọn tốt hơn cho chính công việc cụ thể ấy, sau khi tổ chức của bạn vượt qua đủ điều kiện truy cập tin cậy. Nếu công việc của bạn là bất cứ thứ gì khác — và ngay cả trong một phòng thí nghiệm công nghệ sinh học, phần lớn chi phí token vẫn nằm ở code, pipeline dữ liệu và suy luận tổng quát — thì Claude Opus 5 có thành tích benchmark độc lập, quyền truy cập API mở và hệ sinh thái định tuyến. Lợi thế của chuyên gia là có thật nhưng hẹp; độ bao phủ của mô hình đa dụng thì rộng và có thể kiểm chứng. Với hầu hết các nhóm, câu trả lời không phải là cái này hay cái kia: hãy giữ Rosalind cho những câu hỏi khám phá mà nó được huấn luyện, và định tuyến phần còn lại qua một mô hình đa dụng như Claude Opus 5 — nơi một API, không phụ phí và khả năng chuyển đổi dự phòng giúp việc chạy cả hai trở nên thực tế.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
