Một thẻ hero được tạo có tiêu đề 'Giới thiệu Astra for Law', phụ đề 'Cấu hình pháp lý của OpenAI đối với GPT-6 Astra', với dòng ngày ghi 'Astra for Law được công bố ngày 17 tháng 9 năm 2026 · GPT-6 Astra phát hành ngày 3 tháng 9 năm 2026', phía trên ba thẻ được dán nhãn 'Chỉ mục Tìm kiếm Pháp lý — 230M+ URL luật Hoa Kỳ', 'Kho ngữ liệu — CourtListener, Free Law Project' và 'API — gpt-6-astra-law, sắp ra mắt', với chân trang 'Các số liệu benchmark do nhà cung cấp báo cáo; không được tái lập độc lập.' và logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

Giới thiệu Astra for Law: OpenAI đặt chỉ mục tìm kiếm pháp lý phía sau GPT-6 Astra

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Astra for Law đã được công bố vào ngày 17 tháng 9 năm 2026 — một cấu hình dành cho công việc pháp lý được xây dựng trên GPT-6 Astra, mô hình chủ lực mà công ty phát hành hai tuần trước đó, vào ngày 3 tháng 9. Đây không phải là một mô hình mới. Nó là cùng một bộ trọng số đứng sau một cửa trước khác: một chỉ mục tìm kiếm pháp lý chuyên dụng, các hướng dẫn dành riêng cho pháp lý, và một bộ công cụ nhắm đến việc nghiên cứu án lệ Hoa Kỳ. Sự khác biệt đó quan trọng hơn so với cách định hình khi ra mắt, bởi vì mọi con số trong thông báo đều đo cấu hình này so với mô hình cơ sở thay vì một năng lực mới — và cấu hình đang đảm nhiệm gần như toàn bộ công việc.

Tuyên bố tiêu đề là Astra for Law đã vượt qua kiểm tra tính đúng đắn tổng thể trên 54,0% trong số 200 câu hỏi nghiên cứu pháp lý Hoa Kỳ được lấy từ tập xác thực riêng tư của Legal Research Bench do Vals AI cung cấp, so với 38,7% của GPT-6 Astra chỉ dùng tìm kiếm web — một mức cải thiện tương đối 40%, như OpenAI kể lại. Đây là những số liệu do nhà cung cấp báo cáo trên một tập chia riêng tư, và chưa có phòng thí nghiệm độc lập nào tái lập được chúng. Điều có thể thấy được một cách độc lập lại hữu ích hơn: bảng so sánh công khai của chính Vals AI liệt kê GPT-6 Astra ở mức 39,42% ±3,40 trên chuẩn đánh giá đó, về cơ bản là mốc cơ sở mà OpenAI đang đo lường so với. Khoảng cách đến từ chỉ mục tìm kiếm pháp lý và các hướng dẫn, chứ không phải từ việc mô hình đã trở thành một luật sư giỏi hơn.

Đây là những gì đã phát hành, những gì đã thực sự được đo lường, và những gì vẫn còn thiếu.

Astra for Law thực sự là gì

Ba thứ đã được bổ sung thêm vào GPT-6 Astra, và không thứ nào trong số đó là thay đổi trọng số. Trong một buổi thông tin cho báo chí, Jason Boehmig — đồng sáng lập Ironclad được OpenAI tuyển dụng vào tháng 6 năm 2026 — và kỹ sư Sherwin Wu đã mô tả bản phát hành này là một cấu hình gồm các chỉ dẫn theo lĩnh vực, những thiết lập như độ dài phản hồi, và bộ công cụ cho ngành luật, vốn dự kiến sẽ mở rộng theo thời gian.

Legal Search Index — một lớp truy xuất trên án lệ, luật, quy định, quy tắc tòa án và quyết định hành chính của Hoa Kỳ, bao trùm hơn 230 triệu URL, với các nguồn được bổ sung hàng ngày.

Xuất xứ kho ngữ liệu — chỉ mục này sử dụng dữ liệu từ CourtListener, thư viện do tổ chức phi lợi nhuận Free Law Project duy trì, mà theo OpenAI thì bao phủ hơn 99,9% án lệ tiền lệ đã được công bố của Hoa Kỳ. Nó bổ sung cho nội dung được cấp phép từ các nhà cung cấp bao gồm Thomson Reuters.

Hướng dẫn pháp lý — một tập hợp các hướng dẫn theo lĩnh vực để áp dụng nghiên cứu vào các tình tiết, phát triển lập luận hoặc điều khoản giao dịch, và làm nổi bật những điểm yếu hoặc sự không chắc chắn trong một lập trường.

A generated single-column scoreboard titled 'Astra for Law — the scoreboard' with six rows reading 'Underlying model: GPT-6 Astra', 'Legal Search Index: 230M+ U.S. law URLs', 'Corpus: CourtListener, 99.9% of precedential case law', 'Availability: Trusted Access, Am Law 200 only', 'API model id: gpt-6-astra-law, not yet open' and 'Headline benchmark: 54.0% vs 38.7% vendor-reported', above the footer 'All figures OpenAI-reported on a private validation set; no independent reproduction.' with the OrcaRouter logo composited in the bottom-right corner.

Phần trình diễn trong buổi giới thiệu mang tính cụ thể chứ không trừu tượng: Wu đã soạn một kiến nghị bác bỏ đơn kiện cho một bệnh viện đang đối mặt với khiếu nại về phân biệt đối xử vì khuyết tật và trả đũa, xử lý một thách thức của cổ đông đối với thương vụ bán tài sản trong dịp cuối tuần lễ, và giải quyết một tranh chấp về cam kết bán hàng. Không điều nào trong số đó là năng lực mới đối với một mô hình tiên tiến. Điểm mới là phần truy xuất của công việc không còn đi qua tìm kiếm web thông thường nữa.

Bài kiểm chuẩn, hãy đọc kỹ

Bốn con số xuất hiện từ buổi ra mắt, tất cả đều được gán cho OpenAI, tất cả đều trên cùng một tập xác thực riêng tư, và tất cả đều đáng được tách biệt khỏi nhau:

Độ chính xác tổng thể — 54,0% đối với Astra for Law so với 38,7% đối với GPT-6 Astra khi tìm kiếm web, ở mức nỗ lực suy luận cao nhất.

Các án lệ tham chiếu được tìm thấy — nhiều hơn 24% ở các câu hỏi tập trung vào án lệ, một lần nữa ở mức nỗ lực suy luận cao nhất.

Các đoạn liên quan đã được truy xuất — nhiều hơn tới 54% từ các bản án đúng, với cùng mức độ suy luận như baseline.

Độ dài câu trả lời — trung bình dài gấp khoảng hai lần trên các cài đặt suy luận được kiểm thử.

Con số cuối cùng đó là con số cần đặt cạnh con số đầu tiên. Một phép kiểm tra tính đúng đắn tổng thể thưởng cho độ bao phủ sẽ dễ đạt hơn với một câu trả lời dài hơn, và một phần trong mức tăng 15,3 điểm có khả năng là do lớp truy xuất chỉ đơn giản đưa nhiều tài liệu hơn ra trước mô hình. Đây không phải là lời chỉ trích kết quả — việc tìm thấy nhiều hơn 24% ca tham chiếu là một cải thiện thực sự, được nêu riêng — nhưng điều đó có nghĩa là con số tổng hợp và các con số truy xuất nên được đọc cùng nhau thay vì chỉ đọc con số tổng hợp.

Vấn đề private-split mới là vấn đề lớn hơn. Một tập validation mà OpenAI nắm giữ và không công bố thì không ai có thể chạy lại được, và bảng xếp hạng công khai của cùng benchmark đó lại kể một câu chuyện kém ấn tượng hơn: trang so sánh của chính Vals AI liệt kê GPT-6 Astra ở mức 39,42% ±3,40 trên Legal Research Bench, còn Gemini 3.8 Flash ở mức 38,94% ±3,39. Bất cứ điều gì tạo ra cú nhảy lên 54,0% đều không hiển thị trên bảng công khai, vì bảng công khai đang chấm điểm mô hình cơ sở mà không gắn chỉ mục pháp lý.

A screenshot of the Vals AI 'Compare Models' leaderboard captured September 18, 2026, comparing Gemini 3.8 Flash and GPT-6 Astra: Legal Research Bench (Agentic US legal research) shows Gemini 3.8 Flash 38.94% ±3.39 against GPT-6 Astra 39.42% ±3.40; Vals Index shows 62.25% against 66.61%; and the table also lists Finance Agent (V2) 61.44% vs 53.54%, Tax Agent Bench 66.77% vs 63.34%, MedCode 48.13% vs 48.49%, Terminal-Bench Science 8.57% vs 65.71%, Code Migration 36.55% vs 67.74%, Terminal-Bench 4.0 13.13% vs 57.07% and Vibe Code Bench v1.1 78.65% vs 89.59%, with a Vals Index date of 2026-09-11.

Bản đối chiếu Legora, và con số bên trong nó

Bằng chứng bên thứ ba có giá trị nhất trong các bài đưa tin về màn ra mắt là một bài kiểm thử quy trình làm việc từ Legora, khi kỹ sư pháp lý Percevale Perks của công ty này đã chạy một phép đối chiếu báo cáo tài chính — khớp các số liệu trong bản thảo tài khoản với bảng cân đối số phát sinh, một bảng hợp nhất và tài khoản của năm trước. Tác nhân của Legora đã hoàn thành phép đối chiếu trên 41 tài liệu chỉ trong một lần chạy, mất vài phút, ghi lại từng bước kiểm tra và tạo ra một bản ghi theo từng dòng để xem xét. Nó đã phát hiện cả bốn lỗi mà Legora đã cài vào tài khoản, bao gồm một khoản chênh lệch 500.000 bảng Anh ẩn trong phần thuyết minh doanh thu, giữ lại mọi bước kiểm tra mà mô hình trước đó đã vượt qua, và bổ sung thêm khoảng năm mươi bước nữa.

Đó là một kết quả thực sự tốt trên một bộ tài liệu thực sự khó. Đây cũng là nơi con số hữu ích nhất trong toàn bộ chu kỳ ra mắt bị chôn vùi. Trên Legora's Benchmark for Agentic Reasoning, vốn bao quát các tác vụ pháp lý thực tế từ đầu đến cuối, mức cải thiện trên quy trình báo cáo tài chính là khoảng 40% — và mức cải thiện trung bình trên tất cả các tác vụ BAR là khoảng 3%. Cả hai con số đều là của Legora, cả hai đều mô tả cùng một mô hình, và chỉ một trong số chúng được lan truyền. Nếu bạn đang đánh giá điều này cho một công ty luật, thì 3% là con số để lập kế hoạch dựa trên đó còn 40% là con số để hy vọng.

Kiểm thử độc lập chỉ ra một kiểu lỗi khác

Hai đánh giá độc lập đáng được đặt bên cạnh các con số ra mắt, với lưu ý rằng cả hai đều có quy mô nhỏ và chỉ đến từ một nguồn duy nhất.

HAQQ đã chạy GPT-6 Astra với 41 câu hỏi pháp lý thực tế thuộc 20 lĩnh vực hành nghề ở mức suy luận trung bình. Astra dẫn đầu về nội dung pháp lý với 17,63/20 — hơn chưa đến một điểm. Nó tốn 0,2622 đô la mỗi câu trả lời, gấp khoảng mười một lần chi phí mỗi câu trả lời của GPT-5.6 Luna Pro để đổi lấy mức tăng tổng hợp chưa đến một điểm. Đánh giá của chính HAQQ rất sắc sảo: lợi thế không nằm ở chỗ mô hình thông minh hơn, mà ở chỗ nó ngừng viết. Cùng phép thử đó cho thấy rằng việc chuyển mức nỗ lực suy luận từ thấp lên cao đã nhân chi phí lên khoảng 1,5× và độ trễ lên khoảng 1,8×, đồng thời làm giảm chất lượng được đánh giá 0,17 điểm — một đòn bẩy chi phí được ngụy trang thành đòn bẩy chất lượng, và là lý do để cố định thiết lập mức nỗ lực thay vì để nó ở mức tối đa.

Phát hiện đáng được lan truyền xa nhất không phải là về chi phí. Ở các khu vực tài phán ngoài Hoa Kỳ, cả ba mô hình được thử nghiệm đều trích dẫn đúng điều khoản nhưng lại trình bày sai nội dung của điều khoản đó. Astra đúng về mặt pháp lý ở 66,7% các mục đó; Claude Opus 5 đúng 100%. Một công cụ kiểm tra trích dẫn sẽ cho câu trả lời đó là đạt, vì trích dẫn tồn tại và là trích dẫn đúng. Khách hàng thì không. Đây là kiểu thất bại mà chỉ mục tìm kiếm pháp lý ít có khả năng xử lý nhất, vì chỉ mục này chỉ dành cho Hoa Kỳ và lỗi nằm ở việc đọc hiểu, không phải ở việc truy xuất.

Những gì bạn thực sự có thể nhận được, và khi nào

Astra for Law chưa được cung cấp rộng rãi. Quyền truy cập bắt đầu thông qua một chương trình Trusted Access mới nhắm đến các công ty thuộc Am Law 200, được cung cấp qua ChatGPT và Codex. API được mô tả là sẽ sớm ra mắt dưới mã mô hình gpt-6-astra-law, xuất hiện trong trình chọn mô hình với tên "GPT-6 Astra Law"; Harvey và Legora được nêu tên là khách hàng API sẽ xây dựng dựa trên nó. Chưa có mức giá cho cấu hình pháp lý này được công bố, đây là câu hỏi mở lớn nhất đối với bất kỳ ai đang lập ngân sách dựa trên nó.

Trusted Access mang hai điều khoản dữ liệu: Zero Data Retention trên API, và việc mặc định loại trừ hoạt động sử dụng ChatGPT Enterprise khỏi đánh giá của con người. Khi được hỏi trong buổi họp giao ban về các ngoại lệ, Boehmig không khẳng định chính sách này là tuyệt đối: “Nó chắc chắn phức tạp hơn một câu đó,” ông nói, lưu ý rằng toàn bộ thỏa thuận dài khoảng 30 trang, và nói thêm rằng OpenAI tin tưởng 30 trang đó đáp ứng nhu cầu. OpenAI cho biết đang làm việc với Latham & Watkins về quyền truy cập thông tin, rào chắn đạo đức, chỉ thị của khách hàng và giám sát của công ty luật.

Phần hệ sinh thái lớn hơn phần mô hình: 26 plugin nhà cung cấp, bao gồm Thomson Reuters, Harvey, Legora, iManage, Relativity, Clio, Intapp và DeepJudge; chín plugin cộng đồng từ các nhóm kỹ thuật pháp lý; và 47 kỹ năng tùy chỉnh do những người dùng pháp lý chuyên sâu xây dựng. ChatGPT for Word cũng đã đạt trạng thái sẵn sàng chung cho việc hiệu đính, đề xuất chỉnh sửa và đánh dấu định dạng. Các kỹ sư triển khai tiền tuyến của OpenAI đã làm việc với Sullivan & Cromwell về một công cụ phân tích thỏa thuận, Ropes & Gray về thẩm định M&A, và Cooley về GO Public.

Để hiểu lĩnh vực này hiện nay đông đúc đến mức nào: Anthropic đã ra mắt Claude for Legal vào tháng 5 năm 2026, ba tháng trước khi Astra for Law ra đời.

Những rủi ro mà không chuẩn đối sánh nào trên trang đó nắm bắt được

Không có nội dung nào trong tài liệu ra mắt đề cập đến hai câu hỏi quản trị mà tổng cố vấn pháp lý của một công ty sẽ hỏi đầu tiên. Tính đến tháng 9 năm 2026, chưa có chứng nhận SOC 2, ISO hay HIPAA nào được công bố cho GPT-6 Astra, và không có chi tiết nào được công bố về việc tách riêng dữ liệu theo từng công ty, triển khai cục bộ hoặc lưu trú dữ liệu. Sự thiếu vắng đó không phải là bằng chứng của thất bại — nó chỉ đơn thuần là chưa được tài liệu hóa, đây là một vấn đề khác, và là vấn đề mà công ty phải giải quyết trước khi tài liệu thuộc diện đặc quyền được đưa vào.

Về khía cạnh đạo đức, các quy tắc điều chỉnh chính là Quy tắc mẫu ABA 1.6 về bảo mật, quy định những gì một công ty luật được phép chia sẻ với nhà cung cấp bên thứ ba và có thể yêu cầu cập nhật thông tin công bố cũng như sự đồng ý sau khi được thông tin đầy đủ, và Quy tắc 5.3 về giám sát sự hỗ trợ của người không phải luật sư, đây là lĩnh vực mà đầu ra của AI thuộc vào. Lý do cả hai đều mang tính thực tiễn chứ không chỉ là lý thuyết là Mata v. Avianca, nơi các luật sư bị xử phạt vì nộp các vụ án không tồn tại do AI tạo ra. Một chỉ mục tìm kiếm pháp lý trên các phán quyết thật khiến lỗi cụ thể đó ít có khả năng xảy ra hơn. Điều đó không làm cho nó trở nên bất khả thi, và cũng không giải quyết được gì đối với lỗi đọc sai điều khoản mà HAQQ đã ghi nhận.

Nếu bạn muốn phát triển dựa trên điều này trước khi API mở

Cách nói trung thực nhất hiện nay là gpt-6-astra-law không có trong API của bất kỳ ai, kể cả của chúng tôi — OpenAI đã nói sẽ sớm ra mắt và không nêu ngày cụ thể. Điều đang hoạt động là mô hình cơ sở: openai/gpt-6-astra nằm trên OrcaRouter với mức tăng giá 0%, nghĩa là giá niêm yết từ nhà cung cấp OpenAI được chuyển nguyên vẹn, nên thay đổi giá từ nhà cung cấp đối với mô hình đó được phản ánh ngay trong cùng ngày. Một khóa truy cập được hơn 200 mô hình, với tính năng chuyển đổi dự phòng tự động giữa các nhà cung cấp và DSL định tuyến để kết hợp nhiều mô hình vào một lệnh gọi duy nhất.

A screenshot of OpenAI's developer documentation page for GPT-6 Astra, captured September 18, 2026, showing the model badge labelled 'Default' with the line 'Our most capable model, built for the hardest end-to-end work', a 1,050,000 context window, 128,000 max output tokens, an Apr 30 2026 knowledge cutoff, reasoning token support, and the pricing card reading Input $10.00, Cached input $1.00, Cache writes $12.50, Output $50.00 per 1M tokens, with the notes that prompts with more than 272K input tokens are priced at 2x input and cache rates and 1.5x output for the full request, that cache writes are billed at 1.25x the uncached input token rate, and that Batch and Flex are priced at 50% of Standard rates while Fast mode is priced at 2x.

Hệ quả thực tiễn đối với một nhóm kỹ thuật pháp lý là sự phân tách. Mọi thứ trong quy trình Astra for Law mà không phụ thuộc vào Legal Search Index — soạn thảo từ những dữ kiện bạn cung cấp, tái cấu trúc một bộ điều khoản, định dạng theo mẫu của công ty luật, tạo danh sách kiểm tra rà soát — bạn có thể tạo nguyên mẫu ngay hôm nay trên GPT-6 Astra cơ sở, và đổi model id khi biến thể dành cho luật mở ra mà không cần thay đổi tích hợp của bạn. Mọi thứ phụ thuộc vào index thì bạn không thể tạo nguyên mẫu, vì index là phần chưa được mở bán. Hai lưu ý đáng nói thẳng: một yêu cầu được định tuyến không tự động được bao phủ bởi phê duyệt Zero Data Retention của OpenAI, vốn được cấp theo từng tổ chức, nên một công ty luật cần ZDR nên xác nhận phạm vi bao phủ trên tuyến cụ thể mà mình dùng; và bộ định tuyến là một chặng thêm trong đường đi của dữ liệu, một chi phí thực sự đối với tài liệu đặc quyền ngay cả khi nó mang lại cho bạn khả năng chuyển đổi dự phòng.

Xem gì

Ba điều, theo thứ tự mức độ chúng sẽ thay đổi cục diện. Ngày API cho gpt-6-astra-law, vì đó là khác biệt giữa một bản thí điểm và một sản phẩm. Giá, vì mức 10 USD mỗi triệu token đầu vào và 50 USD mỗi triệu token đầu ra của mô hình cơ sở đi kèm việc tái định giá cho ngữ cảnh dài trên 272.000 token đầu vào — mức mà các bộ tài liệu pháp lý sẽ thường xuyên vượt qua — và nếu cấu hình pháp lý được định giá cao hơn mức đó, thì kinh tế học của một cuộc đối chiếu 41 tài liệu sẽ thay đổi đáng kể. Và một lần chạy lại độc lập 200 câu hỏi đó trên một tập chia do người khác kiểm soát. Cho đến khi điều đó tồn tại, 54,0% là con số của OpenAI về cấu hình của OpenAI, và tuyên bố có thể bảo vệ được là tuyên bố hẹp hơn: một chỉ mục án lệ Hoa Kỳ cộng với hướng dẫn pháp lý tạo ra khả năng truy xuất tốt hơn đáng kể so với tìm kiếm web thông thường trên các câu hỏi nghiên cứu pháp lý Hoa Kỳ. Tuyên bố đó đáng để hành động. Phần còn lại đáng để chờ đợi.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày