Một thẻ hero được tạo với tiêu đề 'Astra for Law vs GPT-6 Astra', phụ đề 'Cùng trọng số — một bên bổ sung chỉ mục tìm kiếm pháp lý', cùng dòng ngày ghi 'Astra for Law công bố ngày 17 tháng 9 năm 2026 · GPT-6 Astra phát hành ngày 3 tháng 9 năm 2026', phía trên hai thẻ: bên trái 'Astra for Law — chỉ mục pháp lý + hướng dẫn, không tiết lộ giá' và bên phải 'GPT-6 Astra — tìm kiếm web, 10 USD vào / 50 USD ra mỗi 1 triệu', với chân trang 'Số liệu của nhà cung cấp chưa được tái lập; điểm bảng công khai của GPT-6 Astra theo Vals AI.' và logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Astra for Law so với GPT-6 Astra: Cùng trọng số, chỉ thêm một chỉ mục tìm kiếm

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Astra for LawGPT-6 Astra không phải là hai mô hình, và việc đặt lựa chọn này dưới dạng đối đầu trực tiếp là điều đầu tiên cần làm đúng. Astra for Law là GPT-6 Astra với một chỉ mục tra cứu pháp lý Hoa Kỳ được gắn vào đường truy xuất của nó, một bộ hướng dẫn soạn thảo pháp lý được xếp thêm lên trên, và các công cụ pháp lý đi kèm. Trọng số là giống hệt nhau. Vậy nên câu hỏi thực sự không phải là mô hình nào thông minh hơn — mà là liệu chỉ mục tra cứu pháp lý có đáng để trả thêm phí hay không, và dựa trên bằng chứng hiện có đến nay, câu trả lời gần như phụ thuộc hoàn toàn vào việc công việc của bạn là tra cứu án lệ hay soát xét tài liệu.

Điều đó quan trọng vì OpenAI chưa công bố giá cho cấu hình pháp lý, API dành cho nó chưa được mở, và phép đo đối đầu trực tiếp duy nhất so với mô hình cơ sở đến từ chính OpenAI trên một tập xác thực riêng. Trang này đi sâu vào những gì thực sự được biết, các con số độc lập nói gì, và một khối lượng công việc pháp lý nhất định thuộc về phía nào trong so sánh.

Chính xác thì điều gì phân biệt chúng

Ba thứ đã được thêm vào, và chúng không có cùng độ khó để tái tạo.

Chỉ mục Tìm kiếm Pháp lý — truy xuất trên án lệ Hoa Kỳ, luật thành văn, quy định, quy tắc tòa án và các quyết định hành chính, hơn 230 triệu URL, nguồn được bổ sung hằng ngày. Đây là phần bạn không thể xây dựng chỉ từ một câu lệnh.

Corpus — được xây dựng trên CourtListener, thư viện của Free Law Project bao quát hơn 99,9% án lệ có giá trị tiền lệ đã được công bố của Hoa Kỳ, được bổ sung bằng nội dung được cấp phép từ các nhà cung cấp, bao gồm Thomson Reuters. Phần công khai là miễn phí; phần được cấp phép và bản cập nhật hằng ngày không phải là thứ mà một công ty luật đơn lẻ có thể tái tạo.

Hướng dẫn và cài đặt — các hướng dẫn phân tích pháp lý và soạn thảo pháp lý, cùng với các cài đặt như độ dài phản hồi. Đây là những yếu tố ở cấp độ prompt và cấp độ cấu hình. Một đội ngũ kỹ thuật pháp lý có năng lực có thể ước lượng được một phần đáng kể trong số đó so với mô hình cơ sở ngay hôm nay.

A generated two-column scoreboard titled 'Astra for Law vs GPT-6 Astra — the scoreboard'. Left column 'Astra for Law' rows: 'Retrieval: Legal Search Index, 230M+ URLs', 'Instructions: legal-specific', 'Headline score: 54.0% vendor-reported', 'Availability: Trusted Access, Am Law 200', 'API model id: gpt-6-astra-law, coming soon', 'Price: not disclosed'. Right column 'GPT-6 Astra' rows: 'Retrieval: general web search', 'Instructions: general', 'Public board score: 39.42% on Vals AI', 'Availability: generally available now', 'API model id: gpt-6-astra', 'Price: $10.00 in / $50.00 out per 1M'. Footer reads 'Astra for Law figures OpenAI-reported on a private split; GPT-6 Astra public board figure per Vals AI.', with the OrcaRouter logo composited in the bottom-right corner.

Chỉ riêng trên GPT-6 Astra, việc truy xuất diễn ra thông qua tìm kiếm web thông thường. Đó là toàn bộ khác biệt trong đường hướng nghiên cứu, và đó là trục mà mọi con số bên dưới đang đo lường.

Cuộc đối đầu trực tiếp duy nhất tồn tại

OpenAI đã kiểm thử cả hai bên trên 200 câu hỏi nghiên cứu pháp lý của Hoa Kỳ từ tập xác thực riêng tư của Vals AI's Legal Research Bench. Ở mức nỗ lực suy luận cao nhất, Astra for Law đã vượt qua kiểm tra tính đúng đắn tổng thể trên 54,0% câu hỏi, so với 38,7% của GPT-6 Astra có tìm kiếm web — 15,3 điểm, được mô tả là mức cải thiện tương đối 40%. Các số liệu hỗ trợ từ cùng lần chạy: tìm được nhiều hơn 24% án lệ tham chiếu trong các câu hỏi về án lệ, truy xuất được nhiều hơn tối đa 54% đoạn trích liên quan từ các bản án đúng của tòa án ở cùng mức nỗ lực suy luận, và các câu trả lời có độ dài trung bình gấp khoảng hai lần.

Ba lưu ý cần được đặt bên cạnh những con số đó, và không lưu ý nào trong số đó là lý do để gạt bỏ chúng. Thứ nhất, chúng là của OpenAI, trên một tập dữ liệu chia mà OpenAI nắm giữ, và chưa có bên độc lập nào tái lập được chúng. Thứ hai, độ dài câu trả lời tăng gấp đôi đáng được đặt cạnh điểm tổng hợp, bởi vì một phép kiểm tra tính đúng đắn thưởng cho độ bao phủ thì dễ vượt qua hơn với một câu trả lời dài hơn — các số liệu truy xuất (nhiều hơn 24% trường hợp, nhiều hơn 54% đoạn trích) là bằng chứng rõ ràng hơn về những gì chỉ mục thực sự bổ sung. Thứ ba, phiên bản công khai của cùng bộ đánh giá đó không cho thấy bước nhảy vọt: trang so sánh của chính Vals AI liệt kê GPT-6 Astra ở 39,42% ±3,40 trên Legal Research Bench, còn Gemini 3.8 Flash ở 38,94% ±3,39. Đó là mô hình cơ sở, không có chỉ mục, về cơ bản nằm đúng ở vị trí mà đường cơ sở của OpenAI đang ở.

A screenshot of the Vals AI 'Compare Models' leaderboard captured September 18, 2026, comparing Gemini 3.8 Flash and GPT-6 Astra: Legal Research Bench (Agentic US legal research) shows Gemini 3.8 Flash 38.94% ±3.39 against GPT-6 Astra 39.42% ±3.40; Vals Index shows 62.25% against 66.61%; and the table also lists Finance Agent (V2) 61.44% vs 53.54%, Tax Agent Bench 66.77% vs 63.34%, MedCode 48.13% vs 48.49%, Terminal-Bench Science 8.57% vs 65.71%, Code Migration 36.55% vs 67.74%, Terminal-Bench 4.0 13.13% vs 57.07% and Vibe Code Bench v1.1 78.65% vs 89.59%, with a Vals Index date of 2026-09-11.

Hai cách đọc độc lập càng làm bức tranh thêm phức tạp. Legora đã chạy đối chiếu khớp báo cáo tài chính qua 41 tài liệu trong một lượt và tìm thấy cả bốn lỗi được cài sẵn, bao gồm khoản chênh lệch £500.000 trong thuyết minh doanh thu, đồng thời bổ sung khoảng năm mươi mục kiểm tra mà mô hình trước đó đã bỏ sót — cải thiện khoảng 40% trên quy trình đó. Tuy nhiên, trên Benchmark for Agentic Reasoning của Legora nói chung, mức cải thiện trung bình trên tất cả các tác vụ chỉ khoảng 3%. Trong khi đó, bài kiểm tra 41 câu hỏi của HAQQ trên 20 lĩnh vực hành nghề đặt mức dẫn đầu về nội dung pháp lý của Astra ở 17,63 trên 20, chưa đầy một điểm so với các mô hình rẻ hơn, với chi phí $0,2622 mỗi câu trả lời. Khi đọc cùng nhau, tóm tắt trung thực là: lợi thế của cấu hình này là lớn và có thể lặp lại trên công việc án lệ Hoa Kỳ nặng về truy xuất, còn mỏng trong lý luận pháp lý tổng quát, và phần lớn chưa được kiểm chứng đối với luật ngoài Hoa Kỳ — nơi cùng bài kiểm tra đó cho thấy cả ba mô hình đều trích dẫn đúng điều khoản nhưng lại trình bày sai nội dung của điều khoản.

Astra for Law không có mức giá được công bố. Bảng giá của GPT-6 Astra là công khai, và đó là con số mà việc so sánh phải dựa trên, bởi vì cấu hình pháp lý chính là cùng mô hình đó cộng thêm truy xuất và không thể hợp lý nếu có chi phí thấp hơn mô hình mà nó bao bọc.

Tiêu chuẩn — $10.00 cho mỗi triệu token đầu vào, $50.00 cho mỗi triệu token đầu ra.

Đầu vào được lưu trong bộ nhớ đệm — $1.00 mỗi triệu, mức giảm giá 90%, và là đòn bẩy quan trọng nhất đối với một công ty đang tái sử dụng các chỉ dẫn thường trực và văn bản mẫu tiền lệ.

Ghi vào bộ nhớ đệm — 12,50 USD mỗi triệu, tính phí bằng 1,25× mức giá đầu vào không dùng bộ nhớ đệm; bộ nhớ đệm mang lại lợi ích từ lần tái sử dụng thứ hai trở đi.

Trên 272.000 token đầu vào — mức gấp 2× đối với đầu vào và bộ nhớ đệm, gấp 1,5× đối với đầu ra, được áp dụng cho toàn bộ yêu cầu, chứ không chỉ các token vượt ngưỡng. Trên thực tế, điều đó có nghĩa là 20,00 đô la cho đầu vào và 75,00 đô la cho đầu ra trên mỗi triệu token đối với bất kỳ yêu cầu dài nào.

Theo lô — 50% so với Tiêu chuẩn. Chế độ nhanh — gấp 2 lần Tiêu chuẩn, và không khả dụng đối với GPT-6 Astra có lưu trú dữ liệu tại EU.

Ngưỡng 272K đó không phải là một chú thích nhỏ cho so sánh này; nó chính là trọng tâm của so sánh này. Một bản đối chiếu gồm 41 tài liệu, một bộ biên bản lời khai đầy đủ, hay một hồ sơ giao dịch kéo dài nhiều năm thường xuyên vượt qua 272.000 token, nghĩa là mức giá pháp lý thực tế là dòng ngữ cảnh dài — 20,00 USD đầu vào và 75,00 USD đầu ra — chứ không phải mức $10/$50 được quảng cáo. Đối với một công ty luật đang xác định quy mô cho một dự án thí điểm, sự khác biệt giữa hai dòng đó là sự khác biệt giữa một dự án phù hợp với ngân sách và một dự án không phù hợp, và đó là lý do để đo khối lượng token thực tế theo từng vụ việc trước khi cam kết, chứ không phải sau đó.

Hai ghi chú chi phí nữa từ kiểm thử độc lập. HAQQ được đo là $0.2622 mỗi câu trả lời trên Astra, khoảng gấp mười một lần chi phí mỗi câu trả lời của GPT-5.6 Luna Pro để đổi lấy chưa đầy một điểm lợi ích tổng hợp — nhưng cũng lưu ý rằng khoảng cách một phần là do Astra viết ít hơn khoảng 3.5× token so với Claude Opus 5, khiến nó rẻ hơn mỗi câu trả lời so với Opus 5 cho khối lượng công việc đó. Và chính kiểm thử đó phát hiện rằng nút điều chỉnh nỗ lực suy luận hoạt động như một đòn bẩy chi phí hơn là đòn bẩy chất lượng: từ thấp đến cao làm chi phí tăng khoảng 1.5× và độ trễ tăng khoảng 1.8× trong khi chất lượng được đánh giá giảm 0.17 điểm. Hãy ghim cố định cài đặt nỗ lực; đừng để nó ở mức tối đa theo mặc định.

Khi mẫu cơ bản là lựa chọn đáng mua hơn

Lập luận chỉ riêng cho GPT-6 Astra đã mạnh mẽ hơn những gì cách định hình khi ra mắt hàm ý, và nó dựa trên ba quan sát.

• Công việc của bạn không phải là tra cứu án lệ Hoa Kỳ. Chỉ mục này chỉ dành riêng cho Hoa Kỳ. Đối với việc soạn thảo hợp đồng, tái cấu trúc điều khoản, tiếp nhận hồ sơ, xây dựng dòng thời gian, hoặc tóm tắt các tài liệu bạn đã có sẵn trong tay, thứ mà Astra for Law bổ sung gần như không mang lại tác dụng gì.

• Bạn vốn đã trả tiền cho hoạt động nghiên cứu pháp lý sơ cấp. Một công ty luật có đăng ký Westlaw hoặc LexisNexis đang mua cùng một phạm vi án lệ hai lần nếu công ty đó cũng trả thêm phí cho một lớp truy xuất mà mình không thể kiểm toán.

• Bạn muốn đường truy xuất do chính mình kiểm soát. Việc nạp một tập tài liệu đã được tuyển chọn vào GPT-6 Astra cơ sở mang lại cho bạn nguồn gốc trích dẫn mà bạn có thể kiểm tra, cùng với việc không phụ thuộc vào mỗi lần nhà cung cấp làm mới chỉ mục.

Có bằng chứng từ bên thứ ba cho thấy mô hình nền tảng không phải là mắt xích yếu. Trên bảng xếp hạng APEX-Agents dành cho luật sư doanh nghiệp của Mercor, một cấu hình GPT-6 Astra đạt 73,4% Pass@1 trên 160 tác vụ — một kết quả từ bên thứ ba trên khối lượng công việc tác tử pháp lý, song hành cùng mức tăng trung bình 3% mà Legora đo được trên bộ đánh giá của chính mình. Cả hai con số đều không liên quan đến chỉ mục tìm kiếm, và cả hai đều cho thấy mô hình cốt lõi đã đang đảm nhận phần lớn công việc pháp lý.

Khi cấu hình xứng đáng với mức giá cao cấp

Lập luận ủng hộ Astra for Law hẹp hơn và, ở những nơi nó áp dụng, lại mang tính quyết định. Nếu khối lượng công việc của bạn là tìm và áp dụng các nguồn thẩm quyền pháp lý Hoa Kỳ — xây dựng danh mục án lệ cho một bản luận cứ, kiểm tra liệu một lập trường có đứng vững trước một chuỗi phán quyết hay không, thực hiện khảo sát quy định trên 50 bang — thì việc có thêm 24% án lệ tham chiếu và tối đa 54% đoạn trích liên quan không phải là một cải thiện nhỏ, mà là sự khác biệt giữa một trợ lý bỏ sót nguồn thẩm quyền và một trợ lý không bỏ sót. Phép đối chiếu tie-out của Legora là minh họa tốt nhất hiện có về hiệu ứng tương tự trên tài liệu thay vì án lệ: việc đối chiếu chéo 41 tệp trong một lượt đúng là kiểu công việc so sánh khối lượng lớn, ngữ cảnh dài, nơi ngữ cảnh truy xuất được nhiều hơn sẽ tạo hiệu ứng cộng dồn.

Lưu ý thẳng thắn về cả hai: giá chưa được công bố, quyền truy cập bị giới hạn cho các công ty thuộc Am Law 200 thông qua chương trình Trusted Access, và chưa có phòng thí nghiệm độc lập nào chạy lại cuộc so sánh trực tiếp. Bạn đang được yêu cầu cam kết trả mức phí cao hơn chỉ dựa trên chuẩn đối sánh của nhà cung cấp và một bài kiểm tra quy trình làm việc của một đối tác.

Chạy cả hai qua một endpoint

Câu hỏi về định tuyến ở đây là một bài toán về thứ tự triển khai chứ không phải một sự lựa chọn. gpt-6-astra-law hiện chưa có mặt trên bất kỳ API nào, kể cả của chúng tôi — OpenAI nói sẽ sớm ra mắt và không nêu ngày cụ thể — nên hôm nay phần duy nhất của so sánh này mà bạn thực sự có thể gọi được chính là mô hình cơ sở. Thứ hiện có là openai/gpt-6-astra trên OrcaRouter với 0% phụ phí, giá niêm yết của nhà cung cấp được giữ nguyên, nên mức $10/$50 và $20/$75 ở trên chính là số tiền bạn phải trả và thay đổi giá từ nhà cung cấp sẽ được áp dụng ngay trong cùng ngày. Hơn 200 mô hình nằm sau một khóa duy nhất, với tính năng tự động chuyển đổi dự phòng giữa các nhà cung cấp.

A screenshot of the OrcaRouter catalogue page for GPT-6 Astra, captured September 18, 2026, showing the listing openai/gpt-6-astra from provider OpenAI with a 1M token context, 128K max output, input of text + image + file with text output, p50 time to first token of 6.01 s and p95 of 10.00 s, $10.00 input and $50.00 output per 1M tokens, 162.0M tokens of routed traffic over seven days, and an OpenAI-compatible Python sample using base_url https://api.orcarouter.ai/v1.

DSL định tuyến là phần ánh xạ trực tiếp tới quyết định cụ thể này. Vì chênh lệch giữa hai sản phẩm là một bước truy xuất, bạn có thể tự tổ hợp nó — định tuyến mô hình cơ sở bằng truy xuất tài liệu của riêng bạn trong một lần gọi và so sánh đầu ra với cùng câu hỏi chỉ được gửi kèm tìm kiếm web. Đó là một cách rẻ để đo xem corpus của riêng bạn tái tạo được bao nhiêu phần trong khoảng cách 54,0% so với 38,7%, trước khi bạn cam kết dùng một sản phẩm cao cấp bị giới hạn. Hợp nhất mô hình, vốn chạy một hội đồng mô hình trên cùng một prompt, bao quát nửa còn lại: nếu lo ngại của bạn là một mô hình đơn lẻ đọc sai một điều khoản, như HAQQ đã phát hiện với luật ngoài Hoa Kỳ, thì một hội đồng sẽ làm lộ ra bất đồng thay vì che giấu nó. Vì định tuyến giữ cả hai bên trên một khóa, việc chuyển model id khi gpt-6-astra-law mở ra là thay đổi cấu hình, không phải tích hợp lại.

Một lưu ý nên nói thẳng ra thay vì che giấu: một yêu cầu được định tuyến không tự động được bao phủ bởi phê duyệt Zero Data Retention của OpenAI, vốn được cấp theo từng tổ chức, nên một công ty cần ZDR nên xác nhận phạm vi bao phủ trên tuyến mà mình sử dụng. Và bộ định tuyến là thêm một chặng nữa trên đường đi của dữ liệu — một cái giá thực sự đối với tài liệu đặc quyền, ngay cả khi nó đổi lấy khả năng chuyển đổi dự phòng.

Nơi điều này dẫn đến

Nếu bạn đang chọn ngay hôm nay, hãy chọn mô hình cơ sở. Astra for Law chưa thể mua được, giá premium của nó vẫn chưa rõ, và bằng chứng độc lập cho thấy GPT-6 Astra vốn đã đạt hiệu suất ở mức cao trên các khối lượng công việc tác nhân pháp lý mà không cần chỉ mục. Hãy xây dựng trên openai/gpt-6-astra ngay bây giờ, đo lường khoảng cách truy xuất của riêng bạn, và để việc hạch toán token cho bạn biết liệu bạn có vượt qua 272K đủ thường xuyên để quan tâm đến hàng long-context hay không.

Sau đó hãy xem lại khi biết được ba điều: giá của gpt-6-astra-law, hình hài các điều khoản API của nó, và một lần chạy lại độc lập cuộc đối đầu 200 câu hỏi trên một tập tách do ai đó không phải OpenAI kiểm soát. Nếu mức giá rơi gần mức cơ sở và những cải thiện về truy xuất vẫn giữ vững bên ngoài tập kiểm định của OpenAI, cấu hình đó trở thành mặc định hiển nhiên cho công việc có cường độ nghiên cứu cao ở Hoa Kỳ, còn mô hình nền vẫn phù hợp cho mọi thứ khác. Cho đến lúc đó, tuyên bố có thể bảo vệ được là tuyên bố hẹp — một chỉ mục án lệ Hoa Kỳ cộng với hướng dẫn pháp lý truy xuất tốt hơn đáng kể so với tìm kiếm web nói chung đối với các câu hỏi pháp lý Hoa Kỳ. Điều đó đáng để trả một khoản nào đó. Trả bao nhiêu vẫn là câu hỏi bỏ ngỏ.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày