GPT-4o ("o" cho "omni") là mô hình AI mới nhất của OpenAI, hỗ trợ cả đầu vào văn bản và hình ảnh với đầu ra văn bản. Nó duy trì mức độ thông minh của [GPT-4 Turbo](/models/openai/gpt-4-turbo) trong khi nhanh gấp đôi...
GPT-4o (2024-05-13) là một mô hình ngôn ngữ đa phương thức từ OpenAI, có thể truy cập thông qua API của OrcaRouter. Nó xử lý văn bản, hình ảnh và tệp tin, phù hợp cho các tác vụ kết hợp dữ liệu trực…
GPT-4o có thể phân tích các hình ảnh được cung cấp như một phần của đầu vào. Nó có thể mô tả nội dung trực quan, trả lời các câu hỏi về đối tượng, văn bản trong hình ảnh và mối quan hệ không gian. Nó cũng có thể trích xuất và chép lại văn bản từ tài liệu được quét hoặc ảnh chụp. Vì xử lý trực tiếp hình ảnh, bạn không cần một mô hình OCR hoặc thị giác riêng biệt. Hình ảnh được token hóa để vừa với cửa sổ ngữ cảnh. Ví dụ, người dùng có thể tải lên ảnh chụp màn hình biểu đồ và yêu cầu mô hình diễn giải các xu hướng. Khả năng hiểu của mô hình không chỉ giới hạn ở các chú thích đơn giản; nó có thể suy luận về nội dung, so sánh nhiều hình ảnh và sử dụng các tín hiệu trực quan cùng với hướng dẫn văn bản. Tính năng này được tích hợp vào cùng một lời gọi API, sử dụng cùng định dạng tin nhắn như các yêu cầu chỉ có văn bản. Trên OrcaRouter, bạn gửi hình ảnh dưới dạng dữ liệu được mã hóa base64 hoặc URL trong mảng nội dung. ID mô hình vẫn là "openai/gpt-4o-2024-05-13".
GPT-4o chấp nhận các tệp tin làm đầu vào. Các định dạng được hỗ trợ bao gồm PDF, tài liệu Microsoft Office (Word, Excel, PowerPoint), tệp văn bản và định dạng hình ảnh. Đối với PDF và tệp Office, mô hình trích xuất nội dung văn bản và phân tích bố cục. Mô hình không hiển thị trực tiếp định dạng phức tạp mà đọc nội dung văn bản. Điều này hữu ích để xử lý báo cáo, hợp đồng, bảng tính hoặc bài thuyết trình mà không cần trích xuất thủ công. Nội dung tệp được token hóa và tính vào tổng số token đầu vào. Mô hình có thể trả lời câu hỏi về nội dung tệp, tóm tắt chúng hoặc thực hiện tính toán trên dữ liệu dạng bảng. Khi sử dụng tệp, bạn đưa chúng vào như một phần nội dung tin nhắn bằng các trường API OpenAI phù hợp. OrcaRouter xử lý việc truyền tải mà không có sửa đổi. Lưu ý rằng khả năng của mô hình phụ thuộc vào chất lượng văn bản được trích xuất; các hình ảnh quét nhiều trong PDF có thể không đọc được hoàn toàn trừ khi chúng có chứa lớp văn bản nhúng.
GPT-4o là mô hình cao cấp với chi phí cao hơn so với các lựa chọn thay thế như GPT-4o-mini hoặc các biến thể GPT-3.5 trước đó. Nếu tác vụ của bạn không yêu cầu khả năng đa phương thức (ví dụ: tác vụ chỉ văn bản), ngữ cảnh lớn (lên đến 128K), hoặc mức độ suy luận toán học được đo bằng MATH-500 (79.1), một mô hình rẻ hơn có thể kinh tế hơn. Ví dụ, phân loại đơn giản, tạo nội dung ngắn, hoặc trò chuyện cơ bản có thể được xử lý bởi các mô hình chi phí thấp hơn vẫn tạo ra chất lượng chấp nhận được. Ngoài ra, nếu ứng dụng của bạn nhạy cảm với độ trễ và mô hình nhỏ hơn nhanh hơn, sự đánh đổi có thể nghiêng về tốc độ hơn là độ chính xác tuyệt đối. Cuối cùng, nếu bạn hiếm khi cần xử lý hình ảnh hoặc tệp tin, khả năng đa phương thức bổ sung là không cần thiết. OrcaRouter cung cấp một loạt các mô hình để bạn có thể chọn tỷ lệ giá-hiệu suất tốt nhất. Đánh giá các yêu cầu của trường hợp sử dụng của bạn dựa trên điểm chuẩn và giá cả để xác định xem lợi thế của GPT-4o có xứng đáng với chi phí bổ sung hay không.
GPT-4o có thể tạo tới 16.384 token cho mỗi yêu cầu. Đây là giới hạn hào phóng cho phép các câu trả lời dài, mã nguồn chi tiết hoặc các phân tích nhiều đoạn văn. Tuy nhiên, token đầu ra được tính phí ở mức $15.00 mỗi triệu token, khiến các đầu ra dài hơn trở nên đắt đỏ hơn. Bạn có thể kiểm soát độ dài đầu ra bằng tham số max_tokens trong lệnh gọi API. Nếu bạn dự đoán cần tạo các nội dung rất dài, hãy cân nhắc việc xử lý theo lô hoặc chia nhỏ yêu cầu. Giới hạn 16.384 áp dụng cho toàn bộ phần hoàn chỉnh, bao gồm cả các bước suy luận hoặc chuỗi tư duy nếu được yêu cầu. Đối với các tác vụ rất phức tạp cần suy nghĩ mở rộng, bạn có thể cần sử dụng nhiều lần gọi. Trên OrcaRouter, số lượng token đầu ra được báo cáo trong trường usage của phản hồi API, nhờ đó bạn có thể theo dõi chi phí một cách chính xác. Không có giới hạn bổ sung nào do OrcaRouter áp đặt; giới hạn gốc của mô hình được áp dụng.
GPT-4o đạt 79.1 trên benchmark MATH-500. MATH-500 bao gồm 500 bài toán thử thách thuộc nhiều chủ đề khác nhau như đại số, hình học, lý thuyết số và xác suất. Điểm 79.1 có nghĩa là mô hình đã trả lời đúng 79.1% số bài toán. Đây là một kết quả mạnh, cho thấy khả năng suy luận toán học vững chắc, đặc biệt đối với một mô hình đa phương thức. Benchmark này kiểm tra cả khả năng giải quyết vấn đề và suy luận từng bước. Điểm số này có thể định hướng kỳ vọng cho các ứng dụng liên quan đến dạy kèm toán, tính toán khoa học, hoặc câu đố logic. Lưu ý rằng hiệu suất trên benchmark không đảm bảo kết quả tương tự trong các tác vụ thực tế; có thể cần tinh chỉnh theo miền hoặc kỹ thuật prompt. Khi xem xét mô hình này, hãy so sánh điểm MATH-500 của nó với các mô hình khác mà bạn đánh giá. OrcaRouter không cung cấp dữ liệu benchmark bổ sung, vì vậy đây là điểm tham chiếu duy nhất được cung cấp cho mô hình này.
Độ trễ phụ thuộc vào một số yếu tố: độ dài đầu vào, độ dài đầu ra dự kiến, tải hiện tại trên máy chủ của OpenAI, và đường truyền mạng giữa ứng dụng của bạn với OrcaRouter. OrcaRouter không gây thêm độ trễ đáng kể nào ngoài thời gian phản hồi của nhà cung cấp cơ bản. Đối với các yêu cầu thông thường với đầu vào vừa phải (vài nghìn token) và đầu ra ngắn (dưới 1.000 token), phản hồi thường đến trong vòng vài giây. Các đầu ra dài hơn (gần 16.384 token) đương nhiên sẽ mất nhiều thời gian hơn vì mô hình tạo token tuần tự. Đầu vào hình ảnh cũng làm tăng độ trễ do quá trình token hóa và xử lý. Bạn có thể tối ưu độ trễ bằng cách giảm độ dài đầu ra, sử dụng prompt ngắn hơn, hoặc gộp các yêu cầu. OrcaRouter cung cấp các endpoint API tiêu chuẩn trả về kết quả không đồng bộ qua luồng (streaming) nếu muốn. Đối với các ứng dụng tương tác thời gian thực, hãy cân nhắc sử dụng chế độ luồng (stream: true) để bắt đầu xử lý ngay khi token đến. Không có số liệu độ trễ cụ thể nào được cung cấp trong thông số kỹ thuật của mô hình, vì vậy đây là các ước tính định tính.
Điểm mạnh: Đầu vào đa phương thức (văn bản, hình ảnh, tệp tin), cửa sổ ngữ cảnh lớn 128K, suy luận toán học mạnh mẽ (MATH-500: 79,1) và giới hạn token đầu ra cao (16.384). Mô hình xử lý hiệu quả các tài liệu dài và hội thoại nhiều lượt. API tương thích chuẩn OpenAI, dễ dàng tích hợp. Hạn chế: Chi phí cao hơn so với các mô hình nhỏ hơn. Không được tối ưu cho các tác vụ không cần đa phương thức hoặc ngữ cảnh lớn. Không có thông tin về hiệu suất ngôn ngữ không phải tiếng Anh hoặc các tiêu chuẩn an toàn cụ thể. Khả năng hiểu hình ảnh có thể bị hạn chế đối với các cảnh quá phức tạp hoặc hình ảnh độ phân giải thấp. Ngoài ra, mô hình có thể đưa ra câu trả lời không chính xác cho các vấn đề nằm ngoài phân phối huấn luyện. Không có cam kết về độ trễ. Đối với người dùng yêu cầu độ trễ cực thấp hoặc chi phí cực thấp, một mô hình khác có thể phù hợp hơn. Điểm chuẩn 79,1 trên MATH-500 cho thấy còn dư địa cải thiện đối với các bài toán khó nhất. Hãy đánh giá xem những sự đánh đổi này có phù hợp với yêu cầu của ứng dụng của bạn hay không.
GPT-4o được tính phí theo token, với mức giá riêng cho token đầu vào và token đầu ra. Token đầu vào có giá $5.00 trên 1 triệu token. Token đầu ra có giá $15.00 trên 1 triệu token. Đây là mức giá của nhà cung cấp, được OrcaRouter chuyển tiếp mà không có phụ phí. Chi phí cho mỗi yêu cầu = (token đầu vào / 1e6 * 5) + (token đầu ra / 1e6 * 15). Ví dụ: một cuộc hội thoại có 4.000 token đầu vào và 200 token đầu ra sẽ tốn (0,004 * $5) + (0,0002 * $15) = $0,02 + $0,003 = $0,023. Không có khoản phí bổ sung nào cho các lệnh gọi API; bạn chỉ trả tiền cho các token đã sử dụng. Giá cả được cập nhật linh hoạt dựa trên các thay đổi từ nhà cung cấp; OrcaRouter sẽ chuyển tiếp mọi điều chỉnh trong tương lai. Vì không có phụ phí, người dùng được hưởng mức giá tương tự như khách hàng trực tiếp của OpenAI, nhưng với sự tiện lợi từ việc quản lý và thanh toán thống nhất của OrcaRouter. Cần lưu ý rằng hình ảnh và tệp được token hóa và góp phần vào số lượng token đầu vào, thường làm tăng chi phí so với đầu vào chỉ có văn bản.
Không. OrcaRouter không cung cấp giảm giá, token được lưu trong bộ nhớ đệm hay giá ưu đãi cho các đầu vào lặp lại. Mỗi token đều được tính phí theo mức giá tiêu chuẩn của nhà cung cấp. Không có chi phí lưu đệm riêng lẻ hay bất kỳ khoản phụ phí nào cho khối lượng lớn. Mức giá 5$/15$ mỗi triệu token là giá cố định. Người dùng cần thông lượng rất cao có thể hỏi về các thỏa thuận tùy chỉnh, nhưng dịch vụ tiêu chuẩn không bao gồm chiết khấu theo khối lượng. Ngoài ra, không có các khoản phí ẩn như phí kết nối hay phí tối thiểu hàng tháng. Mức giá minh bạch và gắn trực tiếp với lượng token sử dụng. Để tối ưu chi phí, hãy cân nhắc giảm kích thước đầu vào (ví dụ: cắt bớt lịch sử, sử dụng prompt ngắn hơn) và độ dài đầu ra (ví dụ: đặt max_tokens thấp hơn). Đồng thời, chỉ sử dụng mô hình khi cần đến các khả năng của nó (đa phương thức, ngữ cảnh lớn) sẽ giúp kiểm soát chi phí. Nếu ứng dụng của bạn có các prompt lặp lại giống hệt nhau mỗi lần, việc lưu đệm ở tầng ứng dụng có thể giảm lượng token sử dụng, nhưng bản thân OrcaRouter không cung cấp tính năng như vậy.
GPT-4o có mức giá cao cấp. Đối với nhiều tác vụ, một mô hình rẻ hơn (ví dụ: GPT-4o-mini hoặc GPT-3.5-turbo) có thể đủ dùng. Cần cân nhắc bằng cách đánh giá độ phức tạp và độ chính xác yêu cầu. Nếu tác vụ của bạn liên quan đến trích xuất hoặc phân loại đơn giản với ngữ cảnh hạn chế, một mô hình rẻ hơn có thể hoạt động tương tự với chi phí chỉ bằng một phần nhỏ. Ngược lại, nếu tác vụ đòi hỏi hiểu biết tinh tế về hình ảnh, tài liệu dài hoặc độ chính xác toán học cao (điểm MATH-500 là 79,1 so với điểm thấp hơn trên các mô hình rẻ hơn), thì GPT-4o có thể xứng đáng với mức giá cao hơn. Hãy sử dụng kiểm thử A/B trên một mẫu đại diện để so sánh chất lượng và chi phí. Đồng thời, lưu ý rằng cùng một mức giá trên mỗi triệu token áp dụng bất kể độ dài văn bản; các yêu cầu ngắn hơn sẽ rẻ hơn. Nếu quy trình làm việc của bạn thường xuyên sử dụng toàn bộ ngữ cảnh 128K, chi phí token đầu vào cho yêu cầu đó có thể cao; hãy đảm bảo rằng ngữ cảnh đó thực sự cần thiết. OrcaRouter cung cấp các chỉ số sử dụng để bạn có thể theo dõi và tối ưu hóa.
Để gọi GPT-4o trên OrcaRouter, hãy sử dụng endpoint API tương thích OpenAI với base_url = "https://api.orcarouter.ai/v1". Đặt tham số model thành "openai/gpt-4o-2024-05-13". Bạn sẽ cần một API key từ OrcaRouter. Định dạng yêu cầu tuân theo API Chat Completions chuẩn của OpenAI: mảng messages với các vai trò (system, user, assistant), nội dung tùy chọn cho hình ảnh và tệp tin, cùng các tham số như temperature, max_tokens, top_p, frequency_penalty, presence_penalty và stop. Ví dụ, một yêu cầu văn bản đơn giản được gửi dưới dạng POST đến /chat/completions. Đối với hình ảnh, hãy đưa nội dung vào như một phần của tin nhắn user với type "image_url". Đối với tệp tin, cũng đưa chúng vào nội dung (định dạng cụ thể tuân theo đặc tả OpenAI). Phản hồi sẽ bao gồm tin nhắn của assistant, thống kê sử dụng (prompt_tokens, completion_tokens, total_tokens) và siêu dữ liệu khác. Không cần header đặc biệt nào ngoài Content-Type và Authorization tiêu chuẩn. Tích hợp hoàn toàn giống như sử dụng trực tiếp OpenAI.
Tất cả các tham số Chat Completions chuẩn của OpenAI đều được hỗ trợ: messages (bắt buộc), model (bắt buộc, đặt thành "openai/gpt-4o-2024-05-13"), temperature (0–2, mặc định 1), top_p (0–1, mặc định 1), n (số lượng completions, mặc định 1), stop (chuỗi hoặc danh sách chuỗi), max_tokens (mặc định 16,384, giới hạn tối đa 16,384), presence_penalty (−2 đến 2, mặc định 0), frequency_penalty (−2 đến 2, mặc định 0), logit_bias (bản đồ ID token đến giá trị bias), user (chuỗi để giám sát lạm dụng), stream (boolean, mặc định false), và functions/tools (dùng để gọi hàm). Đối với đầu vào đa phương thức, nội dung messages có thể là một mảng các phần nội dung với loại "text" hoặc "image_url". Ngoài ra, bạn có thể bao gồm nội dung loại "file" theo tài liệu của OpenAI (ví dụ: cho tệp PDF đính kèm). OrcaRouter chuyển các tham số này trực tiếp đến nhà cung cấp mà không sửa đổi. Đảm bảo bạn không vượt quá cửa sổ ngữ cảnh 128K token. API trả về mã lỗi tiêu chuẩn cho các yêu cầu không hợp lệ, giới hạn tốc độ hoặc lỗi xác thực.
Việc di chuyển rất đơn giản vì API của OrcaRouter hoàn toàn tương thích với OpenAI. Bạn chỉ cần thay đổi hai thứ: base URL từ https://api.openai.com/v1 thành https://api.orcarouter.ai/v1, và model ID từ "gpt-4o-2024-05-13" thành "openai/gpt-4o-2024-05-13". API key từ OrcaRouter sẽ thay thế key OpenAI của bạn. Toàn bộ mã nguồn hiện tại sử dụng thư viện Python/Node của OpenAI hoặc các yêu cầu HTTP thô sẽ hoạt động mà không cần sửa đổi gì khác. Định dạng tin nhắn, tên tham số và cấu trúc phản hồi đều giống hệt nhau. Đối với các thư viện chấp nhận tham số base URL, chỉ cần đặt nó thành endpoint của OrcaRouter. Nếu bạn đang sử dụng client của OpenAI, bạn có thể khởi tạo nó với base_url được đặt thành endpoint của OrcaRouter. Không cần thay đổi gì đối với logic thiết kế prompt hoặc lưu cache. OrcaRouter cũng hỗ trợ streaming (stream: true) và function calling giống hệt như trước. Việc kiểm thử có thể được thực hiện với một tập nhỏ các yêu cầu để xác minh rằng hành vi khớp.
OrcaRouter không sửa đổi hành vi của model. Nó hoạt động hoàn toàn như một cổng trung gian, chuyển tiếp yêu cầu của bạn tới máy chủ của OpenAI và trả về phản hồi nguyên văn. OrcaRouter không áp dụng bất kỳ tiền xử lý, hậu xử lý hay lọc nội dung bổ sung nào. Về xử lý dữ liệu: OrcaRouter không lưu trữ hoặc ghi lại dữ liệu prompt hay completion ngoài những gì cần thiết cho việc thanh toán và giám sát vận hành. Các chính sách dữ liệu của OpenAI sẽ được áp dụng khi sử dụng model qua OrcaRouter. Theo các sự kiện được cung cấp, không có đề cập nào về việc OrcaRouter lưu giữ dữ liệu ngoài việc ghi log API tiêu chuẩn. Người dùng nên xem xét cả chính sách bảo mật của OrcaRouter và chính sách của OpenAI để hiểu rõ về cách xử lý dữ liệu. Nếu bạn có yêu cầu nghiêm ngặt về nơi cư trú dữ liệu, hãy tham khảo ý kiến của OrcaRouter về các tùy chọn có sẵn. Không có dấu hiệu nào cho thấy OrcaRouter chia sẻ dữ liệu với các khách hàng khác. Model ID là thay đổi duy nhất cần thiết; không có hướng dẫn tùy chỉnh nào được chèn vào.
Sự khác biệt chính giữa GPT-4o và GPT-4o-mini là kích thước cửa sổ ngữ cảnh, khả năng đa phương thức, hiệu suất benchmark và chi phí. GPT-4o cung cấp cửa sổ ngữ cảnh 128K và hỗ trợ đầu vào hình ảnh và tệp tin. GPT-4o-mini (dựa trên các sản phẩm của OpenAI) thường có ngữ cảnh nhỏ hơn (ví dụ: 128K hoặc 16K trên một số phiên bản) và có thể không hỗ trợ tất cả các phương thức. Trên MATH-500, GPT-4o đạt điểm 79,1; GPT-4o-mini sẽ đạt điểm thấp hơn. Giá cả: GPT-4o có giá $5/$15 mỗi triệu token, trong khi GPT-4o-mini rẻ hơn đáng kể (ví dụ: $0.15/$0.60 mỗi triệu token ở một số phiên bản). Do đó, GPT-4o-mini phù hợp cho các tác vụ đơn giản hơn, nơi chi phí thấp là quan trọng nhất, trong khi GPT-4o tốt hơn cho các tác vụ suy luận phức tạp, ngữ cảnh dài và đa phương thức. Khi lựa chọn giữa chúng, hãy xem xét các yêu cầu về độ chính xác và nhu cầu về khả năng xử lý hình ảnh hoặc tệp tin. OrcaRouter cung cấp cả hai mô hình dưới các ID riêng biệt. Nếu khối lượng công việc của bạn ít khi sử dụng hình ảnh hoặc ngữ cảnh lớn, GPT-4o-mini có thể là lựa chọn kinh tế hơn.
GPT-4o (2024-05-13) là một mô hình đa phương thức với cửa sổ ngữ cảnh 128K, trong khi các phiên bản GPT-4 cũ hơn (như gpt-4-0613) thường có ngữ cảnh 8K hoặc 32K và chỉ hỗ trợ văn bản (một số phiên bản sau hỗ trợ hình ảnh qua các endpoint thị giác riêng biệt). Giá cho GPT-4o ($5/$15 mỗi triệu token) thường thấp hơn so với mức giá đỉnh của GPT-4 Turbo (ví dụ: $10/$30 mỗi triệu token). Hiệu suất benchmark: điểm MATH-500 được cung cấp là 79.1 dành cho GPT-4o; GPT-4 không có điểm MATH-500 chính thức trong các dữ kiện được cung cấp, nhưng được biết là đạt điểm thấp hơn trên các benchmark toán tương tự. GPT-4o cũng cung cấp giới hạn đầu ra cao hơn (16K token) so với GPT-4 cũ (4K hoặc 8K tùy phiên bản). Nhìn chung, GPT-4o mang lại giá trị tốt hơn cho các ứng dụng đa phương thức, ngữ cảnh dài. Tuy nhiên, các mô hình GPT-4 cũ hơn có thể đã được tinh chỉnh cho các tác vụ cụ thể; hãy đánh giá trên dữ liệu của riêng bạn. Thông qua OrcaRouter, cả hai dòng mô hình đều có thể truy cập được.
Một so sánh trực tiếp yêu cầu các dữ kiện riêng cho từng mô hình không được cung cấp ở đây. Nhìn chung, cả hai mô hình đều cạnh tranh về khả năng suy luận và đa phương thức. GPT-4o có cửa sổ ngữ cảnh 128K, tương tự như ngữ cảnh 200K của Claude (dành cho Sonnet). Cả hai đều hỗ trợ hình ảnh. Điểm benchmark khác nhau: GPT-4o cung cấp điểm MATH-500 là 79.1; điểm của Claude 3.5 Sonnet trên benchmark đó không được cung cấp. Giá: GPT-4o là $5/$15 mỗi triệu token; giá Claude Sonnet thường khoảng $3/$15 mỗi triệu token (có thể thay đổi). Do đó, chi phí đầu vào cho GPT-4o cao hơn. Sự khác biệt về hiệu suất phụ thuộc vào tác vụ: một số người dùng thấy Claude vượt trội trong viết văn dài, trong khi GPT-4o xuất sắc về toán và lập trình. Nếu không có đánh giá có kiểm soát, khuyến nghị kiểm tra cả hai trên các mẫu đại diện. OrcaRouter cung cấp cả hai mô hình, vì vậy bạn có thể dễ dàng so sánh bằng cách thay đổi ID mô hình. Cuối cùng, mô hình tốt nhất phụ thuộc vào yêu cầu cụ thể của bạn về độ chính xác, độ trễ và chi phí. Các dữ kiện được cung cấp không bao gồm điểm của Claude, vì vậy so sánh này vẫn mang tính định tính.
Llama 3 (ví dụ: Llama 3 70B) là một mô hình mã nguồn mở có thể tự lưu trữ, trong khi GPT-4o là độc quyền và được truy cập qua API. GPT-4o hỗ trợ đầu vào đa phương thức (văn bản, hình ảnh, tệp) với ngữ cảnh 128K, trong khi Llama 3 thường chỉ hỗ trợ văn bản (trừ khi được tinh chỉnh cho thị giác) và có ngữ cảnh nhỏ hơn (ví dụ: 8K hoặc 32K). Điểm chuẩn: điểm MATH-500 của GPT-4o là 79,1; Llama 3 70B đạt khoảng 70–75 trên các bài kiểm tra toán tương tự (không được đề cập trong các dữ kiện, nhưng là kiến thức chung). Chi phí: chi phí API của GPT-4o trên mỗi token là cố định; tự lưu trữ Llama 3 bao gồm chi phí cơ sở hạ tầng (GPU, điện) có thể thấp hơn ở khối lượng lớn. Độ trễ: GPT-4o dựa trên API có thể nhanh hơn cho khối lượng công việc bùng nổ; các mô hình tự lưu trữ có thể cung cấp độ trễ ổn định nếu có dung lượng dự trữ. Tính linh hoạt: Llama 3 có thể được tinh chỉnh; GPT-4o thì không. Đối với người dùng muốn tránh bị khóa nhà cung cấp hoặc xử lý dữ liệu nhạy cảm hoàn toàn tại chỗ, các mô hình mã nguồn mở rất hấp dẫn. OrcaRouter cung cấp quyền truy cập vào cả hai loại: bạn có thể sử dụng GPT-4o qua API và cũng có thể truy cập các mô hình mã nguồn mở thông qua OrcaRouter nếu có.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-4o-2024-05-13",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)frequency_penaltylogit_biaslogprobsmax_completion_tokensmax_tokensnparallel_tool_callspredictionpresence_penaltyresponse_formatseedservice_tierstopstreamtemperaturetool_choicetoolstop_logprobstop_pweb_search_options| Đầu vào / 1M tokens | $5.00 |
|---|---|
| Đầu ra / 1M tokens | $15.00 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/openai/gpt-4o-2024-05-13Mở @misc{orcarouter_gpt_4o_2024_05_13,
title = {GPT-4o (2024-05-13) API},
author = {OpenAI},
year = {2024},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13}
}OpenAI. (2024). GPT-4o (2024-05-13) API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-4o-2024-05-13