
Clef so với LFM2.5 2.6B Base: 55 GB trên một H200, hoặc 5.4 GB trên một Laptop
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 219 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Đây là một phép so sánh mà phần cứng quyết định cuộc tranh luận trước cả khi các mô hình lên tiếng. Cloudflare/cleflà một mô hình quyết định đa phương thức 27 tỷ tham số, được hậu huấn luyện từ Qwen3.8-27B, với kho lưu trữ có kích thước chỉ hơn 55 GB trải trên mười hai shard backbone cùng một đầu schema joint nhỏ. LiquidAI/LFM2.5-2.6B-Baselà một checkpoint chỉ văn bản 2,69 tỷ tham số, với trọng số là một tệp 5,4 GB duy nhất, được Liquid AI công bố vào ngày 1 tháng 8 năm 2026 theo LFM Open License. Độ trễ mà chính Cloudflare công bố cho Clef — trung vị 209,3 ms, p95 238,6 ms — được đo trên một H200 duy nhất. Mục tiêu triển khai của Liquid AI cho dòng LFM2.5 là laptop, điện thoại hoặc thiết bị cầm tay Ryzen. Cả hai nhà cung cấp đều mô tả mô hình của mình là nhỏ, nhanh và hiệu quả, và cả hai đều đang nói sự thật về một cỗ máy khác.
Có một khoảng trống thứ hai phía sau khoảng trống đầu tiên, và đó chính là khoảng trống thực sự làm thay đổi kế hoạch. Cả Clef lẫn LFM2.5 2.6B Base đều không trả lời một câu hỏi ngay khi xuất xưởng theo cách mà bạn có thể mong đợi. Clef vốn đã được huấn luyện đầy đủ cho một nhiệm vụ mà nó không thể đi chệch khỏi: nó trả lời các câu hỏi được nhập vào, và nó sẽ không làm bất cứ điều gì khác. Checkpoint Liquid thì chưa được huấn luyện cho bất cứ điều gì cả — nó là một mô hình nền, cố ý không có tinh chỉnh theo chỉ dẫn, và thẻ mô hình của chính Liquid AI nói rằng nó chỉ được khuyến nghị cho việc tinh chỉnh chuyên sâu. Vậy nên câu hỏi thực sự không phải là cái nào rẻ hơn để vận hành. Mà là bạn đang mua một thành phần hoàn chỉnh hay một nguyên liệu khởi đầu, và câu trả lời khác nhau đối với mỗi loại.
Mỗi cái chạy ở đâu, và vì sao đó lại là toàn bộ phép so sánh
Hình thái triển khai không phải là ghi chú bên lề đối với hai mô hình này. Với một mô hình quyết định, nó chính là kiến trúc, bởi vì một lượt forward pass 209 ms và một câu chuyện “chạy trên cỗ máy ngay trước mặt bạn” là cùng một khẳng định được kể từ hai đầu khác nhau.
• Tham số — 27B cho Clef, với bộ mã hóa thị giác Qwen3.8-27B được giữ nguyên; 2,69B chỉ văn bản cho LFM2.5 2.6B Base.
• Đĩa — kho lưu trữ 55 GB dành cho Clef; một tệp safetensors 5.4 GB cho checkpoint Liquid, cùng với các bản dựng GGUF, ONNX và MLX đã lượng tử hoá được phát hành kèm theo.
• Phần cứng — Cloudflare đã thử nghiệm Clef với torch 2.11 và transformers 5.10.2 trên một chiếc H200 duy nhất, và các số liệu về độ trễ của nó đến từ lần chạy đó. Phiên bản anh em đã qua huấn luyện hậu kỳ của Liquid AI đối với checkpoint này chạy ở tốc độ 220 token mỗi giây trên Apple M5 Max và 113 tok/s trên CPU AMD Ryzen, chỉ trong vòng dưới 2,5 GB bộ nhớ, và nhà cung cấp lưu ý rằng có thể đạt 30 tok/s trên điện thoại.
• Ngữ cảnh — 65.536 token cho Clef, theo trang mô hình Workers AI và bài đăng ra mắt; 131.072 token cho LFM2.5 2.6B Base.
• Đầu vào — Clef đọc văn bản, JSON, hình ảnh và khung hình video rồi chấm điểm chúng cùng nhau. Checkpoint Liquid chỉ hỗ trợ văn bản.
• Giấy phép — Apache-2.0 cho Clef. LFM Open License v1.0 cho LFM2.5, vốn là source-available chứ không phải mã nguồn mở theo OSI: việc sử dụng cho mục đích thương mại có điều kiện là tổ chức của bạn phải duy trì doanh thu hằng năm dưới 10 triệu USD, và vượt trên ngưỡng đó thì giấy phép đơn giản là không cấp quyền đó. Ngưỡng này là một dữ kiện mua sắm, không phải một chú thích cuối trang.

Chi phí cho mỗi quyết định không phải là cùng một vấn đề với chi phí cho mỗi token
Điều hấp dẫn ở đây là chia hai mức giá và tuyên bố người thắng cuộc. Điều đó không đứng vững khi đối chiếu với những gì hai mô hình thực sự làm.
Clef là 0,24 USD cho mỗi triệu token đầu vào trên Workers AI của Cloudflare. Đầu ra của nó không phải là văn xuôi, nên dòng token đầu ra thông thường không tồn tại; bạn trả tiền cho trạng thái, một lần, và nhận lại một phân phối. Đối với một lớp định tuyến đưa ra hàng triệu quyết định nhỏ mỗi ngày, con số đó là toàn bộ chi phí vận hành, và đó là con số bạn chỉ có thể nhận được từ nhà cung cấp chứ không phải từ hóa đơn tiền điện của chính mình.
LFM2.5 2.6B Base không tốn phí mỗi lần gọi và không thể đưa ra quyết định. Muốn có được chi phí trên mỗi quyết định từ nó, trước tiên bạn phải tinh chỉnh nó cho tác vụ của mình, nghĩa là thu thập dữ liệu, chạy một job huấn luyện, đánh giá kết quả, và chỉ đến lúc đó mới phát hiện ra nó tốn của bạn bao nhiêu kVA và thời gian kỹ thuật. Tính kinh tế hấp dẫn của một checkpoint 2.6B là có thật, nhưng chúng nằm sau phần việc chưa diễn ra, và người đang so sánh giá trên mỗi token đã bỏ qua thẳng điều đó.
Cách hiểu trung thực là đây là hai giao dịch mua khác nhau. Clef là một thành phần có giá niêm yết và một hóa đơn hosting. Liquid checkpoint là nguyên liệu thô mà chi phí của nó chính là lần chạy huấn luyện mà dù sao bạn cũng sẽ phải trả — và phần đền đáp là sau đó bạn sở hữu hoàn toàn tạo phẩm, tại thời điểm đó chi phí biên của một quyết định thực sự chỉ là điện. Với một tác vụ hẹp, khối lượng lớn, ổn định, sự đánh đổi đó thường là đúng. Với một tác vụ bạn chưa đặc tả, nó lại ngược lại, vì bạn không thể tinh chỉnh hướng tới một mục tiêu mà bạn không thể mô tả.
Một mô hình cơ sở chưa được huấn luyện không phải là một mô hình tệ hơn, mà là một vạch xuất phát khác.
Việc đọc bảng benchmark vắng mặt của checkpoint Liquid như một điểm yếu ẩn là điều dễ mắc phải. Không phải vậy. Chấm điểm một mô hình nền đã huấn luyện trước trên các benchmark tuân thủ chỉ dẫn sẽ đo lường việc thiếu fine-tuning, chứ không phải chất lượng của nền tảng; đó chính xác là lý do Liquid AI benchmark LFM2.5-2.6B sau huấn luyện và để mô hình nền không được đánh giá. Khoảng trống đó có thể kiểm chứng từ phía bạn, và đó chính là mấu chốt: hãy tải 5.4 GB, tự chạy đánh giá trên tác vụ của chính bạn, và biết câu trả lời trước khi bạn cam kết phục vụ bất cứ thứ gì.
Bảng của Clef có dạng bằng chứng ngược lại và mang vấn đề ngược lại. Cloudflare công bố khoảng 40 dòng benchmark, một bộ đánh giá quy trình làm việc đầy đủ và một phân phối độ trễ, và mọi thứ trong số đó đều do Cloudflare tạo ra trên Decision Index của chính Cloudflare, trong khi không có bên thứ ba nào tái lập bất kỳ phần nào của nó. Cột Clef giàu thông tin hơn hẳn cột Liquid, và không một số liệu nào trong đó từng được bất kỳ ai khác kiểm chứng. Đó là một khẳng định mạnh hơn một khoảng trống, và yếu hơn vẻ ngoài của nó.
Những gì bạn có thể tự đo lường cũng chia theo cùng một cách. Với checkpoint Liquid, bạn có thể đo mọi thứ — nó chỉ chiếm 5,4 GB trên đĩa của chính bạn. Với Clef, các trọng số theo giấy phép Apache-2.0 cũng thuộc về bạn để tự sở hữu và vận hành, nhưng để đạt được mức trung vị 209 ms như của Cloudflare thì cần đúng loại GPU mà Cloudflare đã dùng, nên trên thực tế hầu hết các nhóm sẽ đo lường thông qua endpoint được lưu trữ sẵn và thừa hưởng cả tính sẵn sàng lẫn độ trễ của nhà cung cấp đó.
Nơi lớp định tuyến phù hợp, đối với từng cái trong số chúng
Cả Clef lẫn bất kỳ biến thể LFM2.5 nào đều không phải là một route trên OrcaRouter, và bài viết này không phải là một tuyên bố về tính khả dụng — danh mục trả về lỗi 404 cho cả hai, nên Clef đến từ Workers AI của Cloudflare hoặc GPU của chính bạn, còn checkpoint của Liquid đến từ kênh phân phối riêng của nó.
Điều mà một lớp định tuyến thực sự có ích ở đây chính là mô hình mà cả hai mô hình đều ngụ ý. Một bộ chấm điểm nhỏ, có giới hạn, chuyên đưa ra quyết định, cùng một mô hình tổng quát lớn hơn thực thi quyết định đó, xét về mặt cấu trúc chính là một kiến trúc hai mô hình — và bộ khung của chính Clef khiến nửa sau của điều đó trở nên cụ thể, bởi mô hình mà Cloudflare huấn luyện hậu kỳ, Qwen3.8 27B, là một route được niêm yết với giá 0,33 USD mỗi triệu token đầu vào và 2,40 USD mỗi triệu token đầu ra trong ngữ cảnh 262.144 token. Một endpoint đặt trước hơn 200 mô hình nghĩa là bộ ra quyết định rẻ tiền và bên thực thi có năng lực cùng nằm sau một khóa duy nhất, được tổ hợp thành một lệnh gọi duy nhất thông qua DSL định tuyến thay vì phải nối với nhau bằng tay, kèm khả năng chuyển đổi dự phòng tự động để một buổi chiều trục trặc của nhà cung cấp không kéo sập luôn đường ra quyết định. Ngược lại, nếu bạn đang tự vận hành checkpoint Liquid và so sánh bản fine-tune của mình với những mô hình mà nó phải vượt qua, thì chính endpoint đó là thứ biến phép so sánh ấy thành một thay đổi cấu hình thay vì một chu kỳ mua sắm.
Jev 1.13 của TypeSafe đáng được nhắc đến riêng cho trường hợp tự vận hành (self-hosting): đây là mô hình ra quyết định mà Cloudflare đã đánh giá đối chiếu và cố ý dùng đúng POST /v1/systemone dạng yêu cầu như Clef, nó là một route được niêm yết ở mức $0.042 cho mỗi triệu token đầu vào trong ngữ cảnh 65.536 token, và đây là cách ít tốn công nhất để biết liệu một mô hình ra quyết định có giới hạn có giúp ích cho pipeline của bạn hay không, trước khi bạn dành một lần chạy huấn luyện cho một nền tảng có thể không cần phải tồn tại.

Cái nào, để làm gì
Hãy chọn Liquid checkpoint khi tác vụ hẹp, khối lượng lớn, được đặc tả đủ tốt để có thể viết dữ liệu huấn luyện cho nó, và bị giới hạn bởi một trong hai ràng buộc cứng mà một API được định tuyến không thể khắc phục: dữ liệu không thể rời khỏi hạ tầng của bạn, hoặc cỗ máy mà nó phải chạy trên đó chính là chiếc máy trên bàn của bạn. Ngưỡng doanh thu của LFM 1.0 là thứ cần kiểm tra trước tiên, vì nó quyết định liệu giấy phép có thậm chí còn khả dụng cho bạn hay không.
Hãy dùng Clef khi quyết định đã có thể liệt kê được, trạng thái vừa trong 64K, câu trả lời cần một xác suất đã hiệu chỉnh thay vì một câu, và 209 ms trong một hot path chính là đặc tính bạn đang mua. Lược đồ cố định của nó chính là tính năng — một dạng đầu ra có thể kiểm toán, tái lập, không cần parser — và dấu chân 55 GB của nó là cái giá của phần xương sống giúp nó chính xác ngay lần thử đầu tiên thay vì sau một lần chạy huấn luyện.
Điều bạn không nên làm là chọn theo số lượng tham số. Một mô hình 2.69B phải được huấn luyện trước khi có thể trả lời không phải là một phiên bản nhỏ hơn của một mô hình 27B vốn đã có thể trả lời, và hai con số trong tiêu đề — 55 GB và 5.4 GB — mô tả hai ngân sách khác nhau, chứ không phải hai điểm trên cùng một thang đo.

Câu hỏi còn bỏ ngỏ, và nó cũng là một câu hỏi như vậy cho cả hai
Không nhà cung cấp nào công bố bằng chứng có thể trụ vững khi được kiểm chứng độc lập. Lần chạy Decision Index của Cloudflare là tự thực hiện và không được tái lập; các số liệu thông lượng của Liquid AI là đo lường của chính nhà cung cấp trên phần cứng mà họ đã chọn. LFM2.5 2.6B Base hoàn toàn không có benchmark nào theo thiết kế, còn bảng Clef thì có rất nhiều theo lựa chọn.
Đối với checkpoint Liquid, phần bằng chứng còn thiếu thì dễ khắc phục và hoàn toàn nằm trong tay bạn — tệp đủ nhỏ để đánh giá trên một chiếc laptop trong một buổi chiều. Với Clef thì không phải vậy: việc tái tạo mức trung vị 209 ms đòi hỏi phần cứng mà Cloudflare đã dùng và trạng thái mà không ai bên ngoài Cloudflare từng dựng nên được. Sự bất đối xứng đó, hơn bất cứ điều gì trong hai bản đặc tả, chính là thứ nên định hình xem bạn sẽ lên kế hoạch xoay quanh cái nào trong hai cái này trong tháng này.
