Một thẻ tiêu đề được tạo tự động ghi 'Clef vs LFM2.5 2.6B Base', với phụ đề '55 GB trên H200 so với 5.4 GB trên một chiếc laptop', cùng các chip ghi 'mô hình quyết định 27B' và 'base tiền huấn luyện 2.69B'. Logo OrcaRouter được ghép ở góc dưới bên phải.
Engineering & Research

Clef so với LFM2.5 2.6B Base: 55 GB trên một H200, hoặc 5.4 GB trên một Laptop

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây là một phép so sánh mà phần cứng quyết định cuộc tranh luận trước cả khi các mô hình lên tiếng. Cloudflare/cleflà một mô hình quyết định đa phương thức 27 tỷ tham số, được hậu huấn luyện từ Qwen3.8-27B, với kho lưu trữ có kích thước chỉ hơn 55 GB trải trên mười hai shard backbone cùng một đầu schema joint nhỏ. LiquidAI/LFM2.5-2.6B-Baselà một checkpoint chỉ văn bản 2,69 tỷ tham số, với trọng số là một tệp 5,4 GB duy nhất, được Liquid AI công bố vào ngày 1 tháng 8 năm 2026 theo LFM Open License. Độ trễ mà chính Cloudflare công bố cho Clef — trung vị 209,3 ms, p95 238,6 ms — được đo trên một H200 duy nhất. Mục tiêu triển khai của Liquid AI cho dòng LFM2.5 là laptop, điện thoại hoặc thiết bị cầm tay Ryzen. Cả hai nhà cung cấp đều mô tả mô hình của mình là nhỏ, nhanh và hiệu quả, và cả hai đều đang nói sự thật về một cỗ máy khác.

Có một khoảng trống thứ hai phía sau khoảng trống đầu tiên, và đó chính là khoảng trống thực sự làm thay đổi kế hoạch. Cả Clef lẫn LFM2.5 2.6B Base đều không trả lời một câu hỏi ngay khi xuất xưởng theo cách mà bạn có thể mong đợi. Clef vốn đã được huấn luyện đầy đủ cho một nhiệm vụ mà nó không thể đi chệch khỏi: nó trả lời các câu hỏi được nhập vào, và nó sẽ không làm bất cứ điều gì khác. Checkpoint Liquid thì chưa được huấn luyện cho bất cứ điều gì cả — nó là một mô hình nền, cố ý không có tinh chỉnh theo chỉ dẫn, và thẻ mô hình của chính Liquid AI nói rằng nó chỉ được khuyến nghị cho việc tinh chỉnh chuyên sâu. Vậy nên câu hỏi thực sự không phải là cái nào rẻ hơn để vận hành. Mà là bạn đang mua một thành phần hoàn chỉnh hay một nguyên liệu khởi đầu, và câu trả lời khác nhau đối với mỗi loại.

Mỗi cái chạy ở đâu, và vì sao đó lại là toàn bộ phép so sánh

Hình thái triển khai không phải là ghi chú bên lề đối với hai mô hình này. Với một mô hình quyết định, nó chính là kiến trúc, bởi vì một lượt forward pass 209 ms và một câu chuyện “chạy trên cỗ máy ngay trước mặt bạn” là cùng một khẳng định được kể từ hai đầu khác nhau.

• Tham số — 27B cho Clef, với bộ mã hóa thị giác Qwen3.8-27B được giữ nguyên; 2,69B chỉ văn bản cho LFM2.5 2.6B Base.

• Đĩa — kho lưu trữ 55 GB dành cho Clef; một tệp safetensors 5.4 GB cho checkpoint Liquid, cùng với các bản dựng GGUF, ONNX và MLX đã lượng tử hoá được phát hành kèm theo.

• Phần cứng — Cloudflare đã thử nghiệm Clef với torch 2.11 và transformers 5.10.2 trên một chiếc H200 duy nhất, và các số liệu về độ trễ của nó đến từ lần chạy đó. Phiên bản anh em đã qua huấn luyện hậu kỳ của Liquid AI đối với checkpoint này chạy ở tốc độ 220 token mỗi giây trên Apple M5 Max và 113 tok/s trên CPU AMD Ryzen, chỉ trong vòng dưới 2,5 GB bộ nhớ, và nhà cung cấp lưu ý rằng có thể đạt 30 tok/s trên điện thoại.

• Ngữ cảnh — 65.536 token cho Clef, theo trang mô hình Workers AI và bài đăng ra mắt; 131.072 token cho LFM2.5 2.6B Base.

• Đầu vào — Clef đọc văn bản, JSON, hình ảnh và khung hình video rồi chấm điểm chúng cùng nhau. Checkpoint Liquid chỉ hỗ trợ văn bản.

• Giấy phép — Apache-2.0 cho Clef. LFM Open License v1.0 cho LFM2.5, vốn là source-available chứ không phải mã nguồn mở theo OSI: việc sử dụng cho mục đích thương mại có điều kiện là tổ chức của bạn phải duy trì doanh thu hằng năm dưới 10 triệu USD, và vượt trên ngưỡng đó thì giấy phép đơn giản là không cấp quyền đó. Ngưỡng này là một dữ kiện mua sắm, không phải một chú thích cuối trang.

A two-column comparison scoreboard titled 'Clef vs LFM2.5 2.6B Base — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; On disk: 55 GB repository; Context: 65,536 tokens; Output: probability per option, no text; Hardware: H200 class, 209.3 ms median; Licence: Apache 2.0. The right column 'LFM2.5 2.6B Base' reads: Parameters: 2.69B text-only; On disk: 5.4 GB single file; Context: 131,072 tokens; Output: untuned text continuation; Hardware: laptop, 220 tok/s on M5 Max; Licence: LFM 1.0, $10M revenue threshold. A footer reads 'Clef figures per Cloudflare; LFM figures per Liquid AI's cards. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Chi phí cho mỗi quyết định không phải là cùng một vấn đề với chi phí cho mỗi token

Điều hấp dẫn ở đây là chia hai mức giá và tuyên bố người thắng cuộc. Điều đó không đứng vững khi đối chiếu với những gì hai mô hình thực sự làm.

Clef là 0,24 USD cho mỗi triệu token đầu vào trên Workers AI của Cloudflare. Đầu ra của nó không phải là văn xuôi, nên dòng token đầu ra thông thường không tồn tại; bạn trả tiền cho trạng thái, một lần, và nhận lại một phân phối. Đối với một lớp định tuyến đưa ra hàng triệu quyết định nhỏ mỗi ngày, con số đó là toàn bộ chi phí vận hành, và đó là con số bạn chỉ có thể nhận được từ nhà cung cấp chứ không phải từ hóa đơn tiền điện của chính mình.

LFM2.5 2.6B Base không tốn phí mỗi lần gọi và không thể đưa ra quyết định. Muốn có được chi phí trên mỗi quyết định từ nó, trước tiên bạn phải tinh chỉnh nó cho tác vụ của mình, nghĩa là thu thập dữ liệu, chạy một job huấn luyện, đánh giá kết quả, và chỉ đến lúc đó mới phát hiện ra nó tốn của bạn bao nhiêu kVA và thời gian kỹ thuật. Tính kinh tế hấp dẫn của một checkpoint 2.6B là có thật, nhưng chúng nằm sau phần việc chưa diễn ra, và người đang so sánh giá trên mỗi token đã bỏ qua thẳng điều đó.

Cách hiểu trung thực là đây là hai giao dịch mua khác nhau. Clef là một thành phần có giá niêm yết và một hóa đơn hosting. Liquid checkpoint là nguyên liệu thô mà chi phí của nó chính là lần chạy huấn luyện mà dù sao bạn cũng sẽ phải trả — và phần đền đáp là sau đó bạn sở hữu hoàn toàn tạo phẩm, tại thời điểm đó chi phí biên của một quyết định thực sự chỉ là điện. Với một tác vụ hẹp, khối lượng lớn, ổn định, sự đánh đổi đó thường là đúng. Với một tác vụ bạn chưa đặc tả, nó lại ngược lại, vì bạn không thể tinh chỉnh hướng tới một mục tiêu mà bạn không thể mô tả.

Một mô hình cơ sở chưa được huấn luyện không phải là một mô hình tệ hơn, mà là một vạch xuất phát khác.

Việc đọc bảng benchmark vắng mặt của checkpoint Liquid như một điểm yếu ẩn là điều dễ mắc phải. Không phải vậy. Chấm điểm một mô hình nền đã huấn luyện trước trên các benchmark tuân thủ chỉ dẫn sẽ đo lường việc thiếu fine-tuning, chứ không phải chất lượng của nền tảng; đó chính xác là lý do Liquid AI benchmark LFM2.5-2.6B sau huấn luyện và để mô hình nền không được đánh giá. Khoảng trống đó có thể kiểm chứng từ phía bạn, và đó chính là mấu chốt: hãy tải 5.4 GB, tự chạy đánh giá trên tác vụ của chính bạn, và biết câu trả lời trước khi bạn cam kết phục vụ bất cứ thứ gì.

Bảng của Clef có dạng bằng chứng ngược lại và mang vấn đề ngược lại. Cloudflare công bố khoảng 40 dòng benchmark, một bộ đánh giá quy trình làm việc đầy đủ và một phân phối độ trễ, và mọi thứ trong số đó đều do Cloudflare tạo ra trên Decision Index của chính Cloudflare, trong khi không có bên thứ ba nào tái lập bất kỳ phần nào của nó. Cột Clef giàu thông tin hơn hẳn cột Liquid, và không một số liệu nào trong đó từng được bất kỳ ai khác kiểm chứng. Đó là một khẳng định mạnh hơn một khoảng trống, và yếu hơn vẻ ngoài của nó.

Những gì bạn có thể tự đo lường cũng chia theo cùng một cách. Với checkpoint Liquid, bạn có thể đo mọi thứ — nó chỉ chiếm 5,4 GB trên đĩa của chính bạn. Với Clef, các trọng số theo giấy phép Apache-2.0 cũng thuộc về bạn để tự sở hữu và vận hành, nhưng để đạt được mức trung vị 209 ms như của Cloudflare thì cần đúng loại GPU mà Cloudflare đã dùng, nên trên thực tế hầu hết các nhóm sẽ đo lường thông qua endpoint được lưu trữ sẵn và thừa hưởng cả tính sẵn sàng lẫn độ trễ của nhà cung cấp đó.

Nơi lớp định tuyến phù hợp, đối với từng cái trong số chúng

Cả Clef lẫn bất kỳ biến thể LFM2.5 nào đều không phải là một route trên OrcaRouter, và bài viết này không phải là một tuyên bố về tính khả dụng — danh mục trả về lỗi 404 cho cả hai, nên Clef đến từ Workers AI của Cloudflare hoặc GPU của chính bạn, còn checkpoint của Liquid đến từ kênh phân phối riêng của nó.

Điều mà một lớp định tuyến thực sự có ích ở đây chính là mô hình mà cả hai mô hình đều ngụ ý. Một bộ chấm điểm nhỏ, có giới hạn, chuyên đưa ra quyết định, cùng một mô hình tổng quát lớn hơn thực thi quyết định đó, xét về mặt cấu trúc chính là một kiến trúc hai mô hình — và bộ khung của chính Clef khiến nửa sau của điều đó trở nên cụ thể, bởi mô hình mà Cloudflare huấn luyện hậu kỳ, Qwen3.8 27B, là một route được niêm yết với giá 0,33 USD mỗi triệu token đầu vào và 2,40 USD mỗi triệu token đầu ra trong ngữ cảnh 262.144 token. Một endpoint đặt trước hơn 200 mô hình nghĩa là bộ ra quyết định rẻ tiền và bên thực thi có năng lực cùng nằm sau một khóa duy nhất, được tổ hợp thành một lệnh gọi duy nhất thông qua DSL định tuyến thay vì phải nối với nhau bằng tay, kèm khả năng chuyển đổi dự phòng tự động để một buổi chiều trục trặc của nhà cung cấp không kéo sập luôn đường ra quyết định. Ngược lại, nếu bạn đang tự vận hành checkpoint Liquid và so sánh bản fine-tune của mình với những mô hình mà nó phải vượt qua, thì chính endpoint đó là thứ biến phép so sánh ấy thành một thay đổi cấu hình thay vì một chu kỳ mua sắm.

Jev 1.13 của TypeSafe đáng được nhắc đến riêng cho trường hợp tự vận hành (self-hosting): đây là mô hình ra quyết định mà Cloudflare đã đánh giá đối chiếu và cố ý dùng đúng POST /v1/systemone dạng yêu cầu như Clef, nó là một route được niêm yết ở mức $0.042 cho mỗi triệu token đầu vào trong ngữ cảnh 65.536 token, và đây là cách ít tốn công nhất để biết liệu một mô hình ra quyết định có giới hạn có giúp ích cho pipeline của bạn hay không, trước khi bạn dành một lần chạy huấn luyện cho một nền tảng có thể không cần phải tồn tại.

A headless capture of the OrcaRouter model page for qwen/qwen3.8-27b, showing the Qwen breadcrumb, the Qwen3.8 27B title with a 262K context marker, the text, image and video input modalities, and the site's Code samples, Pricing, Performance, Public benchmarks and FAQ navigation tabs.

Cái nào, để làm gì

Hãy chọn Liquid checkpoint khi tác vụ hẹp, khối lượng lớn, được đặc tả đủ tốt để có thể viết dữ liệu huấn luyện cho nó, và bị giới hạn bởi một trong hai ràng buộc cứng mà một API được định tuyến không thể khắc phục: dữ liệu không thể rời khỏi hạ tầng của bạn, hoặc cỗ máy mà nó phải chạy trên đó chính là chiếc máy trên bàn của bạn. Ngưỡng doanh thu của LFM 1.0 là thứ cần kiểm tra trước tiên, vì nó quyết định liệu giấy phép có thậm chí còn khả dụng cho bạn hay không.

Hãy dùng Clef khi quyết định đã có thể liệt kê được, trạng thái vừa trong 64K, câu trả lời cần một xác suất đã hiệu chỉnh thay vì một câu, và 209 ms trong một hot path chính là đặc tính bạn đang mua. Lược đồ cố định của nó chính là tính năng — một dạng đầu ra có thể kiểm toán, tái lập, không cần parser — và dấu chân 55 GB của nó là cái giá của phần xương sống giúp nó chính xác ngay lần thử đầu tiên thay vì sau một lần chạy huấn luyện.

Điều bạn không nên làm là chọn theo số lượng tham số. Một mô hình 2.69B phải được huấn luyện trước khi có thể trả lời không phải là một phiên bản nhỏ hơn của một mô hình 27B vốn đã có thể trả lời, và hai con số trong tiêu đề — 55 GB và 5.4 GB — mô tả hai ngân sách khác nhau, chứ không phải hai điểm trên cùng một thang đo.

A headless capture of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the model title, the TextGeneration and Transformers and Safetensors tags, a 16-languages marker, the Liquid AI organisation, and the opening line describing the LFM2.5 family as hybrid models designed for on-device deployment.

Câu hỏi còn bỏ ngỏ, và nó cũng là một câu hỏi như vậy cho cả hai

Không nhà cung cấp nào công bố bằng chứng có thể trụ vững khi được kiểm chứng độc lập. Lần chạy Decision Index của Cloudflare là tự thực hiện và không được tái lập; các số liệu thông lượng của Liquid AI là đo lường của chính nhà cung cấp trên phần cứng mà họ đã chọn. LFM2.5 2.6B Base hoàn toàn không có benchmark nào theo thiết kế, còn bảng Clef thì có rất nhiều theo lựa chọn.

Đối với checkpoint Liquid, phần bằng chứng còn thiếu thì dễ khắc phục và hoàn toàn nằm trong tay bạn — tệp đủ nhỏ để đánh giá trên một chiếc laptop trong một buổi chiều. Với Clef thì không phải vậy: việc tái tạo mức trung vị 209 ms đòi hỏi phần cứng mà Cloudflare đã dùng và trạng thái mà không ai bên ngoài Cloudflare từng dựng nên được. Sự bất đối xứng đó, hơn bất cứ điều gì trong hai bản đặc tả, chính là thứ nên định hình xem bạn sẽ lên kế hoạch xoay quanh cái nào trong hai cái này trong tháng này.