Nếu bạn chỉ từng sử dụng một nhà cung cấp LLM duy nhất, mức giá niêm yết trên trang giá của nhà cung cấp đó có thể trông giống như giá thực. Nhưng không phải vậy. Đó là giá bán lẻ, và giống như hầu hết các mức giá bán lẻ, nó có rất nhiều biên lợi nhuận và cấu trúc ẩn bên trong. Các nhà tổng hợp kiếm tiền bằng cách tấn công chính cấu trúc đó.
Tại sao giá niêm yết trực tiếp lại cao
Giá trực tiếp có những chi phí không liên quan đến việc vận hành mô hình. Khi bạn mua trực tiếp từ nhà cung cấp, bạn cũng đang trả cho:
•Cam kết tối thiểu. Một số nhà cung cấp muốn số dư trả trước hoặc cam kết chi tiêu trước khi đưa ra mức giá tốt nhất. Các nhóm nhỏ hiếm khi đạt được các bậc đó.
•Một nhà cung cấp, một hợp đồng. Mỗi nhà cung cấp có đăng ký riêng, hóa đơn riêng, tiền tệ riêng. Vận hành ba nhà cung cấp nghĩa là ba hóa đơn và ba phương thức thanh toán.
•Không có cạnh tranh trong chính hóa đơn của bạn. Khi bạn bị khóa vào một nhà cung cấp, nhà cung cấp đó không có lý do gì để giảm giá. Bạn trả mức giá của họ hoặc rời đi.
•Giới hạn tốc độ được đặt để bảo vệ họ, không phải để thuận tiện cho bạn.
Các nhà tổng hợp tồn tại vì họ có thể mua công suất thượng nguồn với số lượng lớn và chuyển một phần chiết khấu xuống cho bạn. Họ cũng cho phép bạn chuyển chi tiêu giữa các nhà cung cấp, đó mới là đòn bẩy thực sự: nếu mô hình A trở nên rẻ hơn vào tháng tới, bạn chuyển lưu lượng truy cập của mình mà không cần đổi nhà cung cấp.
Phép toán, với những con số tròn
Tôi sẽ dùng những con số ví dụ đơn giản có chủ đích để hình dạng của nó rõ ràng. Giá thực thay đổi liên tục, nhưng phép tính thì vẫn vậy.
Giả sử một nhà cung cấp niêm yết một mô hình ở mức $2.50 mỗi triệu token đầu vào và $10.00 mỗi triệu token đầu ra. Một khối lượng công việc điển hình, ví dụ một công cụ tóm tắt phiếu hỗ trợ xử lý 10 triệu token đầu vào và 4 triệu token đầu ra mỗi tháng, sẽ tốn:
Trực tiếp: (10M x $2.50) + (4M x $10.00) = $25 + $40 = $65.00 / thángMột nhà tổng hợp đã đàm phán giá theo khối lượng có thể cung cấp cùng mô hình đó ở mức khoảng một phần tư giá niêm yết, $0.60 mỗi triệu đầu vào và $2.40 mỗi triệu đầu ra:
Qua tổng hợp: (10M x $0.60) + (4M x $2.40) = $6.00 + $9.60 = $15.60 / thángĐó là khoảng $49 tiết kiệm mỗi tháng trên một khối lượng công việc khiêm tốn, giảm ~76%, trước khi bạn động đến bất cứ thứ gì khác. Nhân số lượng token lên gấp mười lần và khoản tiết kiệm tuyệt đối cũng tăng theo.
Điểm mấu chốt không phải là những con số cụ thể này. Điểm mấu chốt là khoảng cách giữa "giá niêm yết" và "giá theo khối lượng" là có thật, và công việc của một nhà tổng hợp là ngồi trong khoảng cách đó và trao lại một phần cho bạn.
Những chi phí khác ẩn trong phần chữ nhỏ
Giá mỗi token là tiêu đề, nhưng nó không phải toàn bộ hóa đơn. Ba điều khiến mọi người vấp ngã:
Giá khi trúng bộ nhớ đệm. Một số mô hình giảm giá cho các token trúng bộ nhớ đệm prompt. Nếu một nhà cung cấp tính giá đầy đủ cho đầu vào được lưu đệm và một nhà khác tính 10% của nó, một khối lượng công việc với các prompt lặp lại có thể khác biệt về chi phí rất nhiều ngay cả ở cùng giá niêm yết. Hãy hỏi trước khi bạn cam kết.
Tiền tệ và ma sát thanh toán. Mua từ một nhà cung cấp có hóa đơn bằng loại tiền tệ hoặc khu vực mà thẻ của bạn không thích sẽ thêm phí chuyển đổi và những rắc rối về giao dịch thất bại. Một hóa đơn tổng hợp duy nhất bằng chính loại tiền tệ của bạn loại bỏ điều đó.
Giới hạn tốc độ như một chi phí ẩn. Một mô hình rẻ mà bạn chỉ có thể gọi 10 lần một phút thì không rẻ; bạn sẽ phải xây dựng logic thử lại và xếp hàng để bù đắp, và đó là thời gian kỹ thuật. Giới hạn thông lượng thuộc về so sánh giá ngay cả khi chúng không có trên trang giá.
Một công cụ ước tính chi phí nhanh
Ước tính chi tiêu trước khi bạn xây dựng rất đơn giản khi bạn đã có các con số. Đây là một script Python nhỏ theo tinh thần đó:
def monthly_cost(input_tokens, output_tokens, in_price, out_price):
# giá tính trên mỗi triệu token
return (input_tokens / 1e6) * in_price + (output_tokens / 1e6) * out_price
# Giá niêm yết trực tiếp
direct = monthly_cost(10_000_000, 4_000_000, 2.50, 10.00)
# Giá qua nhà tổng hợp (giá trị ví dụ)
aggregated = monthly_cost(10_000_000, 4_000_000, 0.60, 2.40)
print(f"Trực tiếp: ${direct:.2f}")
print(f"Qua tổng hợp: ${aggregated:.2f}")
print(f"Tiết kiệm: ${direct - aggregated:.2f}")Chạy số lượng token thực của bạn qua nó với giá thực của bạn. Đó là con số duy nhất quan trọng.
Nơi các nhà tổng hợp không giúp bạn tiết kiệm tiền
Tôi nên thẳng thắn về những giới hạn. Một nhà tổng hợp là một nhà bán lại. Một số mô hình hoàn toàn không có sẵn thông qua các nhà bán lại, và với một số mô hình ngách, mức chênh lệch của nhà tổng hợp có thể tệ hơn so với mua trực tiếp. Khoản tiết kiệm lớn nhất là ở các mô hình đa dụng phổ biến, nơi tồn tại chiết khấu theo khối lượng. Với một mô hình kỳ lạ mà bạn hiếm khi gọi, sự khác biệt là không đáng kể.
Ngoài ra, một mức giá rẻ hơn là vô giá trị nếu độ tin cậy của nhà tổng hợp kém. Một khoản tiết kiệm 30% mà mang lại cho bạn một endpoint chập chờn thì tốn hơn 30% khi bạn tính đến các lần thử lại, phiếu hỗ trợ và thời gian của chính bạn. Giá cả và độ tin cậy là một quyết định, không phải hai.
SiCore TokenWorks là một phiên bản đơn giản của mô hình này: tương thích OpenAI, trả tiền theo mức sử dụng, với một danh mục các mô hình phổ biến từ DeepSeek, Qwen, ERNIE, Doubao, Spark và Pangu cùng với GPT-4o, Claude và Gemini, được niêm yết thấp hơn đáng kể so với mức giá chính thức mỗi token.