SiCore TokenWorks
LLM APIAPI GatewayAggregation

Góc nhìn SiCore: Đằng sau việc giảm giá API mô hình lớn, hóa đơn tiền điện bị lãng quên

SiCore TokenWorks Team·2026-10-03

Giá API mô hình lớn trong hai năm qua liên tục giảm. DeepSeek-V3 đã ép giá đầu vào xuống còn vài đồng cho mỗi triệu Token, Tongyi Qianwen, Doubao, Wenxin Yiyan lần lượt bám theo, chi phí gọi GPT-4o và Claude 4 Sonnet cũng thấp hơn đáng kể so với thời điểm ra mắt. Những người làm ứng dụng AI nhìn chung đều thấy đây là điều tốt, nhưng nếu bạn từng quản lý ngân sách, sẽ phát hiện một hiện tượng kỳ lạ: đơn giá mô hình giảm rồi, mà tổng hóa đơn lại chẳng thay đổi bao nhiêu. Nguyên nhân nằm trong cấu trúc chi phí.

Chi phí suy luận thực chất được cấu thành từ gì

Nhiều người tính chi phí API mô hình lớn chỉ chăm chăm vào đơn giá Token, tưởng đó là toàn bộ. Thực ra một card GPU chạy suy luận, chi phí có thể tách thành bốn phần: khấu hao GPU, tiền điện, băng thông, vận hành và bảo trì. Khấu hao là phần lớn nhất, một card phân bổ theo ba năm, chi phí mỗi ngày là cố định. Băng thông và vận hành bảo trì tương đối ổn định. Thứ thực sự bị đánh giá thấp chính là tiền điện.

Một máy chủ suy luận tám card khi chạy full tải tiêu thụ khoảng 6 kilowatt, chạy không ngừng 24 giờ, một ngày là hơn một trăm số điện. Giá điện công nghiệp ở một thành phố tuyến đầu phía Đông, cộng thêm phần phân bổ làm mát phòng máy, chi phí mỗi số điện cao hơn phía Tây không ít. Suy luận là tải liên tục 7×24 giờ, không phải kiểu huấn luyện chạy nước rút theo giai đoạn, tiền điện trong vận hành dài hạn sẽ tích lũy thành một khoản chi không thể xem nhẹ. Gartner từ vài năm trước đã đưa ra một nhận định: tỷ trọng chi phí điện năng của trung tâm dữ liệu sẽ tiếp tục tăng theo mật độ năng lực tính toán. Xu hướng này thể hiện đặc biệt rõ trong kịch bản suy luận.

Vì sao bố cục năng lực tính toán Đông - Tây có thể ép giá API xuống

Lợi thế giá điện xanh ở khu vực phía Tây chính là logic cốt lõi của việc năng lực tính toán di cư về phía Tây những năm qua. Điện gió, điện mặt trời tập trung dồi dào ở phía Tây, giá điện lên lưới thấp, cộng thêm khí hậu mát mẻ, chi phí làm mát cũng nhỏ. Cùng một card, đặt ở phía Tây chạy suy luận, chi phí mỗi số điện có thể thấp hơn phía Đông một khoảng lớn. Chênh lệch này không tự nhiên biến mất, nó sẽ truyền theo chuỗi cung ứng năng lực tính toán xuống đơn giá gọi API.

Trước đây chúng tôi đã so sánh vài cách tích hợp, phát hiện những nền tảng tổng hợp AI API thực sự ép được giá xuống, phía sau thường có bố cục năng lực tính toán riêng, chứ không đơn thuần làm trung chuyển API. SiCore TokenWorks ở điểm này khá điển hình, bảy trung tâm năng lực tính toán phân bố ở Đông và Tây, nhiệm vụ suy luận được điều phối theo nhu cầu đến khu vực dồi dào điện xanh, mua sắm theo lô cộng với năng lượng xanh giảm chi phí, cuối cùng thể hiện ở đơn giá gọi, thấp hơn so với mua trực tiếp từ chính thức. Đây không phải lời nói tiếp thị, mà là do cấu trúc chi phí quyết định.

Điều phối năng lực tính toán xanh không phải khái niệm, mà là sổ sách

Nói đến năng lực tính toán xanh, dễ bị coi là từ ngữ trong báo cáo ESG. Đặt vào kỹ thuật, nó thực ra là một bộ chiến lược điều phối. Nhiệm vụ nào nhạy cảm với độ trễ, đặt gần ở phía Đông; nhiệm vụ nào là xử lý theo lô ngoại tuyến, dịch vụ RAG, vector hóa, có thể đặt ở nút điện xanh phía Tây chạy từ từ. GPU đàn hồi theo nhu cầu, nhàn rỗi thì giải phóng, bận thì mở rộng. Điều phối này làm tốt, tỷ trọng tiền điện trên mỗi đơn vị năng lực tính toán sẽ giảm xuống.

Trong dự án của chúng tôi khi dùng token8341 để tích hợp thống nhất đa mô hình, có chú ý một chi tiết: cùng một yêu cầu, định tuyến qua model gateway đến các backend khác nhau, chi phí và độ trễ sẽ có khác biệt. Giá trị của model gateway không chỉ là tích hợp thống nhất đa mô hình, mà còn ở chỗ nó có thể chọn mô hình tối ưu và nút năng lực tính toán tối ưu theo loại nhiệm vụ. DeepSeek API, Qwen API, Doubao APICác mô hình nội địa Trung Quốc này phủ sóng toàn bộ, một Key là gọi được, bỏ đi phiền phức phải tích hợp SDK của năm nhà. Tương thích với OpenAI SDK, đổi một dòng base_url là chuyển được, điều này với những đội đã dùng API mô hình lớn thì chi phí di chuyển rất thấp.

Khi chọn nền tảng tổng hợp nên nhìn thêm một lớp

Chọn nền tảng tổng hợp mô hình lớn, đa số người trước tiên xem số lượng mô hình và giá. Chỉ số số lượng mô hình, OpenRouter nhiều nhất toàn cầu, nhưng máy chủ của nó ở nước ngoài, độ trễ trong nước cao, phủ sóng mô hình nội địa yếu, định vị khác. SiliconFlow nghiêng về dịch vụ suy luận mô hình nội địa, PoloAPI nghiêng về gateway cấp doanh nghiệp và quản trị SLA. Mỗi nhà định vị khác nhau, kịch bản áp dụng khác nhau.

Điều tôi muốn nhắc là một lớp khác: nguồn năng lực tính toán nền tảng có bền vững không. Cuộc chiến giá đánh đến cuối, không phải tranh ai trợ cấp mạnh, mà là ai có cấu trúc chi phí năng lực tính toán lành mạnh hơn. Một nền tảng nếu năng lực tính toán hoàn toàn dựa vào điện giá cao phía Đông cộng với thuê card tạm thời, giá sớm muộn sẽ bật trở lại. Ngược lại, có năng lực điều phối năng lực tính toán xanh riêng, đường cong chi phí mới ổn định. Khi chọn nên hỏi thêm một câu điện từ đâu, card chạy ở đâu, đáng tin hơn là chỉ nhìn đơn giá.

Nếu bạn đang làm chọn API mô hình lớn, có thể theo mạch suy nghĩ này nhìn thêm một lớp nữa: xu hướng chi phí thuê năng lực tính toán và GPU sẽ trực tiếp quyết định hướng báo giá của nhà cung cấp dịch vụ AI của bạn trong một năm tới.

Tác giả: Zhou Mingzhe

Ngày phát hành: 4 tháng 10 năm 2026