如果你只用过一家 LLM 提供商,那家提供商定价页面上的标价看起来可能就是价格。其实不是。那是零售价,和大多数零售价一样,其中包含了大量利润和结构性成本。聚合商赚钱的方式,正是针对这种结构下手。
为什么直接标价偏高
直接定价中包含一些与运行模型无关的成本。当你直接从供应商购买时,你还要为以下内容付费:
•最低承诺量。 有些提供商要求你先预付余额或承诺消费,才会给你最优价格。小团队很少能达到这些档位。
•一个提供商,一份合同。 每个供应商都有自己的注册流程、自己的账单、自己的货币。运行三家提供商意味着三张发票和三种支付方式。
•你自己的账单里没有竞争。 当你被锁定在一家供应商时,那家供应商就没有理由给你折扣。你要么接受他们的价格,要么离开。
•为保护他们而不是为你方便而设置的速率限制。
聚合商之所以存在,是因为他们可以批量购买上游容量,并将一部分折扣传递下去。他们还让你能够在提供商之间转移支出,这才是真正的杠杆:如果模型 A 下个月变便宜了,你可以切换流量,而不必切换供应商。
用整数来算这笔账
让我用刻意简化的示例数字,好让结构更清楚。真实价格一直在变,但算术是一样的。
假设某提供商将某模型标价为每百万输入 token 2.50 美元,每百万输出 token 10.00 美元。一个典型工作负载,比如一个支持工单摘要器,每月处理 1000 万输入 token 和 400 万输出 token,成本会是:
Direct: (10M x $2.50) + (4M x $10.00) = $25 + $40 = $65.00 / month一个谈下了批量价格的聚合商,可能以大约标价四分之一的价格提供同一模型,即每百万输入 0.60 美元、每百万输出 2.40 美元:
Aggregated: (10M x $0.60) + (4M x $2.40) = $6.00 + $9.60 = $15.60 / month在一个不大的工作负载上,这每月大约节省 49 美元,降幅约 76%,而且这还没算其他任何东西。把 token 数量扩大一个数量级,绝对节省额也会随之扩大。
关键不在于这些具体数字。关键在于“标价”和“批量价”之间的差距是真实存在的,而聚合商的工作就是站在这道差距里,并把其中一部分返还给你。
藏在细则里的其他成本
每 token 价格是头条,但不是全部账单。有三件事容易让人踩坑:
缓存命中定价。 有些模型会对命中提示缓存的 token 打折。如果一个提供商对缓存输入收取全价,而另一个只收 10%,那么对于提示重复率高的工作负载,即使标价相同,成本也可能相差很多。承诺前先问清楚。
货币和支付摩擦。 从账单货币或地区与你信用卡不匹配的供应商购买,会增加转换费以及扣款失败带来的麻烦。用你本币结算的单一聚合商账单就能消除这一点。
作为隐性成本的速率限制。 一个每分钟只能调用 10 次的便宜模型并不便宜;你会为了弥补它而构建重试和排队逻辑,而那就是工程时间。吞吐限制也应纳入定价比较,尽管它不在定价页面上。
一个快速成本估算器
一旦有了数字,在构建前估算支出就很直接。下面是一个体现这个思路的小型 Python 脚本:
def monthly_cost(input_tokens, output_tokens, in_price, out_price):
# prices are per million tokens
return (input_tokens / 1e6) * in_price + (output_tokens / 1e6) * out_price
# Direct list price
direct = monthly_cost(10_000_000, 4_000_000, 2.50, 10.00)
# Aggregator price (example values)
aggregated = monthly_cost(10_000_000, 4_000_000, 0.60, 2.40)
print(f"Direct: ${direct:.2f}")
print(f"Aggregated: ${aggregated:.2f}")
print(f"Saved: ${direct - aggregated:.2f}")用你的真实 token 数量和真实价格跑一遍。那才是唯一重要的数字。
聚合商在哪些情况下不能帮你省钱
我应该坦率说明局限。聚合商是经销商。有些模型根本无法通过经销商获得,而对某些小众模型来说,聚合商的加价可能比直接购买更糟。节省最大的是那些存在批量折扣的热门通用模型。对于一个你很少调用的冷门模型,差异可以忽略不计。
另外,如果聚合商的可靠性很差,再便宜的价格也毫无价值。一个便宜 30% 但换来的是不稳定端点,一旦把重试、支持工单和你自己的时间算进去,成本就不止多 30%。价格和可靠性是一个决策,不是两个。
SiCore TokenWorks 是这种模式的一个直截了当的版本:兼容 OpenAI、按量付费,目录中包含来自 DeepSeek、Qwen、ERNIE、Doubao、Spark 和 Pangu 的热门模型,以及 GPT-4o、Claude 和 Gemini,标价远低于官方每 token 费率。