根据基准分数选择LLM提供商,就像根据菜单照片选择餐厅。模型很重要,但模型周边的一切同样重要,而周边的这些东西才是真正会在生产环境中让你吃苦头的地方。这是我在把任何真实业务指向某个提供商之前,会用来审查它的一份清单。
正常运行时间与SLA
SLA是一份附带数字的承诺,所以要仔细读这些数字。正常运行时间百分比乍看之下彼此接近,容易误导,直到你换算成实际时长:
| SLA | 每年停机时间 | 每月停机时间 |
|---|---|---|
| 99.9% | 8.76小时 | 43.8分钟 |
| 99.95% | 4.38小时 | 21.9分钟 |
| 99.99% | 52.6分钟 | 4.4分钟 |
99.9%听起来非常出色,但仍然允许每月将近一小时的停机。如果你的产品依赖该端点,那么99.9%和99.99%之间的差别,就是“烦人”和“无感”之间的差别。除了标题上的数字,还要检查两件事:
•什么算作停机。 有些SLA只覆盖完全中断,不覆盖吞吐降级或高错误率。
•他们未达标时你会得到什么。 如果补偿有上限,或者需要你自己提交申请,那这点补偿价值不大。补救措施应该是具体的。
一个根本不公布SLA的提供商,其实已经在告诉你一些信息了,而且不是什么好信息。
延迟与吞吐量
延迟有两个你关心的数字,它们衡量的是不同的事情:
•首Token时间(TTFT)。 响应开始流式输出之前要等多久。这是用户感受到的“响应快不快”。
•每秒Token数(吞吐量)。 响应剩余部分到达的速度。这决定了长回答是否让人感觉缓慢。
这两个指标都会因模型和负载而异,所以不要相信营销数字。自己测量:
import time
from openai import OpenAI
client = OpenAI(base_url="https://api.token8341.com/v1",
api_key="sk-your-key")
start = time.perf_counter()
stream = client.chat.completions.create(
model="deepseek-chat",
messages=[{"role": "user", "content": "Write 200 words about caching"}],
stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
if ttft is None:
ttft = time.perf_counter() - start
tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
f"{tokens / elapsed:.1f} tok/s")在一天中的不同时间、以及你自己预期的并发条件下运行这段代码。一个上午10点很快、晚上7点很慢的提供商,存在你需要了解到的容量问题。
成本
按Token计价是最容易看的部分。完整的成本图景还包括:
•输入与输出价格,因为输出通常比输入贵好几倍。
•缓存命中定价。 对于重复性工作负载,提示缓存降低成本的效果可能超过任何折扣。
•速率限制与限流。 一个便宜但只能偶尔调用的端点,一旦加上排队和重试,就不便宜了。
•货币与支付摩擦。 对小型团队来说,跨境卡手续费和汇兑成本是真实存在的。
要询问你实际工作负载的价格,而不是孤立地看每百万Token的价格。
模型覆盖与兼容性
•API是否兼容OpenAI? 如果兼容,你就可以使用标准SDK,以后切换时无需重写。如果是专有API,你就和这个提供商绑定了。
•能否用一个密钥访问多个模型系列? 只有一两个模型的目录,其锁定程度和专有API一样强。拥有许多模型的目录则为你提供了后备方案,以及通往更便宜路由的路径。
•是否支持嵌入、函数调用和流式输出,而不只是普通聊天?这些功能决定了该端点适合真实应用,还是只适合演示。
数据处理与支持
•数据保留。 提供商会保留你的提示和补全结果用于训练吗?要把这一点落实到书面。
•区域与数据驻留。 请求在哪里处理?对某些用户来说,这是法律要求,而不是偏好。
•支持质量。 在正式采用之前,先试着提交一张支持工单。首次回复的速度和有用程度,是预测故障发生时体验如何的有力指标。
•状态透明度。 公开的状态页面和事件历史会告诉你,这个提供商是否诚实对待自身的可靠性。
简短版
用这五个问题审查每一个候选提供商:
1.SLA是什么,未达标时的补救措施是什么?
2.在我的负载下,实测的TTFT和吞吐量是多少?
3.我的真实工作负载成本是多少,包括缓存命中?
4.API是否兼容OpenAI,并且一个密钥背后有多个模型?
5.他们是否愿意告诉我数据在哪里处理,以及支持响应如何?
这些都不需要高深专业知识。它们需要的是你在故障发生之前去问,而不是事后才问。能从容回答这些问题的提供商,往往才是真正跑过生产流量的,而不只是列出了一个模型。
SiCore TokenWorks 在这份清单的大多数方面都很容易符合:99.9% SLA、位于 https://api.token8341.com/v1 的OpenAI兼容端点、一个密钥覆盖GPT-4o、Claude、Gemini、DeepSeek、Qwen、ERNIE、Doubao、Spark和Pangu,以及带有缓存命中定价的按Token计量计费。