ベンチマークスコアでLLMプロバイダーを選ぶぶのは、メニューの写真でレストランを選ぶぶようなものだ。モデルは重要だが、モデルの周りにあるものも同じじくらい重要であり、そして実際に本番環境で痛いい目に遭ううのはその周りの部分なのだ。これは、本格的に何かを投入する前に私がプロバイダーに対して確認するチェックリストだ。
稼働率とSLA
SLAは数字を伴うった約束なので、数字を読むみなさい。稼働率のパーセンテージは、変わる換してみるまでは紛らわしいらわしいほど近いく見るえる:
| SLA | 年間ダウンタイム | 月間ダウンタイム |
|---|---|---|
| 99.9% | 8.76時間 | 43.8分 |
| 99.95% | 4.38時間 | 21.9分 |
| 99.99% | 52.6分 | 4.4分 |
99.9%は素晴らしいらしく聞くこえるが、それでも月にほぼ1時間の停止を許容している。あなたの製品がそのエンドポイントに依存しているなら、99.9%と99.99%の差は「迷惑」と「忘れるれられる」の差だ。また、見る出ししの数字以外に2つのことを確認すべきだ:
•何がダウンタイムと見るなされるか。 SLAによっては、完全な停止のみを対象とし、スループットの低下や高いいエラー率はカバーしていない。
•彼らがそれを達成できなかったときに何が得るられるか。 クレジットが上限付ききであったり、請求の申請が必要だったりするなら、クレジットにはほとんど価値がない。補償は具体的であるべきだ。
SLAを全く公表しないプロバイダーは何かを伝えるえている。それは良いいことではない。
レイテンシとスループット
レイテンシには気にすべき2つの数字があり、それらは異なるなるものを測定している:
•初回トークンまでの時間(TTFT)。 レスポンスのストリーミングが始めるまるまでの時間。これはユーザーが「キビキビしている」と感じるものだ。
•1秒あたりのトークン数(スループット)。 残るりのレスポンスがどれだけ速いく届くくか。これが長いい回答えるが遅いく感じるかどうかを決めるめる。
どちらもモデルと負荷によって変わるわるので、マーケティングの数字を信じるじてはいけない。自分で測定しなさい:
import time
from openai import OpenAI
client = OpenAI(base_url="https://api.token8341.com/v1",
api_key="sk-your-key")
start = time.perf_counter()
stream = client.chat.completions.create(
model="deepseek-chat",
messages=[{"role": "user", "content": "Write 200 words about caching"}],
stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
if ttft is None:
ttft = time.perf_counter() - start
tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
f"{tokens / elapsed:.1f} tok/s")これを1日の異なるなる時間帯に、そして自分の想定する同じ時実行数の下で実行しなさい。午前10時に速いく、午後7時に遅いいプロバイダーは、あなたが知るっておくべき容量問題を抱えるえている。
コスト
トークンあたりの価格は簡単な部分だ。全体的なコスト像には以下が含むまれる:
•入力と出し力の価格。通常、出し力は入力の数倍のコストがかかるため。
•キャッシュヒットの価格。 反復的なワークロードでは、プロンプトキャッシュはどんな割引よりもコストを削減できる。
•レート制限とスロットリング。 まれにしか使うえない安いいエンドポイントは、キューイングとリトライを加えるえると安いくはない。
•通貨と支払いの摩擦。 越境カード手数料と換算コストは小規模チームにとって現実的な問題だ。
分離された100万トークンあたりの価格ではなく、実際のワークロードの価格を尋ねるねなさい。
モデルのカバレッジと互換性
•APIはOpenAI互換か? そうであれば、標準SDKを使うい、後で書くき直すすことなく切るり替えるえられる。独自仕様であれば、プロバイダーと結婚することになる。
•1つのキーで複数のモデルファミリーにアクセスできるか? 1つか2つのモデルしかないカタログは、独自APIと同じじくらいきつくあなたを縛るる。多いくのモデルがあるカタログは、フォールバックとより安い価なルーティングへの道を提供する。
•プレーンなチャットだけでなく、埋めるめ込むみ、関数呼び出ししび出しし、ストリーミングがサポートされているか? これらの機能が、そのエンドポイントが実際のアプリに適合するか、単なるデモに過ぎるぎないかを決めるめる。
データの取るり扱ういとサポート
•データ保持つ。 プロバイダーはあなたのプロンプトと補完をトレーニングのために保持つするか?これを書く面で入手しなさい。
•リージョンとデータ所在地。 リクエストはどこで処理されるか?一部のユーザーにとって、これは好むみではなく法的要件だ。
•サポートの質。 契約する前にサポートチケットを開くいてみなさい。最初の応答えるの速いさと有用性は、障害時にどうなるかの強いい予測因子だ。
•ステータスの透明性。 公開くステータスページとインシデント履歴は、プロバイダーが自身の信じる頼性について正直すかどうかを教えるえてくれる。
要約版
すべての候補をこの5つの質問に通しなさい:
1.SLAは何か、そしてそれが達成されなかったときの補償は何か?
2.私の負荷下で測定されたTTFTとスループットは?
3.キャッシュヒットを含むめた実際のワークロードのコストは?
4.APIはOpenAI互換で、1つのキーの背後に複数のモデルがあるか?
5.データがどこで処理されるか、サポートがどう応答えるするかを教えるえてくれるか?
これらのどれも深いい専門知る識を必要としない。必要なのは、障害の後ではなく、前に尋ねるねることだ。これらに余裕を持つって答えるえられるプロバイダーは、単にモデルをリストアップしただけでなく、実際に本番トラフィックを運用してきたプロバイダーである傾向がある。
SiCore TokenWorksはこのリストのほとんどに容易に適合する:99.9%のSLA、https://api.token8341.com/v1のOpenAI互換エンドポイント、GPT-4o、Claude、Gemini、DeepSeek、Qwen、ERNIE、Doubao、Spark、Panguをカバーする1つのキー、そしてキャッシュヒット価格を伴ううトークン単位の従量課金。