SiCore TokenWorks
LLM APIAPI Gateway

На що звертати увагу при виборі постачальника LLM API: контрольний список

SiCore TokenWorks Team·2026-09-03

Вибір постачальника LLM за оцінками бенчмарків — це як вибір ресторану за фотографіями в меню. Модель має значення, але все навколо моделі теж має значення, і саме оточення насправді завдає вам клопоту в продакшені. Це контрольний список, який я перевіряю в постачальника, перш ніж спрямувати на нього щось справжнє.

Час безперебійної роботи та SLA

SLA — це обіцянка з цифрами, тож читайте цифри. Відсотки часу безперебійної роботи оманливо близькі одне до одного, поки ви їх не переведете:

SLAПростій на рікПростій на місяць
99.9%8.76 годин43.8 хвилин
99.95%4.38 годин21.9 хвилин
99.99%52.6 хвилин4.4 хвилин

99.9% звучить чудово і все ще допускає майже годину щомісячного простою. Якщо ваш продукт залежить від ендпоінта, 99.9% проти 99.99% — це різниця між «дратує» і «непомітно». Також перевірте дві речі поза основним числом:

•Що вважається простоєм. Деякі SLA охоплюють лише повні відмови, а не знижену пропускну здатність чи високі показники помилок.

•Що ви отримуєте, коли їх не дотримуються. Компенсація мало чого варта, якщо вона обмежена або вимагає подання заявки. Засіб відшкодування має бути конкретним.

Постачальник, який взагалі не публікує SLA, дещо вам повідомляє, і це не щось добре.

Затримка та пропускна здатність

У затримки є два числа, які вас цікавлять, і вони вимірюють різні речі:

•Час до першого токена (TTFT). Скільки часу минає до початку потокової відповіді. Це те, що користувач відчуває як «швидко».

•Токенів за секунду (пропускна здатність). Як швидко надходить решта відповіді. Це визначає, чи довга відповідь здається повільною.

Обидва показники залежать від моделі та від навантаження, тож не довіряйте маркетинговим числам. Виміряйте самі:

import time
from openai import OpenAI

client = OpenAI(base_url="https://api.token8341.com/v1",
                api_key="sk-your-key")

start = time.perf_counter()
stream = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "Write 200 words about caching"}],
    stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
    if ttft is None:
        ttft = time.perf_counter() - start
    tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
      f"{tokens / elapsed:.1f} tok/s")

Запустіть це в кілька різних часів дня і за вашої власної очікуваної конкурентності. Постачальник, який швидкий о 10-й ранку і повільний о 7-й вечора, має проблему з потужністю, про яку вам потрібно знати.

Вартість

Ціна за токен — це легка частина. Повна картина витрат включає:

•Ціни на вхідні та вихідні дані, оскільки вихідні зазвичай коштують у кілька разів дорожче за вхідні.

•Ціноутворення з урахуванням влучань у кеш. Для повторюваних робочих навантажень кеш підказок може скоротити витрати більше, ніж будь-яка знижка.

•Обмеження швидкості та тротлінг. Дешевий ендпоінт, до якого ви можете звертатися лише зрідка, не є дешевим, коли ви додаєте черги та повторні спроби.

•Валюта та труднощі з оплатою. Транскордонні комісії за картками та витрати на конвертацію є реальними для невеликих команд.

Запитайте ціну для вашого фактичного робочого навантаження, а не ціну за мільйон токенів окремо.

Покриття моделей і сумісність

•Чи сумісний API з OpenAI? Якщо так, ви можете використовувати стандартні SDK і пізніше переключитися без переписування. Якщо він пропрієтарний, ви одружуєтеся з постачальником.

•Чи можете ви дістатися кількох сімейств моделей через один ключ? Каталог з однією-двома моделями прив'язує вас так само міцно, як пропрієтарний API. Каталог з багатьма моделями дає вам запасний варіант і шлях до дешевшого маршрутизації.

•Чи підтримуються вбудовування, виклик функцій і потокова передача, а не лише звичайний чат? Це функції, які визначають, чи підходить ендпоінт для реального застосунку, чи лише для демо.

Обробка даних і підтримка

•Збереження даних. Чи зберігає постачальник ваші підказки та відповіді для навчання? Отримайте це письмово.

•Регіон і розміщення даних. Де обробляються запити? Для деяких користувачів це юридична вимога, а не вподобання.

•Якість підтримки. Спробуйте відкрити звернення до підтримки, перш ніж зобов'язуватися. Швидкість і корисність першої відповіді — сильний провісник того, якою буде відмова.

•Прозорість статусу. Публічна сторінка статусу та історія інцидентів показують, чи постачальник чесний щодо власної надійності.

Коротко

Проженіть кожного кандидата через ці п'ять питань:

1.Який SLA і який засіб відшкодування, коли його не дотримано?

2.Які виміряні TTFT і пропускна здатність за мого навантаження?

3.Скільки коштує моє реальне робоче навантаження, включно з влучаннями в кеш?

4.Чи сумісний API з OpenAI, з кількома моделями за одним ключем?

5.Чи скажуть вони мені, де обробляються дані та як реагує підтримка?

Жодне з цих питань не вимагає глибокої експертизи. Вони вимагають, щоб ви запитали до відмови, а не після. Постачальники, які відповідають на них без труднощів, зазвичай ті, що справді обробляли продакшн-трафік, а не просто розмістили модель у списку.

SiCore TokenWorks легко відповідає більшості цього списку: SLA 99.9%, ендпоінт, сумісний з OpenAI, за адресою https://api.token8341.com/v1, один ключ, що охоплює GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark і Pangu, та оплата за токенами з ціноутворенням з урахуванням влучань у кеш.