SiCore TokenWorks
LLM APIAPI Gateway

Что искать в поставщике LLM API: чек-лист

SiCore TokenWorks Team·2026-09-03

Выбирать поставщика LLM по результатам бенчмарков — это как выбирать ресторан по фотографиям в меню. Модель важна, но важно и всё, что её окружает, и именно окружение в реальности бьёт по вам в продакшене. Это чек-лист, через который я прогоняю поставщика, прежде чем направить на него что-то реальное.

Аптайм и SLA

SLA — это обещание с прикреплёнными к нему цифрами, поэтому читайте цифры. Проценты аптайма обманчиво близки друг к другу, пока вы их не переведёте:

SLAПростой в годПростой в месяц
99.9%8,76 часа43,8 минуты
99.95%4,38 часа21,9 минуты
99.99%52,6 минуты4,4 минуты

99.9% звучит превосходно и всё ещё допускает почти час простоя в месяц. Если ваш продукт зависит от эндпоинта, то 99.9% против 99.99% — это разница между «раздражает» и «незаметно». Также проверьте две вещи помимо главной цифры:

•Что считается простоем. Некоторые SLA покрывают только полные отказы, а не деградацию пропускной способности или высокий уровень ошибок.

•Что вы получаете, когда они не выполняют обязательства. Компенсация стоит мало, если она ограничена сверху или требует от вас подачи заявки. Средство правовой защиты должно быть конкретным.

Поставщик, который вообще не публикует SLA, кое-что вам сообщает, и это нечто хорошее.

Задержка и пропускная способность

У задержки есть две цифры, которые вас интересуют, и они измеряют разные вещи:

•Время до первого токена (TTFT). Сколько времени проходит до начала потоковой передачи ответа. Именно это пользователь ощущает как «быстроту».

•Токенов в секунду (пропускная способность). Как быстро приходит остальная часть ответа. Именно это определяет, ощущается ли длинный ответ медленным.

Обе величины зависят от модели и от нагрузки, поэтому не доверяйте маркетинговой цифре. Измерьте сами:

import time
from openai import OpenAI

client = OpenAI(base_url="https://api.token8341.com/v1",
                api_key="sk-your-key")

start = time.perf_counter()
stream = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "Write 200 words about caching"}],
    stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
    if ttft is None:
        ttft = time.perf_counter() - start
    tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
      f"{tokens / elapsed:.1f} tok/s")

Запустите это в разное время суток и при вашей собственной ожидаемой конкурентности. Поставщик, который быстр в 10 утра и медлен в 7 вечера, имеет проблему с мощностями, о которой вам нужно знать.

Стоимость

Цена за токен — это простая часть. Полная картина затрат включает:

•Цены на вход и выход, поскольку выход обычно стоит в несколько раз дороже входа.

•Ценообразование с учётом попаданий в кэш. Для повторяющихся нагрузок кэш промптов может снизить стоимость сильнее любой скидки.

•Лимиты запросов и троттлинг. Дешёвый эндпоинт, к которому можно обращаться лишь изредка, перестаёт быть дешёвым, как только вы добавляете очередь и повторы.

•Валюта и сложности с оплатой. Комиссии за карты при трансграничных платежах и расходы на конвертацию реальны для небольших команд.

Спрашивайте цену вашей фактической нагрузки, а не цену за миллион токенов в вакууме.

Покрытие моделей и совместимость

•Совместим ли API с OpenAI? Если да, вы можете использовать стандартные SDK и позже переключиться без переписывания. Если он проприетарный, вы связываете себя с поставщиком.

•Можно ли через один ключ получить доступ к нескольким семействам моделей? Каталог с одной-двумя моделями привязывает вас так же крепко, как проприетарный API. Каталог со множеством моделей даёт вам запасной вариант и путь к более дешёвой маршрутизации.

•Поддерживаются ли эмбеддинги, вызов функций и потоковая передача, а не только обычный чат? Именно эти возможности определяют, подходит ли эндпоинт для реального приложения или только для демо.

Обработка данных и поддержка

•Хранение данных. Сохраняет ли поставщик ваши промпты и ответы для обучения? Получите это в письменном виде.

•Регион и местонахождение данных. Где обрабатываются запросы? Для некоторых пользователей это юридическое требование, а не предпочтение.

•Качество поддержки. Попробуйте открыть тикет в поддержку до того, как возьмёте на себя обязательства. Скорость и полезность первого ответа — сильный прогноз того, как пройдёт отказ.

•Прозрачность статуса. Публичная страница статуса и история инцидентов говорят о том, честен ли поставщик насчёт собственной надёжности.

Короткая версия

Прогоните каждого кандидата через эти пять вопросов:

1.Каков SLA и каково средство правовой защиты, когда он не соблюдён?

2.Каковы измеренные TTFT и пропускная способность под моей нагрузкой?

3.Сколько стоит моя реальная нагрузка, включая попадания в кэш?

4.Совместим ли API с OpenAI, с несколькими моделями за одним ключом?

5.Скажут ли они мне, где обрабатываются данные и как реагирует поддержка?

Ничто из этого не требует глубокой экспертизы. Это требует, чтобы вы спросили до отказа, а не после. Поставщики, которые отвечают на эти вопросы без затруднений, как правило, те, кто действительно обслуживал продакшен-трафик, а не просто указал модель.

SiCore TokenWorks легко вписывается в большую часть этого списка: SLA 99,9%, эндпоинт, совместимый с OpenAI, по адресу https://api.token8341.com/v1, один ключ, покрывающий GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark и Pangu, и оплата по факту за токен с ценообразованием с учётом попаданий в кэш.