SiCore TokenWorks
LLM APIAPI GatewayCost Optimization

Qué buscar en un proveedor de API de LLM: una lista de verificación

SiCore TokenWorks Team·2026-09-03

Elegir un proveedor de LLM por sus puntuaciones en benchmarks es como elegir un restaurante por las fotos de su menú. El modelo importa, pero también importa todo lo que rodea al modelo, y eso que lo rodea es lo que realmente te causa problemas en producción. Esta es la lista de verificación que aplico a un proveedor antes de apuntarle algo real.

Tiempo de actividad y SLA

Un SLA es una promesa con números adjuntos, así que lee los números. Los porcentajes de tiempo de actividad parecen engañosamente cercanos entre sí hasta que los conviertes:

SLATiempo de inactividad por añoTiempo de inactividad por mes
99.9%8.76 horas43.8 minutos
99.95%4.38 horas21.9 minutos
99.99%52.6 minutos4.4 minutos

99.9% suena excelente y aun así permite casi una hora de interrupción mensual. Si tu producto depende del endpoint, 99.9% frente a 99.99% es la diferencia entre "molesto" y "olvidable". Además, revisa dos cosas más allá de la cifra principal:

•Qué cuenta como tiempo de inactividad. Algunos SLA solo cubren interrupciones totales, no el rendimiento degradado ni las tasas de error elevadas.

•Qué obtienes cuando no lo cumplen. Un crédito vale poco si el crédito tiene un tope o requiere que presentes una reclamación. El remedio debe ser concreto.

Un proveedor que no publicará un SLA en absoluto te está diciendo algo, y no es bueno.

Latencia y rendimiento

La latencia tiene dos números que te importan y miden cosas diferentes:

•Tiempo hasta el primer token (TTFT). Cuánto tarda antes de que la respuesta empiece a transmitirse. Esto es lo que un usuario percibe como "ágil".

•Tokens por segundo (rendimiento). Qué tan rápido llega el resto de la respuesta. Esto es lo que determina si una respuesta larga se siente lenta.

Ambos varían según el modelo y según la carga, así que no confíes en un número de marketing. Mídelo tú mismo:

import time
from openai import OpenAI

client = OpenAI(base_url="https://api.token8341.com/v1",
                api_key="sk-your-key")

start = time.perf_counter()
stream = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "Write 200 words about caching"}],
    stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
    if ttft is None:
        ttft = time.perf_counter() - start
    tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
      f"{tokens / elapsed:.1f} tok/s")

Ejecuta eso en varios momentos diferentes del día y bajo tu propia concurrencia esperada. Un proveedor que es rápido a las 10 a. m. y lento a las 7 p. m. tiene un problema de capacidad que necesitas conocer.

Costo

El precio por token es la parte fácil. El panorama completo del costo incluye:

•Precios de entrada frente a salida, ya que la salida normalmente cuesta varias veces la entrada.

•Precio de aciertos de caché. Para cargas de trabajo repetitivas, una caché de prompts puede reducir el costo más que cualquier descuento.

•Límites de velocidad y limitación. Un endpoint barato al que solo puedes acceder de forma esporádica no es barato una vez que añades colas y reintentos.

•Moneda y fricción de pago. Las comisiones de tarjetas transfronterizas y los costos de conversión son reales para los equipos pequeños.

Pide el precio de tu carga de trabajo real, no el precio por millón de tokens de forma aislada.

Cobertura de modelos y compatibilidad

•¿La API es compatible con OpenAI? Si lo es, puedes usar los SDK estándar y cambiar más adelante sin reescribir. Si es propietaria, te estás casando con el proveedor.

•¿Puedes acceder a varias familias de modelos con una sola clave? Un catálogo con uno o dos modelos te ata tan firmemente como una API propietaria. Un catálogo con muchos modelos te da un respaldo y un camino hacia un enrutamiento más económico.

•¿Se admiten embeddings, llamadas a funciones y streaming, no solo chat simple? Estas son las características que deciden si el endpoint encaja en una app real o solo en una demo.

Manejo de datos y soporte

•Retención de datos. ¿El proveedor conserva tus prompts y completions para entrenamiento? Consíguelo por escrito.

•Región y residencia. ¿Dónde se procesan las solicitudes? Para algunos usuarios esto es un requisito legal, no una preferencia.

•Calidad del soporte. Intenta abrir un ticket de soporte antes de comprometerte. La velocidad y utilidad de la primera respuesta es un fuerte predictor de cómo será una interrupción.

•Transparencia de estado. Una página de estado pública y un historial de incidentes te dicen si el proveedor es honesto sobre su propia fiabilidad.

La versión corta

Somete a cada candidato a estas cinco preguntas:

1.¿Cuál es el SLA, y cuál es el remedio cuando no se cumple?

2.¿Cuáles son el TTFT y el rendimiento medidos bajo mi carga?

3.¿Cuánto cuesta mi carga de trabajo real, incluidos los aciertos de caché?

4.¿Es la API compatible con OpenAI, con varios modelos detrás de una sola clave?

5.¿Me dirán dónde se procesan los datos y cómo responde el soporte?

Ninguna de estas requiere una experiencia profunda. Requieren que preguntes antes de la interrupción, no después. Los proveedores que las responden con soltura tienden a ser los que realmente han gestionado tráfico de producción, en lugar de simplemente haber listado un modelo.

SiCore TokenWorks encaja fácilmente con la mayor parte de esta lista: un SLA del 99.9%, un endpoint compatible con OpenAI en https://api.token8341.com/v1, una sola clave que cubre GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark y Pangu, y facturación medida por token con precios de aciertos de caché.