SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

Cosa cercare in un fornitore di API LLM: una checklist

SiCore TokenWorks Team·2026-09-03

Scegliere un fornitore di LLM in base ai punteggi dei benchmark è come scegliere un ristorante dalle foto del menu. Il modello conta, ma conta anche tutto ciò che gli sta intorno, e sono le cose che gli stanno intorno a morderti davvero in produzione. Questa è la checklist che faccio passare a un fornitore prima di puntarci qualcosa di reale.

Uptime e SLA

Uno SLA è una promessa con dei numeri attaccati, quindi leggi i numeri. Le percentuali di uptime sembrano ingannevolmente vicine tra loro finché non le converti:

SLATempo di inattività all'annoTempo di inattività al mese
99,9%8,76 ore43,8 minuti
99,95%4,38 ore21,9 minuti
99,99%52,6 minuti4,4 minuti

99,9% suona eccellente e consente comunque quasi un'ora di interruzione al mese. Se il tuo prodotto dipende dall'endpoint, 99,9% contro 99,99% è la differenza tra "fastidioso" e "dimenticabile". Controlla anche due cose oltre al numero di facciata:

•Cosa conta come inattività. Alcuni SLA coprono solo le interruzioni totali, non il throughput degradato o gli alti tassi di errore.

•Cosa ottieni quando non lo rispettano. Un credito vale poco se il credito è limitato o richiede che tu presenti un reclamo. Il rimedio dovrebbe essere concreto.

Un fornitore che non pubblica affatto uno SLA ti sta dicendo qualcosa, e non è positivo.

Latenza e throughput

La latenza ha due numeri che ti interessano e misurano cose diverse:

•Time to first token (TTFT). Quanto tempo passa prima che la risposta inizi a essere trasmessa in streaming. È ciò che l'utente percepisce come "reattivo".

•Token al secondo (throughput). Quanto velocemente arriva il resto della risposta. È ciò che determina se una risposta lunga sembra lenta.

Entrambi variano in base al modello e al carico, quindi non fidarti di un numero di marketing. Misuralo tu stesso:

import time
from openai import OpenAI

client = OpenAI(base_url="https://api.token8341.com/v1",
                api_key="sk-your-key")

start = time.perf_counter()
stream = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "Write 200 words about caching"}],
    stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
    if ttft is None:
        ttft = time.perf_counter() - start
    tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
      f"{tokens / elapsed:.1f} tok/s")

Esegui quel codice in momenti diversi della giornata e con la concorrenza che ti aspetti di avere. Un fornitore veloce alle 10 del mattino e lento alle 19 ha un problema di capacità che devi conoscere.

Costo

Il prezzo per token è la parte facile. Il quadro completo dei costi include:

•Prezzi di input vs. output, dato che l'output di solito costa diverse volte l'input.

•Prezzo per cache hit. Per carichi di lavoro ripetitivi, una cache dei prompt può ridurre il costo più di qualsiasi sconto.

•Limiti di frequenza e throttling. Un endpoint economico che puoi chiamare solo con parsimonia non è economico una volta che aggiungi code e tentativi ripetuti.

•Valuta e attrito nei pagamenti. Le commissioni sulle carte transfrontaliere e i costi di conversione sono reali per i team piccoli.

Chiedi il prezzo del tuo carico di lavoro reale, non il prezzo per milione di token in isolamento.

Copertura dei modelli e compatibilità

•L'API è compatibile con OpenAI? Se lo è, puoi usare gli SDK standard e cambiare in seguito senza riscrivere. Se è proprietaria, stai sposando il fornitore.

•Puoi raggiungere diverse famiglie di modelli con una sola chiave? Un catalogo con uno o due modelli ti blocca tanto quanto un'API proprietaria. Un catalogo con molti modelli ti offre un fallback e un percorso verso un routing più economico.

•Sono supportati embeddings, function calling e streaming, non solo la semplice chat? Queste sono le funzionalità che decidono se l'endpoint si adatta a un'app reale o solo a una demo.

Gestione dei dati e supporto

•Conservazione dei dati. Il fornitore conserva i tuoi prompt e le tue completioni per l'addestramento? Fatti mettere questo per iscritto.

•Regione e residenza. Dove vengono elaborate le richieste? Per alcuni utenti questo è un requisito legale, non una preferenza.

•Qualità del supporto. Prova ad aprire un ticket di supporto prima di impegnarti. La velocità e l'utilità della prima risposta sono un forte predittore di come sarà un'interruzione.

•Trasparenza sullo stato. Una pagina di stato pubblica e una cronologia degli incidenti ti dicono se il fornitore è onesto riguardo alla propria affidabilità.

La versione breve

Fai passare ogni candidato attraverso queste cinque domande:

1.Qual è lo SLA, e qual è il rimedio quando non viene rispettato?

2.Quali sono TTFT e throughput misurati sotto il mio carico?

3.Quanto costa il mio carico di lavoro reale, cache hit incluse?

4.L'API è compatibile con OpenAI, con diversi modelli dietro una sola chiave?

5.Mi diranno dove vengono elaborati i dati e come risponde il supporto?

Nessuna di queste richiede una profonda competenza. Richiedono che tu le chieda prima dell'interruzione, non dopo. I fornitori che rispondono a queste domande con disinvoltura tendono a essere quelli che hanno davvero gestito traffico di produzione, non solo elencato un modello.

SiCore TokenWorks si adatta facilmente alla maggior parte di questa lista: uno SLA del 99,9%, un endpoint compatibile con OpenAI su https://api.token8341.com/v1, una chiave che copre GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark e Pangu, e fatturazione a consumo per token con prezzi per cache hit.