SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

Confronto dei prezzi delle API LLM: come gli aggregatori ti fanno risparmiare

SiCore TokenWorks Team·2026-09-03

Se hai sempre usato un solo provider LLM, il prezzo di listino sulla pagina dei prezzi di quel provider probabilmente ti sembra il prezzo. Non lo è. È il prezzo al dettaglio e, come la maggior parte dei prezzi al dettaglio, ha molto margine e molta struttura incorporati. Gli aggregatori guadagnano attaccando esattamente quella struttura.

Perché i prezzi di listino diretti sono alti

I prezzi diretti includono costi che non riguardano l'esecuzione del modello. Quando acquisti direttamente da un fornitore, stai anche pagando per:

•Impegni minimi. Alcuni provider vogliono un saldo prepagato o una spesa impegnata prima di offrirti la loro tariffa migliore. I team piccoli raramente raggiungono quei livelli.

•Un provider, un contratto. Ogni fornitore ha la sua registrazione, la sua fatturazione, la sua valuta. Gestire tre provider significa tre fatture e tre metodi di pagamento.

•Nessuna concorrenza dentro la tua stessa fattura. Quando sei vincolato a un solo fornitore, quel fornitore non ha motivo di farti uno sconto. Paghi la sua tariffa o te ne vai.

•Limiti di velocità pensati per la loro protezione, non per la tua comodità.

Gli aggregatori esistono perché possono acquistare capacità a monte in volume e trasferire parte dello sconto verso il basso. Ti permettono anche di spostare la spesa tra i provider, che è la vera leva: se il modello A diventa più economico il mese prossimo, sposti il tuo traffico senza cambiare fornitore.

I calcoli, con numeri arrotondati

Uso numeri di esempio volutamente semplici così la forma è chiara. I prezzi reali cambiano continuamente, ma l'aritmetica è la stessa.

Diciamo che un provider mette a listino un modello a $2,50 per milione di token in input e $10,00 per milione di token in output. Un carico di lavoro tipico, ad esempio un riassuntore di ticket di assistenza che elabora 10 milioni di token in input e 4 milioni di token in output al mese, costerebbe:

Diretto:  (10M x $2,50) + (4M x $10,00) = $25 + $40 = $65,00 / mese

Un aggregatore che ha negoziato prezzi di volume potrebbe offrire lo stesso modello a circa un quarto del prezzo di listino, $0,60 per milione in input e $2,40 per milione in output:

Aggregato:  (10M x $0,60) + (4M x $2,40) = $6,00 + $9,60 = $15,60 / mese

Sono circa $49 risparmiati al mese su un solo carico di lavoro modesto, una riduzione del ~76%, prima di toccare qualsiasi altra cosa. Moltiplica i conteggi dei token per un ordine di grandezza e il risparmio assoluto cresce di conseguenza.

Il punto chiave non sono questi numeri specifici. Il punto è che il divario tra "prezzo di listino" e "prezzo di volume" è reale, e il compito di un aggregatore è stare in quel divario e restituirtene una parte.

Gli altri costi nascosti nelle clausole

Il prezzo per token è il titolo, ma non è l'intera fattura. Tre cose mettono in difficoltà le persone:

Prezzi per cache-hit. Alcuni modelli scontano i token che colpiscono una cache del prompt. Se un provider addebita il prezzo pieno per l'input in cache e un altro ne addebita il 10%, un carico di lavoro con prompt ripetitivi può differire molto in costo anche a parità di prezzo di listino. Chiedi prima di impegnarti.

Valuta e attrito nei pagamenti. Acquistare da un fornitore la cui fatturazione è in una valuta o regione che la tua carta non gradisce aggiunge commissioni di conversione e grattacapi per addebiti falliti. Un'unica fattura dell'aggregatore nella tua valuta elimina questo problema.

Limiti di velocità come costo nascosto. Un modello economico che puoi chiamare solo 10 volte al minuto non è economico; costruirai logica di retry e di accodamento per compensare, e quello è tempo di ingegneria. I limiti di throughput appartengono al confronto dei prezzi anche se non sono sulla pagina dei prezzi.

Un rapido stimatore di costi

Stimare la spesa prima di costruire è semplice una volta che hai i numeri. Ecco un piccolo script Python in questo spirito:

def costo_mensile(token_input, token_output, prezzo_in, prezzo_out):
    # i prezzi sono per milione di token
    return (token_input / 1e6) * prezzo_in + (token_output / 1e6) * prezzo_out

# Prezzo di listino diretto
diretto = costo_mensile(10_000_000, 4_000_000, 2.50, 10.00)

# Prezzo aggregato (valori di esempio)
aggregato = costo_mensile(10_000_000, 4_000_000, 0.60, 2.40)

print(f"Diretto:    ${diretto:.2f}")
print(f"Aggregato:  ${aggregato:.2f}")
print(f"Risparmio:  ${diretto - aggregato:.2f}")

Fai passare i tuoi conteggi reali di token con i tuoi prezzi reali. Quello è l'unico numero che conta.

Dove gli aggregatori non ti fanno risparmiare

Devo essere chiaro sui limiti. Un aggregatore è un rivenditore. Alcuni modelli non sono disponibili affatto tramite rivenditori e, per alcuni modelli di nicchia, il ricarico di un aggregatore può essere peggiore dell'acquisto diretto. I risparmi sono maggiori sui popolari modelli general-purpose dove esistono sconti di volume. Per un modello esotico che chiami raramente, la differenza è rumore.

Inoltre, un prezzo più basso è inutile se l'affidabilità dell'aggregatore è scarsa. Un risparmio del 30% che ti procura un endpoint instabile costa più del 30% una volta che consideri retry, ticket di supporto e il tuo tempo. Prezzo e affidabilità sono una sola decisione, non due.

SiCore TokenWorks è una versione lineare di questo modello: compatibile con OpenAI, pay-as-you-go, con un catalogo di modelli popolari di DeepSeek, Qwen, ERNIE, Doubao, Spark e Pangu insieme a GPT-4o, Claude e Gemini, listati ben al di sotto delle tariffe ufficiali per token.