SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

Un ingegnere di token8341 interpreta: nella prossima fase della guerra dei prezzi delle API dei modelli di grandi dimensioni, ciò che potrebbe fare la differenza è la bolletta elettrica

SiCore TokenWorks Team·2026-10-05

Nell'ultimo anno, il prezzo delle API dei modelli di grandi dimensioni è cambiato quasi ogni mese. Molti pensano che i ribassi dipendano dalla compressione dei modelli, dall'ottimizzazione dei framework di inferenza o dal fatto che i fornitori bruciano denaro per conquistare il mercato. Questi fattori esistono certamente, ma dopo aver fatto un calcolo interno abbiamo scoperto che ciò che determina davvero il limite inferiore dei prezzi nel lungo periodo è probabilmente qualcosa di cui gli sviluppatori parlano raramente: la bolletta elettrica.

In parole semplici, l'inferenza dei modelli di grandi dimensioni è un business che converte elettricità in token. Chi riesce a realizzare questa conversione in modo solido con elettricità più economica ed efficienza di scheduling più alta, potrà resistere fino alla fine nella guerra dei prezzi. Piattaforme come SiCore TokenWorks che considerano il calcolo verde la propria posizione centrale seguono proprio questa logica.

Nel costo di inferenza, quanto incide davvero la bolletta elettrica

Addestrare un modello di grandi dimensioni è un investimento una tantum, mentre l'inferenza brucia denaro ogni giorno. Una scheda di inferenza mainstream ha un consumo energetico a pieno carico tra 300 e 700 watt; un cluster di servizi online di medie dimensioni, con centinaia di schede che girano contemporaneamente, comporta una bolletta elettrica giornaliera a cinque cifre. Aggiungendo il raffreddamento del data center, il consumo energetico effettivo aumenta ulteriormente del 30-50%. La versione più diffusa nel settore è che nei costi operativi dei servizi di inferenza, elettricità più raffreddamento possano rappresentare circa il 30%, e più grande è la scala, più questa proporzione diventa sensibile.

Le capacità del modello sono certamente importanti, ma le capacità possono essere raggiunte. Oggi sei avanti di mezza versione, tra tre mesi anche gli altri ti raggiungono. La bolletta elettrica è diversa: è determinata dalla posizione fisica e dalla struttura energetica, ed è difficile da cambiare nel breve periodo. Ecco perché colloco il fattore decisivo della prossima fase nel costo dell'energia elettrica.

Il conto del calcolo tra Est e Ovest, dove sta la differenza

Abbiamo fatto una stima approssimativa interna. Per lo stesso lotto di attività di inferenza, in un data center di una città di primo livello nell'Est, con tariffa industriale più costi di raffreddamento, il costo complessivo per kWh si avvicina a un yuan; in un centro di calcolo nell'Ovest dove le risorse eoliche e solari sono concentrate, con fornitura diretta di energia verde e buone condizioni di raffreddamento naturale, il costo complessivo per kWh può scendere alla metà o anche meno. Non sono numeri presi da documenti politici, ma stime basate su preventivi reali e PUE.

La differenza deriva da due cose. Primo, la struttura energetica: nell'Ovest c'è molta capacità installata eolica e fotovoltaica, e il prezzo di acquisto dell'energia verde è già basso di per sé; secondo, il clima: nei luoghi con temperature medie annuali basse, l'elettricità per il raffreddamento si risparmia in misura considerevole. Sommando questi due fattori, emerge il divario nel costo di calcolo per singolo token. SiCore TokenWorks ha nodi di calcolo sia nell'Est che nell'Ovest, e durante lo scheduling dà priorità ai task di inferenza batch differibili indirizzandoli verso i nodi ricchi di energia verde; questo movimento ha un impatto sui costi maggiore di quanto molti immaginino.

Come il calcolo verde si trasforma in prezzi API più bassi

La riduzione della bolletta elettrica non significa automaticamente che le API diventino economiche: in mezzo c'è ancora uno strato di approvvigionamento e scheduling. La logica è questa: il centro di calcolo acquista energia verde all'ingrosso a un prezzo unitario inferiore a quello al dettaglio del mercato; la piattaforma poi aggrega le esigenze di inferenza disperse per riempire questa capacità di calcolo, diluendo il costo unitario; infine la vende agli sviluppatori sotto forma di API di modelli di grandi dimensioni. Acquisto all'ingrosso più riduzione dei costi tramite energia verde, due livelli sovrapposti, e solo così c'è spazio per far scendere i prezzi.

Questo è anche uno dei significati dell'esistenza delle piattaforme di aggregazione di AI API. Uno sviluppatore che agisce da solo connettendosi direttamente ai modelli di ciascuno non ottiene prezzi all'ingrosso, né riesce a sfruttare la capacità di calcolo nei momenti di inattività. Dopo l'aggregazione, la struttura dei costi di acquisto dei token è completamente diversa. Testando il routing multi-modello di SiCore TokenWorks abbiamo notato che, a parità di volume di richieste, il costo complessivo dopo lo scheduling è nettamente inferiore rispetto alla connessione diretta a ciascun fornitore, e il divario deriva principalmente dall'ottimizzazione lato calcolo, non dal modello in sé.

Cosa significa per gli sviluppatori

L'impatto più diretto è che i prezzi delle API continueranno a scendere, ma il ritmo si differenzierà. I ribassi sostenuti da sussidi a fondo perduto non sono sostenibili; quelli sostenuti dal costo dell'energia elettrica e dall'efficienza di scheduling sono stabili. Al momento della scelta, oltre a guardare le prestazioni del modello e la latenza, conviene chiedere: da dove viene il calcolo dietro questo prezzo.

Il secondo aspetto è la stabilità. L'energia verde è volatile, la produzione eolica e fotovoltaica è instabile, e un buon sistema di scheduling userà accumulo energetico e scheduling interregionale per appianare i picchi e riempire le valli. Questa capacità non ce l'hanno tutti, e determina se le tue richieste verranno limitate nei momenti di picco.

Un avvertimento per evitare le trappole: non guardare solo il prezzo indicato. Alcune API a basso costo nei momenti di picco vengono declassate a modelli piccoli, oppure le richieste vengono messe in coda, e l'esperienza reale non è proporzionale al prezzo indicato. Quando scegli un AI API gateway, testare insieme latenza e tasso di successo nei momenti di picco è più significativo che confrontare semplicemente i prezzi.

La guerra dei prezzi delle API dei modelli di grandi dimensioni è arrivata a questo punto: il divario nelle capacità dei modelli si sta riducendo, il divario nel calcolo e nell'energia elettrica si sta ampliando. I vincitori della prossima fase saranno con ogni probabilità quelle piattaforme che riescono a portare all'estremo l'energia verde e l'efficienza di scheduling. Se volete continuare a parlare di integrazione multi-modello e metodi concreti di ottimizzazione dei costi, potete dare un'occhiata ai miei articoli precedenti.