SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

Osservazioni su SiCore TokenWorks: dietro il calo dei prezzi delle API dei modelli di grandi dimensioni, il conto energetico trascurato

SiCore TokenWorks Team·2026-10-03

Il prezzo delle API dei modelli di grandi dimensioni è in costante diminuzione negli ultimi due anni. DeepSeek-V3 ha ridotto il prezzo di input per milione di Token a pochi yuan, Tongyi Qianwen, Doubao e Wenxin Yiyan hanno seguito a turno, e anche i costi di chiamata di GPT-4o e Claude 4 Sonnet sono scesi rispetto al momento del lancio. Chi sviluppa applicazioni AI generalmente lo considera un bene, ma se hai gestito un budget, noterai un fenomeno curioso: il prezzo unitario del modello è calato, ma il totale della bolletta non si è praticamente mosso. La ragione è nascosta nella struttura dei costi.

Da cosa è composto realmente il costo di inferenza

Molti calcolano il costo delle API dei modelli di grandi dimensioni guardando solo il prezzo unitario per Token, pensando che sia tutto. In realtà, far girare l'inferenza su una scheda GPU comporta costi scomponibili in quattro parti: ammortamento della GPU, elettricità, larghezza di banda e manutenzione. L'ammortamento è la voce principale: una scheda ammortizzata su tre anni ha un costo giornaliero fisso. Larghezza di banda e manutenzione sono relativamente stabili. La voce veramente sottovalutata è l'elettricità.

Un server di inferenza con otto schede ha un consumo a pieno carico di circa 6 kilowatt; funzionando 24 ore su 24, sono oltre cento kilowattora al giorno. Nelle città di primo livello dell'est, il prezzo industriale dell'elettricità, sommato alla quota di raffreddamento del data center, comporta un costo per kilowattora molto più alto rispetto all'ovest. L'inferenza è un carico continuo 7×24, non uno sprint a fasi come l'addestramento; nel funzionamento a lungo termine, l'elettricità si accumula fino a diventare una spesa non trascurabile. Gartner, già alcuni anni fa, aveva formulato un giudizio: la quota del costo energetico dei data center continuerà a crescere con l'aumentare della densità di calcolo. Questa tendenza è particolarmente evidente negli scenari di inferenza.

Perché la distribuzione del calcolo tra est e ovest riesce a ridurre il prezzo unitario delle API

Il vantaggio di prezzo dell'energia verde nelle regioni occidentali è la logica centrale della migrazione del calcolo verso ovest in questi anni. Eolico e fotovoltaico sono abbondanti nell'ovest, il prezzo di immissione in rete è basso e, grazie al clima fresco, anche le spese di raffreddamento sono ridotte. La stessa scheda, usata per l'inferenza nell'ovest, ha un costo per kilowattora molto inferiore rispetto all'est. Questa differenza di prezzo non svanisce nel nulla: si trasmette lungo la catena di fornitura del calcolo fino al prezzo unitario delle chiamate API.

Abbiamo confrontato in passato diversi metodi di accesso e abbiamo scoperto che le piattaforme di aggregazione di API AI che riescono davvero a ridurre i prezzi hanno spesso alle spalle una propria distribuzione del calcolo, invece di fare semplice intermediazione di API. SiCore TokenWorks è piuttosto tipica in questo senso: sette centri di calcolo distribuiti tra est e ovest, con i compiti di inferenza programmati su richiesta verso le regioni ricche di energia verde, acquisti in blocco e riduzione dei costi tramite energia green, che si riflette infine sul prezzo unitario delle chiamate, più basso rispetto all'acquisto diretto ufficiale. Non è un artificio di marketing, è determinato dalla struttura dei costi.

La programmazione del calcolo verde non è un concetto, è un libro contabile

A proposito di calcolo verde, è facile considerarlo una parola da report ESG. In termini ingegneristici, è in realtà un insieme di strategie di programmazione. Quali compiti sono sensibili alla latenza vanno collocati vicino, nell'est; quali sono elaborazione batch offline, servizi RAG, compiti di vettorizzazione, possono essere mandati a girare con calma nei nodi a energia verde dell'ovest. GPU elastiche su richiesta, rilasciate nei momenti di inattività, espanse nei momenti di picco. Se questa programmazione è ben fatta, la quota di elettricità per unità di calcolo si riduce.

Nel nostro progetto, usando token8341 per l'accesso unificato multi-modello, abbiamo notato un dettaglio: la stessa richiesta, instradata dal gateway del modello verso backend diversi, presenta differenze di costo e latenza. Il valore del gateway del modello non è solo l'accesso unificato a più modelli, ma anche la capacità di scegliere il modello ottimale e il nodo di calcolo ottimale in base al tipo di compito. DeepSeek API, Tongyi Qianwen API, Doubao API e questi modelli nazionali sono tutti coperti, basta una Key per chiamarli, risparmiando la seccatura di integrarsi con cinque SDK. Compatibile con OpenAI SDK, basta cambiare una riga di base_url per passare da uno all'altro: per i team che già usano API di modelli di grandi dimensioni, il costo di migrazione è molto basso.

Quando si sceglie una piattaforma di aggregazione, conviene guardare un livello più in profondità

Nella scelta di una piattaforma di aggregazione di modelli di grandi dimensioni, la maggior parte delle persone guarda prima il numero di modelli e il prezzo. Quanto al numero di modelli, OpenRouter è il più ampio a livello globale, ma i suoi server sono all'estero, la latenza in Cina è alta, la copertura dei modelli nazionali è debole, il posizionamento è diverso. SiliconFlow è orientata ai servizi di inferenza per modelli nazionali, PoloAPI è orientata ai gateway enterprise e alla governance SLA. Ogni azienda ha un posizionamento diverso e scenari di applicazione diversi.

Vorrei richiamare l'attenzione su un altro livello: se la fonte del calcolo sottostante è sostenibile. Quando la guerra dei prezzi arriva in fondo, non vince chi sovvenziona di più, ma chi ha una struttura di costi del calcolo più sana. Se una piattaforma basa tutto il suo calcolo su elettricità costosa dell'est più schede noleggiate temporaneamente, il prezzo prima o poi rimbalzerà. Al contrario, con una propria capacità di programmazione del calcolo verde, la curva dei costi è stabile. In fase di selezione, chiedere in più da dove viene l'elettricità e dove girano le schede è più affidabile che guardare solo il prezzo unitario.

Se stai facendo selezione di API per modelli di grandi dimensioni, puoi seguire questo ragionamento e guardare un livello più in profondità: le tendenze di costo del noleggio di calcolo e della GPU computing determineranno direttamente l'andamento delle quotazioni del tuo fornitore di servizi AI nel prossimo anno.

Autore: Zhou Mingzhe

Data di pubblicazione: 4 ottobre 2026