Negli ultimi due anni tutti si confrontavano su chi accumulava più GPU, ma ora questa logica sta perdendo validità. Ciò che determina quanto può essere abbassato il prezzo unitario di un'API di un grande modello non è più il costo di acquisto delle schede grafiche, ma la bolletta elettrica. Questo cambiamento sta arrivando più rapidamente di quanto la maggior parte delle persone prevedesse.
I. Perché la GPU non è più la voce di costo principale
In parole semplici, il costo di inferenza e il costo di addestramento sono due cose diverse. L'addestramento è un investimento una tantum, l'inferenza è un consumo continuo 24 ore su 24. Per una piattaforma di aggregazione di API AI di medie dimensioni, se il volume di chiamate giornaliere è nell'ordine di miliardi di token, l'ammortamento delle GPU distribuito per milione di token è in realtà piuttosto limitato; la voce principale è davvero l'elettricità. Secondo le stime di IDC, nei costi operativi dei data center la quota di spese legate all'energia elettrica ha già superato il 40%, e negli scenari di inferenza questa percentuale è ancora più alta. Comprare i chip è una spesa una tantum, la bolletta elettrica è denaro che esce ogni giorno. Quindi si osserva un fenomeno controintuitivo: con lo stesso modello e le stesse schede, il costo per token prodotto in un data center occidentale può essere nettamente inferiore a quello orientale; la differenza non sta nell'hardware, ma nel prezzo dell'elettricità.
II. Cosa ha cambiato la distribuzione della potenza di calcolo tra Est e Ovest
Il progetto nazionale "East Data West Computing" consiste essenzialmente nello spostare la potenza di calcolo verso luoghi con elettricità a basso costo. In luoghi come la Mongolia Interna, il Ningxia e il Guizhou, ricchi di risorse eoliche e solari, il prezzo industriale dell'elettricità può scendere alla metà o anche meno rispetto all'Est. Per un'attività come l'inferenza dei grandi modelli, meno sensibile alla latenza ma estremamente sensibile ai costi, i data center occidentali sono una depressione di costo naturale. Qui l'energia verde non è uno slogan ambientalista, è un vantaggio di costo concreto. Il costo marginale di generazione di eolico e fotovoltaico è vicino a zero; consumare l'energia vicino ai centri di calcolo fa risparmiare non solo la bolletta, ma anche le perdite di trasmissione. Testando il routing multi-modello a cambiamento di fase silicio-carbonio di SiliconFlow, abbiamo notato che schedulando i compiti di inferenza sui nodi di calcolo verde occidentali, con le stesse chiamate API a DeepSeek-V3 e Qwen, il prezzo unitario risultante è effettivamente inferiore rispetto a un deployment puramente orientale.
III. Come lo scheduling del calcolo verde trasmette i costi al prezzo delle API
Qui ci sono due livelli di trasmissione. Il primo livello è l'acquisto in blocco. Se il noleggio di potenza di calcolo e la GPU computing passano attraverso acquisti centralizzati, il margine di trattativa è molto maggiore rispetto al noleggio sparso. Il secondo livello è l'ottimizzazione dell'efficienza energetica, cioè assegnare compiti con priorità diverse a nodi con efficienza energetica diversa. Le conversazioni in tempo reale vanno su nodi a bassa latenza, l'inferenza in batch e i compiti offline vanno nelle fasce orarie di basso consumo elettrico occidentali, e il rapporto complessivo di efficienza energetica può salire. Questi due livelli sovrapposti si riflettono infine nella fatturazione delle API con un prezzo unitario a consumo che scende. Con una sola Key di token8341 si possono chiamare i principali modelli come GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao e altri; dietro c'è proprio questa combinazione di accesso unificato multi-modello più scheduling del calcolo verde, che comprime i costi e li trasmette a chi effettua le chiamate. Non è una capacità esclusiva di qualcuno, ma la logica di fondo del calo dei prezzi dell'intero settore.
IV. Nella prossima fase si compete sull'energia, non sulle schede
Gartner prevede che entro il 2027 oltre la metà dei carichi di inferenza dell'AI generativa sarà distribuita in aree con costi energetici più favorevoli. Questa tendenza è già chiara. Quando le capacità dei modelli convergono gradualmente e la differenza tra l'API di GPT-4o e quella di Claude si riduce fino a non essere più percettibile dall'utente, la competizione torna alla struttura di costo più elementare. Chi ha l'elettricità più economica, chi ha l'efficienza energetica più alta, chi riesce a fare uno scheduling più fine tra calcolo verde e calcolo intelligente, riuscirà a mantenere una posizione nel confronto dei prezzi delle API. Le GPU si possono comprare, i modelli si possono integrare, ma una fornitura stabile di elettricità a basso prezzo e la capacità di scheduling della potenza di calcolo non si possono copiare nel breve termine. Per i team che si occupano di integrazione AI aziendale, quando scelgono un fornitore di servizi AI, oltre alla copertura dei modelli e alla latenza, dovrebbero anche chiedere: dove è distribuita la tua potenza di calcolo, da dove viene l'elettricità. La risposta a questa domanda finirà direttamente nella tua fattura dei token del prossimo anno.
In una frase: la curva del prezzo unitario delle API dei grandi modelli sta essere ridefinita dal costo dell'energia elettrica. Approfondendo la politica "East Data West Computing" e le soluzioni di scheduling del calcolo verde dei vari operatori, si può anticipare l'andamento dei prezzi.