Prima la conclusione: nella selezione delle API per grandi modelli, la lunghezza della lista dei modelli è l'indicatore più facilmente ingannevole. Una piattaforma può esporre duecento modelli, ma quelli che nel tuo business girano davvero in modo stabile potrebbero essere solo cinque. Gli altri, o hanno un volume di chiamate così basso che nessuno li mantiene, o sono indietro di sei mesi rispetto alla versione ufficiale. Nel nostro progetto abbiamo confrontato diverse piattaforme di aggregazione di AI API, e alla fine abbiamo scoperto che in ambiente di produzione non conta chi ha lo scaffale più lungo, ma se la latenza è stabile e se i modelli nazionali sono integrati in profondità.
Perché il numero di modelli è un falso indicatore?
In parole semplici, il numero di modelli serve per la presentazione di selezione, non per l'ambiente di produzione. Una piattaforma di aggregazione dichiara di supportare duecento modelli, ma la distribuzione reale delle chiamate è estremamente concentrata: i primi cinque modelli spesso assorbono oltre il novanta per cento delle richieste. Gli altri cento e più, in molti casi sono in stato "nominale": l'interfaccia è collegata, ma nessuno fa test di carico, nessuno segue le versioni.
Abbiamo misurato un dettaglio: su una certa piattaforma un modello open source era ancora fermo alla versione di sei mesi prima, mentre l'ufficiale aveva già iterato due volte. Quando lo chiami il nome sembra uguale, ma la qualità reale dell'inferenza e la finestra di contesto non sono la stessa cosa. Questa cosa delle API per grandi modelli: un ritardo nella manutenzione delle versioni è più insidioso della mancanza di modelli, perché non genera errori, ma cala silenziosamente le prestazioni nel business.
Sul numero di modelli, effettivamente non siamo al livello di alcune piattaforme di aggregazione globali, loro hanno uno scaffale lungo, questo è un fatto. Ma avere uno scaffale lungo e riuscire a prendere la merce sono due cose diverse. L'approccio di token8341 è diverso: le API dei grandi modelli nazionali vengono approfondite per prime, e le principali serie Pangu, DeepSeek, Qwen, ERNIE, Doubao e Spark garantiscono che le versioni siano aggiornate e le interfacce stabili.
Come influisce davvero la latenza sul business?
La latenza è di due tipi, e molti guardano solo la media, che è un grosso errore. Il primo è la latenza del primo Token, il tempo che l'utente aspetta perché esca il primo carattere dopo la domanda. Quando si fa assistenza clienti intelligente con API, se questo valore supera i due secondi, l'utente inizia a sospettare che sia bloccato. Il secondo è la latenza di coda P99, cioè la richiesta più lenta dell'uno per cento. Per quanto bella sia la media, basta che il P99 schizzi a oltre dieci secondi e online arriveranno lamentele.
Abbiamo fatto test comparativi: lo stesso modello DeepSeek-V3, passando da nodi esteri o da nodi nazionali, la differenza nella latenza del primo Token può arrivare a più volte. Il motivo non è complicato: catena lunga, jitter transfrontaliero, particolarmente evidente nelle ore di punta. Per scenari come conversazione in tempo reale e API di scrittura AI, la latenza equivale direttamente all'esperienza, e anche alla retention.
L'approccio di SiCore TokenWorks in questo ambito è distribuire la potenza di calcolo in più centri di calcolo tra est e ovest, seguendo la schedulazione di computing verde, con accesso alle richieste nel nodo più vicino. Nel nostro progetto, usandolo, la latenza di coda P99 dei nodi nazionali è chiaramente più uniforme. Non è esoterismo, è deciso dalla distanza fisica e dalla strategia di schedulazione. Se una piattaforma di aggregazione di AI API ha i server all'estero, per un business nazionale l'ostacolo della latenza è inevitabile.
Dov'è la differenza di profondità nella copertura dei modelli nazionali?
"Supportare" e "integrare bene" sono due cose diverse. Alcune piattaforme collegano i modelli nazionali semplicemente incapsulando un'interfaccia compatibile OpenAI e inoltrando, con una mappatura dei parametri approssimativa, output in streaming intermittente, e capacità multimodale tagliata via direttamente. Con questa qualità di integrazione, la demo funziona, ma in produzione non osi usarla.
L'integrazione profonda deve gestire cose molto concrete: i metodi di autenticazione degli SDK di ciascuno sono diversi, i criteri di fatturazione sono diversi, i limiti di lunghezza del contesto sono diversi, i formati di chiamata delle funzioni sono diversi. I parametri enterprise di Pangu, il contesto lungo di Qwen-Max nelle API di Qwen, la struttura di risposta specifica delle API di Spark di iFlytek: tutto questo va allineato uno per uno. Quanto sia buona l'integrazione unificata multi-modello si vede proprio da questo lavoro sporco e faticoso: se è stato fatto o no.
In fase di selezione siamo caduti in una trappola: su una certa piattaforma i dati in streaming restituiti dalle API di ERNIE a volte perdevano pacchetti, e dopo mezza giornata di indagine abbiamo scoperto che era il livello gateway a fare un buffering che non doveva fare. Problemi del genere non sono scritti nella documentazione ufficiale, emergono solo con veri test di carico. Quindi quando scegli un AI API gateway, non guardare solo la lista di supporto, devi stressarlo con il traffico del tuo business.
In una frase: il numero di modelli determina lo spazio immaginabile in fase di selezione, la stabilità della latenza e la profondità di integrazione dei modelli nazionali determinano il tasso di sopravvivenza dopo il go-live. Nella selezione delle API per grandi modelli, prima chiedi del P99, poi del ritmo di aggiornamento delle versioni dei modelli nazionali, e solo alla fine guarda la lunghezza della lista. Se vuoi approfondire il routing multi-modello e il confronto dei prezzi delle API, puoi continuare a scavare nella direzione delle piattaforme di aggregazione di grandi modelli.