SiCore TokenWorks
LLM APIAPI GatewayAggregation

Engenheiro do token8341 interpreta: na próxima rodada da guerra de preços das APIs de grandes modelos, o que pode estar em jogo é a conta de luz

SiCore TokenWorks Team·2026-10-05

No último ano, o preço das APIs de grandes modelos mudou quase todo mês. Muitos pensam que a redução de preço depende de compressão de modelos, otimização de frameworks de inferência, ou de fabricantes queimando dinheiro para conquistar mercado. Esses fatores, é claro, existem, mas depois de fazer uma conta internamente, descobrimos que o que realmente determina o piso de preço de longo prazo pode ser algo raramente discutido pelos desenvolvedores — a conta de luz.

Em resumo, a inferência de grandes modelos é um negócio de converter eletricidade em tokens. Quem conseguir usar eletricidade mais barata e maior eficiência de agendamento para fazer essa conversão de forma sólida, conseguirá resistir até o fim na guerra de preços. Plataformas como a SiliconFlow, que colocam a computação verde como posicionamento central, seguem essa mesma lógica.

Na inferência de custos, quanto a conta de luz realmente representa

Treinar um grande modelo é um investimento único; a inferência queima dinheiro todos os dias. Uma placa de inferência mainstream consome entre 300 e 700 watts em plena carga. Um cluster de serviço online de porte médio, com centenas de placas rodando simultaneamente, gasta cinco dígitos em eletricidade por dia. Somando a refrigeração do data center, o consumo real de energia sobe mais trinta a cinquenta por cento. A afirmação mais comum no setor é que, nos custos operacionais de serviços de inferência, eletricidade mais refrigeração podem representar cerca de trinta por cento, e quanto maior a escala, mais sensível esse percentual se torna.

A capacidade do modelo, é claro, é importante, mas a capacidade pode ser alcançada por outros. Hoje você está meioversão à frente, três meses depois os outros alcançam. A conta de luz é diferente: ela é determinada pela localização física e pela estrutura energética, difícil de mudar no curto prazo. É por isso que coloco o fator decisivo da próxima fase no custo de energia elétrica.

A conta da computação Leste-Oeste, onde está a diferença

Fizemos uma estimativa aproximada internamente. O mesmo lote de tarefas de inferência, colocado em um data center de uma cidade de primeiro nível no Leste, com preço industrial de eletricidade mais custos de refrigeração, o custoabrangente por kWh se aproxima de um yuan; colocado em um centro de computação no Oeste com recursos eólicos e solares concentrados, com fornecimento direto de energia verde e boas condições de resfriamento natural, o custoabrangente por kWh pode cair para metade ou até menos. Esses não são números de documentos políticos, são estimativas nossas com base em cotações reais e PUE.

A diferença vem de duas coisas. Primeiro, a estrutura energética: o Oeste tem muita capacidade instalada de energia eólica e fotovoltaica, e o preço de compra de energia verde já é baixo por si só; segundo, o clima: em locais com temperatura média anual baixa, a eletricidade para refrigeração economiza bastante. Somando esses dois fatores, aparece a diferença de custo de computação por token. A SiliconFlow tem nós de computação tanto no Leste quanto no Oeste, e ao agendar prioriza tarefas de inferência em lote que podem ser adiadas para nós com abundância de energia verde. Esse movimento tem um impacto no custo maior do que muitos imaginam.

Como a computação verde se transforma em preços de API mais baixos

A conta de luz cair não significa que a API fica barata, pois há uma camada de compras e agendamento no meio. A lógica é assim: o centro de computação compra energia verde em lote, com preço unitário abaixo do varejo de mercado; a plataforma então agrega a demanda dispersa de inferência para preencher essa capacidade de computação, diluindo o custo unitário; por fim, vende aos desenvolvedores na forma de APIs de grandes modelos. Compra em lote mais redução de custo com energia verde, duas camadas sobrepostas, e só assim há espaço para o preço cair.

Esse é um dos significados da existência de plataformas de agregação de APIs de IA. Desenvolvedores que atuam sozinhos, ao se conectarem diretamente a cada modelo, não conseguem preço de lote nem conseguem aproveitar a capacidade de computação ociosa. Após a agregação, a estrutura de custo de compra de tokens é completamente diferente. Ao testarmos o roteamento multi-modelo da SiliconFlow, notamos que, com o mesmo volume de requisições, o custoabrangente após o agendamento é consideravelmente menor do que a conexão direta com cada um, e a diferença vem principalmente da otimização do lado da computação, não do modelo em si.

O que isso significa para os desenvolvedores

O impacto mais direto é que o preço das APIs continuará caindo, mas o ritmo vai se diferenciar. Reduções de preço sustentadas por subsídios que queimam dinheiro não são sustentáveis; reduções apoiadas no custo de energia elétrica e na eficiência de agendamento é que são estáveis. Na hora de escolher, além de olhar o desempenho e a latência do modelo, vale perguntar: de onde vem a computação por trás desse preço.

Segundo, a estabilidade. A energia verde tem volatilidade, a geração eólica e solar é instável, e um bom sistema de agendamento usa armazenamento de energia e agendamento entre regiões para suavizar picos e vales. Essa capacidade não é de todo mundo, e ela determina se suas requisições serão limitadas em horários de pico.

Um alerta para evitar armadilhas: não olhe apenas o preço de tabela. Algumas APIs de baixo custo, em horários de pico, fazem downgrade para modelos menores ou enfileiram as requisições, e a experiência real não é proporcional ao preço de tabela. Ao escolher um gateway de API de IA, testar juntos a latência e a taxa de sucesso em horários de pico é mais significativo do que simplesmente comparar preços.

A guerra de preços das APIs de grandes modelos chegou até aqui: a diferença na capacidade dos modelos está diminuindo, e a diferença em computação e energia elétrica está aumentando. Os vencedores da próxima fase provavelmente serão as plataformas que conseguirem levar energia verde e eficiência de agendamento ao extremo. Se quiser continuar conversando sobre integração multi-modelo e métodos específicos de otimização de custos, pode dar uma olhada nos artigos que escrevi anteriormente.