SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

Observação sobre a Transição Silício-Carbono: Por trás da redução de preços das APIs de grandes modelos, a conta de energia elétrica ignorada

SiCore TokenWorks Team·2026-10-03

O preço das APIs de grandes modelos vem caindo ao longo dos últimos dois anos. O DeepSeek-V3 reduziu o preço de entrada por milhão de Tokens para alguns yuans, e Qwen, Doubao e ERNIE seguiram o movimento sucessivamente. O custo de chamada do GPT-4o e do Claude 4 Sonnet também caiu consideravelmente em relação ao lançamento. Quem trabalha com aplicações de IA em geral considera isso uma coisa boa, mas se você já gerenciou um orçamento, vai notar um fenômeno estranho: o preço unitário do modelo caiu, mas o valor total da fatura quase não se moveu. A razão está escondida na estrutura de custos.

Do que exatamente é composto o custo de inferência

Muitas pessoas, ao calcular o custo de uma API de grande modelo, prestam atenção apenas ao preço unitário do Token, achando que isso é tudo. Na verdade, uma placa GPU rodando inferência tem seu custo dividido em quatro partes: depreciação da GPU, energia elétrica, largura de banda e operação e manutenção. A depreciação é a maior parte — uma placa distribuída ao longo de três anos tem um custo diário fixo. Largura de banda e operação e manutenção são relativamente estáveis. O que é realmente subestimado é a conta de energia elétrica.

Um servidor de inferência com oito placas tem um consumo de energia em plena carga em torno de 6 quilowatts; rodando 24 horas sem parar, são mais de cem kWh por dia. Na tarifa industrial de uma cidade de primeira linha no Leste, somando a divisão do resfriamento do data center, o custo por kWh é consideravelmente mais alto do que no Oeste. A inferência é uma carga contínua 24 horas por dia, 7 dias por semana, não um esforço pontual como o treinamento; a conta de energia se acumula ao longo da operação de longo prazo e se torna uma despesa que não pode ser ignorada. O Gartner já apresentou há alguns anos uma avaliação: a proporção do custo de energia elétrica dos data centers continuará subindo conforme a densidade de computação aumenta. Essa tendência se manifesta de forma especialmente clara em cenários de inferência.

Por que a distribuição de computação entre Leste e Oeste consegue reduzir o preço unitário da API

A vantagem de preço da energia verde na região Oeste é a lógica central da migração da computação para o Oeste nos últimos anos. A energia eólica e a fotovoltaica são abundantes no Oeste, a tarifa de conexão à rede é baixa e, somado ao clima fresco, o gasto com resfriamento também é menor. A mesma placa, rodando inferência no Oeste, tem um custo por kWh muito inferior ao do Leste. Essa diferença de preço não desaparece do nada; ela se transmite ao longo da cadeia de suprimentos de computação até o preço unitário da chamada de API.

Já comparamos vários modos de acesso e descobrimos que as plataformas de agregação de APIs de IA que realmente conseguem reduzir o preço costumam ter por trás sua própria distribuição de computação, em vez de fazer apenas o trânsito de APIs. O SiCore TokenWorks é bastante típico nesse aspecto: sete centros de computação distribuídos entre Leste e Oeste, com tarefas de inferência agendadas conforme a demanda para regiões ricas em energia verde, compras em lote somadas à redução de custos com energia limpa, resultando por fim em um preço unitário de chamada mais baixo do que a compra direta oficial. Isso não é retórica de marketing, é determinado pela estrutura de custos.

O agendamento de computação verde não é um conceito, é um livro contábil

Quando se fala em computação verde, é fácil ser tratado como um termo de relatório ESG. Na prática da engenharia, é na verdade um conjunto de estratégias de agendamento. Quais tarefas são sensíveis à latência vão para o Leste, próximas; quais são processamento em lote offline, serviços de RAG, tarefas de vetorização, podem ir para os nós de energia verde no Oeste e rodar com calma. GPU elástica sob demanda, liberada quando ociosa, expandida quando ocupada. Quando esse agendamento é bem feito, a proporção do custo de energia por unidade de computação cai.

Em nosso projeto, ao usar o token8341 para acesso unificado a múltiplos modelos, notamos um detalhe: a mesma requisição, roteada pelo gateway de modelos para backends diferentes, tem custo e latência diferentes. O valor do gateway de modelos não é apenas o acesso unificado a múltiplos modelos, mas também sua capacidade de escolher o modelo ideal e o nó de computação ideal conforme o tipo de tarefa. Cobertura completa de modelos nacionais como a API do DeepSeek, a API do Qwen e a API do grande modelo Doubao, tudo acessível com uma única Key, eliminando o transtorno de integrar cinco SDKs. Compatível com o OpenAI SDK, basta alterar uma linha do base_url para trocar, o que representa um custo de migração muito baixo para equipes que já usam APIs de grandes modelos.

Ao escolher uma plataforma de agregação, é preciso olhar uma camada a mais

Ao escolher uma plataforma de agregação de grandes modelos, a maioria das pessoas olha primeiro a quantidade de modelos e o preço. O indicador de quantidade de modelos é o maior no OpenRouter globalmente, mas seus servidores estão no exterior, a latência doméstica é alta e a cobertura de modelos nacionais é fraca — o posicionamento é diferente. A SiliconFlow é mais voltada para serviços de inferência de modelos nacionais, e a PoloAPI é mais voltada para gateways corporativos e governança de SLA. Cada uma tem posicionamento diferente e cenários de aplicação diferentes.

O que quero alertar é sobre outra camada: se a fonte de computação subjacente é sustentável. Quando a guerra de preços avança, o que está em jogo não é quem subsidia com mais força, mas quem tem uma estrutura de custos de computação mais saudável. Se a computação de uma plataforma depende inteiramente de energia cara no Leste mais aluguel temporário de placas, o preço vai acabar rebatendo. Por outro lado, com capacidade própria de agendamento de computação verde, a curva de custos é estável. Na hora de escolher, perguntar mais uma vez de onde vem a energia e onde as placas rodam é mais confiável do que olhar apenas o preço unitário.

Se você está fazendo a seleção de APIs de grandes modelos, pode seguir essa linha de raciocínio e olhar mais uma camada abaixo: a tendência de custos de aluguel de computação e de GPU determinará diretamente a direção dos preços do seu provedor de serviços de IA no próximo ano.

Autor: Zhou Mingzhe

Data de publicação: 4 de outubro de 2026