SiCore TokenWorks
LLM APIAPI Gateway

IA verde: executando inferência de LLM com energia limpa

SiCore TokenWorks Team·2026-09-03

A história do carbono da IA geralmente se concentra no treinamento. Isso é compreensível: uma única execução de treinamento de grande porte pode consumir megawatts-hora ao longo de semanas. Mas o treinamento acontece uma vez. A inferência acontece toda vez que alguém pergunta qualquer coisa ao modelo, para sempre, em milhões de usuários. A energia que realmente se acumula é a energia do serviço.

Para um consumidor de API, isso significa que a "verdidão" do seu uso de LLM é decidida principalmente por algo que você não controla diretamente: onde ficam as GPUs do provedor e o que as alimenta. Você pode, no entanto, escolher um provedor com base nisso.

Por que a energia de inferência é uma história de data center

Uma carga de trabalho de inferência é um cluster de GPUs rodando em um data center. Duas coisas dominam sua pegada:

A rede elétrica à qual ele está conectado. Uma GPU consumindo 700 watts puxa energia que é tão limpa ou suja quanto a matriz elétrica regional. Um data center em uma região com muita energia eólica e solar emite muito menos carbono por token do que o mesmo hardware em uma rede elétrica com forte dependência de carvão, mesmo que todo o resto seja idêntico.

Resfriamento. Os servidores transformam eletricidade em calor, e livrar-se desse calor consome mais eletricidade. É isso que o PUE (power usage effectiveness) mede: a energia total da instalação dividida pela energia que chega aos equipamentos de TI. Um PUE de 1,5 significa que a instalação usa 50% de energia extra além do que os servidores consomem. Uma instalação moderna bem projetada opera mais próxima de 1,1 a 1,2. Climas frios e secos reduzem drasticamente o custo de resfriamento, o que é uma grande razão pela qual data centers continuam aparecendo em regiões interiores frias em vez de centros urbanos.

Onde a energia limpa e barata realmente está

Os lugares com a melhor economia de energia limpa para computação não são os polos tecnológicos óbvios. Eles tendem a ser regiões interiores com fortes recursos eólicos e solares e um clima seco e frio:

•Inner Mongolia (Horinger). Uma das maiores bases de energia eólica da China. Invernos frios significam que, por boa parte do ano, pouca ou nenhuma refrigeração mecânica é necessária.

•Xinjiang (Hami). Irradiação solar altíssima e vento constante. Remoto, mas remoto não é problema quando sua carga de trabalho é um cluster de GPUs que você controla remotamente.

•Ningxia (Zhongwei). Já é uma região estabelecida de data centers com solar e eólica em escala de utilidade; abriga uma das principais regiões de nuvem internacionais, o que mostra que a economia funciona em escala.

O padrão é o mesmo nos três casos: geração renovável abundante, um clima frio e seco que reduz o PUE, e terra barata o suficiente para construir as subestações e os campos solares que alimentam os racks.

Nada disso é tecnologia exótica. É localização. A coisa mais verde que um provedor de computação pode fazer é colocar seu hardware onde a rede elétrica já é limpa e o clima faz metade do resfriamento de graça.

O que as alegações "verdes" deveriam realmente lhe dizer

É aqui que eu fico cético. "Verde" é uma palavra de marketing até que alguém lhe dê números. Quando um provedor faz uma alegação de energia limpa, há três coisas que vale a pena exigir:

•PUE. Se não publicarem, trate a alegação como não verificável.

•A matriz elétrica real da região onde o data center está localizado. Um provedor que apenas compra certificados de energia renovável enquanto opera em uma rede elétrica fóssil não está operando de forma verde. A localização é a divulgação.

•Se as renováveis são capacidade real, não compensações. Nova capacidade eólica e solar construída para alimentar a instalação é uma alegação diferente de comprar créditos em outro lugar.

Provedores honestos lhe darão a região e as características da instalação. Se a resposta for "nossos data centers estão em Inner Mongolia, Xinjiang e Ningxia, em redes elétricas com alta penetração de renováveis, em climas frios", isso é uma afirmação concreta e verificável. Se a resposta for um slogan, siga em frente.

O que você pode realmente fazer a respeito

Você não vai auditar a subestação de um provedor. Mas você pode tomar algumas decisões que inclinam sua própria pegada:

•Escolha provedores que divulgam localização e PUE, não aqueles que apenas imprimem "neutro em carbono" na página.

•Use modelos menores onde a tarefa permitir. Um modelo de 7B pode responder a uma pergunta de suporte quase tão bem quanto um de 175B, com uma fração da energia. Direcionar tráfego fácil para um modelo pequeno é a maior alavanca de carbono que você controla.

•Faça cache agressivamente. O cache de prompt transforma a entrada repetida em um custo único, reduzindo tanto a latência quanto a energia para cargas de trabalho repetitivas.

•Agrupe quando puder. Menos requisições, porém maiores, superam muitas requisições minúsculas em termos de utilização do servidor.

O enquadramento honesto é que você não consegue medir seu caminho até uma pegada limpa com uma planilha, porque a matriz elétrica não está nos seus dados. O que você pode fazer é escolher provedores cuja infraestrutura torna a pegada menor por design, e parar de direcionar requisições triviais para o maior modelo que você pode pagar.

Essa é a posição que a SiCore TokenWorks assume: seus três centros de computação ficam em Inner Mongolia Horinger, Xinjiang Hami e Ningxia Zhongwei, regiões escolhidas por sua alta penetração de renováveis e climas frios que mantêm o PUE baixo. Se você se importa com a energia por trás das suas chamadas de API, esse é o tipo de divulgação que importa mais do que um selo.