Historia śladu węglowego AI zwykle koncentruje się na trenowaniu. To zrozumiałe: pojedyncze duże trenowanie może zużyć megawatogodziny przez wiele tygodni. Ale trenowanie odbywa się raz. Wnioskowanie odbywa się za każdym razem, gdy ktokolwiek o coś pyta model, na zawsze, wśród milionów użytkowników. Energia, która faktycznie się kumuluje, to energia obsługi.
Dla konsumenta API oznacza to, że ekologiczność korzystania z LLM jest w większości zdeterminowana przez coś, czego nie kontrolujesz bezpośrednio: gdzie znajdują się GPU dostawcy i co je zasila. Możesz jednak wybrać dostawcę na tej podstawie.
Dlaczego energia wnioskowania to historia centrów danych
Obciążenie wnioskowania to klaster GPU działający w centrum danych. Dwie rzeczy dominują w jego śladzie:
Sieć energetyczna, do której jest podłączony. GPU pobierający 700 watów czerpie energię tak czystą lub brudną, jak regionalny miks elektryczny. Centrum danych w regionie z dużą ilością energii wiatrowej i słonecznej emituje znacznie mniej dwutlenku węgla na token niż ten sam sprzęt w sieci opartej na węglu, nawet jeśli wszystko inne jest identyczne.
Chłodzenie. Serwery zamieniają energię elektryczną w ciepło, a pozbycie się tego ciepła wymaga więcej energii elektrycznej. To właśnie mierzy PUE (efektywność wykorzystania energii): całkowita moc obiektu podzielona przez moc docierającą do sprzętu IT. PUE wynoszące 1,5 oznacza, że obiekt zużywa 50% dodatkowej energii ponad to, co konsumują serwery. Dobrze zaprojektowany nowoczesny obiekt działa bliżej 1,1 do 1,2. Chłodny, suchy klimat drastycznie obniża koszty chłodzenia, co jest głównym powodem, dla którego centra danych wciąż pojawiają się w zimnych regionach śródlądowych, a nie w centrach miast.
Gdzie faktycznie znajduje się tania czysta energia
Miejsca o najlepszej ekonomice czystej energii dla obliczeń to nie oczywiste huby technologiczne. Zwykle są to regiony śródlądowe z silnymi zasobami wiatru i słońca oraz suchym, chłodnym klimatem:
•Mongolia Wewnętrzna (Horinger). Jedna z największych baz energii wiatrowej w Chinach. Mroźne zimy oznaczają, że przez większość roku potrzebne jest niewiele chłodzenia mechanicznego lub wcale.
•Xinjiang (Hami). Bardzo wysokie nasłonecznienie i stały wiatr. Odległe, ale odległość nie stanowi problemu, gdy twoje obciążenie to klaster GPU, którym zarządzasz zdalnie.
•Ningxia (Zhongwei). Już ugruntowany region centrów danych z solarnymi i wiatrowymi farmami na skalę przemysłową; hostuje jeden z głównych międzynarodowych regionów chmurowych, co świadczy o tym, że ekonomika działa na skalę.
Wzorzec jest taki sam we wszystkich trzech: obfita generacja odnawialna, chłodny suchy klimat obniżający PUE i ziemia wystarczająco tania, by budować stacje transformatorowe i pola solarne zasilające serwerownie.
Nic z tego nie jest egzotyczną technologią. To lokalizacja. Najbardziej ekologiczną rzeczą, jaką może zrobić dostawca obliczeń, jest umieszczenie sprzętu tam, gdzie sieć energetyczna jest już czysta, a klimat wykonuje połowę chłodzenia za darmo.
Co właściwie powinny mówić twierdzenia o "zieloności"
Tu staję się sceptyczny. "Zielony" to słowo marketingowe, dopóki ktoś nie poda ci liczb. Gdy dostawca składa twierdzenie o czystej energii, warto zapytać o trzy rzeczy:
•PUE. Jeśli go nie opublikują, traktuj twierdzenie jako niezweryfikowalne.
•Rzeczywisty miks energetyczny regionu, w którym znajduje się centrum danych. Dostawca, który jedynie kupuje certyfikaty energii odnawialnej, działając na sieci opartej na paliwach kopalnych, nie działa ekologicznie. Lokalizacja to ujawnienie.
•Czy odnawialne źródła to realna moc, a nie kompensacje. Nowa energia wiatrowa i słoneczna zbudowana do zasilania obiektu to inne twierdzenie niż kupowanie kredytów gdzie indziej.
Uczciwi dostawcy podadzą ci region i charakterystykę obiektu. Jeśli odpowiedź brzmi: "nasze centra danych znajdują się w Mongolii Wewnętrznej, Xinjiangu i Ningxii, w sieciach o wysokim udziale energii odnawialnej, w chłodnym klimacie", to konkretne, weryfikowalne stwierdzenie. Jeśli odpowiedź to slogan, idź dalej.
Co faktycznie możesz z tym zrobić
Nie będziesz audytować stacji transformatorowej dostawcy. Ale możesz podjąć kilka decyzji, które przechylą twój własny ślad:
•Wybieraj dostawców, którzy ujawniają lokalizację i PUE, a nie takich, którzy po prostu drukują "neutralny węglowo" na stronie.
•Używaj mniejszych modeli, gdzie zadanie na to pozwala. Model 7B może odpowiedzieć na pytanie wsparcia niemal tak dobrze jak model 175B przy ułamku energii. Kierowanie łatwego ruchu do małego modelu to największa dźwignia węglowa, którą kontrolujesz.
•Buforuj agresywnie. Buforowanie promptów zamienia powtarzające się dane wejściowe w jednorazowy koszt, zmniejszając zarówno opóźnienie, jak i energię dla powtarzalnych obciążeń.
•Grupuj, gdy możesz. Mniej, większych żądań bije wiele małych pod względem wykorzystania serwera.
Uczciwe ujęcie jest takie, że nie możesz zmierzyć sobie drogi do czystego śladu za pomocą arkusza kalkulacyjnego, ponieważ miks energetyczny nie znajduje się w twoich danych. Możesz natomiast wybierać dostawców, których infrastruktura z założenia zmniejsza ślad, i przestać kierować trywialne żądania do największego modelu, na jaki cię stać.
To stanowisko zajmuje SiCore TokenWorks: jego trzy centra obliczeniowe znajdują się w mongolskim Horinger, xinjiangskim Hami i ningxiańskim Zhongwei — regionach wybranych ze względu na wysoki udział energii odnawialnej i chłodny klimat utrzymujący niskie PUE. Jeśli zależy ci na energii stojącej za twoimi wywołaniami API, to właśnie takiego rodzaju ujawnienie ma większe znaczenie niż odznaka.