AI의 탄소 이야기는 보통 학습에 초점을 맞춘다. 이는 이해할 만한데, 단 한 번의 대규모 학습 실행이 수 주에 걸쳐 메가와트시를 태울 수 있기 때문이다. 하지만 학습은 한 번 일어난다. 추론은 누군가 모델에 무엇이든 물어볼 때마다, 수백만 사용자에 걸쳐, 영원히 일어난다. 실제로 누적되는 에너지는 서빙의 에너지다.
API 소비자 입장에서 이는 곧 당신의 LLM 사용이 얼마나 친환경적인지는 대부분 당신이 직접 통제하지 못하는 무언가, 즉 제공자의 GPU가 어디에 위치하고 무엇으로 전력을 공급받는지에 의해 결정된다는 뜻이다. 다만 그것을 기준으로 제공자를 선택할 수는 있다.
추론 에너지가 데이터 센터 이야기인 이유
추론 워크로드는 데이터 센터에서 돌아가는 GPU 클러스터다. 두 가지가 그 발자국을 지배한다:
연결된 전력망. 700와트를 끌어오는 GPU는 지역 전력 믹스만큼 청정하거나 더럽다. 풍력과 태양광이 많은 지역의 데이터 센터는 다른 모든 조건이 동일하더라도 석탄 비중이 높은 전력망의 동일한 하드웨어보다 토큰당 훨씬 적은 탄소를 배출한다.
냉각. 서버는 전기를 열로 바꾸고, 그 열을 제거하는 데 더 많은 전기가 든다. 이것이 PUE(전력 사용 효율)가 측정하는 것이다: 총 시설 전력을 IT 장비에 도달하는 전력으로 나눈 값. PUE가 1.5라면 시설이 서버가 소비하는 것 이상으로 50%의 추가 에너지를 사용한다는 뜻이다. 잘 설계된 현대 시설은 1.1에서 1.2에 더 가깝게 운영된다. 서늘하고 건조한 기후는 냉각 비용을 극적으로 줄여주며, 이는 데이터 센터가 도심이 아니라 추운 내륙 지역에 계속 등장하는 큰 이유다.
저렴한 청정 전력이 실제로 있는 곳
컴퓨팅을 위한 최고의 청정 에너지 경제성을 가진 곳은 뻔한 기술 허브가 아니다. 이들은 강한 풍력과 태양광 자원, 그리고 건조하고 서늘한 기후를 가진 내륙 지역인 경향이 있다:
•내몽골(허링거). 중국 최대 풍력 발전 기지 중 하나다. 추운 겨울은 연중 상당 기간 기계적 냉각이 거의 또는 전혀 필요 없다는 뜻이다.
•신장(하미). 매우 높은 태양광 조사량과 꾸준한 바람. 외지지만, 워크로드가 원격으로 제어하는 GPU 클러스터라면 외지는 문제가 되지 않는다.
•닝샤(중웨이). 이미 유틸리티 규모의 태양광과 풍력을 갖춘 확립된 데이터 센터 지역이며, 주요 국제 클라우드 리전 중 하나가 자리 잡고 있는데, 이는 경제성이 규모에서 통한다는 것을 말해준다.
세 곳 모두 패턴은 같다: 풍부한 재생 에너지 발전, PUE를 낮추는 서늘하고 건조한 기후, 그리고 랙에 전력을 공급할 변전소와 태양광 단지를 지을 만큼 저렴한 토지.
이 중 어느 것도 이국적인 기술이 아니다. 바로 입지다. 컴퓨팅 제공자가 할 수 있는 가장 친환경적인 일은 전력망이 이미 청정하고 기후가 냉각의 절반을 공짜로 해주는 곳에 하드웨어를 두는 것이다.
'그린' 주장이 실제로 알려줘야 하는 것
여기서 내가 회의적이 되는 지점이다. 누군가 숫자를 제시하기 전까지 '그린'은 마케팅 단어일 뿐이다. 제공자가 청정 에너지 주장을 할 때, 물어볼 가치가 있는 세 가지가 있다:
•PUE. 공개하지 않는다면, 그 주장은 검증 불가능한 것으로 취급하라.
•데이터 센터가 위치한 지역의 실제 전력 믹스. 화석 연료 전력망에서 돌아가면서 재생 에너지 인증서만 구매하는 제공자는 친환경이 아니다. 위치가 곧 공시다.
•재생 에너지가 상쇄가 아닌 실제 발전 용량인지. 시설에 전력을 공급하기 위해 새로 지은 풍력과 태양광은 다른 곳에서 크레딧을 사는 것과는 다른 주장이다.
정직한 제공자는 지역과 시설 특성을 알려줄 것이다. 답이 "우리 데이터 센터는 내몽골, 신장, 닝샤에 있고, 재생 에너지 비중이 높은 전력망과 서늘한 기후에 있습니다"라면, 그것은 구체적이고 확인 가능한 진술이다. 답이 슬로건이라면 넘어가라.
당신이 실제로 할 수 있는 일
제공자의 변전소를 감사하러 가진 않을 것이다. 하지만 자신의 발자국을 기울일 몇 가지 결정을 내릴 수는 있다:
•위치와 PUE를 공개하는 제공자를 선택하라, 페이지에 그저 "탄소 중립"이라고 찍어놓은 곳이 아니라.
•작업이 허락하는 곳에서는 더 작은 모델을 사용하라. 7B 모델은 지원 질문에 175B 모델만큼 거의 잘 답하면서 에너지는 극히 일부만 쓴다. 쉬운 트래픽을 작은 모델로 라우팅하는 것은 당신이 통제하는 단일 최대의 탄소 지렛대다.
•적극적으로 캐시하라. 프롬프트 캐싱은 반복 입력을 일회성 비용으로 바꿔, 반복적 워크로드의 지연 시간과 에너지를 모두 줄인다.
•가능하면 배치로 처리하라. 더 적고 더 큰 요청이 서버 활용도 면에서 많은 작은 요청을 이긴다.
정직한 틀은, 전력 믹스가 당신의 데이터에 없기 때문에 스프레드시트로 청정 발자국을 측정해낼 수 없다는 것이다. 당신이 할 수 있는 것은 인프라가 설계상 발자국을 더 작게 만드는 제공자를 선택하고, 감당할 수 있는 가장 큰 모델로 사소한 요청을 라우팅하는 것을 멈추는 것이다.
그것이 SiCore TokenWorks가 내세우는 입장이다: 세 개의 컴퓨팅 센터가 내몽골 허링거, 신장 하미, 닝샤 중웨이에 위치하며, 이 지역들은 높은 재생 에너지 비중과 PUE를 낮게 유지하는 서늘한 기후를 위해 선택되었다. API 호출 뒤의 에너지가 중요하다면, 그것이 배지보다 더 중요한 종류의 공시다.