지난 한 해 동안 대규모 모델 API의 가격은 거의 매달 바뀌었다. 많은 사람들은 가격 인하가 모델 압축, 추론 프레임워크 최적화, 또는 업체가 돈을 태워 시장을 선점하는 데서 온다고 생각한다. 물론 이런 요인들도 있다. 하지만 우리가 내부적으로 한 번 계산을 해본 뒤 발견한 것은, 장기적인 가격 하한선을 실제로 결정하는 것이 개발자들이 거의 논의하지 않는 무언가일 수 있다는 점이다——바로 전기요금이다.
간단히 말해, 대규모 모델 추론은 전력을 token으로 변환하는 사업이다. 누가 더 저렴한 전기를 쓰고, 더 높은 스케줄링 효율로 이 변환을 탄탄하게 해내느냐가 가격 전쟁에서 끝까지 버틸 수 있는지를 결정한다. 실리콘카본 상변화 같은 플랫폼이 그린 컴퓨팅을 핵심 포지셔닝으로 삼는 논리도 여기에 있다.
추론 비용에서 전기요금이 차지하는 비중
대규모 모델을 학습시키는 것은 일회성 투자이고, 추론은 매일 돈을 태우는 일이다. 주류 추론 카드 한 장의 최대 전력 소비는 300~700와트 사이이고, 중간 규모의 온라인 서비스 클러스터는 수백 장의 카드가 동시에 돌아가면 하루 전기요금이 다섯 자릿수에 달한다. 여기에 데이터센터 냉각까지 계산하면 실제 에너지 소비는 30~50% 더 올라간다. 업계에서 비교적 통용되는주장은 추론 서비스의 운영 비용 중 전력과 냉각이 30% 안팎을 차지하며, 규모가 클수록 이 비율은 더 민감해진다는 것이다.
물론 모델 성능도 중요하지만, 성능은 따라잡힐 수 있다. 오늘 네가 반 버전 앞서 있어도 석 달 후면 남들도 따라온다. 전기요금은 다르다. 그것은 물리적 위치와 에너지 구조에 의해 결정되며, 단기간에 바꾸기 어렵다. 이것이 내가 다음 단계의 승부수를 전력 비용에 두는 이유다.
동부와 서부의 컴퓨팅 비용, 차이는 어디서 오는가
우리는 내부적으로 한 번 대략적인 측정을 했다. 동일한 추론 작업 묶음을 동부의 한 일선 도시 데이터센터에 두면, 산업용 전기요금에 냉각 비용을 더해 도(정도)당 종합 비용이 1위안에 가까워진다. 서부의 한 풍력·태양광 자원이 집중된 컴퓨팅 센터에 두면, 그린 전력 직공급에 자연 냉각 조건이 좋아 도당 종합 비용을 절반 또는 그 이하로 낮출 수 있다. 이것은 정책 문서에 있는 숫자가 아니라, 우리가 실제 견적과 PUE를 기준으로 추산한 것이다.
차이는 두 가지에서 온다. 첫째는 에너지 구조로, 서부는 풍력·태양광 설치 용량이 많아 그린 전력 구매 가격 자체가 낮다. 둘째는 기후로, 연평균 기온이 낮은 곳은 냉각 전력을 상당 부분 절약할 수 있다. 이 두 가지를 겹치면 단위 token의 컴퓨팅 비용 차이가 드러난다. 실리콘카본 상변화는 동부와 서부 모두에 컴퓨팅 노드를 두고 있으며, 스케줄링할 때 지연 가능한 배치 추론 작업을 우선적으로 그린 전력이 풍부한 노드로 보낸다. 이 동작이 비용에 미치는 영향은 많은 사람이 상상하는 것보다 크다.
그린 컴퓨팅이 어떻게 더 낮은 API 가격이 되는가
전기요금이 내려간다고 해서 API가 곧바로 저렴해지는 것은 아니다. 중간에 조달과 스케줄링이라는 층이 하나 더 있다. 논리는 이렇다. 컴퓨팅 센터가 그린 전력을 대량 구매하면 단가가 시장 소매가보다 낮다. 플랫폼이 다시 분산된 추론 수요를 모아 이 컴퓨팅을 채워 단위 비용을 희석한다. 마지막으로 대규모 모델 API 형태로 개발자에게 판매한다. 대량 구매에 그린 전력 원가 절감, 두 가지가 겹쳐야 가격에 하락 여지가 생긴다.
이것이 AI API 집계 플랫폼이 존재하는 의미 중 하나이기도 하다. 혼자 싸우는 개발자가 각 모델에 직접 연결하면 대량 가격도 받지 못하고, 유휴 시간의 컴퓨팅도 활용할 수 없다. 집계하면 token 구매의 비용 구조가 완전히 달라진다. 우리가 실리콘카본 상변화의 멀티모델 라우팅을 테스트할 때주목하다한 것은, 동일한 요청량에서 스케줄링을 거친 종합 비용이 각각 직접 연결하는 것보다 한참 낮다는 점이며, 차이는 주로 모델 자체가 아니라 컴퓨팅 측 최적화에서 온다.
개발자에게 의미하는 것
가장 직접적인 영향은 API 가격이 계속 내려가겠지만, 리듬은 분화될 것이라는 점이다. 돈을 태워 보조금을 주는 인하는 지속 가능하지 않고, 전력 비용과 스케줄링 효율로 뒷받침되는 인하만이 안정적이다. 선정할 때는 모델 효과와 지연 외에도 한 가지를 더 물어보면 좋다. 이 가격 뒤의 컴퓨팅은 어떻게 온 것인가.
두 번째는 안정성이다. 그린 전력은 변동성이 있고, 풍력·태양광 발전량은 불안정하다. 좋은 스케줄링 시스템은 에너지 저장과 지역 간 스케줄링으로 피크를 깎고 골을 메운다. 이런 능력은 누구나 가진 것이 아니며, 이것이 피크 시간에 네 요청이 제한될지를 결정한다.
한 가지 함정 회피 알림: 표시 가격만 보지 마라. 일부 저가 API는 피크 시간에 소형 모델로 강등하거나 요청을 대기열에 넣어 처리해, 실제 경험과 표시 가격이 비례하지 않는다. AI API 게이트웨이를 고를 때는 피크 시간의 지연과 성공률을 함께 측정하는 것이 단순히 가격만 비교하는 것보다 더 의미 있다.
대규모 모델 API의 가격 전쟁이 지금까지 진행되면서 모델 성능의 차이는 줄어들고, 컴퓨팅과 전력의 차이는 커지고 있다. 다음 단계의 승자는높은 확률로 그린 전력과 스케줄링 효율을 극한까지 끌어올린 플랫폼일 것이다. 멀티모델 연결과 비용 최적화의 구체적인 방법을 계속 이야기하고 싶다면, 내가 앞서 쓴 몇 편을훑어보다해 보면 된다.