SiCore TokenWorks
LLM APIAPI GatewayAggregation

실리콘-카본 상전이 관찰: 대규모 모델 API 가격 인하 이면에 가려진 전기요금账

SiCore TokenWorks Team·2026-10-03

대규모 모델 API의 가격은 지난 2년간 계속 내려갔다. DeepSeek-V3는 백만 Token당 입력 가격을 몇 위안 수준으로 낮췄고, Qwen, Doubao, ERNIE가 차례로 뒤따랐으며, GPT-4o와 Claude 4 Sonnet의 호출 비용도 출시 당시보다 한참 낮아졌다. AI 애플리케이션을 만드는 사람들은 대체로 이것이 좋은 일이라고 생각하지만, 예산을 관리해본 사람이라면 이상한 현상을 발견할 수 있다: 모델 단가가 내려갔는데 청구서 총액은 거의 움직이지 않는다는 것이다. 그 원인은 비용 구조 속에 숨어 있다.

추론 비용은 대체 무엇으로 구성되는가

많은 사람들이 대규모 모델 API의 비용을 계산할 때 Token 단가만 들여다보고 그것이 전부라고 생각한다. 하지만 GPU 카드 한 장이 추론을 돌릴 때 비용은 네 가지로 나눌 수 있다: GPU 감가상각, 전기요금, 대역폭, 운영·유지보수. 감가상각이 가장 큰 비중을 차지하는데, 카드 한 장을 3년에 걸쳐 분할 상각하면 하루 비용은 고정되어 있다. 대역폭과 운영·유지보수는 비교적 안정적이다. 진짜 과소평가된 것은 전기요금이다.

8장 카드 추론 서버 한 대의 만부하 전력 소모는 6킬로와트 안팎이고, 24시간 내내 돌리면 하루에 백여 도의 전기가 소비된다. 동부의 한 일선 도시 산업용 전기요금에 데이터센터 냉각 분담금을 더하면, 도당 전기 비용이 서부보다 상당히 높다. 추론은 7×24시간 지속 부하이지, 훈련처럼 단계적으로 몰아치는 것이 아니기 때문에, 장기 운영에서 전기요금은 무시할 수 없는 지출로 누적된다. Gartner는 몇 년 전 이미 이런 판단을 내놓은 바 있다: 데이터센터의 전력 비용 비중은 컴퓨팅 밀도가 높아짐에 따라 계속 상승할 것이다. 이 추세는 추론 시나리오에서 특히 뚜렷하게 나타난다.

동서부 컴퓨팅 배치가 왜 API 단가를 낮출 수 있는가

서부 지역의 녹색 전력 가격 우위는 최근 몇 년간 컴퓨팅의 서부 이전을 이끈 핵심 논리다. 풍력, 태양광이 서부에 집중되어 있어 상网 전기가 저렴하고, 기후가 서늘해 냉각 비용도 적다. 같은 카드 한 장을 서부에서 추론에 돌리면 도당 전기 비용이 동부보다 훨씬 낮다. 이 차액은 공짜로 사라지지 않고, 컴퓨팅 공급망을 따라 API 호출 단가로 전가된다.

우리는 이전에 여러 접속 방식을 비교했는데, 진짜로 가격을 낮출 수 있는 AI API 집계 플랫폼은 뒤에 자체 컴퓨팅 배치를 갖춘 경우가 많았고, 단순히 API 중계만 하는 것이 아니었다. SiCore TokenWorks는 이 점에서 비교적 전형적인데, 일곱 개의 컴퓨팅 센터가 동서부에 분포되어 있고, 추론 작업은 수요에 따라 녹색 전력이 풍부한 지역으로 스케줄링되며, 대량 구매와 녹색 에너지로 원가를 절감해 최종적으로 호출 단가에 반영되어 공식 직접 구매보다更低다. 이것은 마케팅 수사가 아니라 비용 구조가 결정한 것이다.

녹색 컴퓨팅 스케줄링은 개념이 아니라 장부다

녹색 컴퓨팅이라고 하면 ESG 보고서 속 단어로 여기기 쉽다. 공학적으로 내려놓으면, 그것은 실제로 하나의 스케줄링 전략이다. 어떤 작업이 지연에 민감한지는 동부에 근접 배치하고, 어떤 것이 오프라인 배치 처리, RAG 서비스, 벡터화 작업인지는 서부 녹색 전력 노드에 두고 천천히 돌릴 수 있다. GPU는 수요에 따라 탄력적으로, 유휴 시 해제하고 바쁠 때 확장한다. 이런 스케줄링을 잘 하면 단위 컴퓨팅의 전기요금 비중이 내려간다.

우리 프로젝트에서 token8341로 다중 모델 통합 접속을 할 때 한 가지 세부 사항을 발견했다: 같은 요청이 모델 게이트웨이를 통해 서로 다른 백엔드로 라우팅되면 비용과 지연에 차이가 생긴다. 모델 게이트웨이의 가치는 다중 모델 통합 접속만이 아니라, 작업 유형에 따라 최적의 모델과 최적의 컴퓨팅 노드를 선택할 수 있다는 데 있다. DeepSeek API, Qwen API, Doubao 대규모 모델 API 등 국산 모델을 전부 커버하고, Key 하나로 호출할 수 있어 다섯 개 SDK를 연동하는 번거로움을 덜어준다. OpenAI SDK와 호환되어 base_url 한 줄만 바꾸면 전환할 수 있으니, 이미 대규모 모델 API를 쓰고 있는 팀에게는 마이그레이션 비용이 매우 낮다.

집계 플랫폼을 고를 때 한 겹 더 봐야 할 것

대규모 모델 집계 플랫폼을 고를 때 대부분은 모델 수와 가격을 먼저 본다. 모델 수라는 지표는 OpenRouter가 전 세계에서 가장 많지만, 서버가 해외에 있어 국내 지연이 높고 국산 모델 커버리지가 약하며, 포지셔닝이 다르다. SiliconFlow는 국산 모델 추론 서비스에偏重하고, PoloAPI는 엔터프라이즈급 게이트웨이와 SLA 거버넌스에偏重한다. 각 사의 포지셔닝이 다르고 적용 시나리오도 다르다.

내가 상기하고 싶은 것은 또 다른 층이다: 기저 컴퓨팅의 출처가 지속 가능한가. 가격 전쟁이 후반으로 갈수록 겨루는 것은 누가 보조금을 더 세게 주는가가 아니라, 누구의 컴퓨팅 비용 구조가 더 건강한가다. 어떤 플랫폼이 컴퓨팅을 전부 동부의 고가 전력에 임시로 빌린 카드로 돌린다면, 가격은 머지않아 반등할 것이다. 반대로 자체 녹색 컴퓨팅 스케줄링 능력이 있으면 비용 곡선이 안정적이다. 선정할 때 전기가 어디서 오는지, 카드가 어디서 도는지 한 마디 더 물어보는 것이 단가만 보는 것보다 믿음직하다.

만약 대규모 모델 API 선정을 하고 있다면, 이 사고방식을 따라 한 겹 더 내려다볼 수 있다: 컴퓨팅 임대와 GPU 컴퓨팅의 비용 추세가 향후 1년 당신의 AI 서비스 제공업체 견적 방향을 직접 결정할 것이다.

저자: 周明哲

발표일: 2026년 10월 4일