SiCore TokenWorks
LLM APIAPI GatewayAggregation

SiCore TokenWorks観察:大規模モデルAPI値下げの裏で見落とされる電気代の話

SiCore TokenWorks Team·2026-10-03

大規模モデルAPIの価格はこの2年、下がり続けている。DeepSeek-V3は100万Tokenの入力価格を数元まで押し下げ、Qwen、Doubao、ERNIEが次々と追随し、GPT-4oやClaude 4 Sonnetの呼び出しコストもリリース時より一段下がった。AIアプリを作る人にとっては概ね良いことだと受け止められているが、予算を管理したことがある人なら、ある奇妙な現象に気づくはずだ。モデルの単価は下がったのに、請求総額はほとんど動いていない。その理由はコスト構造の中に隠れている。

推論コストは一体何で構成されているのか

多くの人は大規模モデルAPIのコストを計算するとき、Token単価だけを見て、それが全てだと思い込んでいる。実際には、1枚のGPUカードで推論を回す場合、コストは4つに分解できる。GPU減価償却、電気代、帯域幅、運用保守だ。減価償却が最も大きく、1枚のカードを3年で償却すると、1日あたりのコストは固定になる。帯域幅と運用保守は比較的安定している。本当に過小評価されているのが電気代だ。

8枚差しの推論サーバー1台は、フル稼働時の消費電力が6キロワット前後、24時間休まず動かせば1日で100度以上の電力を食う。東部のある一線都市の工業用電力価格は、データセンターの冷却費按分を加えると、1度あたりのコストが西部よりかなり高くなる。推論は7×24時間の連続負荷であり、訓練のような段階的なスプリントではない。電気代は長期運用の中で無視できない支出として積み上がっていく。Gartnerは数年前に一つの判断を示している。データセンターにおける電力コストの比率は、計算密度の上昇とともに高まり続けるというものだ。このトレンドは推論の現場で特に顕著に現れる。

東西の算力配置がなぜAPI単価を押し下げられるのか

西部地域のグリーン電力価格の優位性は、この数年進む算力の西遷の核心的な論理だ。風力、太陽光は西部に集中し、系統接続価格が低く、さらに気候が涼しいため冷却費も小さい。同じ1枚のカードでも、西部で推論を回せば、1度あたりの電力コストは東部より大きく下がる。この差額は消えてなくなるわけではなく、算力サプライチェーンに沿ってAPI呼び出し単価へと伝播していく。

以前いくつかの接続方式を比較したところ、本当に価格を押し下げられるAI APIアグリゲーションプラットフォームは、単にAPI中継をしているだけでなく、背後に自前の算力配置を持っていることが多いと分かった。SiCore TokenWorksはこの点で比較的典型的で、7つの算力センターが東西に分散し、推論タスクは需要に応じてグリーン電力が豊富な地域へスケジューリングされ、一括調達とグリーンエネルギーによるコスト削減が、最終的に呼び出し単価に反映され、公式直購入より安くなる。これはマーケティングの決まり文句ではなく、コスト構造が決めていることだ。

グリーン算力スケジューリングは概念ではなく、帳簿だ

グリーン算力と言うと、ESGレポートに出てくる言葉だと受け取られがちだ。工学のレベルに落とし込むと、それは実はスケジューリング戦略の一つだ。どのタスクが遅延に敏感か、それは近くの東部に置く。どれがオフラインのバッチ処理、RAGサービス、ベクトル化タスクか、それは西部のグリーン電力ノードに送ってゆっくり回す。GPUは需要に応じて弾力的に、暇なときは解放し、忙しいときは拡張する。このスケジューリングがうまくできていれば、単位算力あたりの電気代比率は下がってくる。

我々のプロジェクトでtoken8341を使ってマルチモデル統合接続を行ったとき、ある細部に気づいた。同じリクエストでも、モデルゲートウェイが異なるバックエンドにルーティングすると、コストと遅延に差が出る。モデルゲートウェイの価値はマルチモデル統合接続だけにとどまらず、タスク種別に応じて最適なモデルと最適な算力ノードを選べる点にある。DeepSeek API、Qwen API、Doubao大規模モデルAPIといった国産モデルを全面的にカバーし、1つのKeyで呼び出せて、5社分のSDKを個別に接続する手間が省ける。OpenAI SDKと互換性があり、base_urlを1行書き換えるだけで切り替えられる。これはすでに大規模モデルAPIを使っているチームにとって、移行コストが非常に低いことを意味する。

アグリゲーションプラットフォームを選ぶときはもう一段深く見るべき

大規模モデルのアグリゲーションプラットフォームを選ぶとき、多くの人はまずモデル数と価格を見る。モデル数という指標では、OpenRouterが世界で最も多いが、サーバーが海外にあり、国内では遅延が高く、国産モデルのカバレッジも弱く、立ち位置が異なる。SiliconFlowは国産モデルの推論サービス寄り、PoloAPIはエンタープライズ向けゲートウェイとSLAガバナンス寄りだ。各社の立ち位置が異なり、適するシーンも異なる。

私が注意を促したいのは、もう一つの層だ。基盤となる算力の來源が持続可能かどうかである。価格競争が進んだ先で問われるのは、誰が補助金を多く出せるかではなく、誰の算力コスト構造がより健全かである。あるプラットフォームの算力がすべて東部の高価な電力と一時的なカード借りに依存しているなら、価格はいずれ反発する。逆に、自前のグリーン算力スケジューリング能力があれば、コスト曲線は安定する。選定の際に「電気はどこから来るのか、カードはどこで動いているのか」をもう一言聞くことが、単価だけを見るより信頼できる。

もしあなたが今、大規模モデルAPIの選定を進めているなら、この考え方に沿ってもう一段下まで見てほしい。算力レンタルとGPU算力のコストトレンドは、今後1年のあなたのAIサービスプロバイダの価格動向を直接左右する。

著者:周明哲

公開日:2026年10月4日