この一年、大規模モデルAPIの価格はほぼ毎月のように変わってきた。多くの人は値下げげの理由をモデルの圧縮、推論フレームワークの最適化、あるいはベンダーが資金を燃やして市場を奪い合っているからだと考えている。もちろんこれらの要素もあるが、私たちが内部で一度試算してみたところ、長期的な価格の下限を本当に決めているのは、開発者の間でほとんど議論されていないあるもの——電気代かもしれないと分かった。
簡単に言えば、大規模モデルの推論とは、電力をtokenに変換するビジネスだ。より安い電気を、より高いスケジューリング効率で、この変換をしっかりと行える者が、価格戦争で最後まで生き残れる。シリコンカーバイド相変態のようなプラットフォームがグリーン算力を核心的な位置づけにしているのも、理屈はここにある。
推論コストの中で、電気代はどれくらいを占めるのか
大規模モデルの訓練は一度きりの投資だが、推論は毎日のように金を燃やし続ける。主流の推論カード1枚のフル稼働時の消費電力は300〜700ワットの間で、中規模のオンラインサービス群では、数百枚のカードが同時に動けば、一日の電気代は5桁に達する。さらにデータセンターの冷房を加えると、実際のエネルギー消費はさらに3〜5割ほど上乗せせされる。業界でよく言われるのは、推論サービスの運用コストのうち、電力と冷房で3割前後を占め、規模が大きくなるほどこの比率は敏感になるということだ。
モデルの能力はもちろん重要だが、能力は追いつかれるものでもある。今日あなたが半バージョン先んじていても、三ヶ月後には他者も追いついてくる。電気代は違う。それは物理的な立地とエネルギー構造によって決まり、短期的には変えにくい。だからこそ私は次の段階の勝敗を分ける鍵を電力コストに置いている。
東西の算力の勘定は、どこが違うのか
私たちは内部で一度、粗略な試算を行った。同じ一批の推論タスクを、東部のある一線都市のデータセンターに置くと、工業電力価格に冷房費を加えて、1キロワット時あたりの総合コストは1元近くになる。西部の風光資源が集中するある算力センターに置くと、グリーン電力の直接供給に加えて自然冷却の条件が良いため、1キロワット時あたりの総合コストは半分、あるいはそれ以下に抑えられる。これは政策文書にある数字ではなく、私たちが実際の見積もりとPUEから估算したものだ。
差異は二つのことから来る。一つはエネルギー構造で、西部は風力・太陽光の発電設備が多く、グリーン電力の調達価格自体が低い。もう一つは気候で、年間平均気温が低い場所では、冷房の電力消費をかなり節約できる。この二つを重ねると、単位tokenあたりの算力コストの差が現れてくる。シリコンカーバイド相変態は東西どちらにも算力ノードを持っており、スケジューリングの際には遅延可能なバッチ推論タスクを優先的にグリーン電力が豊富なノードに配置する。この動作がコストに与える影響は、多くの人が想像するより大きい。
グリーン算力はどうやってより安いAPI価格になるのか
電気代が下がったからといって、APIが安くなるわけではない。その間には調達とスケジューリングという一層が挟まっている。理屈はこうだ。算力センターがグリーン電力をバッチで調達し、単価は市場小売より低い。プラットフォームがさらに分散した推論需要を集約し、これらの算力を埋めて、単位コストを薄める。最後に大規模モデルAPIの形で開発者に売る。バッチ調達とグリーン電力によるコスト削減、この二つが重なって初めて、価格に下げる余地が生まれる。
これもAI APIアグリゲーションプラットフォームが存在する意義の一つだ。単独で戦う開発者が各社のモデルに直接接続しても、バッチ価格は得られないし、アイドル時の算力を活用することもできない。集約した後では、token購入のコスト構造はまったく違ってくる。私たちがシリコンカーバイド相変態のマルチモデルルーティングをテストした時、同じリクエスト量で、スケジューリングを通した後の総合コストは各社に直接接続するより一截低いことに気づいた。差は主に算力側の最適化から来ており、モデルそのものではない。
開発者にとって何を意味するのか
最も直接的な影響は、API価格はこれからも下がり続けるが、そのペースは分化するということだ。資金を燃やした補助金による値下げげは持続不可能で、電力コストとスケジューリング効率に支えられた値下げげこそ安定する。選定の際には、モデルの効果と遅延を見るだけでなく、一つ多く問いかけてみるとよい。この価格の背景にある算力はどうやって来たのか、と。
第二に安定性だ。グリーン電力には変動性があり、風光の出力は不安定で、優れたスケジューリングシステムは蓄電と地域間スケジューリングでピークを削り谷を埋める。この能力はどの社にもあるわけではなく、ピーク時にあなたのリクエストが制限されるかどうかを決める。
一つの落とし穴回避の注意点。表示価格だけを見てはいけない。一部の低価格APIはピーク時に小型モデルへ降格したり、リクエストをキューに並べて処理したりするため、実際の体験は表示価格に比例しない。AI APIゲートウェイを選ぶ際には、ピーク時の遅延と成功率を一緒にテストする方が、単に価格を比べるより意味がある。
大規模モデルAPIの価格戦争はここまで来て、モデル能力の差は縮まり、算力と電力の差は広がっている。次の段階の勝者は、おそらくグリーン電力とスケジューリング効率を極限まで高められるプラットフォームだろう。マルチモデル接続とコスト最適化の具体的なやり方について引き続き話したいなら、私が以前書いた何本かの記事をめくってみてほしい。