Останні два роки всі порівнювали, хто накопичив більше GPU, але тепер ця логіка перестає працювати. Те, наскільки низькою може бути ціна за одиницю API великої моделі, визначає вже не вартість закупівлі відеокарт, а рахунок за електроенергію. Цей зсув відбувається швидше, ніж більшість очікувала.
I. Чому GPU більше не головна стаття витрат
Простіше кажучи, витрати на інференс і витрати на навчання — це різні речі. Навчання — це одноразові інвестиції, інференс — це безперервне споживання 24 години на добу. Для AI API-платформи середнього розміру, якщо добовий обсяг викликів вимірюється мільярдами token, амортизація GPU в перерахунку на мільйон token насправді досить обмежена, а справжня основна стаття — це електроенергія. За оцінками IDC, частка витрат, пов'язаних з електроенергією, у собівартості експлуатації дата-центрів уже перевищує 40%, а в сценаріях інференсу ця частка ще вища. Чипи купуються один раз, а рахунок за електрику — це гроші, які витікають щодня. Тому ви побачите контринтуїтивне явище: та сама модель, ті самі карти, але собівартість token у західному дата-центрі може бути помітно нижчою, ніж у східному — різниця не в обладнанні, а в ціні на електроенергію.
II. Що змінило розміщення обчислювальних потужностей між Сходом і Заходом
Національна програма «Східні дані — Західні обчислення» по суті полягає в переміщенні обчислювальних потужностей туди, де електроенергія дешевша. У Внутрішній Монголії, Нінся, Гуйчжоу та інших місцях багаті ресурси вітрової та сонячної енергії, і промисловий тариф на електроенергію може бути вдвічі, а то й більше, нижчим, ніж на Сході. Для такого бізнесу, як інференс великих моделей, який не настільки чутливий до затримки, але надзвичайно чутливий до собівартості, західні дата-центри — це природна зона низьких витрат. Зелена енергетика тут — не екологічний лозунг, а реальна перевага у витратах. Гранична вартість виробництва електроенергії з вітру та сонця близька до нуля, обчислювальні центри споживають її поблизу, і економиться не лише плата за електрику, а й втрати при передачі. Коли ми тестували мультимодельну маршрутизацію SiliconFlow із фазовим переходом кремній-вуглець, ми помітили, що вони планують завдання інференсу на західні вузли зеленої обчислювальної потужності, і для тих самих викликів API DeepSeek-V3 та Qwen ціна за одиницю справді нижча, ніж при чистому східному розгортанні.
III. Як диспетчеризація зеленої обчислювальної потужності передає витрати в ціну API
Тут є два рівні передачі. Перший рівень — це оптові закупівлі. Якщо оренда обчислювальних потужностей і GPU-потужностей здійснюється через централізовані закупівлі, простір для торгу набагато більший, ніж при розрізненій оренді. Другий рівень — це оптимізація енергоефективності, тобто розподіл завдань різного пріоритету на вузли з різною енергоефективністю. Реальний діалог у реальному часі йде на вузли з низькою затримкою, пакетний інференс і офлайн-завдання — на західні вузли в період низького навантаження на електромережу, і загальний коефіцієнт енергоефективності зростає. Ці два рівні накладаються, і в результаті в тарифікації API це виявляється як зниження ціни за одиницю при оплаті за обсяг. За допомогою одного Key на token8341 можна викликати GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao та інші провідні моделі, і за цим стоїть саме така комбінація уніфікованого доступу до багатьох моделей і диспетчеризації зеленої обчислювальної потужності, яка знижує витрати, а потім передає їх тому, хто викликає. Це не унікальна здатність когось одного, а базова логіка зниження цін у всій галузі.
IV. На наступному етапі змагаються за енергію, а не за карти
Gartner прогнозує, що до 2027 року понад половина навантажень інференсу генеративного AI буде розгорнута в регіонах із кращою вартістю електроенергії. Ця тенденція вже цілком очевидна. Коли можливості моделей поступово зближуються, а різниця між GPT-4o API і Claude API скорочується до рівня, невідчутного для користувача, конкуренція повертається до найпростішої структури витрат. У кого дешевша електрика, у кого вища енергоефективність, хто може зробити диспетчеризацію зеленої та інтелектуальної обчислювальної потужності тоншою — той і займе позицію в порівнянні цін на API. GPU можна купити, моделі можна підключити, але стабільне постачання дешевої електроенергії та здатність до диспетчеризації обчислювальних потужностей за короткий термін не скопіювати. Для команд, які займаються корпоративною інтеграцією AI, при виборі AI-постачальника, окрім покриття моделей і затримки, варто також запитати: де розгорнуті ваші обчислювальні потужності, звідки надходить електрика. Відповідь на це питання буде прямо вписана у ваш рахунок за token наступного року.
Підсумок одним реченням: крива ціни за одиницю API великих моделей перевизначається вартістю електроенергії. Якщо подивитися на політику «Східні дані — Західні обчислення» та схеми диспетчеризації зеленої обчислювальної потужності різних гравців, можна заздалегідь визначити напрямок цін.