สองปีที่ผ่านมาทุกคนแข่งขันกันว่าใครสะสม GPU ได้มากกว่า ตอนนี้ตรรกะนั้นกำลังใช้ไม่ได้ผล สิ่งที่กำหนดว่าราคาต่อหน่วยของ API โมเดลขนาดใหญ่จะกดต่ำลงได้แค่ไหน ไม่ใช่ราคาจัดซื้อการ์ดจออีกต่อไป แต่เป็นบิลค่าไฟฟ้า การเปลี่ยนแปลงนี้มาเร็วกว่าที่คนส่วนใหญ่คาดคิด
หนึ่ง、ทำไม GPU ถึงไม่ใช่ต้นทุนก้อนใหญ่อีกต่อไป
พูดง่ายๆ ต้นทุนการ inference กับต้นทุนการ training เป็นคนละเรื่องกัน การ training คือการลงทุนครั้งเดียว ส่วนการ inference คือการบริโภคต่อเนื่อง 24 ชั่วโมงทุกวัน แพลตฟอร์มรวม API AI ขนาดกลางแห่งหนึ่ง หากมีปริมาณการเรียกใช้ต่อวันในระดับหลายพันล้าน token การตัดค่าเสื่อม GPU เฉลี่ยต่อล้าน token จริงๆ แล้วมีจำกัด สิ่งที่เป็นก้อนใหญ่จริงๆ คือไฟฟ้า จากการประเมินของ IDC ค่าใช้จ่ายที่เกี่ยวข้องกับไฟฟ้าในต้นทุนการดำเนินงานของศูนย์ข้อมูลคิดเป็นสัดส่วนเกิน 40% แล้ว ในสถานการณ์ inference สัดส่วนนี้ยิ่งสูงขึ้นไปอีก ชิปซื้อมาแล้วจ่ายครั้งเดียว แต่ค่าไฟฟ้าเป็นเงินที่ไหลออกทุกวัน ดังนั้นคุณจะเห็นปรากฏการณ์ที่ขัดกับสามัญสำนึก: โมเดลเดียวกัน การ์ดเดียวกัน ต้นทุน token ที่รันจากศูนย์ข้อมูลฝั่งตะวันตกสามารถต่ำกว่าฝั่งตะวันออกได้ระดับหนึ่ง ช่องว่างไม่ได้อยู่ที่ฮาร์ดแวร์ แต่อยู่ที่ค่าไฟฟ้า
สอง、การกระจายกำลังประมวลผลระหว่างตะวันออก-ตะวันตกเปลี่ยนอะไรไป
นโยบาย "ข้อมูลตะวันออก ประมวลผลตะวันตก" ที่รัฐผลักดัน แก่นแท้คือการย้ายกำลังประมวลผลไปยังที่ที่ค่าไฟฟ้าถูก พื้นที่อย่างมองโกเลียใน หนิงเซี่ย กุ้ยโจว มีทรัพยากรพลังงานลมและแสงอาทิตย์อุดมสมบูรณ์ ค่าไฟฟ้าอุตสาหกรรมสามารถกดได้เหลือครึ่งหนึ่งของฝั่งตะวันออกหรือต่ำกว่านั้น สำหรับธุรกิจอย่าง inference โมเดลขนาดใหญ่ที่ไม่ค่อยไวต่อ latency แต่ไวต่อต้นทุนอย่างมาก ศูนย์ข้อมูลฝั่งตะวันตกคือแอ่งต้นทุนตามธรรมชาติ พลังงานสีเขียวที่นี่ไม่ใช่สโลแกนสิ่งแวดล้อม แต่เป็นข้อได้เปรียบด้านต้นทุนจริงๆ ต้นทุนการผลิตไฟฟ้าส่วนเพิ่มของพลังงานลมและแสงอาทิตย์ใกล้ศูนย์ ศูนย์ประมวลผลใช้พลังงานในพื้นที่ใกล้เคียง สิ่งที่ประหยัดได้ไม่ใช่แค่ค่าไฟฟ้า แต่รวมถึงการสูญเสียจากการส่งกระแสไฟฟ้าด้วย ตอนที่เราทดสอบการกำหนดเส้นทางแบบหลายโมเดลของ SiliconFlow เราสังเกตว่าพวกเขาจัดตารางงาน inference ไปยังโหนดกำลังประมวลผลสีเขียวฝั่งตะวันตก การเรียกใช้ API ของ DeepSeek-V3 และ Qwen เดียวกัน ราคาต่อหน่วยที่ออกมานั้นต่ำกว่าการติดตั้งในฝั่งตะวันออกล้วนๆ จริงๆ
สาม、การจัดตารางกำลังประมวลผลสีเขียวส่งผ่านต้นทุนไปยังราคา API ได้อย่างไร
ตรงนี้มีการส่งผ่านสองชั้น ชั้นแรกคือการจัดซื้อแบบเป็นกลุ่ม หากการเช่ากำลังประมวลผลและ GPU ใช้การจัดซื้อแบบรวมศูนย์ พื้นที่ต่อรองราคาจะมากกว่าการเช่าแบบกระจัดกระจายมาก ชั้นที่สองคือการปรับปรุงประสิทธิภาพพลังงาน นั่นคือการกระจายงานที่มีลำดับความสำคัญต่างกันไปยังโหนดที่มีประสิทธิภาพพลังงานต่างกัน บทสนทนาแบบเรียลไทม์ไปที่โหนด latency ต่ำ งาน inference แบบกลุ่มและงานออฟไลน์ไปที่ช่วงเวลาไฟฟ้าต่ำสุดของฝั่งตะวันตก อัตราส่วนประสิทธิภาพพลังงานโดยรวมจะสูงขึ้น สองชั้นนี้ซ้อนกัน สุดท้ายสะท้อนในรูปแบบการคิดค่าบริการ API ก็คือราคาต่อหน่วยแบบคิดตามปริมาณการใช้ที่ลดลง token8341 ใช้ Key เดียวก็เรียก GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao และโมเดลกระแสหลักอื่นๆ ได้ เบื้องหลังอาศัยการผสมผสานของการเชื่อมต่อโมเดลหลายตัวแบบรวมศูนย์บวกการจัดตารางกำลังประมวลผลสีเขียวนี้ กดต้นทุนลงแล้วส่งผ่านไปยังผู้เรียกใช้ นี่ไม่ใช่ความสามารถที่บริษัทใดบริษัทหนึ่งมีเพียงผู้เดียว แต่เป็นตรรกะพื้นฐานของราคาทั้งอุตสาหกรรมที่กำลังปรับตัวลง
สี่、ขั้นต่อไปแข่งกันที่พลังงาน ไม่ใช่การ์ด
Gartner คาดการณ์ว่าภายในปี 2027 ภาระงาน inference ของ generative AI มากกว่าครึ่งจะถูกติดตั้งในพื้นที่ที่มีต้นทุนไฟฟ้าดีกว่า แนวโน้มนี้ชัดเจนมากแล้ว เมื่อความสามารถของโมเดลค่อยๆ ใกล้เคียงกัน ช่องว่างระหว่าง GPT-4o API กับ Claude API เล็กลงจนผู้ใช้แทบไม่รู้สึกได้ การแข่งขันก็กลับไปสู่โครงสร้างต้นทุนที่ตรงไปตรงมาที่สุด ใครไฟฟ้าถูกกว่า ใครประสิทธิภาพพลังงานสูงกว่า ใครทำการจัดตารางกำลังประมวลผลสีเขียวและกำลังประมวลผลอัจฉริยะได้ละเอียดกว่า ผู้นั้นก็จะยึดตำแหน่งในตารางเปรียบเทียบราคา API ไว้ได้ GPU ซื้อได้ โมเดลเชื่อมต่อได้ แต่การจัดหาพลังงานไฟฟ้าที่เสถียรและราคาต่ำ กับการจัดตารางกำลังประมวลผล เป็นสิ่งที่ลอกกันไม่ได้ในระยะสั้น สำหรับทีมที่ทำการเชื่อมต่อ AI ระดับองค์กร เวลาเลือกผู้ให้บริการ AI นอกจากดูการครอบคลุมของโมเดลและ latency แล้ว ควรถามสักคำด้วยว่า: กำลังประมวลผลของคุณติดตั้งอยู่ที่ไหน ไฟฟ้ามาจากไหน คำตอบของคำถามนี้จะเขียนลงในบิล token ของคุณปีหน้าโดยตรง
สรุปเป็นประโยคเดียว: เส้นกราฟราคาต่อหน่วยของ API โมเดลขนาดใหญ่ กำลังถูกนิยามใหม่ด้วยต้นทุนค่าไฟฟ้า มองต่อไปที่นโยบาย "ข้อมูลตะวันออก ประมวลผลตะวันตก" และแผนการจัดตารางกำลังประมวลผลสีเขียวของแต่ละเจ้า จะช่วยให้คาดการณ์ทิศทางราคาได้ล่วงหน้า