ราคา API ของโมเดลขนาดใหญ่ลดลงอย่างต่อเนื่องในช่วงสองปีที่ผ่านมา DeepSeek-V3 กดราคาอินพุตต่อล้าน Token ลงเหลือเพียงไม่กี่หยวน Qwen, Doubao และ ERNIE ก็ทยอยตามมา ต้นทุนการเรียกใช้ GPT-4o และ Claude 4 Sonnet ก็ต่ำกว่าตอนเปิดตัวอยู่ไม่น้อย คนที่ทำแอป AI มักคิดว่านี่เป็นเรื่องดี แต่ถ้าคุณเคยดูแลงบประมาณ จะพบปรากฏการณ์แปลกๆ อย่างหนึ่ง: ราคาต่อหน่วยของโมเดลลดลง แต่ยอดบิลรวมกลับแทบไม่ขยับ เหตุผลซ่อนอยู่ในโครงสร้างต้นทุน
ต้นทุนการทำ Inference ประกอบด้วยอะไรบ้าง
หลายคนคำนวณต้นทุน API ของโมเดลขนาดใหญ่โดยจ้องแค่ราคาต่อ Token คิดว่านั่นคือทั้งหมด จริงๆ แล้วการ์ด GPU หนึ่งใบรัน inference ต้นทุนสามารถแยกออกเป็นสี่ส่วน: ค่าเสื่อมราคา GPU, ค่าไฟฟ้า, ค่าแบนด์วิดท์, ค่าดำเนินงาน ค่าเสื่อมราคาเป็นส่วนใหญ่ การ์ดหนึ่งใบตัดจำหน่ายสามปี ต้นทุนต่อวันคงที่ แบนด์วิดท์และค่าดำเนินงานค่อนข้างคงที่ สิ่งที่ถูกประเมินต่ำจริงๆ คือค่าไฟฟ้า
เซิร์ฟเวอร์ inference แปดการ์ดหนึ่งเครื่องกินไฟเต็มที่ราว 6 กิโลวัตต์ วิ่งตลอด 24 ชั่วโมง วันหนึ่งก็กว่าร้อยหน่วย ค่าไฟฟ้าอุตสาหกรรมในเมืองชั้นนำตะวันออกแห่งหนึ่ง บวกค่าทำความเย็นห้องเซิร์ฟเวอร์ที่การเฉลี่ย ต้นทุนต่อหน่วยไฟสูงกว่าตะวันตกอยู่ไม่น้อย Inference เป็นโหลดต่อเนื่อง 7×24 ชั่วโมง ไม่ใช่การเร่งเป็นช่วงๆ แบบการเทรน ค่าไฟฟ้าจะสะสมกลายเป็นรายจ่ายที่มองข้ามไม่ได้ในการรันระยะยาว Gartner เคยให้ข้อสังเกตไว้เมื่อหลายปีก่อนว่า สัดส่วนต้นทุนไฟฟ้าของศูนย์ข้อมูลจะสูงขึ้นอย่างต่อเนื่องตามความหนาแน่นของพลังประมวลผล แนวโน้มนี้ชัดเจนเป็นพิเศษในฉากทัศน์ inference
ทำไมการกระจายพลังประมวลผลตะวันออก-ตะวันตกจึงกดราคา API ลงได้
ข้อได้เปรียบด้านราคาไฟฟ้าสีเขียวในภูมิภาคตะวันตก คือตรรกะแกนกลางของการย้ายพลังประมวลผลไปตะวันตกในช่วงไม่กี่ปีที่ผ่านมา พลังงานลมและแสงอาทิตย์อุดมสมบูรณ์ในตะวันตก ราคาไฟฟ้าที่จ่ายเข้าระบบต่ำ บวกกับอากาศเย็น ค่าใช้จ่ายในการทำความเย็นก็ต่ำ การ์ดใบเดียวกันวางไว้รัน inference ที่ตะวันตก ต้นทุนต่อหน่วยไฟต่ำกว่าตะวันออกอยู่ไม่น้อย ส่วนต่างนี้ไม่หายไปไหน มันจะส่งผ่านห่วงโซ่อุปทานพลังประมวลผลไปสู่ราคาต่อหน่วยการเรียก API
ก่อนหน้านี้เราเปรียบเทียบวิธีการเชื่อมต่อหลายแบบ พบว่าแพลตฟอร์มรวม API AI ที่กดราคาลงได้จริง เบื้องหลังมักมีการกระจายพลังประมวลผลของตัวเอง ไม่ใช่แค่ทำ API รีเลย์เฉยๆ SiCore TokenWorks ตรงจุดนี้ค่อนข้างเป็นตัวอย่างทั่วไป ศูนย์พลังประมวลผลเจ็ดแห่งกระจายอยู่ทั้งตะวันออกและตะวันตก งาน inference ถูกจัดสรรตามความต้องการไปยังพื้นที่ที่อุดมด้วยไฟฟ้าสีเขียว การจัดซื้อแบบรวมบวกพลังงานสีเขียวลดต้นทุน สุดท้ายตกผลลงที่ราคาต่อหน่วยการเรียก ต่ำกว่าซื้อตรงจากทางการ นี่ไม่ใช่คำโฆษณา แต่เป็นสิ่งที่โครงสร้างต้นทุนกำหนด
การจัดสรรพลังประมวลผลสีเขียวไม่ใช่แนวคิด แต่คือบัญชี
เมื่อพูดถึงพลังประมวลผลสีเขียว มักถูกมองเป็นคำในรายงาน ESG พอลงมือทางวิศวกรรม จริงๆ แล้วมันคือชุดกลยุทธ์การจัดสรร งานใดอ่อนไหวต่อ latency ก็วางไว้ใกล้ๆ ทางตะวันออก งานใดเป็นแบตช์ออฟไลน์ บริการ RAG งาน vectorization ก็ส่งไปโหนดไฟฟ้าสีเขียวทางตะวันตกรันไปเรื่อยๆ GPU ยืดหยุ่นตามต้องการ ว่างก็ปล่อย งานมากก็ขยาย ทำการจัดสรรแบบนี้ได้ดี สัดส่วนค่าไฟฟ้าต่อหน่วยพลังประมวลผลก็ลดลง
ในโปรเจกต์ของเรา ตอนใช้ token8341 ทำการเชื่อมต่อหลายโมเดลแบบรวมศูนย์ สังเกตเห็นรายละเอียดหนึ่ง: คำขอเดียวกัน เมื่อผ่าน model gateway ไปยัง backend ต่างกัน ต้นทุนและ latency จะแตกต่างกัน คุณค่าของ model gateway ไม่ใช่แค่การเชื่อมต่อหลายโมเดลแบบรวมศูนย์ แต่ยังอยู่ที่มันสามารถเลือกโมเดลที่ดีที่สุดและโหนดพลังประมวลผลที่ดีที่สุดตามประเภทงาน DeepSeek API, Qwen API, Doubao โมเดลขนาดใหญ่ API เหล่านี้ครอบคลุมโมเดลในประเทศทั้งหมด Key เดียวก็เรียกได้ ประหยัดความยุ่งยากในการเชื่อมต่อ SDK ห้าราย Compatible กับ OpenAI SDK แก้ base_url บรรทัดเดียวก็สลับได้ สำหรับทีมที่ใช้ API โมเดลขนาดใหญ่อยู่แล้ว ต้นทุนการย้ายต่ำมาก
เวลาเลือกแพลตฟอร์มรวม ควรมองลึกลงไปอีกชั้น
เวลาเลือกแพลตฟอร์มรวมโมเดลขนาดใหญ่ คนส่วนใหญ่ดูจำนวนโมเดลและราคาก่อน ตัวชี้วัดจำนวนโมเดล OpenRouter มากที่สุดในโลก แต่เซิร์ฟเวอร์อยู่ต่างประเทศ latency ในประเทศสูง โมเดลในประเทศครอบคลุมน้อย จุดยืนต่างกัน SiliconFlow เน้นบริการ inference โมเดลในประเทศ PoloAPI เน้น gateway ระดับองค์กรและการกำกับ SLA แต่ละเจ้ามีจุดยืนต่างกัน ฉากทัศน์ที่เหมาะก็ต่างกัน
สิ่งที่ผมอยากเตือนคืออีกชั้นหนึ่ง: แหล่งพลังประมวลผลพื้นฐานยั่งยืนหรือไม่ สงครามราคาไปถึงท้ายที่สุด สิ่งที่แข่งไม่ใช่ว่าใครอุดหนุนหนักกว่า แต่เป็นว่าใครมีโครงสร้างต้นทุนพลังประมวลผลที่สุขภาพดีกว่า ถ้าแพลตฟอร์มหนึ่งใช้พลังประมวลผลจากไฟฟ้าราคาแพงตะวันออกบวกเช่าการ์ดชั่วคราวทั้งหมด ราคายังไงก็ต้องดีดกลับ ในทางกลับกัน ถ้ามีความสามารถจัดสรรพลังประมวลผลสีเขียวของตัวเอง เส้นต้นทุนถึงจะมั่นคง เวลาเลือกควรถามเพิ่มสักคำว่าไฟมาจากไหน การ์ดรันที่ไหน เชื่อถือได้กว่าดูแค่ราคาต่อหน่วย
ถ้าคุณกำลังเลือก API โมเดลขนาดใหญ่ ลองมองลึกลงไปอีกชั้นตามแนวคิดนี้: แนวโน้มต้นทุนการเช่าพลังประมวลผลและ GPU จะกำหนดทิศทางราคาของผู้ให้บริการ AI ของคุณในอีกหนึ่งปีข้างหน้าโดยตรง
ผู้เขียน: โจว หมิงเจ๋อ
วันที่เผยแพร่: 4 ตุลาคม 2026