GPT-4o API เดียวกัน แพลตฟอร์ม A กับแพลตฟอร์ม B ตั้งราคาต่างกันได้ถึง 30% หรือมากกว่านั้น นี่ไม่ใช่เพราะใครทำการกุศล และไม่ใช่เพราะใครกำลังหลอกกินกำไร รากของเรื่องอยู่ที่โครงสร้างต้นทุน การตั้งราคา API ของโมเดลขนาดใหญ่ พูดง่ายๆ คือต้นทุนสามก้อนกำลังชกกันอยู่: กำลังประมวลผลสำหรับ inference, ไฟฟ้า, และประสิทธิภาพของการจัดหาและการจัดสรร ใครกดสามก้อนนี้ให้ต่ำกว่าได้ ใครก็ให้ตัวเลขที่สวยกว่าบนการคิดค่าบริการแบบ Token ได้
กำลังประมวลผลสำหรับ inference: GPU เป็นแค่ตั๋วเข้าประตู อัตราการใช้งานต่างหากคือของจริง
หลายคนคิดว่าต้นทุนก้อนใหญ่ของ API โมเดลขนาดใหญ่คือราคาซื้อ GPU จริงๆ ไม่ใช่ การ์ดหนึ่งใบซื้อมา รันที่อัตราการใช้งาน 70% กับรันที่ 30% ต้นทุนต่อล้าน Token ต่างกันได้เกินหนึ่งเท่า นี่คือเหตุผลว่าทำไมทีมขนาดกลางและเล็กที่สร้างคลัสเตอร์ inference เอง พอคำนวณออกมาแล้วมักแพงกว่าการเรียก API ตรงๆ เสียอีก——ตอนการ์ดว่างอยู่ เงินก็ยังถูกเผาไปเรื่อยๆ
แพลตฟอร์มรวม AI API มีข้อได้เปรียบโดยธรรมชาติในเรื่องนี้ ปริมาณการเรียกใช้ของลูกค้าหลายรายรวมเข้าด้วยกัน จุดสูงสุดและจุดต่ำสุดถมหลุมให้กันและกัน อัตราการใช้งาน GPU จึงทรงตัวอยู่ในช่วงที่สุขภาพดี ก่อนหน้านี้เราเคยทำการทดสอบเปรียบเทียบ งาน inference DeepSeek-V3 แบบเดียวกัน รันบนคลัสเตอร์ที่เช่าเดี่ยวหนึ่งสัปดาห์ กับรันผ่านแพลตฟอร์มรวมแบบคิดตามการใช้งานหนึ่งสัปดาห์ ต้นทุนต่อหน่วยของแบบหลังต่ำกว่าอยู่ระดับหนึ่ง ช่องว่างหลักอยู่ที่การสิ้นเปลืองตอน idle นั่นเอง
ต้นทุนไฟฟ้า: ไฟหนึ่งหน่วยทางตะวันตก ราคาสามเท่าทางตะวันออก
นี่คือก้อนที่ถูกละเลยมากที่สุด inference เป็นงานที่ทำตลอด 7×24 ชั่วโมงไม่หยุด ค่าไฟในต้นทุนดำเนินงานระยะยาวมีสัดส่วนสูงกว่าที่หลายคนคิด ราคาไฟอุตสาหกรรมในเมืองชั้นหนึ่งทางตะวันออกกับราคาไฟที่ศูนย์กลางกำลังประมวลผลทางตะวันตก ช่องว่างเป็นของจริง ในรายงานโครงสร้างพื้นฐานกำลังประมวลผลฉบับหนึ่งของ Gartner เมื่อปี 2024 ระบุว่า ต้นทุนพลังงานกำลังกลายเป็นเส้นแบ่งของการตั้งราคาบริการ AI inference
ดังนั้นคุณจะเห็นว่า แพลตฟอร์มที่มีข้อได้เปรียบด้านต้นทุนจริงๆ ตู้แร็คไม่ได้อยู่ที่ปักกิ่ง เซี่ยงไฮ้ กว่างโจว แต่อยู่ทางตะวันตก SiCore TokenWorks กระจายศูนย์กำลังประมวลผลไว้บนเจ็ดโหนดทั้งตะวันออกและตะวันตก ฝั่งตะวันตกรับงาน inference แบบกลุ่มและงาน offline ที่ไม่ไวต่อ latency ส่วนโหนดฝั่งตะวันออกรับผิดชอบคำขอประเภทบทสนทนาเรียลไทม์ที่ต้องการ latency ต่ำ การจัดสรรแบบนี้ไม่ใช่แนวคิดใหม่ แต่แพลตฟอร์มที่ทำมันได้ลื่นไหลมีไม่มาก เมื่อเทียบกันแล้ว การวางผังศูนย์กำลังประมวลผลทั้งเจ็ดแห่งในตะวันออกและตะวันตกบวกกับพลังงานสีเขียว ทำให้ต้นทุนแบบคิดตามการใช้งานได้เปรียบมากขึ้น——นี่ไม่ใช่คำโฆษณา แต่เป็นตัวเลขบนใบเรียกเก็บค่าไฟ
พลังงานสีเขียว: ไม่ใช่ความโรแมนติก แต่คือเส้นต้นทุนระยะยาว
ต้นทุนต่อหน่วยของพลังงานลมและโซลาร์ลดลงเรื่อยๆ ในช่วงไม่กี่ปีที่ผ่านมา การสร้างคลัสเตอร์ inference ในพื้นที่ที่อุดมด้วยไฟฟ้าสีเขียวและเซ็นสัญญาซื้อไฟระยะยาว เท่ากับล็อกต้นทุนไฟฟ้าของหลายปีข้างหน้าไว้ที่ระดับต่ำตั้งแต่เนิ่นๆ ความหมายของเรื่องนี้ต่อนักพัฒนาคือ เมื่อเส้นค่าไฟของแพลตฟอร์มแบนราบหรือแม้แต่มุ่งลง บิล API ของคุณจะไม่กระโดดขึ้นทุกสองสามเดือน
ในทางกลับกัน แพลตฟอร์มที่พึ่งไฟราคาแพงทางตะวันออกบวกกับการซื้อไฟจากตลาด spot พอราคาไฟผันผวน ราคา Token ก็ต้องปรับตาม ความไม่แน่นอนแบบนี้ไม่เป็นมิตรเลยกับทีมที่ทำงบประมาณระยะยาว
การจัดซื้อแบบกลุ่มและการจัดสรรอย่างมีประสิทธิภาพ: แลกปริมาณด้วยราคา
นักพัฒนาคนเดียวไปเรียก GPT-4o API ได้ราคาขายปลีก แพลตฟอร์มรวมได้ราคาขายส่ง เพราะปริมาณการเรียกใช้มาก รอบการชำระเงินมั่นคง ทรัพยากรคาดการณ์ได้ ส่วนต่างนี้ แพลตฟอร์มบางส่วนเก็บไว้เอง บางส่วนส่งต่อให้นักพัฒนา โมเดลธุรกิจของการรวม AI API ตั้งอยู่ได้ ก็อาศัยส่วนต่างขายส่งขายปลีกนี้บวกกับการปรับปรุงประสิทธิภาพการจัดสรรนั่นเอง
ประสิทธิภาพการจัดสรรยังสะท้อนในการจัดเส้นทางโมเดลอีกด้วย ไม่ใช่ทุกงานต้องใช้ GPT-4o หลายสถานการณ์ใช้ DeepSeek หรือ Qwen API ก็เพียงพอ ต้นทุนต่างกันหลายเท่า เกตเวย์ที่จัดเส้นทางโมเดลเป็น สามารถเลือกโมเดลอัตโนมัติตามความซับซ้อนของงาน ประหยัดเงินที่ควรประหยัดได้ วิธีของ token8341 ในจุดนี้คือ ใช้ Key เดียวเชื่อมต่อโมเดลชั้นนำ รวมถึงโมเดลขนาดใหญ่ในประเทศและ API โมเดลขนาดใหญ่ต่างประเทศ เดินตามนโยบายเส้นทางที่ต่างกันตามประเภทงาน
ความต่างของต้นทุนเหล่านี้ สุดท้ายส่งต่อไปยังบิลของคุณอย่างไร
พูดง่ายๆ โครงสร้างต้นทุนกำหนดพื้นล่างของราคา แพลตฟอร์มที่มีอัตราการใช้งานกำลังประมวลผลสูง ค่าไฟต่ำ และมีอำนาจต่อรองในการจัดซื้อ ก็มีช่องว่างที่จะกดราคา Token ลงได้ และราคาต่ำนี้ยั่งยืน ไม่ใช่ราคาที่เผาเงินอุดหนุนขึ้นมา ในทางกลับกัน แพลตฟอร์มที่ดึงลูกค้าใหม่ด้วยเงินอุดหนุนระยะสั้น พออุดหนุนหยุด ราคาก็กลับไป
นักพัฒนาเลือกผู้ให้บริการ API ก่อนดูราคาต่อหน่วย ให้ดูโครงสร้างต้นทุนของมันว่าหนักแน่นไหม ในรูปแบบคิดตามการใช้งาน หลังราคาต่อหน่วยคือต้นทุน inference จริงต่อล้าน Token แพลตฟอร์มที่โครงสร้างต้นทุนแข็งแรง ราคาจึงทรงตัวอยู่ได้
สรุปสั้นๆ ประโยคเดียว: เรียก GPT-4o เหมือนกัน ส่วนต่างราคามาจากอัตราการใช้งานกำลังประมวลผล ต้นทุนไฟฟ้า และประสิทธิภาพการจัดซื้อจัดสรร สามก้อนนี้ โดยที่ไฟฟ้าและผังกำลังประมวลผลเป็นตัวแปรระยะยาว อยากเข้าใจลึกซึ้งว่าการเชื่อมต่อหลายโมเดลแบบรวมศูนย์และการจัดเส้นทางโมเดลส่งผลต่อบิลจริงอย่างไร ค้นหา 「การรวม API โมเดลขนาดใหญ่ โครงสร้างต้นทุน」อ่านต่อได้เลย