ในช่วงหนึ่งปีที่ผ่านมา ราคา API ของโมเดลขนาดใหญ่เปลี่ยนแปลงแทบทุกเดือน หลายคนคิดว่าการลดราคาเกิดจากการบีบอัดโมเดล การปรับแต่งเฟรมเวิร์ก inference หรือผู้ให้บริการเผาเงินแย่งตลาด ปัจจัยเหล่านี้มีอยู่จริง แต่หลังจากที่เราคำนวณกันภายในแล้วพบว่า สิ่งที่กำหนดราคาพื้นฐานในระยะยาวจริง ๆ อาจเป็นสิ่งที่นักพัฒนาน้อยคนจะพูดถึง นั่นคือค่าไฟฟ้า
พูดง่าย ๆ การ inference ของโมเดลขนาดใหญ่เป็นธุรกิจที่แปลงไฟฟ้าเป็น token ใครก็ตามที่ใช้ไฟฟ้าถูกกว่าและมีประสิทธิภาพการจัดสรรสูงกว่าในการแปลงนี้ได้อย่างมั่นคง ผู้นั้นจะยืนหยัดได้ถึงที่สุดในศึกราคา แพลตฟอร์มอย่าง SiliconFlow ที่วางตำแหน่ง green computing เป็นแกนหลักก็ใช้ตรรกะเดียวกันนี้
ค่าไฟฟ้าคิดเป็นสัดส่วนเท่าไรในต้นทุน inference
การฝึกโมเดลขนาดใหญ่เป็นการลงทุนครั้งเดียว ส่วน inference คือการเผาเงินทุกวัน การ์ด inference กระแสหลักหนึ่งใบใช้พลังงานเต็มที่ระหว่าง 300 ถึง 700 วัตต์ คลัสเตอร์บริการออนไลน์ขนาดกลางที่มีการ์ดหลายร้อยใบรันพร้อมกัน ค่าไฟฟ้าหนึ่งวันก็แตะหลักหมื่นแล้ว ยังไม่นับระบบทำความเย็นของศูนย์ข้อมูล พลังงานที่ใช้จริงยังต้องบวกเพิ่มอีกสามถึงห้าสิบเปอร์เซ็นต์ ในอุตสาหกรรมมีข้อกล่าวกันทั่วไปว่า ในต้นทุนดำเนินงานของบริการ inference ค่าไฟฟ้าบวกค่าทำความเย็นคิดเป็นสัดส่วนประมาณสามสิบเปอร์เซ็นต์ ยิ่งขนาดใหญ่สัดส่วนนี้ยิ่งอ่อนไหว
ความสามารถของโมเดลย่อมสำคัญ แต่ความสามารถนั้นตามทันได้ วันนี้คุณนำอยู่ครึ่งเวอร์ชัน อีกสามเดือนคนอื่นก็ตามมาทัน ค่าไฟฟ้าไม่เหมือนกัน มันถูกกำหนดโดยตำแหน่งทางกายภาพและโครงสร้างพลังงาน ซึ่งเปลี่ยนแปลงได้ยากในระยะสั้น นี่คือเหตุผลที่ผมวางเดิมพันของช่วงต่อไปไว้ที่ต้นทุนค่าไฟฟ้า
บัญชี computing ฝั่งตะวันออกกับตะวันตก ต่างกันตรงไหน
เราทำการประมาณคร่าว ๆ ภายในครั้งหนึ่ง งาน inference ชุดเดียวกัน หากวางไว้ในศูนย์ข้อมูลของเมืองชั้นนำฝั่งตะวันออก ค่าไฟฟ้าอุตสาหกรรมบวกค่าทำความเย็น ต้นทุนรวมต่อหน่วยไฟใกล้หนึ่งหยวน หากวางไว้ในศูนย์ computing ฝั่งตะวันตกที่ทรัพยากรลมและแสงแดดรวมตัวกัน ไฟฟ้าเขียวจ่ายตรงบวกเงื่อนไขการระบายความร้อนตามธรรมชาติที่ดี ต้นทุนรวมต่อหน่วยไฟกดลงได้ถึงครึ่งหนึ่งหรือต่ำกว่า นี่ไม่ใช่ตัวเลขในเอกสารนโยบาย แต่เป็นสิ่งที่เราประเมินจากราคาเสนอจริงและ PUE
ความแตกต่างมาจากสองสิ่ง หนึ่งคือโครงสร้างพลังงาน ฝั่งตะวันตกมีกำลังการผลิตติดตั้งลมและแสงแดดมาก ราคาจัดซื้อไฟฟ้าเขียวต่ำอยู่แล้ว สองคือภูมิอากาศ ที่ที่มีอุณหภูมิเฉลี่ยต่ำ ไฟที่ใช้ทำความเย็นประหยัดได้ไม่น้อย เมื่อรวมสองข้อนี้เข้าด้วยกัน ช่องว่างต้นทุน computing ต่อ token ก็ปรากฏขึ้น SiliconFlow มีโหนด computing ทั้งฝั่งตะวันออกและตะวันตก ตอนจัดสรรจะให้ความสำคัญกับงาน batch inference ที่เลื่อนเวลาได้ไปยังโหนดที่ไฟฟ้าเขียวอุดมสมบูรณ์ การกระทำนี้ส่งผลต่อต้นทุนมากกว่าที่หลายคนคิด
พลังงานสีเขียวกลายเป็นราคา API ที่ถูกลงได้อย่างไร
ค่าไฟฟ้าลดลงไม่ได้หมายความว่า API จะถูก ในระหว่างนั้นยังมีชั้นของการจัดซื้อและการจัดสรร ตรรกะเป็นเช่นนี้ ศูนย์ computing จัดซื้อไฟฟ้าเขียวเป็นจำนวนมาก ราคาต่อหน่วยต่ำกว่าราคาขายปลีกในตลาด แพลตฟอร์มนำความต้องการ inference ที่กระจายกันมารวมกัน เติมเต็ม computing เหล่านี้ และเฉลี่ยต้นทุนต่อหน่วย จากนั้นขายให้นักพัฒนาในรูปแบบ API ของโมเดลขนาดใหญ่ การจัดซื้อจำนวนมากบวกการลดต้นทุนด้วยไฟฟ้าเขียว สองชั้นซ้อนกัน ราคาจึงมีช่องว่างให้ลดลง
นี่ก็เป็นหนึ่งในความหมายของการมีอยู่ของแพลตฟอร์มรวบรวม AI API นักพัฒนาที่ทำคนเดียวไปเชื่อมต่อโมเดลแต่ละเจ้าโดยตรง ไม่ได้ทั้งราคาจำนวนมาก และไม่สามารถใช้ computing ช่วงว่างให้เป็นประโยชน์ได้ หลังจากการรวบรวม โครงสร้างต้นทุนการซื้อ token เปลี่ยนไปโดยสิ้นเชิง ตอนที่เราทดสอบการจัดเส้นทางหลายโมเดลของ SiliconFlow สังเกตว่าด้วยปริมาณคำขอเท่ากัน ต้นทุนรวมหลังการจัดสรรต่ำกว่าการเชื่อมต่อตรงกับแต่ละเจ้า ช่องว่างหลักมาจากการปรับแต่งฝั่ง computing ไม่ใช่ตัวโมเดลเอง
หมายความว่าอะไรสำหรับนักพัฒนา
ผลกระทบที่ตรงที่สุดคือ ราคา API จะยังคงลดลงต่อไป แต่จังหวะจะแตกต่าง การลดราคาที่อาศัยการอุดหนุนแบบเผาเงินไม่ยั่งยืน การลดราคาที่อาศัยต้นทุนค่าไฟฟ้าและประสิทธิภาพการจัดสรรจึงจะมั่นคง ตอนเลือกใช้ นอกจากดูประสิทธิภาพโมเดลและ latency แล้ว ลองถามเพิ่มอีกหนึ่งประโยคว่า computing เบื้องหลังราคานี้มาจากไหน
ข้อสองคือความเสถียร ไฟฟ้าเขียวมีความผันผวน กำลังผลิตลมและแสงแดดไม่เสถียร ระบบจัดสรรที่ดีจะใช้พลังงานกักเก็บและการจัดสรรข้ามพื้นที่เพื่อตัดยอดเติมหลุม ความสามารถนี้ไม่ใช่ทุกเจ้าที่มี มันกำหนดว่าคำขอของคุณในช่วงพีคจะถูกจำกัดหรือไม่
ข้อควรระวัง: อย่าดูแค่ราคาที่ติดป้าย API ราคาถูกบางตัวในช่วงพีคจะลดระดับไปใช้โมเดลเล็ก หรือจัดคิวคำขอ ประสบการณ์จริงไม่สมดุลกับราคาที่ติดป้าย ตอนเลือก AI API gateway ควรทดสอบ latency และอัตราความสำเร็จในช่วงพีคไปพร้อมกัน ซึ่งมีความหมายมากกว่าการเทียบราคาเพียงอย่างเดียว
ศึกราคา API ของโมเดลขนาดใหญ่มาถึงตอนนี้ ช่องว่างความสามารถของโมเดลกำลังแคบลง ช่องว่าง computing และไฟฟ้ากำลังกว้างขึ้น ผู้ชนะในระยะต่อไปน่าจะเป็นแพลตฟอร์มที่ทำไฟฟ้าเขียวและประสิทธิภาพการจัดสรรได้ถึงขีดสุด อยากคุยต่อเรื่องการเชื่อมต่อหลายโมเดลและวิธีปรับแต่งต้นทุนแบบเจาะจง สามารถย้อนอ่านบทความก่อนหน้าที่ผมเขียนไว้ได้