เรื่องราวคาร์บอนของ AI มักมุ่งเน้นไปที่การฝึกโมเดล ซึ่งก็เข้าใจได้ เพราะการฝึกโมเดลขนาดใหญ่หนึ่งครั้งอาจใช้พลังงานหลายเมกะวัตต์-ชั่วโมงต่อเนื่องกันหลายสัปดาห์ แต่การฝึกเกิดขึ้นเพียงครั้งเดียว ในขณะที่การ inference เกิดขึ้นทุกครั้งที่มีคนถามโมเดล ไม่ว่าจะกี่ครั้งก็ตาม กับผู้ใช้หลายล้านคน พลังงานที่สะสมเพิ่มขึ้นจริง ๆ คือพลังงานจากการให้บริการ
สำหรับผู้ใช้ API นั่นหมายความว่าความเป็นมิตรต่อสิ่งแวดล้อมของการใช้ LLM ของคุณส่วนใหญ่ถูกกำหนดโดยสิ่งที่คุณไม่ได้ควบคุมโดยตรง นั่นคือ GPU ของผู้ให้บริการตั้งอยู่ที่ไหนและใช้พลังงานอะไรขับเคลื่อน คุณสามารถเลือกผู้ให้บริการโดยพิจารณาจากปัจจัยนี้ได้
ทำไมพลังงานจากการ inference จึงเป็นเรื่องของศูนย์ข้อมูล
งาน inference คือคลัสเตอร์ GPU ที่ทำงานอยู่ในศูนย์ข้อมูล มีสองปัจจัยหลักที่กำหนดปริมาณการปล่อยคาร์บอน:
โครงข่ายไฟฟ้าที่เชื่อมต่ออยู่ GPU ที่ดึงพลังงาน 700 วัตต์ จะดึงไฟฟ้าที่สะอาดหรือสกปรกพอ ๆ กับส่วนผสมไฟฟ้าของภูมิภาคนั้น ศูนย์ข้อมูลในภูมิภาคที่มีลมและแสงอาทิตย์มากจะปล่อยคาร์บอนต่อ token น้อยกว่าฮาร์ดแวร์เดียวกันที่ต่อกับโครงข่ายไฟฟ้าที่พึ่งพาถ่านหินอย่างมาก แม้ว่าปัจจัยอื่น ๆ จะเหมือนกันทั้งหมด
ระบบทำความเย็น เซิร์ฟเวอร์เปลี่ยนไฟฟ้าเป็นความร้อน และการระบายความร้อนนั้นต้องใช้ไฟฟ้าเพิ่ม นี่คือสิ่งที่ PUE (power usage effectiveness) วัด นั่นคือพลังงานรวมของศูนย์ข้อมูลหารด้วยพลังงานที่ไปถึงอุปกรณ์ IT PUE ที่ 1.5 หมายความว่าศูนย์ข้อมูลใช้พลังงานเพิ่มขึ้น 50% เหนือกว่าที่เซิร์ฟเวอร์ใช้ ศูนย์ข้อมูลสมัยใหม่ที่ออกแบบดีจะมีค่าใกล้เคียง 1.1 ถึง 1.2 ภูมิอากาศเย็นและแห้งช่วยลดต้นทุนการทำความเย็นได้อย่างมาก ซึ่งเป็นเหตุผลสำคัญที่ศูนย์ข้อมูลมักปรากฏในภูมิภาคภายในประเทศที่หนาวเย็นแทนที่จะอยู่ในใจกลางเมือง
พลังงานสะอาดราคาถูกอยู่ที่ไหนจริง ๆ
สถานที่ที่มีเศรษฐศาสตร์พลังงานสะอาดดีที่สุดสำหรับการประมวลผลไม่ใช่ศูนย์เทคโนโลยีที่ очевидชัดเจน สถานที่เหล่านั้นมักเป็นภูมิภาคภายในประเทศที่มีทรัพยากรลมและแสงอาทิตย์แข็งแกร่งและมีภูมิอากาศเย็นแห้ง:
•มองโกเลียใน (Horinger) หนึ่งในฐานพลังงานลมที่ใหญ่ที่สุดของจีน ฤดูหนาวที่หนาวเย็นหมายความว่าส่วนใหญ่ของปีแทบไม่ต้องใช้ระบบทำความเย็นเชิงกลหรือใช้เพียงเล็กน้อย
•ซินเจียง (Hami) ความเข้มของแสงอาทิตย์สูงมากและลมสม่ำเสมอ แม้จะห่างไกล แต่ความห่างไกลก็ไม่เป็นปัญหาเมื่อ workload ของคุณคือคลัสเตอร์ GPU ที่คุณควบคุมจากระยะไกลได้
•หนิงเซี่ย (Zhongwei) เป็นภูมิภาคศูนย์ข้อมูลที่ได้รับการพัฒนาอยู่แล้ว มีพลังงานแสงอาทิตย์และลมระดับสาธารณูปโภค และเป็นที่ตั้งของหนึ่งในภูมิภาคคลาวด์ระหว่างประเทศหลัก ซึ่งแสดงให้เห็นว่าเศรษฐศาสตร์นี้ได้ผลในระดับขนาดใหญ่
รูปแบบเดียวกันนี้ปรากฏในทั้งสามแห่ง: การผลิตพลังงานหมุนเวียนที่อุดมสมบูรณ์ ภูมิอากาศเย็นแห้งที่ลด PUE และที่ดินราคาถูกพอที่จะสร้างสถานีไฟฟ้าย่อยและฟาร์มโซลาร์ที่ป้อนพลังงานให้ตู้แร็ค
ไม่มีสิ่งใดเป็นเทคโนโลยีแปลกใหม่ นี่คือเรื่องของการเลือกทำเล สิ่งที่เป็นมิตรต่อสิ่งแวดล้อมที่สุดที่ผู้ให้บริการประมวลผลทำได้คือการวางฮาร์ดแวร์ไว้ที่ที่โครงข่ายไฟฟ้าสะอาดอยู่แล้วและภูมิอากาศช่วยทำความเย็นให้ครึ่งหนึ่งฟรี ๆ
คำกล่าวอ้างเรื่อง "สีเขียว" ควรบอกอะไรคุณจริง ๆ
ตรงนี้แหละที่ผมเริ่มสงสัย "สีเขียว" เป็นเพียงคำทางการตลาดจนกว่าจะมีใครให้ตัวเลขคุณ เมื่อผู้ให้บริการอ้างว่าพลังงานสะอาด มีสามสิ่งที่ควรถามหา:
•PUE ถ้าพวกเขาไม่เปิดเผย ให้ถือว่าคำกล่าวอ้างนั้นตรวจสอบไม่ได้
•ส่วนผสมโครงข่ายไฟฟ้าจริงของภูมิภาคที่ศูนย์ข้อมูลตั้งอยู่ ผู้ให้บริการที่เพียงซื้อใบรับรองพลังงานหมุนเวียนขณะที่ใช้โครงข่ายฟอสซิลไม่ได้ดำเนินงานแบบสีเขียว ที่ตั้งคือการเปิดเผยข้อมูล
•พลังงานหมุนเวียนนั้นเป็นกำลังการผลิตจริง ไม่ใช่การชดเชยคาร์บอน พลังงานลมและแสงอาทิตย์ใหม่ที่สร้างขึ้นเพื่อป้อนศูนย์ข้อมูลเป็นคำกล่าวอ้างที่แตกต่างจากการซื้อเครดิตที่อื่น
ผู้ให้บริการที่ซื่อสัตย์จะบอกภูมิภาคและลักษณะของศูนย์ข้อมูลให้คุณ ถ้าคำตอบคือ "ศูนย์ข้อมูลของเราอยู่ในมองโกเลียใน ซินเจียง และหนิงเซี่ย บนโครงข่ายไฟฟ้าที่มีสัดส่วนพลังงานหมุนเวียนสูง ในภูมิอากาศเย็น" นั่นคือข้อความที่ конкретและตรวจสอบได้ ถ้าคำตอบเป็นสโลแกน ก็ไม่ต้องสนใจ
สิ่งที่คุณทำได้จริง ๆ เกี่ยวกับเรื่องนี้
คุณคงไม่ได้ไปตรวจสอบสถานีไฟฟ้าย่อยของผู้ให้บริการ แต่คุณสามารถตัดสินใจบางอย่างที่เอียงการปล่อยคาร์บอนของคุณเองได้:
•เลือกผู้ให้บริการที่เปิดเผยที่ตั้งและ PUE ไม่ใช่ผู้ที่เพียงพิมพ์ "carbon neutral" บนหน้าเว็บ
•ใช้โมเดลที่เล็กลงเมื่องานเอื้ออำนวย โมเดล 7B สามารถตอบคำถามฝ่ายสนับสนุนได้ดีพอ ๆ กับโมเดล 175B โดยใช้พลังงานเพียงเศษเสี้ยว การส่งทราฟฟิกง่าย ๆ ไปยังโมเดลเล็กคือคันโยกด้านคาร์บอนที่ใหญ่ที่สุดที่คุณควบคุมได้
•แคชอย่างจริงจัง Prompt caching เปลี่ยนอินพุตที่ซ้ำ ๆ ให้เป็นต้นทุนครั้งเดียว ลดทั้ง latency และพลังงานสำหรับงานที่ทำซ้ำ
•จัดกลุ่มคำขอเมื่อทำได้ คำขอที่น้อยลงแต่ใหญ่ขึ้นชนะคำขอเล็ก ๆ จำนวนมากในแง่การใช้ประโยชน์ของเซิร์ฟเวอร์
การมองอย่างซื่อสัตย์คือคุณไม่สามารถวัดปริมาณการปล่อยคาร์บอนให้สะอาดได้ด้วยสเปรดชีต เพราะส่วนผสมโครงข่ายไฟฟ้าไม่ได้อยู่ในข้อมูลของคุณ สิ่งที่คุณทำได้คือเลือกผู้ให้บริการที่โครงสร้างพื้นฐานทำให้การปล่อยคาร์บอนน้อยลงโดยการออกแบบ และหยุดส่งคำขอเล็ก ๆ น้อย ๆ ไปยังโมเดลที่ใหญ่ที่สุดที่คุณจ่ายไหว
นั่นคือจุดยืนที่ SiCore TokenWorks วางไว้: ศูนย์ประมวลผลสามแห่งตั้งอยู่ในมองโกเลียใน Horinger, ซินเจียง Hami และหนิงเซี่ย Zhongwei ซึ่งเป็นภูมิภาคที่เลือกสรรมาสำหรับสัดส่วนพลังงานหมุนเวียนสูงและภูมิอากาศเย็นที่ทำให้ PUE ต่ำ หากคุณใส่ใจพลังงานที่อยู่เบื้องหลังการเรียก API ของคุณ นั่นคือการเปิดเผยข้อมูลแบบที่สำคัญกว่าเครื่องหมายรับรองใด ๆ