สองปีก่อนผมช่วยทีมที่ทำระบบบริการลูกค้าข้ามพรมแดนทำ architecture review บนไวท์บอร์ดในห้องประชุมเต็มไปด้วยตารางเปรียบเทียบคะแนนของโมเดลแต่ละเจ้า MMLU, C-Eval, HumanEval ใครสูงกว่าแค่จุดทศนิยมไม่กี่ตำแหน่งก็เถียงกันได้ครึ่งวัน ปีนี้กลับไปอีกครั้ง ทีมเดิม บนไวท์บอร์ดเปลี่ยนเป็นตัวเลขอีกชุดหนึ่ง: ต้นทุนเฉลี่ยต่อบทสนทนา, P99 latency, availability ติดต่อกันเจ็ดวัน การเปลี่ยนแปลงนี้ไม่ใช่กรณีเฉพาะ ผมทำแพลตฟอร์ม AI มาหลายปี รู้สึกได้ชัดว่าตรรกะในการเลือก API โมเดลขนาดใหญ่ขององค์กร กำลังเปลี่ยนจาก "บูชาพารามิเตอร์" ไปสู่ "บัญชีวิศวกรรม"
จากกระดาษอันดับสู่บัญชี การเลือกเปลี่ยนอะไรไปบ้าง
พูดง่ายๆ คำถามหลักของการเลือกในอดีตคือ "โมเดลไหนฉลาดที่สุด" ตอนนี้กลายเป็น "โมเดลไหนคุ้มที่สุดสำหรับงานนี้" คะแนนบนกระดาษอันดับเป็นตัวชี้วัดแบบ static ภายใต้เงื่อนไขห้องแล็บ แต่ในสภาพแวดล้อม production สิ่งที่คุณเผชิญคือการเรียกหลายล้านครั้ง, ปริมาณการใช้งานที่พุ่งสูงเป็นระลอก, และเวอร์ชันโมเดลที่เปลี่ยนทุกไตรมาส โมเดลที่ติดอันดับต้นๆ บนกระดาษ ถ้าต้นทุน inference เป็นสองเท่าของอีกตัว และ latency สูงกว่าเท่าตัว เมื่อวางในสถานการณ์ที่เรียกวันละล้านครั้ง บัญชีก็คำนวณไม่ลงตัว ในโปรเจกต์ของเราตอนนี้ให้ความสำคัญกับการเลือกโมเดลที่เหมาะสมที่สุดโดยอัตโนมัติตามงานมากขึ้น——งานอย่าง classification, summarization ใช้โมเดลเล็ก งานที่ต้อง reasoning ซับซ้อนค่อย route ไปโมเดลใหญ่ ต้นทุนรวมลดลงได้มาก นี่คือเหตุผลที่ model gateway เริ่มกลายเป็นมาตรฐาน มันไม่ได้แค่ forward request แต่รับหน้าที่ routing, degradation, rate limiting ซึ่งเป็นความรับผิดชอบระดับ production
สามปัจจัยที่ผลักดันอุตสาหกรรมมาถึงจุดเปลี่ยนนี้
อย่างแรกคือช่องว่างความสามารถของโมเดลกำลังแคบลง ช่องว่างระหว่างโมเดลหัวแถวกับโมเดลระดับรองลงมา เปลี่ยนจากเมื่อก่อน "ใช้ได้หรือไม่" เป็น "ต่างกันนิดเดียว" สำหรับสถานการณ์ทางธุรกิจส่วนใหญ่ ความต่างแค่นี้ผู้ใช้สัมผัสไม่ถึง แต่ความต่างของต้นทุนเป็นของจริง อย่างที่สองคือโมเดลในประเทศตามทันในสถานการณ์ภาษาจีนแล้ว Qwen, DeepSeek, Doubao, ERNIE เหล่านี้ ในด้านความเข้าใจภาษาจีน, ความรู้เฉพาะท้องถิ่น, การปรับให้เข้ากับ compliance กลับเข้ากับธุรกิจในประเทศได้ดีกว่าโมเดลต่างประเทศ เมื่อก่อนหลายทีมใช้ "โมเดลต่างประเทศเป็นหลัก โมเดลในประเทศเป็น backup" ตอนนี้กลับกันแล้ว อย่างที่สาม ซึ่งสำคัญที่สุด องค์กรเปลี่ยนจาก Demo เข้าสู่การผลิตระดับ scale ขั้น Demo ปริมาณการเรียกน้อย ต้นทุนไม่ sensitive พอเข้าสู่ scale ต้นทุนของการเรียกแต่ละครั้ง ความสูญเสียจากการ timeout แต่ละครั้ง จะถูกขยายขยาย ตอนนี้การเลือกจึงไม่ใช่ปัญหาความชอบทางเทคนิค แต่เป็นปัญหาทางการเงิน
หลังการเปลี่ยนทิศ โครงสร้างพื้นฐานต้องเสริมส่วนไหนบ้าง
ส่วนแรกคือ model gateway มันแก้ปัญหา "ประตูเดียวจัดการทุกโมเดล" ถ้าไม่มี gateway ทุกครั้งที่เชื่อมโมเดลใหม่ต้องแก้โค้ดหนึ่งรอบ, ดูแลชุดคีย์หนึ่งชุด, เขียน logic retry หนึ่งชุด มี gateway แล้ว เชื่อมต่อหลายโมเดลแบบ unified การสลับโมเดลโปร่งใสต่อธุรกิจชั้นบน ส่วนที่สองคือ AI API aggregation คุณค่าของส่วนนี้อยู่ที่การรวม procurement, billing, quota management เข้าด้วยกัน เราทำการเปรียบเทียบภายใน เชื่อม SDK ของห้าค่ายเอง แค่ดูแลเอกสารและ version compatibility ก็กินพลังวิศวกรคนหนึ่งไปไม่น้อย เปลี่ยนเป็นแพลตฟอร์ม aggregation ที่เข้ากันได้กับ OpenAI SDK แก้ base_url บรรทัดเดียวก็สลับได้ สิ่งที่ประหยัดที่ตามมาคือ manpower จริงๆ ตรงนี้ขอพูดถึงหน่อยว่า positioning ของ SiCore TokenWorks ที่เน้นโมเดลในประเทศก่อนบวก compute สีเขียว ลงตัวพอดีกับจุดเปลี่ยนนี้——สิ่งที่องค์กรต้องการไม่ใช่จำนวนโมเดลมากที่สุด แต่คือครอบคลุมโมเดลในประเทศครบ, ต้นทุนควบคุมได้, การ schedule compute เสถียร ส่วนที่สามคือ observability ถ้าไม่มี call log, สถิติการใช้ Token, การกระจายของ latency คุณไม่รู้เลยว่าเงินหมดไปตรงไหน โมเดลไหนถ่วงขา การปรับแต่งต่อเนื่องมีเงื่อนไขเบื้องต้นคือต้องมองเห็นได้
สามการคาดการณ์สำหรับการเลือกในปี 2026
คาดการณ์แรก การคิดค่าบริการตามปริมาณจะกลายเป็นตัวเลือกเริ่มต้น โหมดเหมาจ่ายรายปีรายเดือนแบบหยาบจะถอยไปอยู่เฉพาะสถานการณ์ที่มีปริมาณสูงเสถียรบางส่วน เพราะปริมาณธุรกิจในตัวเองผันผวน ไม่มีใครอยากจ่ายค่า compute ที่ว่างเปล่า คาดการณ์ที่สอง model routing จะเปลี่ยนจาก "ฟีเจอร์ขั้นสูง" เป็น "ฟีเจอร์พื้นฐาน" เมื่อองค์กรหนึ่งใช้สามสี่โมเดลพร้อมกันกลายเป็นเรื่องปกติ การเลือกโมเดลที่เหมาะสมที่สุดอัตโนมัติจะไม่ใช่ของแถม แต่เป็นความจำเป็นในการประหยัดเงิน คาดการณ์ที่สาม compute สีเขียวและการใช้ของในประเทศจะเปลี่ยนจากแต้มบวกเป็นตัวชี้วัดการสร้างสรรค์นวัตกรรมเทคโนโลยีสารสนเทศแบบบังคับ compliance, ต้นทุนพลังงาน, ความเสถียรของ supply chain สามเรื่องนี้ในปี 2026 จะถูกเขียนเป็นข้อกำหนดแบบบังคับบังคับใน procurement process มากขึ้น การ schedule compute ที่ SiCore TokenWorks การวางแผนในภาคตะวันออกและตะวันตก โดยแก่นแท้คือการตอบสนองต่อแนวโน้มนี้
สรุปพูดสั้น ๆ: การการโยกย้ายของตรรกะการเลือก โดยแท้จริงคือการเปลี่ยนจาก "เลือกโมเดลที่ฉลาดที่สุด" เป็น "เลือกชุดค่าผสมที่เหมาะสมที่สุด" ถ้าอยากเข้าใจรายละเอียดการลงมือทำของ multi-model routing และ API aggregation ลึกขึ้น สามารถค้นต่อในทิศทาง model gateway, โมเดลขนาดใหญ่ API, การคิดค่าบริการตามปริมาณได้