SiCore TokenWorks
LLM APIAPI Gateway

Apa yang Harus Diperhatikan dalam Penyedia API LLM: Sebuah Daftar Periksa

SiCore TokenWorks Team·2026-09-03

Memilih penyedia LLM berdasarkan skor benchmark seperti memilih restoran berdasarkan foto menunya. Modelnya penting, tetapi segala hal di sekitar model juga penting, dan hal-hal di sekitarnya itulah yang sebenarnya mengganggu Anda di produksi. Ini adalah daftar periksa yang saya gunakan untuk menguji penyedia sebelum saya mengarahkan apa pun yang nyata ke sana.

Uptime dan SLA

SLA adalah janji dengan angka yang menyertainya, jadi bacalah angkanya. Persentase uptime tampak berdekatan secara menyesatkan sampai Anda mengonversinya:

SLADowntime per tahunDowntime per bulan
99,9%8,76 jam43,8 menit
99,95%4,38 jam21,9 menit
99,99%52,6 menit4,4 menit

99,9% terdengar sangat baik dan masih memungkinkan hampir satu jam gangguan bulanan. Jika produk Anda bergantung pada endpoint, 99,9% versus 99,99% adalah perbedaan antara "mengganggu" dan "bisa dilupakan." Periksa juga dua hal di luar angka utama:

•Apa yang dianggap sebagai downtime. Beberapa SLA hanya mencakup gangguan total, bukan throughput yang menurun atau tingkat error yang tinggi.

•Apa yang Anda dapatkan saat mereka gagal memenuhinya. Kredit bernilai kecil jika kredit dibatasi atau mengharuskan Anda mengajukan klaim. Remedi harus konkret.

Penyedia yang tidak mau mempublikasikan SLA sama sekali sedang memberi tahu Anda sesuatu, dan itu bukan hal yang baik.

Latensi dan throughput

Latensi memiliki dua angka yang Anda pedulikan dan keduanya mengukur hal yang berbeda:

•Waktu ke token pertama (TTFT). Berapa lama sebelum respons mulai streaming. Inilah yang dirasakan pengguna sebagai "gesit."

•Token per detik (throughput). Seberapa cepat sisa respons tiba. Inilah yang menentukan apakah jawaban panjang terasa lambat.

Keduanya bervariasi menurut model dan beban, jadi jangan percaya angka pemasaran. Ukur sendiri:

import time
from openai import OpenAI

client = OpenAI(base_url="https://api.token8341.com/v1",
                api_key="sk-your-key")

start = time.perf_counter()
stream = client.chat.completions.create(
    model="deepseek-chat",
    messages=[{"role": "user", "content": "Write 200 words about caching"}],
    stream=True,
)
ttft = None
tokens = 0
for chunk in stream:
    if ttft is None:
        ttft = time.perf_counter() - start
    tokens += 1
elapsed = time.perf_counter() - start
print(f"TTFT: {ttft:.2f}s, total: {elapsed:.2f}s, "
      f"{tokens / elapsed:.1f} tok/s")

Jalankan itu pada beberapa waktu berbeda dalam sehari dan di bawah konkurensi yang Anda perkirakan sendiri. Penyedia yang cepat pada pukul 10 pagi dan lambat pada pukul 7 malam memiliki masalah kapasitas yang perlu Anda ketahui.

Biaya

Harga per token adalah bagian yang mudah. Gambaran biaya lengkapnya mencakup:

•Harga input vs. output, karena output biasanya berbiaya beberapa kali lipat input.

•Harga cache-hit. Untuk beban kerja yang berulang, cache prompt dapat memangkas biaya lebih dari diskon apa pun.

•Batas laju dan throttling. Endpoint murah yang hanya bisa diakses secara terbatas tidak murah setelah Anda menambahkan antrean dan percobaan ulang.

•Gesekan mata uang dan pembayaran. Biaya kartu lintas batas dan biaya konversi nyata bagi tim kecil.

Tanyakan harga untuk beban kerja Anda yang sebenarnya, bukan harga per juta token secara terpisah.

Cakupan model dan kompatibilitas

•Apakah API-nya kompatibel dengan OpenAI? Jika ya, Anda dapat menggunakan SDK standar dan beralih nanti tanpa menulis ulang. Jika proprietary, Anda menikah dengan penyedianya.

•Bisakah Anda mengakses beberapa keluarga model melalui satu kunci? Katalog dengan satu atau dua model mengunci Anda seketat API proprietary. Katalog dengan banyak model memberi Anda cadangan dan jalur ke perutean yang lebih murah.

•Apakah embeddings, function calling, dan streaming didukung, bukan hanya chat biasa? Fitur-fitur inilah yang menentukan apakah endpoint cocok untuk aplikasi nyata atau hanya demo.

Penanganan data dan dukungan

•Retensi data. Apakah penyedia menyimpan prompt dan completion Anda untuk pelatihan? Dapatkan ini secara tertulis.

•Wilayah dan residensi. Di mana permintaan diproses? Bagi sebagian pengguna ini adalah persyaratan hukum, bukan preferensi.

•Kualitas dukungan. Coba buka tiket dukungan sebelum Anda berkomitmen. Kecepatan dan kegunaan respons pertama adalah prediktor kuat tentang bagaimana gangguan akan terasa.

•Transparansi status. Halaman status publik dan riwayat insiden memberi tahu Anda apakah penyedia jujur tentang keandalan mereka sendiri.

Versi singkatnya

Uji setiap kandidat melalui lima pertanyaan ini:

1.Apa SLA-nya, dan apa remedinya ketika gagal dipenuhi?

2.Berapa TTFT dan throughput terukur di bawah beban saya?

3.Berapa biaya beban kerja nyata saya, termasuk cache hit?

4.Apakah API-nya kompatibel dengan OpenAI, dengan beberapa model di balik satu kunci?

5.Maukah mereka memberi tahu saya di mana data diproses dan bagaimana dukungan merespons?

Tidak satu pun dari ini memerlukan keahlian mendalam. Semuanya menuntut agar Anda bertanya sebelum gangguan terjadi, bukan sesudahnya. Penyedia yang menjawabnya dengan nyaman cenderung merupakan penyedia yang benar-benar telah menjalankan lalu lintas produksi, bukan sekadar mencantumkan model.

SiCore TokenWorks cocok dengan sebagian besar daftar ini: SLA 99,9%, endpoint yang kompatibel dengan OpenAI di https://api.token8341.com/v1, satu kunci yang mencakup GPT-4o, Claude, Gemini, DeepSeek, Qwen, ERNIE, Doubao, Spark, dan Pangu, serta penagihan per token dengan harga cache-hit.