Si solo has usado un proveedor de LLM, el precio de lista en la página de precios de ese proveedor probablemente parezca el precio. No lo es. Es el precio minorista y, como la mayoría de los precios minoristas, tiene mucho margen y estructura incorporados. Los agregadores ganan dinero atacando exactamente esa estructura.
Por qué los precios de lista directos son altos
Los precios directos tienen costos que no se relacionan con ejecutar el modelo. Cuando compras directamente a un proveedor, también estás pagando por:
•Compromisos mínimos. Algunos proveedores quieren un saldo prepago o un gasto comprometido antes de darte su mejor tarifa. Los equipos pequeños rara vez alcanzan esos niveles.
•Un proveedor, un contrato. Cada proveedor tiene su propio registro, su propia facturación, su propia moneda. Trabajar con tres proveedores significa tres facturas y tres métodos de pago.
•Sin competencia dentro de tu propia factura. Cuando estás atado a un solo proveedor, ese proveedor no tiene razón para aplicar descuentos. Pagas su tarifa o te vas.
•Límites de velocidad configurados para su protección, no para tu comodidad.
Los agregadores existen porque pueden comprar capacidad upstream en volumen y trasladar parte del descuento. También te permiten mover el gasto entre proveedores, que es la verdadera ventaja: si el modelo A se abarata el mes que viene, cambias tu tráfico sin cambiar de proveedor.
Los números, con cifras redondas
Voy a usar números de ejemplo deliberadamente simples para que la forma quede clara. Los precios reales cambian constantemente, pero la aritmética es la misma.
Digamos que un proveedor lista un modelo a $2.50 por millón de tokens de entrada y $10.00 por millón de tokens de salida. Una carga de trabajo típica, por ejemplo un resumidor de tickets de soporte que procesa 10 millones de tokens de entrada y 4 millones de tokens de salida al mes, costaría:
Directo: (10M x $2.50) + (4M x $10.00) = $25 + $40 = $65.00 / mesUn agregador que haya negociado precios por volumen podría ofrecer el mismo modelo a aproximadamente un cuarto del precio de lista, $0.60 por millón de entrada y $2.40 por millón de salida:
Agregado: (10M x $0.60) + (4M x $2.40) = $6.00 + $9.60 = $15.60 / mesEso supone unos $49 ahorrados al mes en una sola carga de trabajo modesta, una reducción de ~76%, antes de tocar cualquier otra cosa. Multiplica los recuentos de tokens por un orden de magnitud y el ahorro absoluto escala con ellos.
El punto clave no son estos números específicos. El punto es que la brecha entre "precio de lista" y "precio por volumen" es real, y el trabajo de un agregador es situarse en esa brecha y devolverte parte de ella.
Los otros costos que se esconden en la letra pequeña
El precio por token es el titular, pero no es toda la factura. Hay tres cosas que suelen sorprender a la gente:
Precio por acierto de caché. Algunos modelos aplican descuento a los tokens que aciertan en una caché de prompt. Si un proveedor cobra el precio completo por la entrada en caché y otro cobra el 10% de este, una carga de trabajo con prompts repetitivos puede diferir mucho en costo incluso con el mismo precio de lista. Pregunta antes de comprometerte.
Fricción de moneda y pago. Comprar a un proveedor cuya facturación está en una moneda o región que tu tarjeta no acepta bien añade comisiones de conversión y dolores de cabeza por cargos rechazados. Una única factura de agregador en tu propia moneda elimina eso.
Los límites de velocidad como costo oculto. Un modelo barato al que solo puedes llamar 10 veces por minuto no es barato; tendrás que construir lógica de reintentos y colas para compensar, y eso es tiempo de ingeniería. Los límites de rendimiento pertenecen a la comparación de precios aunque no estén en la página de precios.
Un estimador de costos rápido
Estimar el gasto antes de construir es sencillo una vez que tienes los números. Aquí hay un pequeño script de Python en ese espíritu:
def monthly_cost(input_tokens, output_tokens, in_price, out_price):
# prices are per million tokens
return (input_tokens / 1e6) * in_price + (output_tokens / 1e6) * out_price
# Direct list price
direct = monthly_cost(10_000_000, 4_000_000, 2.50, 10.00)
# Aggregator price (example values)
aggregated = monthly_cost(10_000_000, 4_000_000, 0.60, 2.40)
print(f"Direct: ${direct:.2f}")
print(f"Aggregated: ${aggregated:.2f}")
print(f"Saved: ${direct - aggregated:.2f}")Pasa tus recuentos reales de tokens por él con tus precios reales. Ese es el único número que importa.
Dónde los agregadores no te ahorran dinero
Debo ser franco sobre los límites. Un agregador es un revendedor. Algunos modelos no están disponibles a través de revendedores en absoluto, y para algunos modelos de nicho el margen de un agregador puede ser peor que ir directamente. Los ahorros son mayores en los modelos populares de propósito general donde existen descuentos por volumen. Para un modelo exótico que llamas rara vez, la diferencia es insignificante.
Además, un precio más barato no vale nada si la fiabilidad del agregador es mala. Un ahorro del 30% que te compra un endpoint inestable cuesta más del 30% una vez que tienes en cuenta los reintentos, los tickets de soporte y tu propio tiempo. Precio y fiabilidad son una sola decisión, no dos.
SiCore TokenWorks es una versión directa de este modelo: compatible con OpenAI, pago por uso, con un catálogo de modelos populares de DeepSeek, Qwen, ERNIE, Doubao, Spark y Pangu junto a GPT-4o, Claude y Gemini, listados muy por debajo de las tarifas oficiales por token.