SiCore TokenWorks
LLM APIAPI GatewayCost OptimizationAggregation

Comparação de Preços de API de LLM: Como os Agregadores Economizam Seu Dinheiro

SiCore TokenWorks Team·2026-09-03

Se você só usou um provedor de LLM, o preço de tabela na página de preços desse provedor provavelmente parece ser o preço. Não é. É o preço de varejo e, como a maioria dos preços de varejo, tem muita margem e estrutura embutidas. Os agregadores ganham dinheiro atacando exatamente essa estrutura.

Por que os preços de tabela diretos são altos

O preço direto tem custos que não se referem à execução do modelo. Quando você compra diretamente de um fornecedor, também está pagando por:

•Compromissos mínimos. Alguns provedores exigem um saldo pré-pago ou um gasto comprometido antes de oferecerem sua melhor tarifa. Equipes pequenas raramente alcançam esses patamares.

•Um provedor, um contrato. Cada fornecedor tem seu próprio cadastro, sua própria cobrança, sua própria moeda. Operar três provedores significa três faturas e três métodos de pagamento.

•Nenhuma concorrência dentro da sua própria conta. Quando você está preso a um fornecedor, esse fornecedor não tem motivo para dar desconto. Você paga a tarifa dele ou vai embora.

•Limites de taxa definidos para a proteção deles, não para sua conveniência.

Os agregadores existem porque conseguem comprar capacidade upstream em volume e repassar parte do desconto. Eles também permitem que você mova gastos entre provedores, o que é a verdadeira alavancagem: se o modelo A ficar mais barato no mês que vem, você troca seu tráfego sem trocar de fornecedor.

A matemática, com números redondos

Vou usar números de exemplo deliberadamente simples para que o formato fique claro. Os preços reais mudam constantemente, mas a aritmética é a mesma.

Digamos que um provedor liste um modelo a $2,50 por milhão de tokens de entrada e $10,00 por milhão de tokens de saída. Uma carga de trabalho típica, digamos um resumidor de tickets de suporte fazendo 10 milhões de tokens de entrada e 4 milhões de tokens de saída por mês, custaria:

Direto:  (10M x $2,50) + (4M x $10,00) = $25 + $40 = $65,00 / mês

Um agregador que negociou preços por volume pode oferecer o mesmo modelo a aproximadamente um quarto do preço de tabela, $0,60 por milhão de entrada e $2,40 por milhão de saída:

Agregado:  (10M x $0,60) + (4M x $2,40) = $6,00 + $9,60 = $15,60 / mês

Isso é cerca de $49 economizados por mês em uma única carga de trabalho modesta, uma redução de ~76%, antes de você mexer em qualquer outra coisa. Multiplique as contagens de tokens por uma ordem de magnitude e a economia absoluta escala junto.

O ponto principal não são esses números específicos. O ponto é que a diferença entre "preço de tabela" e "preço por volume" é real, e o trabalho de um agregador é ocupar essa diferença e devolver parte dela para você.

Os outros custos que se escondem nas letras miúdas

O preço por token é a manchete, mas não é a conta inteira. Três coisas pegam as pessoas de surpresa:

Preço de acerto de cache. Alguns modelos dão desconto em tokens que acertam um cache de prompt. Se um provedor cobra preço cheio pela entrada em cache e outro cobra 10% disso, uma carga de trabalho com prompts repetitivos pode diferir muito em custo mesmo com o mesmo preço de tabela. Pergunte antes de se comprometer.

Fricção de moeda e pagamento. Comprar de um fornecedor cuja cobrança é em uma moeda ou região que seu cartão não aceita bem adiciona taxas de conversão e dores de cabeça com cobranças recusadas. Uma única fatura de agregador na sua própria moeda elimina isso.

Limites de taxa como custo oculto. Um modelo barato que você só pode chamar 10 vezes por minuto não é barato; você vai construir lógica de retry e enfileiramento para compensar, e isso é tempo de engenharia. Limites de throughput pertencem à comparação de preços, mesmo que não estejam na página de preços.

Um estimador de custo rápido

Estimar o gasto antes de construir é simples quando você tem os números. Aqui está um pequeno script Python nesse espírito:

def monthly_cost(input_tokens, output_tokens, in_price, out_price):
    # prices are per million tokens
    return (input_tokens / 1e6) * in_price + (output_tokens / 1e6) * out_price

# Direct list price
direct = monthly_cost(10_000_000, 4_000_000, 2.50, 10.00)

# Aggregator price (example values)
aggregated = monthly_cost(10_000_000, 4_000_000, 0.60, 2.40)

print(f"Direct:     ${direct:.2f}")
print(f"Aggregated: ${aggregated:.2f}")
print(f"Saved:      ${direct - aggregated:.2f}")

Coloque suas contagens reais de tokens com seus preços reais. Esse é o único número que importa.

Onde os agregadores não economizam seu dinheiro

Devo ser franco sobre os limites. Um agregador é um revendedor. Alguns modelos não estão disponíveis através de revendedores de forma alguma, e para alguns modelos de nicho a margem de um agregador pode ser pior do que ir direto. A economia é maior nos modelos populares de uso geral, onde existem descontos por volume. Para um modelo exótico que você raramente chama, a diferença é insignificante.

Além disso, um preço mais barato é inútil se a confiabilidade do agregador for ruim. Uma economia de 30% que compra um endpoint instável custa mais de 30% quando você considera retries, tickets de suporte e seu próprio tempo. Preço e confiabilidade são uma única decisão, não duas.

SiCore TokenWorks é uma versão direta desse modelo: compatível com OpenAI, pagamento conforme o uso, com um catálogo de modelos populares da DeepSeek, Qwen, ERNIE, Doubao, Spark e Pangu, ao lado de GPT-4o, Claude e Gemini, listados bem abaixo das tarifas oficiais por token.