Visão geral

Introdução

A Stac roda modelos de IA open-source em produção por um preço mensal fixo — nunca por token, nunca interrompido no meio de uma resposta.

A Stac é infraestrutura de inferência para modelos de linguagem open-source. Você escolhe um plano, nós rodamos o modelo que esse plano usa em capacidade dedicada, e você paga um preço mensal fixo por essa capacidade. Não há medidor por token, nem fatura surpresa no fim do mês, nem trabalho de DevOps do seu lado.

A API é compatível com a OpenAI, então a maioria dos clientes funciona mudando duas linhas: a URL base e a API key. Clientes compatíveis com a Anthropic (como o Claude Code) funcionam da mesma forma, apontando para /v1/messages.

bash
curl https://api.trystac.com/v1/chat/completions \
  -H "Authorization: Bearer $STAC_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "your-stack-model",
    "messages": [{ "role": "user", "content": "Hello" }]
  }'

Por que preço fixo

Preço por token torna o custo uma função de um uso que você não controla. Um loop de retry, um contexto longo ou um pico de tráfego caem todos na mesma fatura, e a única forma de limitar isso é limitar o seu produto.

A Stac inverte essa lógica. Você reserva capacidade — uma stack — e a stack custa o mesmo, sirva ela dez requisições por dia ou dez mil. O que varia é a latência sob carga, não o preço, e isso é algo que dá para planejar.

Provedores por tokenStac
Unidade de cobrançaTokens de entrada + saídaCapacidade reservada
Previsibilidade de custoVaria com o tráfegoFixa mensal
Interrupções de requisiçãoTruncadas por cotaNenhuma
Cold startsComuns em camadas compartilhadasNunca — a capacidade já está reservada
Escolha de modeloCatálogo do provedorDefinida por plano; personalizada no Enterprise

O que você recebe

Uma stack é um deployment com seu próprio modelo, seu próprio system prompt, sua própria base de conhecimento e suas próprias API keys. Nada da sua configuração é compartilhado com outros clientes.

  • Capacidade reservada. Seu tráfego nunca disputa espaço de requisição com o de outro cliente.
  • API compatível com OpenAI e Anthropic. Chat completions, streaming, function calling, os dois formatos de requisição.
  • Configuração de comportamento. System prompt e parâmetros de geração, editáveis pelo dashboard sem redeploy.
  • Base de conhecimento. Envie documentos; a recuperação é feita para você.
  • Logs de uso. Cada requisição registrada por modelo, status, tokens e duração.

Próximos passos

  1. Crie uma stack

    Escolha um plano. O provisionamento leva poucos minutos.

  2. Gere uma API key

    As keys são vinculadas a uma única stack e exibidas apenas uma vez, na criação.

  3. Envie sua primeira requisição

    Siga o quickstart — leva cerca de cinco minutos.