Pular para o conteúdo
OmniRoute source

Auto-Combo: Let OmniRoute Pick the Best AI for You (Português (Brasil))

Em vez de escolher um modelo de IA específico (como GPT-4o ou Claude), você pode deixar o OmniRoute escolher automaticamente o melhor para cada solicitação. Ele considera:

  • Disponibilidade — O provedor está funcionando agora?
  • Velocidade — Quão rápido ele é?
  • Custo — Quanto ele custa?
  • Qualidade — Ele é adequado para esse tipo de tarefa?
  • Capacidade — Ele ainda tem cota disponível?

O OmniRoute atribui uma pontuação a todos os seus provedores conectados e escolhe o melhor. Se ele falhar, o próximo será usado automaticamente.


Etapa 1: Defina seu modelo como auto em sua IDE ou CLI:

model: "auto"

Etapa 2: Pronto! O OmniRoute cuida do restante.

Etapa 3 (opcional): Use uma variante para tarefas específicas:

model: "auto/coding" # Melhor para código
model: "auto/fast" # Resposta mais rápida
model: "auto/cheap" # Opção mais barata

Se você quer… Use isto Melhor para Como funciona
Melhor no geral auto Perguntas gerais, conversas Equilibra velocidade, custo e qualidade
Melhor código auto/coding Escrever código, depuração Escolhe modelos bons em tarefas de código
Resposta mais rápida auto/fast Respostas rápidas, baixa latência Prioriza a velocidade acima de tudo
Opção mais barata auto/cheap Economizar dinheiro Escolhe o provedor mais barato
Modelo mais avançado auto/smart Tarefas complexas Prioriza qualidade + explora novos modelos
Maior disponibilidade auto/offline Quando os provedores estão ocupados Escolhe provedores com maior capacidade
Janela do terminal
# Conversa geral — equilibrado
curl http://localhost:20128/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"auto","messages":[{"role":"user","content":"Hello!"}]}'
# Geração de código — qualidade em primeiro lugar
curl http://localhost:20128/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"auto/coding","messages":[{"role":"user","content":"Write a Python function"}]}'
# Resposta rápida — velocidade em primeiro lugar
curl http://localhost:20128/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"auto/fast","messages":[{"role":"user","content":"What is 2+2?"}]}'

Quando você envia uma solicitação com model: "auto", o OmniRoute:

  1. Analisa todos os seus provedores conectados — Todos os provedores que você adicionou (OpenAI, Anthropic, Google etc.)
  2. Atribui uma pontuação a cada um, considerando, entre outros fatores:
    • Ele está funcionando? (disponibilidade)
    • Ele tem capacidade? (cota)
    • Quanto ele custa? (preço)
    • Quão rápido ele é? (velocidade)
    • Ele é adequado para essa tarefa? (qualidade)
  3. Escolhe o melhor — O provedor com a maior pontuação recebe sua solicitação
  4. Recupera-se automaticamente — Se ele falhar, o OmniRoute tentará o próximo automaticamente

Cada provedor recebe uma pontuação de 0 a 1. Quanto maior a pontuação, melhor a adequação.

Fator Peso O que significa
Disponibilidade 20% O provedor está funcionando? (estado do circuit breaker)
Cota 15% Ele ainda tem capacidade disponível?
Custo 15% Quanto ele custa? (mais barato = pontuação mais alta)
Velocidade 12% Quão rápido ele é? (menor latência = pontuação mais alta)
Adequação à Tarefa 8% Ele é adequado para esse tipo de tarefa?
Estabilidade 5% Ele é consistente? (baixa taxa de erros)
Nível 5% Nível da conta (Ultra > Pro > Free)
Outros 20% Afinidade de contexto, densidade de conexão etc.

Cada variante usa pesos diferentes:

Variante Prioriza Principais Pesos
auto Equilíbrio health=20%, quota=15%, cost=15%
auto/coding Qualidade taskFit=37%, stability=15%
auto/fast Velocidade latency=32%, health=28%
auto/cheap Custo cost=37%
auto/smart Qualidade + Exploração taskFit=37%, exploration=10%
auto/offline Capacidade quota=37%, health=28%

O OmniRoute tem três camadas de proteção:

Se o melhor provedor falhar, o OmniRoute tentará automaticamente o próximo. Você não precisa fazer nada.

Se um provedor continuar falhando:

  • Pontuação < 0,2 → Excluído por 5 minutos
  • Disjuntor aberto → Excluído automaticamente
  • Mais de 50% dos provedores indisponíveis → Modo de incidente (sem exploração)

Se todos os provedores falharem, o OmniRoute encaminhará as solicitações para provedores gratuitos estáveis (como Kiro ou Qoder) como último recurso.


Se você tiver várias contas para o mesmo provedor (por exemplo, duas chaves da OpenAI), o OmniRoute tratará cada uma como um candidato separado. Isso significa:

  • A conta A ainda tem cota disponível → usá-la
  • A conta B está com limite de requisições → ignorá-la
  • A conta C é mais barata → dar preferência a ela

Cada conta recebe uma pontuação independente com base em sua própria integridade, cota e velocidade.


O OmniRoute ocasionalmente explora novos provedores para descobrir opções melhores:

  • Padrão: 5% das solicitações vão para provedores aleatórios
  • Auto/inteligente: taxa de exploração de 10%
  • Desabilitada quando mais de 50% dos provedores não estão íntegros

Isso ajuda o OmniRoute a aprender quais provedores funcionam melhor para os seus padrões de uso.


Não. Por padrão, o custo representa apenas 15% da pontuação. Um provedor barato, rápido e íntegro pode superar um mais caro. Use auto/cheap se quiser priorizar ainda mais o custo.

O OmniRoute o ignora automaticamente e tenta o próximo. Se um provedor continuar falhando, ele será temporariamente excluído (por 5 a 30 minutos). Você não precisa fazer nada.

Verifique os cabeçalhos da resposta — o OmniRoute inclui o provedor e o modelo usados em cada resposta.

Sim! O sistema de pontuação usa dados históricos (latência, taxas de erro e taxas de sucesso) para tomar decisões melhores ao longo do tempo.

“Qual é a diferença entre auto e auto/smart?”

Seção intitulada ““Qual é a diferença entre auto e auto/smart?””
  • auto — Equilibrado, 5% de exploração
  • auto/smart — Prioriza a qualidade (mesmos pesos que auto/coding), 10% de exploração

Use auto/smart quando quiser a melhor qualidade e não se importar com explorações ocasionais.

Sim! Use uma combinação com a estratégia priority em vez de auto e, depois, envie o nome exato da combinação no campo model (por exemplo, model: "my-combo" — não auto). Consulte a Referência Técnica para obter detalhes.

“Qual é a diferença em relação ao round-robin?”

Seção intitulada ““Qual é a diferença em relação ao round-robin?””

O round-robin alterna entre os provedores em ordem. A combinação automática atribui uma pontuação a cada provedor e escolhe o melhor. Ela é mais inteligente — considera integridade, velocidade, custo e qualidade.



Para desenvolvedores e colaboradores, consulte a Referência Técnica do Auto-Combo para obter:

  • Algoritmo de pontuação completo com 16 fatores
  • Tabelas de pesos dos pacotes de modos
  • Caminhos dos arquivos de implementação
  • Endpoints da API
  • Detalhes do algoritmo de autocorreção

Código-fonte do OmniRoute (a58000c7685f)

HagiCode

HagiCode é um ambiente de programação com agentes, fluxos estruturados, execução multiagente e visualizações Hero Dungeon.

Transforme ideias em software útil com um fluxo de trabalho com agentes mais inteligente, rápido e agradável.

Interface principal do HagiCode no tema claro
  • SmartFluxos estruturados transformam intenções em um caminho executável da ideia à entrega.
  • EfficientFluxos multiagente mantêm pesquisa, implementação e revisão em andamento simultaneamente.
  • FunO Hero Dungeon torna longas sessões de programação mais visuais e colaborativas.
Acessar HagiCode