Ir al contenido
OmniRoute source

Auto-Combo: Let OmniRoute Pick the Best AI for You (Español)

En lugar de elegir un modelo de IA específico (como GPT-4o o Claude), puedes dejar que OmniRoute elija automáticamente el mejor para cada solicitud. Tiene en cuenta:

  • Estado — ¿Está funcionando el proveedor en este momento?
  • Velocidad — ¿Qué tan rápido es?
  • Coste — ¿Cuánto cuesta?
  • Calidad — ¿Es adecuado para este tipo de tarea?
  • Capacidad — ¿Le queda cuota disponible?

OmniRoute puntúa todos tus proveedores conectados y elige el mejor. Si falla, prueba automáticamente con el siguiente.


Paso 1: Configura tu modelo como auto en tu IDE o CLI:

model: "auto"

Paso 2: ¡Eso es todo! OmniRoute se encarga del resto.

Paso 3 (opcional): Usa una variante para tareas específicas:

model: "auto/coding" # La mejor para código
model: "auto/fast" # La respuesta más rápida
model: "auto/cheap" # La opción más barata

Si quieres… Usa esto Ideal para Cómo funciona
La mejor en general auto Preguntas generales, chat Equilibra velocidad, coste y calidad
La mejor para código auto/coding Escribir código, depurar Elige modelos adecuados para programar
La respuesta más rápida auto/fast Respuestas rápidas, baja latencia Prioriza la velocidad sobre todo lo demás
La opción más barata auto/cheap Ahorrar dinero Elige el proveedor más barato
El modelo más inteligente auto/smart Tareas complejas Prioriza la calidad y explora nuevos modelos
La mayor disponibilidad auto/offline Cuando los proveedores están ocupados Elige los proveedores con mayor capacidad
Ventana de terminal
# Chat general — equilibrado
curl http://localhost:20128/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"auto","messages":[{"role":"user","content":"Hello!"}]}'
# Generación de código — prioridad a la calidad
curl http://localhost:20128/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"auto/coding","messages":[{"role":"user","content":"Write a Python function"}]}'
# Respuesta rápida — prioridad a la velocidad
curl http://localhost:20128/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"auto/fast","messages":[{"role":"user","content":"What is 2+2?"}]}'

Cuando envías una solicitud con model: "auto", OmniRoute:

  1. Revisa todos tus proveedores conectados — Todos los proveedores que hayas añadido (OpenAI, Anthropic, Google, etc.)
  2. Puntúa cada uno, teniendo en cuenta, entre otras cosas:
    • ¿Está funcionando? (estado)
    • ¿Tiene capacidad? (cuota)
    • ¿Cuánto cuesta? (precio)
    • ¿Qué tan rápido es? (velocidad)
    • ¿Es adecuado para esta tarea? (calidad)
  3. Elige el mejor — El proveedor con la puntuación más alta recibe tu solicitud
  4. Se recupera automáticamente — Si falla, OmniRoute prueba automáticamente con el siguiente

Cada proveedor recibe una puntuación de 0 a 1. Cuanto mayor sea la puntuación, mejor se ajustará.

Factor Peso Qué significa
Estado 20% ¿Está funcionando el proveedor? (estado del disyuntor)
Cuota 15% ¿Le queda capacidad disponible?
Coste 15% ¿Qué tan caro es? (más barato = mayor puntuación)
Velocidad 12% ¿Qué tan rápido es? (menor latencia = mayor puntuación)
Adecuación a la tarea 8% ¿Es adecuado para este tipo de tarea?
Estabilidad 5% ¿Es consistente? (tasa de errores baja)
Nivel 5% Nivel de la cuenta (Ultra > Pro > Free)
Otros 20% Afinidad de contexto, densidad de conexiones, etc.

Cada variante utiliza ponderaciones diferentes:

Variante Prioriza Ponderaciones clave
auto Equilibrio health=20%, quota=15%, cost=15%
auto/coding Calidad taskFit=37%, stability=15%
auto/fast Velocidad latency=32%, health=28%
auto/cheap Coste cost=37%
auto/smart Calidad + exploración taskFit=37%, exploration=10%
auto/offline Capacidad quota=37%, health=28%

OmniRoute tiene tres capas de protección:

Si el mejor proveedor falla, OmniRoute prueba automáticamente el siguiente. No necesitas hacer nada.

Si un proveedor sigue fallando:

  • Puntuación < 0.2 → Se excluye durante 5 minutos
  • Disyuntor abierto → Se excluye automáticamente
  • Más del 50 % de los proveedores no están disponibles → Modo incidente (sin exploración)

Si todos los proveedores fallan, OmniRoute dirige las solicitudes a proveedores gratuitos estables (como Kiro o Qoder) como último recurso.


Si tienes varias cuentas para el mismo proveedor (p. ej., dos claves de OpenAI), OmniRoute trata cada una como un candidato independiente. Esto significa:

  • A la cuenta A le queda cuota → usarla
  • La cuenta B tiene un límite de solicitudes → omitirla
  • La cuenta C es más barata → preferirla

Cada cuenta se puntúa de forma independiente según su propio estado, cuota y velocidad.


OmniRoute explora ocasionalmente nuevos proveedores para descubrir mejores opciones:

  • Predeterminado: el 5 % de las solicitudes se envía a proveedores aleatorios
  • Auto/smart: tasa de exploración del 10 %
  • Deshabilitada cuando más del 50 % de los proveedores presenta problemas

Esto ayuda a OmniRoute a determinar qué proveedores funcionan mejor para tus patrones de uso.


“¿Elegirá siempre el modelo más caro?”

Sección titulada «“¿Elegirá siempre el modelo más caro?”»

No. De forma predeterminada, el coste solo representa el 15 % de la puntuación. Un proveedor barato, rápido y en buen estado puede superar a uno caro. Usa auto/cheap si quieres priorizar aún más el coste.

“¿Qué ocurre si un proveedor deja de funcionar?”

Sección titulada «“¿Qué ocurre si un proveedor deja de funcionar?”»

OmniRoute lo omite automáticamente y prueba el siguiente. Si un proveedor sigue fallando, se excluye temporalmente (entre 5 y 30 minutos). No necesitas hacer nada.

“¿Puedo ver qué proveedor se utilizó?”

Sección titulada «“¿Puedo ver qué proveedor se utilizó?”»

Consulta los encabezados de la respuesta: OmniRoute incluye el proveedor y el modelo utilizados en cada respuesta.

¡Sí! El sistema de puntuación utiliza datos históricos (latencia, tasas de error y tasas de éxito) para tomar mejores decisiones con el tiempo.

“¿Cuál es la diferencia entre auto y auto/smart?”

Sección titulada «“¿Cuál es la diferencia entre auto y auto/smart?”»
  • auto — Equilibrado, 5 % de exploración
  • auto/smart — Prioriza la calidad (los mismos pesos que auto/coding), 10 % de exploración

Usa auto/smart cuando quieras la mejor calidad y no te importe que se realicen exploraciones ocasionales.

“¿Puedo forzar el uso de un proveedor específico?”

Sección titulada «“¿Puedo forzar el uso de un proveedor específico?”»

¡Sí! Usa una combinación con la estrategia priority en lugar de auto y, a continuación, envía el nombre exacto de la combinación en el campo model (p. ej., model: "my-combo"; no auto). Consulta la Referencia técnica para obtener más información.

“¿En qué se diferencia esto de round-robin?”

Sección titulada «“¿En qué se diferencia esto de round-robin?”»

Round-robin recorre los proveedores en orden. Auto-combo puntúa cada proveedor y elige el mejor. Es más inteligente: tiene en cuenta el estado, la velocidad, el coste y la calidad.



Para desarrolladores y colaboradores, consulta la Referencia técnica de Auto-Combo para obtener información sobre:

  • Algoritmo completo de puntuación de 16 factores
  • Tablas de ponderaciones de los paquetes de modos
  • Rutas de archivos de implementación
  • Endpoints de la API
  • Detalles del algoritmo de autorreparación

Código fuente de OmniRoute (a58000c7685f)

HagiCode

HagiCode es un espacio de trabajo de programación con agentes, flujos estructurados, ejecución multiagente y vistas de Hero Dungeon.

Convierte ideas en software útil con un flujo de trabajo con agentes más inteligente, rápido y ameno.

Interfaz principal de HagiCode con tema claro
  • SmartLos flujos estructurados convierten la intención en un itinerario ejecutable desde la idea hasta la entrega.
  • EfficientLos flujos multiagente permiten avanzar en paralelo con la investigación, implementación y revisión.
  • FunHero Dungeon hace que las largas sesiones de programación sean visuales y colaborativas.
Visitar HagiCode