¿Qué es el enrutamiento de modelos LLM?
El enrutamiento de modelos LLM es la práctica de dirigir automáticamente cada consulta al modelo más rentable capaz de responderla bien. Las tareas simples van a modelos baratos y rápidos. Las complejas van a modelos de frontera. Bien implementado, el enrutamiento reduce los costes de inferencia entre un 40 y un 85% manteniendo una calidad de respuesta casi idéntica a usar siempre el modelo más caro.
TL;DR - Puntos Clave
- GPT-4o cuesta 16 veces más por token que GPT-4o mini. Para la mayoría de las consultas en producción, el modelo más barato rinde de forma idéntica
- RouteLLM (UC Berkeley, ICLR 2025) logró más del 85% de reducción de costes en MT Bench manteniendo el 95% del rendimiento de GPT-4, enviando solo el 14% de las consultas al modelo potente
- FrugalGPT (Stanford, 2023) demostró hasta un 98% de reducción de costes mediante enrutamiento en cascada, donde los modelos baratos gestionan la mayoría de consultas y los caros solo ven las difíciles
- Las tres estrategias prácticas de enrutamiento son: enrutamiento basado en clasificador, enrutamiento en cascada y enrutamiento semántico, cada una adaptada a diferentes tipos de carga de trabajo
- La lógica de enrutamiento es más robusta cuando se aplica en la capa de gateway, no en el código de cada aplicación individual
La mayoría de los equipos envía todo a GPT-4o porque es la opción segura por defecto. Es como contratar a un neurocirujano para tomarte la temperatura.
El neurocirujano es excelente. Simplemente pagas 400 euros por un trabajo de 10 segundos. El enrutamiento de modelos LLM resuelve esto adaptando automáticamente la complejidad de la consulta a la capacidad del modelo.
Esta guía cubre las tres estrategias que funcionan en producción y las herramientas que puedes usar para implementarlas hoy. Para el marco completo de optimización de costes, lee la Guía Completa de Optimización de Tokens de IA.
)
El Problema de Usar Siempre el Mejor Modelo
Es un patrón que veo constantemente. Un equipo elige GPT-4o para su primera funcionalidad de IA porque es el mejor. Funciona. Lanzan más funcionalidades usando el mismo modelo. Nadie se detiene a preguntar si cada consulta realmente lo necesita.
Seis meses después, el 80% de su presupuesto de inferencia va a un modelo de frontera que responde cosas como "resume esto en dos frases" y "¿es este correo urgente, sí o no?"
GPT-4o cuesta $2,50 por millón de tokens de entrada. GPT-4o mini cuesta $0,15. Eso es una diferencia de 16 veces. Claude 3 Haiku está alrededor de $0,80. Gemini 1.5 Flash a $0,075 es 33 veces más barato que GPT-4o.
¿La diferencia en calidad de respuesta en tareas simples y estructuradas? Prácticamente nula.
No estás pagando por mejores respuestas. Estás pagando por una capacidad que no estás usando.
El enrutamiento de modelos LLM es la solución. En lugar de un único modelo para todo, construyes una capa de enrutamiento que examina cada consulta entrante y la envía al modelo correcto: el modelo más barato capaz de hacer bien el trabajo.
)
Las Tres Estrategias de Enrutamiento
Estrategia 1: Enrutamiento Basado en Clasificador
Entrenas un clasificador ligero (un pequeño modelo BERT o un prompt de LLM rápido) para predecir la complejidad de la consulta antes de que llegue a tu modelo principal. El clasificador produce una puntuación o categoría. Las consultas por debajo de un umbral van al modelo pequeño. Las consultas por encima van al modelo de frontera.
Este es el enfoque que utiliza RouteLLM. El equipo de investigación de Berkeley y Anyscale entrenó enrutadores con datos de preferencia del LMSYS Chatbot Arena: pares de respuestas donde los humanos juzgaron qué modelo lo hacía mejor. Los enrutadores aprendieron, a partir de esa señal, qué consultas realmente necesitan el modelo potente.
Sus resultados, publicados en ICLR 2025:
- Enrutador de factorización matricial: 85% de reducción de costes en MT Bench, 95% del rendimiento de GPT-4, solo el 14% de consultas enviadas al modelo potente
- Clasificador basado en BERT: 45% de ahorro en MMLU con calidad comparable
- Con aumento de datos del juez LLM: misma calidad del 95% con solo el 14% de llamadas al modelo potente, 75% de reducción de costes total El enrutamiento basado en clasificador funciona mejor cuando la distribución de tus consultas es relativamente predecible. Las tareas de clasificación, preguntas de sí/no, extracción estructurada y resumen casi siempre funcionan bien en modelos pequeños. El razonamiento profundo, la generación abierta y el código de múltiples pasos no.
Mejor para: Equipos con alto volumen de consultas y una división identificable entre simple/complejo. Baja latencia adicional una vez entrenado el clasificador.
Estrategia 2: Enrutamiento en Cascada
El enrutamiento en cascada no pre-clasifica las consultas. Envía cada consulta al modelo barato primero, comprueba si la respuesta cumple un umbral de confianza y solo escala al modelo caro cuando no lo cumple.
Esta es la idea central de FrugalGPT, el paper de Stanford de Lingjiao Chen, Matei Zaharia y James Zou. La cascada prueba modelos más baratos en secuencia, se detiene cuando uno produce una respuesta suficientemente segura y solo llama al modelo caro si los demás fallan el umbral.
Resultados de Stanford: hasta un 98% de reducción de costes en comparación con usar siempre la mejor API de LLM, con la misma calidad de respuesta. En promedio entre benchmarks, las cascadas al estilo FrugalGPT lograron ahorros de entre el 50 y el 98%.
El mecanismo que hace funcionar las cascadas es la comprobación de confianza. Para tareas estructuradas donde el modelo sabe si conoce la respuesta esto es fiable. Para la generación abierta, donde los modelos se equivocan con confianza regularmente, las cascadas son más complicadas. Necesitas un juez de calidad (otro modelo o una función de puntuación) en lugar de una puntuación de confianza bruta.
Mejor para: Cargas de trabajo donde el modelo barato gestiona la mayoría de consultas y quieres minimizar las llamadas al modelo potente sin pre-clasificar nada.
Estrategia 3: Enrutamiento Semántico
El enrutamiento semántico embebe la consulta entrante usando un modelo de embedding ligero y la compara con el cluster de temas más cercano. Cada cluster mapea a un modelo optimizado para ese dominio.
Las consultas de código van a un modelo especialista en código. Las consultas médicas van a un modelo ajustado con datos clínicos. La conversación general va a la opción más barata capaz.
Esto es diferente al enrutamiento por complejidad. No preguntas "¿qué tan difícil es esto?" Preguntas "¿qué tipo de tarea es esta?" Una pregunta médica simple y una médica compleja van ambas al modelo médico. Una pregunta de Python compleja y una simple van ambas al modelo de código.
El enrutamiento automático de LiteLLM soporta este enfoque: clasifica cada solicitud usando heurísticas, un clasificador LLM pequeño (Haiku o GPT-4o mini) o reglas léxicas/semánticas, y luego enruta a un modelo fijo o a un grupo de modelos puntuado por nivel.
Mejor para: Equipos que ejecutan múltiples modelos especializados o proveedores, o aplicaciones que abarcan dominios de tareas claramente distintos (soporte, código, análisis, creativo).
Estrategias de Enrutamiento de un Vistazo
| Estrategia | Señal de Enrutamiento | Latencia Adicional | Mejor Para | Reducción de Costes |
|---|---|---|---|---|
| Basado en clasificador | Puntuación de complejidad predicha | Baja (tras el entrenamiento) | Tareas estructuradas de alto volumen | 45-85% |
| Cascada | Confianza de respuesta | Media (llamada al modelo barato) | Tipos mixtos, sin pre-clasificación | 50-98% |
| Semántico | Embedding del tema de consulta | Muy baja | Despliegues multi-dominio, multi-modelo | Variable según distribución |
)
Herramientas Open Source que Debes Conocer
RouteLLM (UC Berkeley + Anyscale) es la opción más rigurosa académicamente. Incluye cuatro implementaciones de enrutador: factorización matricial, clasificador BERT, similitud coseno y LLM como juez. Puedes usar sus pesos pre-entrenados o entrenar los tuyos en tu distribución de consultas. El repositorio de GitHub es open source. Mejor para equipos que quieren garantías teóricas sólidas y se sienten cómodos con un paso de entrenamiento.
LiteLLM es la opción de propósito general más lista para producción. Gestiona el enrutamiento junto con balanceo de carga, fallbacks, límites de presupuesto y conmutación por error de proveedores. Las estrategias de enrutamiento incluyen: menos ocupado, basado en latencia, basado en uso y basado en coste. La configuración proxy significa que no cambias el código de la aplicación: apuntas todo al proxy de LiteLLM y configuras el enrutamiento en YAML. Mejor para equipos que quieren enrutamiento más toda la infraestructura de inferencia en una sola capa.
Martian es un enrutador gestionado con un enfoque basado en ML que se adapta a tu tráfico con el tiempo. Se sitúa entre tu aplicación y tus proveedores de LLM, aprende qué consultas necesitan qué modelo y optimiza automáticamente. Mejor para equipos que quieren enrutamiento sin construir ni mantener ninguna infraestructura.
El Equilibrio Coste-Calidad en la Práctica
La decisión de enrutamiento no es binaria: modelo pequeño o de frontera. La mayoría de los sistemas en producción se benefician de tres niveles.
| Tipo de Consulta | Nivel de Modelo | Por Qué |
|---|---|---|
| Clasificación, sí/no, extracción estructurada | Nano (GPT-4o mini, Gemini Flash) | Precisión casi idéntica a la de frontera en tareas estructuradas |
| Resumen, Q&A moderada, traducción | Nivel medio (Haiku, Gemini 1.5 Flash) | Potente en compresión y recuperación; económico |
| Razonamiento complejo, generación de código, análisis | Frontera (GPT-4o, Claude Sonnet) | Necesario para tareas de múltiples pasos y creativas |
| Dominio específico (médico, legal, código) | Especializado ajustado o RAG | Supera al generalista en tareas estrechas |
Para una distribución de producción realista (60% simple, 30% moderada, 10% compleja ) el enrutamiento a tres niveles produce aproximadamente entre un 70 y un 80% de reducción de costes respecto a enrutar todo al nivel de frontera.
Para gestionar los costes de contexto dentro de cada nivel, consulta la guía de Optimización de la Ventana de Contexto. Para cachear entradas repetidas antes de que lleguen al enrutador, consulta Estrategias de Caché para LLM.
Enrutamiento en la Capa de Gateway
El lugar más duradero para implementar el enrutamiento no es el código de tu aplicación. Es la capa de gateway.
Cuando el enrutamiento vive dentro de servicios individuales, cada equipo mantiene su propia lógica. Se desactualiza. No tiene en cuenta nuevos modelos. Los costes vuelven a subir.
Una capa de enrutamiento a nivel de gateway aplica reglas consistentes a todo el tráfico de LLM en cada aplicación. Defines la política de enrutamiento una vez. Todos los consumidores la reciben automáticamente. Y obtienes los datos de atribución de costes para ver si el enrutamiento realmente está funcionando.
El AI Gateway de NeuralTrust proporciona políticas de enrutamiento junto con atribución de costes, para que puedas ver, por ruta y por consumidor, cuánto de tu tráfico llega a cada nivel de modelo y cuánto cuesta. Combinado con compresión de prompts y caché, el enrutamiento a nivel de gateway se convierte en la base de un sistema completo de gestión de costes de tokens.
Preguntas Frecuentes sobre Enrutamiento de Modelos LLM
1. ¿Qué es el enrutamiento de modelos LLM?
El enrutamiento de modelos LLM es el proceso automático de dirigir cada consulta al modelo más rentable capaz de gestionarla. Una capa de enrutamiento evalúa la consulta entrante (por complejidad, tema, confianza u otras señales) y selecciona el modelo apropiado de un grupo. Esto sustituye el comportamiento por defecto de enviar todo a un único modelo, normalmente caro.
2. ¿Cuánto puede reducir el enrutamiento los costes de LLM?
Los benchmarks de investigación sitúan el rango entre el 40 y el 98% según la distribución de consultas y el método de enrutamiento. RouteLLM logró un 85% de reducción de costes en MT Bench con el 95% de la calidad de GPT-4. FrugalGPT logró hasta un 98% de reducción de costes entre benchmarks. Los ahorros reales en producción dependen de cuántas de tus consultas son genuinamente simples.
3. ¿Cuál es la diferencia entre el enrutamiento en cascada y el enrutamiento basado en clasificador?
El enrutamiento basado en clasificador toma la decisión de enrutamiento antes de que la consulta llegue a ningún modelo, usando un clasificador ligero entrenado para predecir la complejidad. El enrutamiento en cascada envía la consulta al modelo barato primero y solo escala si la respuesta no cumple un umbral de confianza. Los clasificadores no añaden latencia de llamada al modelo; las cascadas añaden la latencia de la llamada al modelo barato en cada consulta.
4. ¿El enrutamiento perjudica la calidad de las respuestas?
En tareas donde los modelos pequeños son genuinamente capaces (extracción estructurada, clasificación, resumen, preguntas de sí/no) la pérdida de calidad es insignificante. En razonamiento complejo, generación abierta y tareas de múltiples pasos, enrutar a un modelo más débil sí afectará a la calidad. La clave está en calibrar qué tareas realmente necesitan el modelo de frontera. La mayoría de las cargas de trabajo en producción tienen un porcentaje menor de consultas genuinamente difíciles de lo que los equipos asumen.
5. ¿Qué herramienta de enrutamiento open source debería usar?
RouteLLM para equipos que quieren enrutamiento riguroso y académico con pesos pre-entrenados. LiteLLM para infraestructura de producción que combina enrutamiento con balanceo de carga, fallbacks y gestión de presupuesto en una sola capa proxy. Martian para una opción gestionada y de mantenimiento cero que se adapta a tu tráfico automáticamente.
6. ¿Qué es el enrutamiento semántico?
El enrutamiento semántico embebe la consulta entrante y la compara con un cluster de temas, luego enruta al modelo más adecuado para ese dominio. A diferencia del enrutamiento por complejidad (modelo pequeño vs. grande), el enrutamiento semántico pregunta "¿qué tipo de tarea es esta?" en lugar de "¿qué tan difícil es esta tarea?". Es más útil cuando ejecutas modelos especializados para dominios distintos como código, médico, legal o soporte al cliente.
Artículos relacionados
- Optimización de Tokens de IA: Guía Completa para Reducir los Costes de LLM
- Compresión de Prompts: Reduce los Costes de Tokens Sin Perder Calidad
- Estrategias de Caché para LLM: Caché de Prompts, Caché Semántico y Cuándo Usar Cada Uno
- Reducción de Costes de LLM: 12 Estrategias para Bajar los Costes de Inferencia de IA
- Optimización Ventana de Contexto: 6 Estrategias para LLMs (2026)
Sobre el Autor
Roger Howroyd es Head of Global SEO and AI en NeuralTrust, donde lidera la estrategia de búsqueda de la compañía en SEO, AEO, GEO y optimización para LLMs. Está especializado en búsqueda potenciada por IA, estrategia de contenidos, desarrollo de backlinks y SEM. Conecta en LinkedIn
NeuralTrust es una plataforma de seguridad para agentes de IA, reconocida en la Guía de Mercado de Gartner 2025 para AI Gateways y Guardian Agents, y en la KuppingerCole 2025 Leadership Compass for Generative AI Defense. Con sede en Barcelona y certificación ISO 27001.
)
)