¿Qué es el control de longitud de salida en LLMs?
El control de longitud de salida es la práctica de limitar cuántos tokens genera un LLM por respuesta, usando instrucciones en el system prompt, formatos estructurados, stop sequences, ejemplos few-shot y el parámetro max_tokens. Reduce directamente el coste de los tokens de salida (entre 2 y 6 veces más caros que los de entrada) sin degradar la calidad de las respuestas cuando se aplica correctamente.
TL;DR - Puntos clave
- Los LLMs generan por defecto respuestas más largas de lo necesario porque el entrenamiento con RLHF premia las respuestas más largas, no las mejores
- El benchmark YapBench (2026, 76 modelos analizados) muestra que los modelos más verbosos producen respuestas entre 10 y 20 veces más largas de lo necesario para tareas sencillas
- Los tokens de salida cuestan entre 2 y 6 veces más que los de entrada en todos los proveedores principales, los pipelines verbosos queman dinero rápido
- Cinco controles evitan la sobreproducción: instrucciones explícitas de longitud, formatos de salida estructurados, calibración few-shot, stop sequences y límites con max_tokens
- Combinar una instrucción de longitud en el system prompt con max_tokens como red de seguridad reduce la salida entre un 40% y un 74% sin pérdida de calidad en la mayoría de tareas
- NeuralTrust TrustGate aplica políticas de longitud de salida a nivel de gateway, automáticamente, en todos los modelos y equipos
Tu LLM está escribiendo tres párrafos para decir sí. Eso no es inteligencia. Es un artefacto del entrenamiento y te está costando dinero real. Esta guía cubre cinco controles que reducen la longitud de salida entre un 40% y un 74% sin tocar la calidad de las respuestas.
)
Tu modelo habla demasiado. Aquí tienes el motivo.
Imagina esto. Le pides a un LLM que clasifique un ticket de soporte como facturación, técnico o general. Te responde: "Gracias por proporcionar este contexto. Basándome en mi análisis del mensaje, que describe un problema relacionado con los cargos de la cuenta..." y luego 200 palabras más antes de que finalmente diga "facturación."
La respuesta era una palabra. Has pagado 250 tokens.
Esto no es un defecto puntual. Es predecible. La investigación demuestra que los modelos de recompensa entrenados con RLHF presentan un sesgo sistemático hacia la longitud, al asociar la verbosidad con la calidad porque los anotadores humanos, durante la recopilación de feedback, prefirieron respuestas más largas el 63% de las veces en los conjuntos de datos de referencia. El modelo aprendió: más largo equivale a mejor.
El benchmark YapBench midió la sobreproducción en 76 modelos y encontró que los más verbosos producen respuestas entre 10 y 20 veces más largas de lo necesario para tareas con respuestas idealmente breves. Los modelos más recientes generan respuestas más largas que los anteriores. El problema empeora.
Cada token extra es un evento de facturación.
)
Lo que realmente cuesta
Los tokens de salida no tienen el mismo precio que los de entrada. Los tokens de salida cuestan entre 2 y 6 veces más que los de entrada en todos los proveedores principales, porque la generación ocurre de forma secuencial (token a token) mientras que la lectura de tu entrada se realiza en un único paso en paralelo.
Cálculo rápido: Claude Sonnet 4.6 cobra 3 dólares por millón de tokens de entrada y 15 dólares por millón de tokens de salida. Es una diferencia de 5 veces. Si ejecutas un pipeline de clasificación de alto volumen con un modelo sin restricciones y tu respuesta media es de 400 tokens cuando debería ser de 50, estás pagando 8 veces más en salida de lo necesario. A escala, eso no es un error de redondeo.
La guía de optimización de tokens de IA cubre el modelo de costes completo. El control de longitud de salida es la palanca más rápida una vez que tienes la monitorización de uso de tokens en marcha y puedes ver tu ratio de salida frente a entrada.
Cinco formas de frenar la sobreproducción
1. Restricciones de longitud explícitas en el system prompt
Es lo primero que debes probar, y funciona mejor de lo que espera la mayoría de los ingenieros.
Añade una instrucción de longitud directa en tu system prompt. No vaga, del tipo "sé conciso", los modelos interpretan eso de forma diferente cada vez. Específica:
- "Responde en 2 frases o menos."
- "Tu respuesta debe tener menos de 50 palabras."
- "Devuelve únicamente la etiqueta de clasificación. Sin explicaciones."
Las instrucciones de longitud específicas a nivel de prompt reducen los tokens de salida entre un 40% y un 60% en tareas estándar. En modelos verbosos, una indicación de longitud explícita reduce la salida entre un 74% y un 86%.
El detalle que importa: "sé breve" y "sé conciso" sin un objetivo concreto se tratan como sugerencias suaves. Los números funcionan. Las etiquetas funcionan. "Sin explicación" funciona. Los adjetivos vagos, no.
La guía de compresión de prompts cubre cómo reducir el lado de entrada. Las restricciones de longitud en la salida son la imagen especular de ese trabajo.
2. Formatos de salida estructurados
La prosa es cara. Un modelo al que se le pregunta "¿es urgente este ticket?" en modo texto libre podría escribir 150 palabras. Si se le pide devolver JSON con un único campo, devuelve {"urgente": true} (6 tokens).
Los formatos de salida estructurados como JSON reducen significativamente la verbosidad en comparación con el texto libre. Benchmarks recientes muestran un 40% menos de tokens en respuestas tabulares estructuradas respecto a equivalentes en prosa.
Usa salida estructurada cuando:
- Haces clasificación, enrutamiento o extracción
- El sistema receptor parsea la respuesta de todos modos
- Necesitas salida determinista y parseable
Un compromiso a tener en cuenta: forzar salida JSON puede reducir la calidad del razonamiento entre un 10% y un 15% en tareas complejas. Para clasificación y extracción, eso es irrelevante. Para razonamiento en varios pasos, mantén la prosa y aplica restricciones de longitud en su lugar.
3. Calibración few-shot de longitud
Puedes moldear la longitud de salida de un modelo mediante ejemplos, sin necesidad de reentrenarlo.
Incluye dos o tres ejemplos en tu prompt donde cada respuesta sea del tamaño que quieres. Si todos los ejemplos tienen dos frases, el modelo lo imita. El prompting few-shot elicita de forma fiable generaciones más concisas en todos los modelos, y el condicionamiento con 8 ejemplos reduce la longitud de salida significativamente frente al prompting sin ejemplos (zero-shot).
El principio: muestra, no solo dices. Tu instrucción de longitud le indica al modelo qué lograr. Los ejemplos few-shot le muestran cómo es eso en la práctica. Ambos juntos son mucho más efectivos que cualquiera por separado.
Esto encaja de forma natural con la guía de optimización del contexto, los ejemplos few-shot concisos reducen la carga del contexto al tiempo que calibran la longitud de salida.
4. Stop sequences
Las stop sequences le indican a la API que detenga la generación en el momento en que aparezca una cadena específica. Control basado en patrones, más quirúrgico que max_tokens.
OpenAI admite hasta 4 stop sequences. La Messages API de Anthropic admite hasta 16. Usos habituales:
- Si generas XML, para en
</output>para que el modelo no pueda añadir comentarios tras cerrar la etiqueta - En sistemas de diálogo, para en
"Usuario:"para que el modelo no alucine el siguiente turno - Para tareas de respuesta única, para en
\n\npara que el modelo no pueda añadir un segundo párrafo de relleno
Las stop sequences son especialmente eficaces en salidas estructuradas: las etiquetas de cierre y los delimitadores dan al modelo un punto de finalización natural. También interactúan bien con el caché: la guía de estrategias de caché para LLMs explica cómo los puntos de parada limpios mejoran las tasas de acierto del caché de prompts.
5. Disciplina con max_tokens
La mayoría de los sistemas en producción no establecen max_tokens o lo fijan en 4096 "por si acaso." Ambas opciones son caras.
max_tokens es un límite absoluto. El modelo factura por cada token generado hasta ese límite. Si tu salida esperada es de 150 tokens y tu techo es 4096, estás invitando a un derroche potencial de 3946 tokens en cada llamada.
Valores predeterminados por tipo de tarea que funcionan en producción:
- Clasificación, enrutamiento, sí/no: 10-50 tokens
- Respuestas de un párrafo: 200-400 tokens
- Respuestas de chat: 512-1024 tokens
- Generación de contenido largo: 2048-4096 tokens
Establece max_tokens según el tipo de tarea, no según el máximo del modelo. Y combínalo con una instrucción de longitud en el system prompt: la instrucción le dice al modelo qué objetivo alcanzar, y max_tokens es la red de seguridad si se pasa.
)
Calidad frente a longitud: cuándo tener cuidado
El control de longitud no es gratuito. Tres situaciones en las que una salida más corta supone realmente una peor salida:
Razonamiento en varios pasos. Si el modelo necesita pasos intermedios para obtener la respuesta correcta, reducir la longitud total de salida elimina el razonamiento. Aplica las restricciones de longitud solo al campo de respuesta final, no a toda la cadena de pensamiento.
Consultas ambiguas de usuarios. Las preguntas abiertas a menudo necesitan una respuesta clarificadora, no una sola frase. Aplica restricciones de longitud a los campos estructurados y deja que los turnos conversacionales sean más largos.
Contenido regulado. Una respuesta que omita un aviso legal requerido por un límite de 50 palabras puede ser incompleta en un sector regulado. Conoce tu tarea antes de aplicar restricciones.
Para todo lo demás: la mayoría de las tareas LLM empresariales no necesitan 400 tokens. Necesitan 40.
Los cinco controles de un vistazo
| Técnica | Esfuerzo de implementación | Reducción de tokens | Riesgo de calidad | Más adecuado para |
|---|---|---|---|---|
| Instrucción de longitud en system prompt | Bajo | 40-74% | Bajo | Todos los tipos de tarea |
| Salida estructurada (JSON/YAML) | Bajo-Medio | 40%+ | Bajo-Medio (tareas complejas) | Clasificación, extracción |
| Calibración few-shot | Medio | Variable | Bajo | Formatos de salida personalizados |
| Stop sequences | Bajo | Variable | Bajo | Estructurado, diálogo |
| Límite max_tokens | Muy bajo | Red de seguridad | Medio (riesgo de truncado) | Todos los tipos de tarea |
Aplicación a nivel de gateway
Aplicar estos controles a nivel de aplicación funciona. Pero crea un problema nuevo: cada equipo tiene que acordarse de hacerlo, y cada nueva funcionalidad LLM comienza desde cero.
La configuración más limpia es la aplicación a nivel de gateway. NeuralTrust TrustGate aplica políticas de longitud de salida a nivel de infraestructura: estableciendo topes de max_tokens por tipo de ruta, requisitos de salida estructurada por consumidor y registrando el recuento de tokens de salida por funcionalidad de forma automática. Cada solicitud pasa por esas políticas. Sin configuración por equipo requerida.
La guía de enrutamiento de modelos LLM cubre el enrutamiento como complemento al control de longitud: envía las consultas más simples a modelos más baratos y deja que las restricciones de longitud actúen en el lado de la salida. La guía de reducción de costes LLM sitúa el control de longitud de salida en el contexto de caché, enrutamiento y compresión como parte de una estrategia de costes completa.
Preguntas frecuentes acerca de la longitud de salida de los LLMs
1. ¿Cómo reduzco la longitud de salida de un LLM?
Combina cinco controles: añade una instrucción de longitud explícita en tu system prompt ("responde en dos frases o menos"), cambia a formatos de salida estructurados como JSON para tareas que no necesiten prosa, incluye ejemplos few-shot con respuestas del tamaño correcto, establece una stop sequence que finalice la generación en un punto natural, y limita max_tokens a un tope apropiado para la tarea. Juntos, reducen la salida entre un 40% y un 74% sin pérdida de calidad en la mayoría de tareas.
2. ¿Qué es el parámetro max_tokens?
max_tokens es un parámetro de API que establece un techo absoluto en el número de tokens que el modelo genera por respuesta. La generación se detiene al alcanzar ese límite, aunque sea en mitad de una frase. Es una red de seguridad, establécelo por tipo de tarea (10-50 para clasificación, 200-400 para resúmenes cortos, 512-1024 para chat) en combinación con instrucciones a nivel de prompt.
3. ¿Qué son las stop sequences en LLMs?
Las stop sequences son cadenas que defines en la llamada a la API. Cuando la salida generada por el modelo coincide con una stop sequence, la generación termina de inmediato. OpenAI admite hasta 4 stop sequences. Anthropic admite hasta 16. Patrones útiles: etiquetas XML de cierre, doble salto de línea y cadenas marcadoras como "Usuario:" que señalan el inicio de un nuevo turno conversacional.
4. ¿Forzar salida JSON reduce la calidad?
En tareas de razonamiento complejo, sí: las restricciones de formato estructurado pueden reducir la calidad del razonamiento entre un 10% y un 15% porque el modelo tiene menos libertad para trabajar los pasos intermedios. En tareas de extracción, clasificación y enrutamiento, el impacto en la calidad es insignificante y el ahorro de tokens es sustancial. Adapta la restricción de formato al tipo de tarea.
5. ¿Puedo aplicar políticas de longitud de salida en todos los modelos de forma automática?
Sí, a nivel de gateway. NeuralTrust TrustGate aplica topes de max_tokens, requisitos de salida estructurada y monitorización de tokens de salida en todas las rutas y todos los equipos, de forma automática y sin implementación por funcionalidad. Consulta la página de producto TrustGate para ver cómo funciona la aplicación a nivel de gateway.
Artículos relacionados
- Optimización de Tokens de IA: Guía Completa para Reducir los Costes de LLM
- Compresión de Prompts: Reduce los Costes de Tokens Sin Perder Calidad
- Estrategias de Caché para LLM: Caché de Prompts, Caché Semántico y Cuándo Usar Cada Uno
- Reducción de Costes de LLM: 12 Estrategias para Bajar los Costes de Inferencia de IA
- Optimización Ventana de Contexto: 6 Estrategias para LLMs (2026)
- Enrutamiento de Modelos LLM: Envía Consultas al Modelo Correcto Automáticamente
- Token Usage Monitoring: Track, Attribute, and Optimise AI Spend
Acerca del autor
Roger Howroyd es Head of Global SEO and AI en NeuralTrust, donde lidera la estrategia de búsqueda de la empresa en SEO, AEO, GEO y optimización para LLMs. Especializado en búsqueda potenciada por IA, estrategia de contenidos, desarrollo de enlaces y SEM. Conecta en LinkedIn.
NeuralTrust es una plataforma de seguridad para agentes de IA, reconocida en la Guía de Mercado de Gartner 2025 para AI Gateways y Guardian Agents, el Gartner Hype Cycle for Application Security 2026 y el KuppingerCole Leadership Compass 2025 para Generative AI Defense. Certificada ISO 27001. Sede central en Barcelona.
)
)