Cómo ahorrar tokens en llm: guía práctica de un experto en ia
Ahorrar tokens no es solo una cuestión de “ser más barato” sino que también mejora la velocidad de respuesta, reduce el riesgo de alcanzar el límite de contexto y suele producir respuestas más claras y enfocadas.Ser radicalmente conciso en el prompt
La regla de oro es que cada token que se envía cuenta.- Eliminar saludos, cortesía innecesaria y frases de relleno, como “Por favor, sé tan amable de…”, “Me gustaría que me ayudaras con…”.
- Ir directo al grano. En lugar de:“Hola, espero que estés bien. Quería pedirte que me expliques de forma detallada y paso a paso cómo funciona el algoritmo de backpropagation en redes neuronales, incluyendo ejemplos matemáticos…”. es mejor escribir:“Explica backpropagation con fórmulas y un ejemplo numérico simple.”
Usa instrucciones claras y estructuradas
Los modelos responden mejor cuando les das formato:- Usar listas numeradas o viñetas.
- Especificar el formato de salida deseado: “Responde en máximo 150 palabras”, “Solo lista de puntos”, “JSON sin texto adicional”. Indica el nivel de detalle: “Explicación para principiantes, 3 párrafos máximo”.
Ejemplo efectivo
Resume el siguiente texto en 5 puntos clave. Máximo 80 palabras. [texto]
Eliminar contexto innecesario
- No pegar documentos enteros si solo se necesita una parte. Resumir primero o pedir al modelo que resuma por secciones.
- En conversaciones largas, resumir el historial periódicamente en lugar de reenviar todo el chat.
- Evitar pegar código completo cuando solo se necesita analizar una función.
Técnicas de prompting eficientes
- "Few-shot" selectivo: en lugar de 5 ejemplos largos, usa 1-2 ejemplos cortos y bien elegidos.
- "Chain-of-Thought" comprimido: en vez de “Piensa paso a paso de forma muy detallada”, usar “Razona brevemente y da la respuesta final”.
- "Role + objetivo": “Eres un experto en X. Responde de forma concisa y técnica.”
Controlar la longitud de la respuesta
La mayoría de APIs permiten el parámetro max_tokens. Usarlo siempre que puedas. También se puede instruir al modelo:
- “Responde en menos de 100 tokens”
- “Solo la respuesta final, sin explicación”
- “Usa lenguaje telegráfico”
Técnicas más avanzadas (para uso intensivo)
- Caching de prompts: sistemas como Anthropic, OpenAI y otros permiten cachear el system prompt o el contexto fijo. El coste de los tokens cacheados es mucho menor.
- Modelos más pequeños o especializados: no uses GPT-4o / Claude 3.5 Sonnet para tareas simples. Modelos más baratos (GPT-4o-mini, Claude Haiku, Gemini Flash, Grok más ligero, etc.) consumen menos y suelen ser suficientes.
- Compresión de contexto: herramientas o técnicas de summarization automática del historial de conversación.
- Tokenización eficiente: en algunos idiomas (especialmente español) ciertas formas de escribir generan más tokens. Experimenta con abreviaturas o estructuras más cortas cuando sea apropiado.
Resumen de las mejores prácticas
- Eliminar cortesía y relleno.
- Ser directo y específico.
- Limitar la longitud de la respuesta.
- Resumir en lugar de pegar textos largos.
- Usar el modelo más pequeño que cumpla el trabajo.
- Aprovechar el prompt caching cuando esté disponible.
- Medir siempre, contar tokens antes de enviar prompts largos.
Aplicando estas técnicas de forma disciplinada es habitual reducir el consumo de tokens entre un 40 % y un 70 % sin perder calidad de respuesta, e incluso mejorándola, porque el modelo se enfoca mejor.
Resume el siguiente texto en 5 puntos clave. Máximo 80 palabras. [texto]