LOS TOKENS EN LA INTELIGENCIA ARTIFICIAL: LA UNIDAD BÁSICA DEL LENGUAJE DE LAS MÁQUINAS

Un token es la unidad mínima de texto que un modelo de lenguaje procesa. No necesariamente coincide con una palabra completa. Puede ser:
  • Una palabra entera, como “casa”.
  • Parte de una palabra, como “in”, “creíble”.
  • Un signo de puntuación, como “,” o “!”.
  • Un espacio o un carácter especial.
  • Incluso un fragmento de código o un emoji.
Los modelos no leen el texto como lo hacemos los humanos, palabra por palabra o letra por letra. Primero lo convierten en una secuencia de tokens mediante un proceso llamado tokenización.
Los tokens son, en esencia, el “alfabeto” con el que las inteligencias artificiales leen y escriben. Entender cómo funcionan permite aprovechar mejor los modelos actuales: diseñar mejores prompts, controlar costos y comprender las limitaciones reales de estas tecnologías.
A medida que los modelos evolucionan, las ventanas de contexto crecen y los tokenizadores se optimizan, pero el concepto de token seguirá siendo la pieza central de cómo las máquinas procesan el lenguaje humano.

¿Cómo funciona la tokenización?

La mayoría de los modelos actuales utilizan algoritmos como Byte Pair Encoding, WordPiece o SentencePiece. Estos métodos aprenden, a partir de grandes cantidades de texto, las formas más eficientes de dividir las palabras.

Ejemplos aproximados

  • “Hola” → 1 token.
  • “Inteligencia” → 2 o 3 tokens.
  • “artificial” → 1 o 2 tokens.
  • “¡Hola, mundo!” → varios tokens, incluyendo signos de puntuación.
  • Una palabra muy rara o un nombre propio puede fragmentarse en varios tokens.
Este enfoque permite que el modelo maneje vocabulario prácticamente infinito sin necesidad de tener una entrada separada para cada posible palabra del mundo.

Por qué los tokens son tan importantes

Ventana de contexto

Los modelos tienen un límite máximo de tokens que pueden procesar a la vez, la “ventana de contexto”. Modelos antiguos manejaban 2.000–4.000 tokens. Los actuales llegan a 128.000, 200.000 o incluso más de un millón de tokens. Ese límite incluye tanto el texto de entrada, prompt, como la respuesta generada.

Costo

La mayoría de las APIs de inteligencia artificial cobran por token de entrada y de salida. Por eso, escribir prompts concisos y eficientes no solo mejora los resultados, sino que también reduce el gasto.

Rendimiento y latencia

Cuantos más tokens tenga que procesar el modelo, más tiempo y recursos computacionales necesita. Un prompt muy largo puede hacer que la respuesta sea más lenta o más cara.

Calidad de la comprensión

La forma en que se tokeniza el texto influye en cómo el modelo “entiende” el lenguaje. Idiomas con morfología compleja (como el español o el alemán) a veces se fragmentan más que el inglés, lo que puede afectar ligeramente el rendimiento.

Tokens de entrada vs. tokens de salida

  • Tokens de entrada (input): todo lo que le envías al modelo, como instrucciones, contexto, ejemplos, historial de conversación.
  • Tokens de salida (output): la respuesta que genera el modelo.
Muchas plataformas muestran el consumo de tokens en tiempo real para que el usuario tenga control.

Consejos prácticos para trabajar con tokens

  • Ser conciso cuando sea posible. Menos tokens de entrada suelen traducirse en respuestas más rápidas y baratas.
  • Usar herramientas de conteo de tokens (muchas plataformas y librerías las ofrecen) antes de enviar prompts largos.
  • Tener en cuenta que el historial de conversación también consume tokens. En chats largos es fácil alcanzar el límite de contexto.
  • En tareas técnicas, como código, datos estructurados, a veces conviene usar formatos más compactos para reducir el número de tokens.