← Volver a Aprende con CDIA

¿Qué es la IA generativa?Tokenización

BásicoInteligencia Artificial7 min de lectura

Tokenización

El primer paso invisible de todo modelo de lenguaje: partir el texto en tokens y convertirlos en números. Explica el costo por token, los límites de contexto y varios errores célebres.

Un modelo de lenguaje no ve letras ni palabras. Ve números. Antes de que el texto entre al modelo, hay un paso silencioso que lo parte en piezas y le asigna a cada una un número: la tokenización. Es tan básico que casi nunca se menciona, pero explica cosas que a todos nos han sorprendido alguna vez —por qué un modelo cuenta mal las letras de una palabra, por qué cobran "por token", o por qué a veces trastabilla con nombres raros—.

¿Qué es un token?

Un token es la unidad mínima que el modelo procesa. Lo intuitivo sería "un token = una palabra", pero no es así. Los modelos modernos usan subpalabras: los términos comunes son un solo token, y los raros se parten en pedazos.

Por ejemplo, con un tokenizador típico:

  • "gato" → 1 token
  • "tokenización"token + ización → 2 tokens
  • "antidisestablishmentarianism" → 5 o 6 tokens

Una regla de bolsillo para el español: un token equivale más o menos a ¾ de una palabra, o unos 4 caracteres. Un párrafo de 100 palabras ronda los 130–150 tokens.

¿Por qué subpalabras y no palabras?

Porque un idioma tiene infinitas palabras posibles (nombres propios, errores de tipeo, términos nuevos, "supercalifragilístico"), pero un modelo necesita un vocabulario fijo y finito —típicamente entre 30.000 y 100.000 tokens—. Las subpalabras resuelven la tensión:

  • Las palabras frecuentes entran enteras (eficiente).
  • Cualquier palabra jamás vista se puede reconstruir juntando piezas conocidas. El modelo nunca se topa con un "no sé qué es esto": en el peor caso, la deletrea con fragmentos.

El algoritmo más usado para armar ese vocabulario se llama BPE (Byte-Pair Encoding): parte de caracteres sueltos y, mirando millones de textos, va fusionando los pares que más se repiten, hasta llegar al tamaño de vocabulario deseado. Los pares comunes ("es", "ción", "ing") terminan siendo un solo token; los raros quedan en pedazos.

"el gato duerme" elgatoduerme 318964251120
Texto → tokens → identificadores numéricos. Recién esos números entran al modelo (y se convierten en vectores).

Del token al vector

El identificador (9642 para "gato") es solo un índice, no tiene significado por sí mismo. Su siguiente parada es la tabla de embeddings: cada id se cambia por un vector que captura significado. La cadena completa es:

texto → tokens → ids → embeddings → modelo

La tokenización es solo el primer eslabón, pero condiciona todo lo demás.

Por qué esto te afecta en la práctica

  • El costo y los límites se miden en tokens. Las APIs cobran por token y la "ventana de contexto" (cuánto texto cabe) se mide en tokens, no en palabras. El español suele gastar más tokens que el inglés para decir lo mismo.
  • Explica errores raros. Cuando un modelo se equivoca al contar las letras de "fresa" o al invertir una palabra, muchas veces es porque nunca vio letras: vio el token fresa como una pieza indivisible.
  • El idioma importa. Un texto en un idioma poco representado en el entrenamiento se parte en más tokens (más caro, más lento), porque su vocabulario está optimizado para lo que más abundaba en los datos.

La próxima vez que un modelo haga algo extraño con una palabra, pregúntate primero: ¿cómo la habrá tokenizado? Muchas veces, la respuesta está ahí.