← Volver a Aprende con CDIA
BásicoInteligencia Artificial10 min de lectura

¿Qué es la IA generativa?

Los modelos que crean contenido nuevo en vez de clasificarlo: difusión, GAN y —la rama de esta serie— los grandes modelos de lenguaje, máquinas de predecir la siguiente palabra construidas sobre la atención del Transformer.

La IA generativa es la familia de modelos que no clasifican ni predicen un número: producen contenido nuevo. Texto, imágenes, audio, video, código, estructuras moleculares. Todos comparten la misma receta: aprenden la distribución de probabilidad de un tipo de dato y luego muestrean de ella para crear ejemplares que nunca existieron.

Eso la separa de todo lo que vimos en las series anteriores. Una regresión logística responde "¿esto es A o B?". Un modelo generativo responde "dame algo que podría pertenecer a este mundo".

Una familia con varias ramas

Según el tipo de dato y la forma de muestrear, la IA generativa se organiza en unas pocas familias:

FamiliaQué generaIdea central
Modelos de lenguaje (LLM)Texto y códigoPredecir el siguiente token, uno a uno
DifusiónImagen, audio, videoPartir de ruido y limpiarlo paso a paso
GANImagenUn generador y un crítico compitiendo
Autoencoders variacionalesDatos comprimidosCodificar a un espacio latente y decodificar

Esta serie se concentra en la primera rama, los grandes modelos de lenguaje, por una razón práctica: son la que hoy sostiene los asistentes, los buscadores conversacionales, los copilotos de programación y los agentes. Todo lo que verás aquí —tokens, atención, temperatura, contexto, herramientas— sale de ella.

Los modelos de lenguaje: todo se reduce a predecir lo que sigue

Un Large Language Model (LLM, o "gran modelo de lenguaje") es un modelo generativo entrenado con enormes cantidades de texto para hacer una tarea aparentemente simple: predecir la siguiente palabra. De esa habilidad básica, repetida a gran escala, emergen la conversación, la traducción, la programación y el razonamiento.

En el corazón de un LLM hay una pregunta: dado el texto hasta ahora, ¿qué palabra viene después? Formalmente, el modelo estima la probabilidad de una palabra dadas todas las anteriores:

La probabilidad de una frase completa es el producto de estas predicciones, una por una:

Generar texto consiste en muestrear repetidamente la siguiente palabra y volver a alimentarla al modelo. A esto se le llama generación autorregresiva.

Tokens: las piezas del lenguaje

Los modelos no trabajan con palabras exactas, sino con tokens: fragmentos de texto (una palabra, parte de una palabra o un signo). Por ejemplo, "inteligencia" podría dividirse en intel + igencia. Cada token se convierte en un vector de números llamado embedding, que captura su significado en un espacio de muchas dimensiones, donde palabras relacionadas quedan cerca entre sí.

El motor: la arquitectura Transformer

Desde 2017, casi todos los LLM se basan en el Transformer. Su ingrediente estrella es el mecanismo de atención, que permite a cada palabra "mirar" a todas las demás de la frase y decidir cuáles son relevantes para entender el contexto. Es la pieza que resuelve, por ejemplo, que al leer "banco" en "me senté en el banco del parque" el modelo preste más atención a "parque" que a "dinero".

Le dedicamos dos lecciones completas en esta serie —una a la atención en detalle y otra al Transformer que la apila muchas veces—, así que aquí basta con quedarnos con la idea: el modelo entiende el contexto dejando que cada token pondere la relevancia de todos los demás.

¿Qué significa "Large"?

Lo de Large es literal. Estos modelos tienen miles de millones de parámetros —los números ajustables, como los de una regresión, pero a escala astronómica. Su entrenamiento minimiza una función de pérdida llamada entropía cruzada, que mide qué tan sorprendido queda el modelo ante la palabra correcta:

Una métrica relacionada es la perplejidad, que se interpreta como "entre cuántas palabras, en promedio, duda el modelo":

Menor perplejidad significa un modelo más seguro y, normalmente, más capaz.

De predecir texto a ser útil: el ajuste

Un modelo recién entrenado solo sabe continuar texto. Para que siga instrucciones y resulte útil y seguro, se aplican fases adicionales:

  1. Preentrenamiento: aprende lenguaje general leyendo enormes corpus de texto.
  2. Ajuste por instrucciones (instruction tuning): aprende a responder peticiones a partir de ejemplos.
  3. Aprendizaje por refuerzo con retroalimentación humana (RLHF): se afina según las preferencias de evaluadores humanos.

La "temperatura" al generar

Al producir texto, un parámetro llamado temperatura () controla cuán creativo o predecible es el modelo. Modifica las probabilidades antes del muestreo:

Con baja (cercana a ) el modelo elige casi siempre la palabra más probable y se vuelve conservador; con alta explora opciones menos obvias y resulta más creativo... pero también más propenso a equivocarse.

Límites que conviene tener presentes

  • Alucinaciones: pueden generar información falsa con total seguridad, porque optimizan plausibilidad, no veracidad.
  • Ventana de contexto: solo "recuerdan" una cantidad limitada de tokens a la vez.
  • Sesgos: reflejan los sesgos presentes en los datos con que fueron entrenados.

En código

Con la librería transformers de Hugging Face se puede generar texto con un modelo abierto en pocas líneas. Fíjate en la generación autorregresiva (max_new_tokens) y en la temperatura:

from transformers import pipeline

generador = pipeline("text-generation", model="gpt2")

salida = generador(
    "La inteligencia artificial sirve para",
    max_new_tokens=20,   # cuántos tokens nuevos generar, uno tras otro
    do_sample=True,      # muestrear en vez de elegir siempre el más probable
    temperature=0.7,     # cuán creativo (ver la lección de Temperatura)
)
print(salida[0]["generated_text"])

Los parámetros temperature, top_p y top_k que verás en las próximas lecciones aparecen aquí como argumentos: son los mandos con que gobiernas la generación.

Lo que viene en esta serie

La serie sigue el camino natural: primero las piezas internas —tokenización, embeddings, atención, Transformer—, después los mandos de la generación —temperatura, top-p, top-k—, y finalmente el oficio de construir sistemas con estos modelos: prompts, RAG, agentes, ingeniería de contexto, el bucle y el harness que lo sostiene.

Para llevar

La IA generativa agrupa a los modelos que crean contenido nuevo muestreando de una distribución aprendida: difusión para imagen, GAN, autoencoders variacionales y —la rama de esta serie— los modelos de lenguaje. Un LLM es, en esencia, una gigantesca máquina de predecir la siguiente palabra, construida sobre el mecanismo de atención del Transformer. Su aparente inteligencia surge de la escala: miles de millones de parámetros entrenados sobre cantidades inmensas de texto. Entender esta base ayuda a usarlos con criterio, aprovechando su potencia y reconociendo sus límites.