← Volver a Aprende con CDIA

¿Qué es la IA generativa?Temperatura

IntermedioInteligencia Artificial6 min de lectura

Temperatura

El mando que controla cuán creativo o predecible es un LLM: reescala las probabilidades de cada palabra antes de muestrear.

La temperatura es el mando que controla cuán creativo o predecible es un modelo de lenguaje al generar texto. Baja la temperatura y responde de forma segura y repetitiva; súbela y arriesga opciones menos obvias.

Recordemos: el modelo elige palabras por probabilidad

Como vimos en la lección principal, un LLM produce, en cada paso, una probabilidad para cada posible siguiente token. Antes de convertirse en probabilidades, esos puntajes crudos se llaman logits (). La temperatura actúa sobre los logits justo antes de la función softmax:

Todo el efecto está en dividir por .

Qué hace cada régimen

  • : dividir por un número muy pequeño agranda las diferencias entre logits. La palabra más probable domina casi por completo. El modelo se vuelve determinista y conservador (esto es prácticamente el greedy decoding).
  • : se usan las probabilidades tal como el modelo las aprendió, sin distorsión.
  • : las diferencias se aplanan, las opciones improbables ganan chance. El texto es más diverso y creativo... y más propenso a errores o incoherencias.

Un ejemplo intuitivo: si los logits favorecen "gato" sobre "gaviota", con baja saldrá "gato" casi siempre; con alta, "gaviota" empieza a aparecer.

En código

Todo el efecto cabe en unas pocas líneas: dividir los logits por antes de la softmax.

import numpy as np

def softmax_con_temperatura(logits, T):
    z = logits / T
    z -= z.max()          # truco para estabilidad numérica
    e = np.exp(z)
    return e / e.sum()

logits = np.array([2.0, 1.0, 0.1])           # "gato", "perro", "gaviota"
print(softmax_con_temperatura(logits, 0.3))  # T baja: casi todo a "gato"
print(softmax_con_temperatura(logits, 1.5))  # T alta: se reparte más parejo

En una API o en transformers, no programas esto: basta pasar el argumento temperature=0.7.

¿Cuándo usar cuál?

  • Temperatura baja (0.0 – 0.3): respuestas factuales, extracción de datos, código, matemáticas. Quieres precisión y reproducibilidad.
  • Temperatura media (0.5 – 0.8): conversación natural, redacción asistida. Un buen equilibrio.
  • Temperatura alta (0.9 – 1.2+): brainstorming, escritura creativa, generar variantes. Priorizas la diversidad sobre la exactitud.

Cómo se relaciona con top-p y top-k

La temperatura reescala las probabilidades; top-p y top-k (las otras dos lecciones de esta serie) recortan qué candidatos siguen en juego. En la práctica se combinan: primero se ajusta la temperatura, luego se filtra el conjunto de candidatos. Son controles complementarios, no rivales.

Para llevar

La temperatura reparte las probabilidades antes de muestrear: baja para respuestas seguras, alta para respuestas creativas. Es el control más directo del comportamiento de un LLM. Combínalo con top-p y top-k para acotar además cuántas opciones considerar.