Antes de entrenar un solo modelo, hay una pregunta que casi nadie se hace en voz alta: ¿dónde viven los datos y cómo están ordenados? Suena aburrido comparado con las redes neuronales, lo sé. Pero la mayoría de los proyectos de datos no fracasan por elegir mal el algoritmo, sino porque los datos estaban desperdigados, mal guardados o eran imposibles de consultar a tiempo.
Esta serie va sobre esa capa de abajo, la que sostiene todo lo demás. La que rara vez sale en los cursos brillantes de IA pero que separa un experimento de laboratorio de algo que funciona en producción.
Dos ideas que se confunden todo el tiempo
Hay dos conceptos que conviene separar desde el principio, porque suenan parecido y no lo son:
- Una estructura de datos es la forma en que organizamos la información en memoria mientras un programa corre: una lista, un diccionario, un árbol. Vive en la RAM, dura lo que dura el proceso y se elige buscando velocidad.
- Una base de datos es donde la información sobrevive cuando el programa se apaga: en disco, ordenada para que muchos la consulten a la vez, sin perderse ni corromperse.
Una es el taller donde trabajas; la otra, la bodega donde guardas lo terminado. Un buen ingeniero de datos se mueve entre ambas sin pensarlo.
Por qué esto le importa a alguien de IA
Podrías decir: "yo hago modelos, no soy DBA". Y sin embargo:
- Un
JOINmal escrito puede tardar horas donde uno bien pensado tarda segundos. Eso es la diferencia entre iterar diez veces al día o una. - Elegir la estructura correcta —un hash map en vez de recorrer una lista— puede convertir un algoritmo inservible en uno instantáneo.
- Y cuando llegamos a los sistemas modernos de IA, resulta que las bases de datos vectoriales son el corazón de la búsqueda semántica y de todo lo que hoy llamamos RAG. El puente entre "guardar datos" y "razonar sobre ellos" ya está tendido.
El recorrido
- Estructuras de datos — arrays, listas, diccionarios, árboles y grafos. Cómo elegir la caja correcta y por qué la velocidad depende de esa elección.
- Bases de datos relacionales — tablas, claves y el arte de no repetir información. El modelo que lleva medio siglo ganando.
- SQL en la práctica — el idioma con el que le preguntamos cosas a los datos.
SELECT,JOIN,GROUP BYcon ejemplos que puedes copiar. - Bases de datos vectoriales — dónde guardamos los embeddings y cómo buscamos por significado en lugar de por texto exacto. El eslabón que conecta esta serie con la IA moderna.
En resumen
Los datos primero tienen que existir en algún lugar y estar ordenados de una forma que puedas consultar. Las estructuras de datos resuelven esto mientras el programa corre; las bases de datos, cuando ya no corre. Dominar esta capa no es glamoroso, pero es lo que hace que todo lo de arriba —el procesamiento, los modelos, los LLM— sea posible en el mundo real y no solo en un notebook.
