Especiales

¿Cuánto sabe de Chile la IA?

Diez modelos baratos rinden el examen: el mejor saca 82 puntos de 100; el último, 21.

Son los modelos que terminan dentro de un chatbot municipal, una tarea escolar o un piloto de gobierno, y de Chile saben lo poco que alcanzaron a leer sobre Chile. Las 33 preguntas chilenas del benchmark Trueque, de LatamGPT, miden cuánto.

Cargando el índice…

Metodología

Cómo se construyó este índice

Las preguntas

Salen de Trueque beta 0.1, el benchmark de LatamGPT: 500 preguntas sobre América Latina propuestas por personas y curadas a mano, cada una con una respuesta de referencia sustentada en fuentes. Este índice usa las 33 etiquetadas como Chile. No las escribimos nosotros, y eso es deliberado: quien escribe las preguntas decide el resultado.

Los modelos

Diez, de nueve laboratorios distintos, todos por debajo de un dólar por millón de tokens de entrada: GPT-5.6 Luna, Gemini 3.1 Flash Lite, DeepSeek V4 Flash, Mistral Small, Qwen3.7 Flash, Gemma 4 26B, Llama 4 Scout, Nemotron 3 Nano, Phi-4 y Granite 4.1 8B. El criterio es el precio: son los que se eligen cuando el presupuesto manda, y varios son de pesos abiertos, así que una institución puede correrlos en su propia infraestructura. Los modelos de frontera no están en el índice y no se puede suponer que fallen igual.

El protocolo

Cada modelo responde las 33 preguntas una sola vez, a temperatura 0, sin búsqueda web ni herramientas y con el razonamiento apagado: mide lo que sabe de memoria, no su capacidad de investigar. Sin apagarlo, los modelos que piensan antes de responder gastaban el presupuesto de tokens razonando y devolvían respuestas vacías.

El juez

Gemini 3.6 Flash compara cada respuesta contra la referencia y la califica con 1, 0,5 o 0. Devuelve solo ese número: pedirle además una justificación multiplicaba por diez el costo de la evaluación sin cambiar el resultado. No compite en el índice, así que no puede premiarse a sí mismo. Aun así es un juez automático: las 330 respuestas están abiertas en la matriz para que cualquiera revise si el puntaje es justo.