Los modelos de IA fallan al recordar, no al almacenar: un estudio de Google revela cómo recuperar hechos 'olvidados
Un estudio de Google Research y Technion muestra que los LLMs de frontera codifican el 95-98% de los hechos, pero fallan al recordarlos. Pensar más tiempo recupera hasta el 65%.

Cuando un modelo de lenguaje alucina, lo normal es pensar que no tiene el dato. Los equipos de ingeniería asumen que falta conocimiento y responden con más parámetros, más datos o arquitecturas de recuperación. Un estudio de Google Research y el Technion sugiere que muchas veces el problema no es que el modelo no sepa, sino que no consigue acceder a lo que ya tiene guardado.
Los experimentos, realizados con modelos como GPT-5 y Gemini-3, muestran que estos codifican entre el 95% y el 98% de los hechos probados. Pero fallan al recordar directamente entre el 26% y el 34% de esos hechos. Si se les da tiempo para pensar, recuperan entre el 40% y el 65% de lo que habían 'olvidado'. Los investigadores comparan este fenómeno con la sensación de tener una palabra en la punta de la lengua: el conocimiento está, pero hace falta esfuerzo para sacarlo.
Del almacén a la estantería: cinco perfiles de conocimiento
El estudio propone algo que suena sencillo pero cambia el diagnóstico: en lugar de medir si el modelo acierta una pregunta, hay que comprobar si el hecho está codificado en sus parámetros (puede reproducir el texto original) o si realmente lo conoce (responde a preguntas desde distintos ángulos). Distinguen cinco perfiles, desde el recuerdo directo hasta el fallo de codificación, pasando por el fallo de recuerdo, el recuerdo con razonamiento y la inferencia sin codificación.
Un ejemplo concreto: el hecho de que Oasis tocó su primer concierto en el club Boardwalk. El modelo puede completar la frase de Wikipedia sin problema (está codificado), pero falla si le preguntas '¿dónde tocó Oasis su primer concierto?' Ahí está el fallo de recuerdo. Si le das tiempo para razonar, puede llegar a la respuesta. O puede deducirla combinando otros datos, como que Oasis se formó en Mánchester y que el Boardwalk era un club famoso de los 90.
Escalar no siempre es la solución
Los investigadores evaluaron 13 modelos con más de 4 millones de respuestas, usando un benchmark llamado WikiProfile con 2.150 hechos de Wikipedia. Y encontraron algo que contradice la intuición habitual: agrandar el modelo no arregla el problema de recuerdo. Al escalar Gemma3 de 1.000 a 27.000 millones de parámetros, los fallos de codificación bajaron del 85% al 23%, pero los de recuerdo aumentaron hasta el 40% sin dejar tiempo de razonamiento. Es decir, más capacidad de almacenamiento significa más hechos atrapados en un estado 'codificado pero inaccesible'.
Nitay Calderon, investigador de Google, lo explica claro: "Cuando los hechos salen mal, la reacción típica es escalar, entrenar un modelo más grande o añadir datos. Ambos son caros, y si los hechos ya están codificados, ninguno ayuda".
Qué implica para los desarrolladores
El estudio sugiere que muchas veces se usa RAG (recuperación aumentada) para resolver alucinaciones que el modelo ya podría responder de memoria. Calderon advierte: "Mucho de lo que los equipos resuelven con RAG son hechos que el modelo ya puede responder de memoria, así que pagas latencia y coste por nada". RAG tiene sentido para datos frescos o internos, pero no como parche universal.
También recomiendan usar el razonamiento con moderación: solo entre el 10% y el 20% de los hechos realmente necesitan pensar. Y como los modelos no son buenos detectando cuándo van a fallar, conviene usar pipelines de generar y verificar, o reformular las preguntas para facilitar el recuerdo.
El benchmark WikiProfile está disponible en Hugging Face, y cuesta unos 500 dólares evaluar un modelo completo. Se puede abaratar omitiendo variantes de opción múltiple.
La gran pregunta es si esto se traslada a dominios especializados. En Wikipedia, el problema es sobre todo de recuerdo; pero en datos internos de una empresa, quizá los hechos ni siquiera estén codificados. Aun así, para Calderon, esto nivela el campo: "La mayoría de las empresas no construyen modelos desde cero, y las palancas que importan ahora no son las de pre-entrenamiento, sino las de post-entrenamiento y las herramientas de inferencia que ya usan".
##Relacionado

Dyson lanza un cepillo dental de 500 dólares con cámara y chorro de agua
La firma de aspiradoras presenta el CameraJet: un cepillo eléctrico con cámara endoscópica y un chorro de líquido que promete eliminar la placa sin hilo dental.

Google corteja a los estudios de Hollywood con millones por sus archivos
Google quiere licenciar los catálogos de Disney, Warner y Universal para entrenar sus modelos de IA, y está dispuesto a pagar cientos de millones.

Slack renueva Slackbot con seis funciones nuevas
Slack ha anunciado seis novedades para Slackbot, incluyendo un modo de pantalla completa y búsqueda profunda.