La IA falla en acertijos que los humanos resuelven con facilidad
Un repaso a siete pruebas muestra que los modelos de IA aún tienen lagunas en razonamiento espacial, memoria y lógica, pese a mejorar en otras áreas.

Los puzzles y juegos han sido parte del desarrollo de la IA desde sus inicios. Arthur Samuel popularizó el término "machine learning" en 1959 con un algoritmo que aprendía a jugar a las damas, y desde entonces el ajedrez o el Go han servido para medir avances. Pero los acertijos también revelan dónde siguen fallando los modelos, y eso es lo que explora un artículo de MIT Technology Review con siete pruebas que han puesto en apuros a la IA.
Los números muestran una mejora rápida, pero desigual. En 2024, los mejores modelos resolvían solo el 18% de los puzzles de Connections del New York Times; a principios de 2025, algunos los resolvían casi perfectamente. Sin embargo, cambios sutiles en acertijos clásicos y las pruebas visuales siguen siendo un punto débil.
Razonamiento espacial y memoria
Los humanos tenemos una ventaja enorme en el razonamiento espacial. Los problemas de rotación mental, típicos de los tests de CI, piden identificar si dos imágenes representan el mismo objeto desde ángulos distintos. Los modelos de lenguaje con capacidad visual fallan estrepitosamente en esto: no logran manipular objetos 3D como haría un arquitecto o un ingeniero mecánico.
Otra debilidad aparece cuando un puzzle se parece a uno visto durante el entrenamiento. En un estudio de 2024, investigadores de Google y la Universidad de Illinois entrenaron modelos con variaciones del clásico problema de Caballeros y Escuderos, donde unos siempre dicen la verdad y otros siempre mienten. Los modelos tendían a responder con lo memorizado, ignorando las diferencias clave. Lo mismo ocurre con el test SimpleBench, donde las preguntas parecen complejas pero los humanos detectan la trampa al instante.
Visual, abstracción e intuición
En dos dimensiones tampoco se libran. El benchmark ARC-AGI, que exige inferir reglas abstractas a partir de ejemplos, sigue siendo un quebradero de cabeza. Los modelos funcionan mejor cuando reciben las cuadrículas como secuencias de números en lugar de imágenes, y cuando aciertan suelen usar reglas enrevesadas, mientras que los humanos se apoyan en conceptos visuales simples.
La intuición humana es otro terreno donde la IA destaca... pero no siempre para bien. Los psicólogos han diseñado problemas donde los humanos damos respuestas automáticas que fallan si se leen con cuidado. Por ejemplo, una colonia de murciélagos que duplica su población cada día tarda 60 días en llenar la cueva: ¿cuántos días para la mitad? Muchos responden 30, pero la respuesta correcta es 59.
Complejidad creciente
Cuando la complejidad aumenta, los modelos también flaquean. Un estudio de Apple mostró que la IA resuelve la Torre de Hanoi o problemas de cruzar un río con pocas piezas, pero falla a partir de seis. Otro estudio de la Universidad de Washington, Stanford y el Allen Institute observó dificultades similares con los puzzles de lógica tipo ZebraLogic. Los comentaristas cuestionaron si esto revela una limitación única de la IA o simplemente que es normal equivocarse cuando la complejidad aprieta.
El artículo no da las soluciones, pero sí invita al lector a intentarlo. Si aciertas, habrás demostrado que puedes superar a una IA en estos acertijos... al menos por ahora. La pregunta que queda en el aire es si estas lagunas son un problema estructural o solo cuestión de tiempo y más datos.
##Relacionado

Sonos presenta sus nuevos Ace Ultra y Beam Ultra con IA integrada
La compañía ha mostrado sus nuevos auriculares y barra de sonido, junto con el sistema operativo Sonos 27 que incorpora funciones de IA.

Empirik sale de la incubadora de Sequoia con 21 millones para predecir fallos
La startup, creada por dos directivos de Sequoia, usa IA para anticipar caídas de infraestructura. Ya cuenta con clientes como S&P Global.

Anthropic lanza Fable 5.1: más barato, menos restricciones y nueva capa de privacidad
El nuevo modelo de Anthropic reduce costes y falsos positivos de seguridad, y estrena una opción de privacidad para empresas.