Ir al contenido

La IA se topa con pared: matemáticos humanos le ganan en la prueba más difícil hasta ahora

La evaluación fue revisada por 30 matemáticos y buscó medir si la IA puede resolver problemas inéditos de manera autónoma, más allá de repetir información aprendida previamente

Le pusieron 10 problemas inéditos a la IA y no logró alcanzar el nivel de los matemáticos

Tabla de contenido

Ciudad de México.— Los sistemas de inteligencia artificial más avanzados todavía están lejos de igualar a los mejores matemáticos humanos cuando enfrentan problemas completamente nuevos. Esa es la principal conclusión de First Proof, una evaluación que puso a prueba a varios modelos de IA con ejercicios de matemáticas de nivel investigación que nunca habían sido publicados.

La prueba incluyó 10 problemas elaborados por investigadores que ya habían encontrado la solución durante sus trabajos académicos, pero que aún no habían difundido los resultados. Las respuestas fueron revisadas por un grupo de 30 matemáticos especializados.

Problemas inéditos y evaluación de expertos

De acuerdo con la revista Nature, esta es la primera evaluación que reúne tres condiciones al mismo tiempo: utiliza problemas de nivel investigación, plantea preguntas que no aparecen en internet ni en literatura científica y somete las respuestas a una revisión formal realizada por especialistas.

El objetivo era comprobar si los modelos podían generar razonamientos originales y resolver desafíos desconocidos, en lugar de reproducir información aprendida durante su entrenamiento.

Los organizadores señalaron que estas pruebas también permitirán medir en el futuro qué tan útiles pueden ser las herramientas de IA para apoyar el trabajo de investigadores, verificar demostraciones matemáticas o colaborar en proyectos científicos.

El mejor modelo resolvió 6 de 10 problemas

El sistema con mejor desempeño fue desarrollado por investigadores de la Escuela Politécnica Federal de Zúrich (ETH), en Suiza. Su modelo logró resolver correctamente seis de los diez problemas planteados.

La herramienta utilizó respuestas generadas por ChatGPT que posteriormente eran revisadas y mejoradas mediante un sistema de verificación que incorporaba otros chatbots como apoyo.

En segundo lugar quedó un equipo de la Universidad de California en Los Ángeles (UCLA), seguido por OpenAI con ChatGPT 5.5 Pro funcionando de forma autónoma. El cuarto lugar fue para un sistema desarrollado por investigadores de la Universidad de Princeton.

La carrera por resolver matemáticas complejas

La evaluación llega pocas semanas después de que un chatbot desarrollado por OpenAI sorprendiera al resolver un problema matemático planteado hace 80 años por el matemático Paul Erdős.

Sin embargo, los resultados de First Proof muestran que esos avances todavía no son suficientes para superar de manera consistente a especialistas humanos cuando se trata de resolver problemas complejos y completamente inéditos.

Por ahora, la inteligencia artificial sigue avanzando en matemáticas, pero los investigadores concluyen que los expertos humanos conservan la ventaja en los desafíos más difíciles y especializados.

Últimas noticias