Inicio / Noticias / Inteligencia Artificial

OpenAI o3: El Modelo que Resolvió lo que Solo los Humanos Podían

En diciembre de 2024, OpenAI lanzó un modelo que hizo temblar a la comunidad científica mundial: o3. No por su velocidad ni por la fluidez de sus conversaciones, sino por algo mucho más profundo: alcanzó una puntuación del 87,5 % en el benchmark ARC-AGI, una prueba diseñada específicamente para resistir a los modelos de IA y que los mejores humanos resuelven apenas al 85 %. Por primera vez, una máquina superó formalmente a los humanos en un test de razonamiento abstracto de alto nivel.

¿Qué es OpenAI o3?

o3 es el sucesor del modelo o1, lanzado a mediados de 2024. Pertenece a la línea de modelos de razonamiento avanzado de OpenAI: sistemas diseñados no para responder rápido, sino para pensar profundo. Donde un modelo convencional como GPT-4 tardaría milisegundos en dar una respuesta, o3 puede tomarse segundos, minutos o incluso más tiempo para analizar el problema antes de responder.

La familia o3 incluye dos variantes:

  • o3-mini: más rápido y económico, optimizado para matemáticas y programación.
  • o3 (full): el más poderoso, capaz de razonamiento científico de nivel experto.

El hito ARC-AGI: ¿qué significa realmente?

El benchmark ARC-AGI (Abstraction and Reasoning Corpus for Artificial General Intelligence) fue creado por François Chollet, investigador de Google, con un propósito muy específico: construir una prueba que los modelos de lenguaje actuales no pudieran pasar memorizando datos de entrenamiento.

Las pruebas de ARC-AGI consisten en patrones visuales abstractos que requieren razonamiento genuino, no reconocimiento de patrones estadísticos. El promedio humano ronda el 85 %. Los mejores modelos anteriores no superaban el 30 %. Que o3 alcance el 87,5 % representa un salto histórico que muchos investigadores no esperaban ver hasta finales de esta década.

¿Cómo funciona el razonamiento de o3?

o3 implementa lo que OpenAI llama razonamiento mediante cadena de pensamiento privada. Antes de generar la respuesta visible, el modelo ejecuta un proceso interno de reflexión donde:

  1. Descompone el problema en subproblemas más simples.
  2. Explora múltiples caminos de solución en paralelo.
  3. Evalúa y descarta los caminos que llevan a contradicciones.
  4. Combina los mejores razonamientos parciales en una respuesta coherente.

Este proceso es computacionalmente costoso —o3 usa significativamente más recursos que GPT-4— pero produce resultados de una calidad radicalmente superior en problemas complejos.

¿En qué tareas brilla o3?

Los benchmarks muestran que o3 sobresale en áreas donde el razonamiento paso a paso es crítico:

  • Matemáticas avanzadas: resuelve problemas de nivel olimpíada internacional con alta precisión.
  • Programación compleja: obtiene puntuaciones de primer nivel en Codeforces, superando al 99 % de los programadores humanos en algunos tests.
  • Ciencia: análisis de papers científicos, diseño de experimentos, interpretación de datos.
  • Razonamiento legal y médico: análisis de casos complejos donde el error puede tener consecuencias graves.

La controversia del coste computacional

o3 tiene un precio: es significativamente más caro de usar que sus predecesores. En las primeras pruebas, algunos problemas del benchmark ARC-AGI le costaron a OpenAI miles de dólares en cómputo. Esto abre un debate sobre si el modelo es práctico para uso masivo o si solo será viable para casos de uso de alto valor.

OpenAI respondió con o3-mini, que reduce drásticamente el coste manteniendo la mayor parte de las capacidades de razonamiento para tareas de matemáticas y código.

El camino hacia la AGI

Sam Altman, CEO de OpenAI, declaró a principios de 2025 que la empresa cree estar “a meses, no años, de la AGI” (Inteligencia General Artificial). o3 es el argumento más sólido que han presentado hasta ahora. Sin embargo, Chollet —el creador de ARC-AGI— advierte que superar la prueba no equivale necesariamente a AGI: el modelo aún carece de la capacidad de aprendizaje continuo con pocos ejemplos que define la inteligencia humana.

Lo que es innegable es que o3 representa el mayor salto en capacidad de razonamiento de la historia de la IA, y que las implicaciones para la ciencia, la ingeniería y la medicina apenas están empezando a materializarse.

webmaster
webmaster
Equipo PuroIA
Especialista en Inteligencia Artificial privada y soberanía digital para empresas latinoamericanas.

¿Le interesa implementar IA privada en su empresa?

Solicite una demostración gratuita de 3 días sin compromiso y vea el poder del ecosistema PuroIA en acción.

Solicitar Demo Gratuita