¿Una IA con 99,95% en juegos 2D que los humanos aprenden rápido? Lo que ARC-AGI-3 revela sobre descubrir reglas desconocidas y su posible uso para buscar ventajas de trading

La capacidad de la IA ha sido extrañamente desigual.

Compartir este artículo

Compartir este artículo

Publicidad
Publicidad

0. Resumen en cinco segundos: una IA podía resolver problemas de élite y aun así perderse en un juego sencillo sin manual

La capacidad de la IA ha sido extrañamente desigual.

Hace tiempo que las máquinas superaron a los humanos en ajedrez y, en 2025, una versión avanzada de Gemini Deep Think obtuvo 35/42 puntos, nivel de medalla de oro, en una evaluación oficial de la Olimpiada Internacional de Matemáticas. Sin embargo, los modelos de frontera podían sufrir mucho cuando recibían un entorno 2D simple, sin instrucciones ni objetivo explícito, y tenían que descubrir por sí mismos qué hacer.[1]

ARC-AGI-3 fue diseñado precisamente para medir esa brecha. El agente debe actuar, observar cambios, inferir mecanismos, descubrir objetivos y planificar sin reglas expresadas en lenguaje natural.[2][3]

En septiembre de 2026, GPT-6 Astra obtuvo 62,71% en ARC-AGI-3 Semi-Private con el Standard harness y un máximo verificado de 99,95% con el Provider Adapter de OpenAI.[2][4]

Eso no demuestra que AGI esté terminada. No es 100%, y el 99,95% utilizó gestión de contexto específica del proveedor.

El cambio importante es más concreto: la IA mejoró mucho en aprender dentro de un entorno nuevo donde, al principio, ni siquiera está claro cuál es la tarea.

En mercados, eso sugiere un papel más sensato que “predice el precio de mañana”: un agente que descubre posibles ventajas estadísticas, las prueba y trata de destruir sus propias conclusiones.

1. ¿Qué es AGI? Y 1, 2 y 3 son generaciones del test, no niveles de IA

AGI significa Artificial General Intelligence, inteligencia artificial general.

ARC Prize la entiende, de forma aproximada, como un sistema capaz de adquirir habilidades que los humanos pueden adquirir con una eficiencia similar a la humana.[2]

ARC-AGI-1, 2 y 3 no significan “AGI nivel 1, 2 y 3”. Son generaciones del benchmark.

  • ARC-AGI-1: introducido en 2019; rompecabezas de cuadrículas de colores donde hay que deducir una transformación oculta a partir de pocos ejemplos.[5]
  • ARC-AGI-2: mismo formato, mayor dificultad. Cada tarea incluida fue resuelta por al menos dos personas en dos intentos o menos.[5][6]
  • ARC-AGI-3: pasa de puzzles estáticos a entornos interactivos desconocidos que deben aprenderse mediante muchas acciones.[3]

En versión infantil:

1 = acertijo visual
2 = acertijo visual mucho más cruel 3 = juego nuevo después de que alguien tirara el manual

2. ¿Cómo es un “juego desconocido”? Un mundo 2D cuyo significado aparece solo al actuar

ARC-AGI-3 utiliza entornos 2D por turnos. El estado puede representarse en cuadrículas de hasta 64×64 y el agente elige entre las acciones disponibles.[7]

La clave es que conocer los botones no revela qué significa ganar.

Un ejemplo inventado, no una tarea oficial, podría comenzar así:

■■□□□□
■●□□▲□
□□□■□□

No hay explicación.

Te mueves a la derecha y el punto se mueve. Tocas el triángulo y cambia de color. En otro lugar se abre algo parecido a una puerta.

Una persona empieza a formar hipótesis:

“Quizá el punto soy yo.”
“Quizá el triángulo es un interruptor.”
“Tal vez debo cambiar de estado antes de ir a la puerta.”

ARC-AGI-3 mide este ciclo: exploración → modelado → adquisición del objetivo → planificación y ejecución.[2]

El benchmark está pensado para que los humanos lo aprendan relativamente rápido, pero eso no significa que cualquier niño complete todos los juegos. El estudio humano de 2026 incluyó 458 participantes: los entornos fueron calibrados como resolubles por humanos, aunque el éxito individual variaba.[8]

3. ¿Por qué una IA podía ser brillante en ajedrez y matemáticas pero débil aquí?

En ajedrez las reglas están completas desde el principio. En matemáticas, el problema te dice qué hay que demostrar.

Pueden ser tareas extremadamente difíciles, pero el marco del problema ya está definido.

ARC-AGI-3 pregunta algo anterior:

“¿Qué cuenta como progreso?”
“¿Para qué sirve este objeto?”
“¿Qué cambió por mi última acción?”

Los humanos hacemos esto constantemente con aparatos, juegos, trabajos y aplicaciones nuevas. Interactuamos unas pocas veces y creamos un modelo aproximado de “probablemente funciona así”.

Los modelos de frontera tenían una debilidad importante para construir y mantener ese tipo de modelo con poca experiencia.

Podían resolver un teorema difícil y luego perderse en una interfaz parecida a un juguete.

4. GPT-5.6 Sol: un cerebro potente que, en la práctica, tiraba su cuaderno

GPT-5.6 Sol Max obtuvo 96,5% en ARC-AGI-1 y 92,5% en ARC-AGI-2, pero solo 7,78% en ARC-AGI-3 Semi-Private.[9]

OpenAI investigó y descubrió que parte del problema estaba en el harness, el software que conecta el modelo con el juego.[10]

El razonamiento oculto se descartaba después de cada acción y la historia antigua acababa truncándose.

La analogía humana sería:

“Pisar rojo abre la puerta.”
→ das un paso
→ rompes la nota donde lo habías escrito
→ en el siguiente paso: “¿Qué será esta cosa roja?”

Cuando OpenAI activó retención del razonamiento y compactación del contexto, la puntuación de Sol en el Public set subió de 13,3% a 38,3%.[10]

No debe compararse directamente 7,78 con 38,3: el primero es Semi-Private y los otros son Public.

La lección sigue siendo clara: la capacidad depende tanto del razonamiento del modelo como de cómo conserva y comprime la experiencia.

5. GPT-6 Astra: 62,71% y 99,95% no son el mismo tipo de resultado

ARC Prize verificó GPT-6 Astra el 2 de septiembre de 2026.[4]

Sus mejores resultados Semi-Private fueron:

Condición Mejor resultado de Astra
Standard harness 62,71% (Max)
Provider Adapter 99,95% (High)

El Standard harness se parece más a una interfaz mínima compartida, donde el modelo decide qué notas visibles conservar.

El Provider Adapter mantiene estado de razonamiento opaco específico del proveedor entre solicitudes y utiliza compactación para contextos largos.[2][4]

Por eso es inexacto decir “Astra sola y desnuda obtuvo 99,95%”. La descripción correcta es Astra más la gestión de contexto diseñada por OpenAI obtuvo 99,95%.

Incluso 62,71% en Standard representa un salto enorme frente al 7,78% Semi-Private de Sol Max.[4][9]

La comparación humana también requiere precisión. Astra Max con Provider Adapter obtuvo 98,55% y utilizó menos acciones que la referencia humana en 96,0% de los niveles completados, con 51,7% menos acciones por nivel en promedio.[2]

No significa “más inteligente que el 96% de las personas”. Es una comparación de eficiencia por nivel contra una mediana humana.

6. ¿Qué hacía realmente Astra? Escribía un pequeño libro de física privado para cada juego

ARC Prize destacó el comportamiento de Astra, no solo su nota.

En lugar de guardar cada observación literalmente, comprimía información sobre:

  • ubicación de objetos,
  • efectos de acciones,
  • estado actual,
  • planes pendientes,
  • siguientes operaciones útiles.

Incluso inventaba una notación simbólica compacta para describir mecánicas.[2]

Conceptualmente podía representar algo como:

rojo + acción derecha → estado B estado B + objetivo azul → puerta abierta

Eso es un pequeño modelo del mundo: una representación que permite predecir qué hará el entorno después.

Lo importante es que la respuesta no estaba memorizada previamente; la estructura útil surgía de la interacción.

7. Entonces, ¿ya tenemos AGI? ARC Prize dice explícitamente que no

ARC Prize describe Astra como un cambio escalonado visible en las capacidades de frontera, pero no afirma que demuestre AGI.[2]

ARC-AGI-3 sigue siendo un mundo limitado:

  • cuadrículas 2D,
  • interacción por turnos,
  • mecánicas deterministas,
  • objetivos cerrados.

El mundo real tiene reglas que cambian, variables ocultas, rivales estratégicos y objetivos ambiguos.

Además, el Grand Prize exige 100%. Un 99,95% verificado está muy cerca, pero no es 100%.[11]

La lectura precisa es: no se completó la inteligencia general, pero una debilidad histórica —aprender con eficiencia en entornos interactivos nuevos— se redujo de forma drástica.

8. ¿Dónde puede servir? En trabajos donde nadie puede escribir todo el reglamento de antemano

Las aplicaciones más interesantes van mucho más allá de los puzzles.

  1. Simulación de fábricas y logística: variar personal, inventario, secuencias y rutas para descubrir condiciones que reducen retrasos o costes.
  2. Exploración de software: aprender interfaces desconocidas e identificar condiciones reproducibles de errores.
  3. Juegos y robótica: aprender relaciones causales entre acción y resultado con pocos intentos.
  4. Publicidad, precios y operaciones: explorar combinaciones de decisiones y observar resultados.
  5. Apoyo a investigación: generar hipótesis, probarlas, descartar fallos y actualizar el modelo del sistema.

La instrucción cambia de “sigue esta regla” a “descubre qué reglas importan de verdad”.

9. ¿Y acciones y scalping? Un descubridor de ventajas candidatas es más sensato que un oráculo

Aquí, una ventaja o edge significa una pequeña ventaja estadística repetible que sobrevive después de los costes de trading.

Un enfoque tipo Astra no empezaría con una regla terminada como “compra cuando RSI sea menor que 30”. Observaría libro de órdenes, operaciones, precio, spread, volumen y hora.

Luego preguntaría:

¿Qué combinaciones del estado actual son seguidas por un pequeño sesgo direccional en los próximos segundos o minutos?

La IA podría proponer una hipótesis que combine aumento repentino de profundidad compradora, ráfaga de compras a mercado, spread estrecho y una franja horaria concreta.

Eso sigue siendo una hipótesis, no una fórmula rentable.

Los mercados difieren radicalmente de ARC: sus reglas no son estables. Cambian participantes, noticias, liquidez, regulación y regímenes.

Si solo dices “encuentra un patrón rentable”, la IA puede confundir una coincidencia histórica con una ley natural.

10. Un sistema serio debe obligar a la IA a atacar sus propios descubrimientos

Un backtest evalúa una regla de trading con datos históricos.

El peligro es probar miles o millones de variantes: algunas parecerán espectaculares solo por azar. Es el problema conocido como sobreajuste de backtest.[12][13]

Un explorador de ventajas creíble debería:

  1. generar hipótesis;
  2. buscar candidatos en un periodo de desarrollo;
  3. rechazarlos con datos nunca usados para descubrirlos;
  4. intentar romperlos en mercados alcistas, bajistas, volátiles y tranquilos;
  5. descontar comisiones, spread y deslizamiento;
  6. registrar cuántas ideas se probaron;
  7. hacer validación walk-forward respetando el orden temporal;
  8. usar paper trading antes de capital real;
  9. definir condiciones de apagado cuando la ventaja desaparece.

El papel ideal no es el de profeta.

Es un investigador que propone 1.000 ideas y un revisor que mata 998 de ellas.

11. Conclusión: de “IA que responde” a “IA que descubre cuáles son las reglas”

Lo importante de ARC-AGI-3 no es solo el vistoso 99,95%.

Es el ciclo:

observar → actuar → fallar → inferir una regla → corregir la hipótesis → avanzar hacia el objetivo.

Sol mostró cuánto puede sufrir un modelo potente si conserva mal su experiencia. Astra mostró una mejora enorme al comprimir experiencia en reglas útiles y ejecutarlas con pocas interacciones.

Eso permite cambiar el trabajo que damos a un agente avanzado.

En vez de:

“Esta es la regla. Ejecútala.”

podemos decir:

“Aquí están el entorno y los datos. Encuentra las reglas que parecen importar, intenta romperlas en otras condiciones y trae solo las que sobrevivan.”

Nada de esto garantiza beneficios bursátiles. El mercado es mucho más hostil que ARC.

Pero si dejamos de mirar a la IA como una adivina y la vemos como una máquina para descubrir y atacar hipótesis, el resultado de Astra se vuelve una noticia muy práctica.

  1. Google DeepMind — IMO 2025 gold-medal-level result (2025-07-21) deepmind.google
  2. ARC Prize — “OpenAI's GPT-6 Astra on ARC-AGI-3” (2026-09-03) arcprize.org
  3. ARC Prize — “Announcing ARC-AGI-3” (2026-03-25) arcprize.org
  4. ARC Prize Verified Results — GPT-6 Astra (verified 2026-09-02) arcprize.org
  5. ARC Prize — ARC-AGI-1 & ARC-AGI-2 Guide arcprize.org
  6. ARC Prize — “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (2025-05-20) arcprize.org
  7. ARC-AGI-3 Docs — Game Schema docs.arcprize.org
  8. ARC Prize — “Measuring Human Performance on ARC-AGI-3” (2026-04-14) arcprize.org
  9. ARC Prize Verified Results — GPT-5.6 arcprize.org
  10. OpenAI — “How two settings tripled our ARC-AGI-3 scores” (2026-07-29) openai.com
  11. ARC Prize 2026 — ARC-AGI-3 Competition; Grand Prize requires 100% arcprize.org
  12. Bailey, Borwein, López de Prado & Zhu — “The Probability of Backtest Overfitting papers.ssrn.com
  13. Bailey & López de Prado — “How ‘backtest overfitting’ in finance leads to false discoveries” (2021) academic.oup.com

Compartir este artículo

Publicidad

Buscar otros artículos

Todos los artículos

Mendoi-chan

Escrito por

Mendoi-chan

Convierte las fricciones del trabajo y la vida diaria en estructuras claras y próximos pasos prácticos.

Acerca del sitio
Publicidad

Artículos recientes

  1. 1Dormí 18 horas en un día: ¿sueño de recuperación o una señal para prestar atención?
  2. 2¿De verdad hay que disculparse por “no darles nietos” a los padres? A veces que un hijo adulto vuelva a casa y comparta una comida ya importa mucho
  3. 3El día en que una VTuber de 40 años se convirtió en un “centro cívico digital”: la edad no siempre mata la demanda; a veces cambia su forma
  4. 4Encargué desde el móvil un desarrollo de nivel sénior a un agente de IA… y la mudanza terminó antes
  5. 5Cómo una automatización de artículos con IA se convirtió en una “fábrica autónoma” en aproximadamente una semana: un golpe de Ultra, Level 6 y por qué Level 7 puede esperar

También te puede interesar

Publicidad