Quien haya investigado estrategias de muy corto plazo a mano sabe que lo más pesado no es simplemente «hacer cálculos».
¿Qué hacer cuando aparece la señal A? ¿Y si B aparece al mismo tiempo? ¿Mantener la operación con volatilidad alta y descartarla con volatilidad baja? ¿Seguir tendencia en una sesión y no entrar en otra?
Si se comprueba cada rama una por una, una noche normal se convierte rápidamente en un laboratorio privado. Pasar varias horas al día durante años y terminar con una sola estrategia superviviente no es una situación extraña.
Entonces llega una IA orientada a la exploración.
En un flujo de investigación de este tipo, puede probar miles de variantes en cuestión de horas, investigar por qué la rentabilidad no es estable y convertir el motivo del fracaso en el siguiente experimento.
La reacción humana es inmediata:
«¿Cuánto tardaría una persona si tuviera que hacer todo esto una por una?»
Pero concluir «la IA puede probar 4.000 estrategias, así que hemos ganado» es peligroso. En finanzas, probar más también significa tener más oportunidades de sobreajustar el pasado.[1][2]
La combinación útil es otra:
hipótesis humana × exploración de IA × refutación de IA × corrección estadística por búsqueda masiva.
No basta con una IA que encuentre ganadores. Conviene tener otra cuyo trabajo sea intentar destruirlos.
1. Por qué años de investigación manual pueden comprimirse de repente
La investigación manual de estrategias es una cadena de tareas pequeñas:
- Formular una hipótesis.
- Implementar una condición.
- Hacer un backtest.
- Leer el resultado.
- Preguntar por qué es inestable.
- Separar condiciones.
- Volver a probar.
Ningún paso tiene que ser extraordinario por sí solo. Lo caro es repetirlos cientos o miles de veces.
Además está el coste de cambiar de contexto: ¿qué probé ayer?, ¿ya usé este filtro?, ¿ese resultado era anterior o posterior a cambiar el supuesto de spread?
Un agente explorador puede mantener el ciclo en movimiento.
No tiene por qué detenerse en «da beneficio». Puede comprobar si el resultado depende de unos pocos días, desaparece con costes, vive solo en una sesión o se rompe al quitar un componente.
Eso es más que acelerar backtests.
Es acelerar la iteración de investigación.
2. La fortaleza de Astra se parece menos a «saber la respuesta» y más a «moverse por un entorno desconocido»
ARC-AGI-3 ayuda a entender esta diferencia.
Es un benchmark interactivo formado por entornos nuevos en rejillas 2D, sin instrucciones en lenguaje natural ni un objetivo declarado. El agente debe explorar, inferir reglas, construir un modelo del entorno, descubrir objetivos útiles, planificar, actuar y corregirse.[3][4]
En julio de 2026, GPT-5.6 Sol obtuvo 7,78% en el conjunto semiprivado de ARC Prize. OpenAI también mostró, en el conjunto público y con otra configuración, que conservar el estado de razonamiento y compactar el contexto podía elevar a Sol de 13,3% a 38,3%.[5]
En septiembre, Astra obtuvo 62,7% en el mismo conjunto semiprivado con el arnés estándar de ARC Prize y 99,9% con un Provider Adapter que conserva más estado de razonamiento entre acciones. Como el diseño del arnés cambia mucho el resultado, no conviene interpretar 99,9 frente a 7,78 como una simple proporción directa. Lo relevante es el salto en exploración, modelado de estado y adaptación de largo horizonte.[6][3]
ARC Prize también informó de que, en el 96% de los niveles completados por Astra, utilizó menos acciones que la mediana de los humanos que lograron terminarlos.[3]
Es una inteligencia distinta de resolver una ecuación difícil de una sola vez.
Se parece más a:
«¿Qué pasa si toco esto? Bien. ¿Y si pruebo aquello? Ah, ya entendí la regla.»
Que un juego 2D que parece accesible incluso para un niño haya sido difícil durante tanto tiempo para la IA hace visible precisamente esta frontera.
ARC Prize también aclara que saturar ARC-AGI-3 no demuestra por sí solo la existencia de AGI. Es un entorno cerrado y determinista, muy distinto del mundo real.[3]
3. Por qué explorar un juego 2D puede recordar a investigar scalping
El mercado no es un rompecabezas determinista. Intervienen agentes, información oculta, cambios de régimen, costes y restricciones de ejecución.
Aun así, el ciclo de investigación se parece.
Supongamos que añadir una condición de desequilibrio del libro de órdenes mejora el backtest.
Las siguientes preguntas son obligatorias:
- ¿El desequilibrio predice realmente algo?
- ¿Funciona solo con volatilidad alta?
- ¿Es un artefacto de un spread bajo?
- ¿Desaparece con una ejecución un tick peor?
- ¿Solo existe en una sesión concreta?
Observar. Cambiar. Medir. Actualizar la hipótesis.
La estructura se parece al ciclo de ARC-AGI-3: percibir, actuar, recibir respuesta, actualizar el modelo y elegir la siguiente acción.[3][4]
Por eso una instrucción mejor que «encuentra los parámetros más rentables» es:
«Descompón por qué existe este beneficio, busca qué condiciones lo destruyen y convierte esos fallos en los próximos experimentos.»
4. La experiencia humana no desaparece — «por aquí huele a algo» se convierte en un mapa
Se puede dejar que la IA empiece desde cero.
Pero cuanto mayor es el espacio de búsqueda, más valiosa es la experiencia humana para decidir dónde gastar primero el presupuesto de exploración.
Quien lleva años leyendo y probando componentes suele condensar conocimiento así:
- débil por sí solo, pero quizá útil como filtro;
- interesante solo en regímenes tendenciales;
- precioso en backtest, frágil ante costes;
- mejor para prohibir entradas que para predecir dirección;
- parece fuerte, pero probablemente concentra el beneficio en un periodo.
No es una lista de verdades.
Es un mapa previo del espacio de búsqueda.
La ciencia está usando estructuras parecidas. Co-Scientist, publicado en 2026, parte de un objetivo definido por investigadores y de evidencia previa, y genera, critica, ordena y evoluciona hipótesis repetidamente al aumentar el cómputo de prueba.[7]
En trading, la persona puede decir «empieza a cavar aquí» y la IA explorar miles de ramas alrededor.
La experiencia funciona mejor como guía de presupuesto que como dogma.
5. Por qué las combinaciones se convierten en un infierno manual
Imaginemos 20 componentes.
Con solo dos opciones por componente — usar o no usar — ya existen:
2^20 = 1.048.576 combinaciones.
Con tres opciones — no usar, usar normalmente o usar de forma inversa — aparecen:
3^20 = 3.486.784.401 combinaciones.
Nadie sensato prueba todo por fuerza bruta. El conocimiento del dominio elimina combinaciones absurdas.
Pero la investigación real añade umbrales, horas, volatilidad, spreads, tiempo de mantenimiento, exclusión de noticias, asimetría entre largos y cortos y supuestos de ejecución.
Así que el antiguo proceso de:
«¿Y si miro esto también? ¿Y si excluyo aquel caso? ¿Solo en este régimen?»
era, en la práctica, una persona caminando por un árbol de búsqueda condicional gigantesco.
Que tardara años es bastante razonable.
La hoja de cálculo era inocente. El universo era demasiado grande.
6. Lo valioso no es la fuerza bruta, sino elegir el siguiente experimento
Un buen agente explorador cambia la próxima prueba según el resultado anterior.
Si una estrategia es A+B+C+D, retiremos componentes uno por uno.
- Quitar D casi no cambia nada → D puede ser decorativo.
- B es débil solo, pero A+B reduce mucho el drawdown → B puede ser un filtro, no una fuente de predicción.
- C es débil en todo el periodo, pero fuerte con volatilidad alta → C puede depender del régimen.
Quitar piezas para entender su contribución suele llamarse prueba de ablación.
El nombre importa menos que el objetivo:
desmontar una estrategia compleja y quedarse con las piezas que realmente hacen trabajo.
Explorar → fallar → clasificar la causa → elegir la siguiente prueba.
Automatizar ese ciclo convierte al modelo en algo más parecido a un asistente de investigación que a un simple optimizador.
7. El mayor peligro sigue siendo el sobreajuste — si pruebas 4.000 cosas, aparecerá un «genio con suerte»
Este es el punto crítico en finanzas.
Si se prueban 4.000 estrategias y se publica solo la más bonita, el ganador puede ser simplemente la mejor coincidencia accidental con la historia.
White formalizó el problema del data snooping: reutilizar los mismos datos para inferencia y selección de modelos hace posible que resultados satisfactorios aparezcan por azar y no por superioridad real.[1]
Combinar múltiples señales agrava el problema.
Novy-Marx mostró que las estrategias seleccionadas a partir de múltiples señales sufren fuertes sesgos de sobreajuste y que incluso señales aleatorias sin poder predictivo real pueden producir backtests aparentemente muy significativos tras seleccionar y combinar.[2]
La capacidad de exploración tiene dos filos.
La IA puede equivocarse miles de veces más rápido.
Y luego premiar el error más bonito.
Cuanto mayor sea la búsqueda, más debe formar parte del propio buscador la defensa contra el sobreajuste.
8. La defensa empieza registrando todos los intentos y reservando datos finales que no se usan para seleccionar
Si se exploran miles de candidatos, los candidatos descartados también son evidencia.
Un proceso robusto debería incluir al menos:
- Registrar cada prueba. Qué cambió, cuántas variantes se intentaron y por qué se descartaron.
- Separar descubrimiento y evaluación final. No mirar repetidamente el conjunto final mientras se elige el modelo.
- Validar hacia delante en el tiempo. Construir con datos anteriores y comprobar con datos posteriores mediante evaluación walk-forward.
- Empeorar la ejecución a propósito. Aumentar spread, comisiones, slippage, latencia y pesimismo de fills.
- Mover los parámetros. Un sistema que vive solo en un umbral mágico merece sospecha.
- Separar regímenes. Ver si el beneficio se concentra en un año, una sesión, una volatilidad, una dirección o muy pocas operaciones.
- Corregir estadísticamente el hecho de haber intentado muchas cosas.
El Deflated Sharpe Ratio, DSR, corrige la interpretación del Sharpe por sesgo de selección derivado de múltiples pruebas y por rendimientos no normales.[8]
La Probability of Backtest Overfitting, PBO, fue diseñada para backtests de inversión y estima la probabilidad de sobreajuste mediante validación cruzada simétrica combinatoria.[9]
Reality Check de White trata el data snooping entre muchos candidatos; la prueba SPA de Hansen busca ser más potente y menos sensible a alternativas malas o irrelevantes.[1][10]
No hace falta memorizar todos los nombres.
La regla es:
si el ganador apareció después de 4.000 intentos, evalúalo como el ganador de un torneo de 4.000 intentos.
Y si se mira el supuesto conjunto final y luego se modifica la estrategia, ese conjunto deja de ser final e intacto.
9. Una arquitectura fuerte puede usar dos IA: una encuentra ganadores y otra intenta matarlos
Se pueden separar papeles.
IA exploradora
- genera nuevas condiciones;
- recombina hipótesis humanas;
- busca efectos por régimen;
- convierte fallos en nuevos experimentos.
IA falsificadora
- empeora costes;
- retrasa ejecuciones;
- elimina días;
- perturba umbrales;
- cambia de periodo y mercado;
- aplica DSR, PBO, Reality Check y SPA;
- comprueba si el beneficio proviene de muy pocas observaciones.
La primera dice: «Encontré una».
La segunda responde: «¿Seguro?»
Si sobrevive, otra ronda.
En investigación financiera, esa personalidad desagradable es una característica de calidad.
El objetivo deja de ser «máximo beneficio histórico» y pasa a ser:
«una estructura que sigue siendo explicable y resistente después de dañar razonablemente parámetros, costes, supuestos y muestra».
10. Cuando salga un nuevo modelo, mira qué capacidad acaba de cruzar un muro — no solo la puntuación total
La idea va mucho más allá del scalping.
Cuando aparece una nueva IA, un aumento pequeño en un benchmark general puede importar menos que una tarea extraña que pasa de casi imposible a práctica.
La pregunta útil es:
«¿Qué trabajo no era económicamente viable con la generación anterior y ahora sí puede serlo?»
En Astra, ARC-AGI-3 destaca exploración de entornos desconocidos, construcción de modelos compactos, mantenimiento de estado y acción eficiente.[3]
Después se conecta esa capacidad con cuellos de botella reales:
- ¿Dónde pierde el ser humano tiempo decidiendo qué probar después?
- ¿Dónde hay miles de hipótesis comprobables?
- ¿Puede medirse objetivamente el éxito?
- ¿La repetición multiplica la diferencia de coste laboral?
- ¿Una mejor exploración se convierte en beneficio, ahorro o velocidad de I+D?
Cuando varias respuestas son «sí», puede aparecer una oportunidad.
La ciencia ya se mueve en esta dirección: Co-Scientist escala un ciclo de generar, criticar, comparar y evolucionar hipótesis.[7]
Así, el lanzamiento de un modelo puede verse como una búsqueda del tesoro:
«¿Qué parte brutalmente tediosa del trabajo humano acaba de volverse escalable por máquina?»
Resumen final:
La persona dibuja el primer mapa. La IA cava fuera del mapa. La estadística pregunta si lo brillante es realmente oro.
Cuanto más fuerte sea la IA, más importante es mantener un escéptico.
Ese escéptico también puede ser otra IA.
- Halbert White — A Reality Check for Data Snooping, Econometrica 68(5), 2000 onlinelibrary.wiley.com
- Robert Novy-Marx — Backtesting Strategies Based on Multiple Signals, NBER Working Paper 21329, 2015 nber.org
- ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3 (2026-09-03) arcprize.org
- ARC Prize — Announcing ARC-AGI-3 / ARC-AGI-3 documentation https://docs.arcprize.org/ arcprize.org
- OpenAI — How two settings tripled our ARC-AGI-3 scores (GPT-5.6 Sol) openai.com
- OpenAI — GPT-6 Astra: A new generation of intelligence openai.com
- Juraj Gottweis et al. — Accelerating scientific discovery with Co-Scientist, Nature, 2026 nature.com
- David H. Bailey & Marcos López de Prado — The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality, 2014 doi.org
- David H. Bailey, Jonathan Borwein, Marcos López de Prado & Qiji Jim Zhu — The Probability of Backtest Overfitting, 2015 papers.ssrn.com
- Peter Reinhard Hansen — A Test for Superior Predictive Ability, Journal of Business & Economic Statistics 23(4), 2005 tandfonline.com
