«Arranca Astra en una carpeta vacía. Tira todos los Skills antiguos. Llega a la respuesta de un solo golpe. Si hay que corregir algo, vuelve a empezar desde cero».
Es un resumen exagerado, pero pegadizo. Si llevas meses añadiendo reglas a un agente, es fácil imaginar al pobre modelo leyendo manuales internos hasta la hora de salida sin tocar la tarea.
La recomendación real de OpenAI es más precisa:
no borres todo; carga solo lo que importa, cuando importa.
Y la idea no se limita a Skills o AGENTS.md. También sirve para chats largos y sesiones extensas de Codex.
A medida que una sesión crece, conversaciones antiguas, resultados de herramientas, logs, intentos fallidos e instrucciones ya sustituidas pueden seguir presentes como material para la siguiente decisión. La historia útil ayuda. La historia inútil es como trabajar con recibos del año pasado, un USB roto y seis versiones de la misma checklist encima de la mesa.
1. OpenAI no dice “vacía todo”; dice “audita el andamiaje viejo”
OpenAI Developers publicó el 11 de septiembre de 2026 “Rethinking skills and prompts for GPT-6 Astra”.
El objetivo son las instrucciones acumuladas para compensar modelos anteriores: «lee siempre estos documentos», «ejecuta todos los tests siempre», «pide permiso antes de cada paso».
Astra sigue mejor las instrucciones. La guía oficial advierte que es más sensible a Skills, AGENTS.md y otras instrucciones del contexto, y que una guía ambigua o contradictoria puede hacer que se detenga demasiado pronto.
El problema no es que Astra ignore las reglas.
El problema es que puede obedecer con demasiada disciplina las muletas que escribimos para modelos antiguos.
OpenAI incluso pone como mal ejemplo obligar al agente a leer una pila de documentos antes de cada edición: quema contexto y ralentiza el trabajo.
La alternativa es acortar las descripciones de Skills, definir con precisión cuándo se activan, dejar en AGENTS.md solo reglas realmente permanentes, cargar documentación especializada solo cuando toca, definir qué significa “terminado” y revisar viejas reglas de aprobación, parada y pruebas excesivas.
Piensa en una constitución pequeña + manuales bajo demanda.
2. ¿Qué hay de verdad en las cuatro frases virales?
«Carpeta vacía» es una exageración. OpenAI no pide tirar el repositorio existente ni todo el contexto; pide leer lo que la tarea necesita.
«Borra todos los Skills antiguos» tampoco. La recomendación es estrechar triggers, reducir descripciones y eliminar contradicciones o restricciones innecesarias.
«Una sola oportunidad para acertar» solo se parece a medias. Lo oficial es definir el criterio de finalización para que Astra no vuelva tras la primera implementación si todavía faltan ejecutar, revisar y corregir pasos.
«Si corriges, empieza desde cero» va en dirección contraria a mid-turn steering: Astra puede recibir una corrección durante el trabajo y conservar lo ya completado.
La idea útil es: no tengas amnesia; deja de mantener recuerdos inútiles siempre activos.
3. ¿Crece de verdad el consumo de contexto al alargarse una sesión?
A nivel de API, normalmente sí.
El modelo no ve solo la última frase. Los mensajes anteriores, resultados de herramientas, instrucciones y estado conversacional que se conservan o se vuelven a enviar forman parte del input de respuestas posteriores.
Simplificando:
5k previos + 1k nuevos = ~6k de entrada
Más tarde podría ser:
100k previos + 1k nuevos = ~101k de entrada
La implementación puede compactar, truncar, cachear o conservar selectivamente estado, así que la cifra real varía. Pero el historial largo no es un adjunto gratuito e infinito.
La documentación de Realtime de OpenAI explica explícitamente que las salidas de turnos anteriores pasan a ser entrada de turnos posteriores.
4. ¿El prompt caching hace irrelevante la hinchazón?
Ayuda mucho, pero no es un cubo de basura mágico.
A 14 de septiembre de 2026, GPT-6 Astra cuesta en API 10 dólares por millón de tokens de entrada normal, 1 dólar por millón de cached input y 50 dólares por millón de salida. Los prompts por encima de 272k tokens de entrada aplican 2x a entrada/cache y 1,5x a salida para toda la solicitud.
Un prefijo estable que acierta en caché puede ser mucho más barato. Aun así, la parte nueva sigue creciendo, puede haber cache miss, las instrucciones irrelevantes o conflictivas siguen ahí y cruzar cierto tamaño cambia incluso el régimen de precios.
Además, precios de API y límites internos de ChatGPT, Codex o Work no son la misma cosa. No hay base pública suficiente para afirmar que un chat largo consuma la cuota del producto de forma perfectamente lineal con todos los tokens históricos.
5. El mayor riesgo no es el dinero, sino los “fantasmas” de reglas antiguas
Como Astra es sensible a instrucciones, un «detente siempre aquí» de hace cien turnos, un contract ya sustituido o un «ejecuta todos los tests siempre» defensivo pueden seguir entrando en la decisión.
Hay tres tipos de basura especialmente peligrosos:
Resuelta: bugs arreglados, debates cerrados, opciones descartadas.
Duplicada: la misma regla repetida con distintas palabras.
Obsoleta: instrucciones que fueron correctas pero ya no encajan con el branch o contract actual.
Un humano dice «eso era antes». El modelo ve texto todavía presente.
Paradójicamente, un modelo mejor puede sufrir el fallo de obedecer mejor instrucciones que ya no hacen falta.
6. ¿Sirve abrir una sesión nueva y decir “lee toda la anterior y continúa”?
Solo a medias.
Si abres una sesión nueva, vuelves a meter todo el historial y lo mantienes activo, solo has cambiado de habitación: todas las cajas siguen encima de la mesa.
Es mejor tratar la sesión antigua como almacén y la nueva como mesa de trabajo.
Lleva: estado actual, decisiones cerradas, reglas todavía vigentes, tareas pendientes, evidencias/archivos/commits/URLs necesarios para verificar y restricciones cuya pérdida sería peligrosa.
Normalmente deja atrás debates resueltos, logs enormes de prueba y error, enfoques rechazados, duplicados y reglas obsoletas.
Carry forward only what matters.
7. Un prompt práctico de relevo
Revisa la sesión anterior y continúa llevando solo el estado actual, las decisiones ya cerradas, las reglas vigentes, las tareas pendientes y la evidencia necesaria para verificar el trabajo.
No reproduzcas ni mantengas el log antiguo literalmente. Descarta instrucciones obsoletas, debates resueltos, pasos intermedios e información duplicada. Conserva solo el contexto necesario para la tarea actual.
No repitas trabajo ya completado. Continúa desde el primer punto pendiente.
La clave no es «no leas la sesión anterior». Es leerla para extraer el estado actual, no para conceder residencia permanente a toda la historia.
8. ¿Cuándo conviene cortar y abrir otra sesión?
No hace falta reiniciar cada N turnos. Mejores señales: se repite la misma explicación; vuelven reglas retiradas; ya no está claro qué terminó; los logs pesan más que el estado útil; cambia claramente la fase; o el estado actual cabe en 10–30 líneas mientras el historial ocupa miles.
Flujos como investigación → implementación → verificación → publicación son fáciles de compactar en los límites de fase.
Para workflows largos por API, OpenAI también ofrece compaction para reducir el footprint de tokens conservando la información relevante.
9. Conclusión: lo fuerte no es estar vacío, sino tener la mesa ordenada
Astra no necesita amnesia. Conserva conocimiento real, decisiones consolidadas y límites importantes.
Lo que sobra es obligarlo a releer cada desvío histórico como si siguiera siendo una instrucción actual.
Sesión vieja = almacén. Sesión nueva = mesa limpia. Handoff = albarán con solo las cajas necesarias.
No hace falta fundar una religión de la carpeta vacía. Basta con retirar de la mesa los recibos del año pasado y el USB roto.
Sources
- https://developers.openai.com/blog/rethinking-skills-and-prompts-for-gpt-6-astra
- https://developers.openai.com/api/docs/guides/latest-model
- https://platform.openai.com/docs/api-reference/realtime-server-events
- https://developers.openai.com/api/docs/models/gpt-6-astra
- https://developers.openai.com/api/docs/guides/compaction

