TL;DR
Hace poco miré cómo uso la IA y noté algo raro.
Casi nunca le doy pasos detallados.
Casi siempre le digo cosas como: “quiero ganar”, “quiero trabajar menos”, “no te detengas a mitad”, “comprueba si de verdad quedó hecho”.
Muy vago. Bastante vago.
Pero cuando la IA intenta cumplir en serio esos objetivos vagos, separa las condiciones por su cuenta, crea criterios de cierre, piensa cómo comprobar el resultado y añade guardarraíles donde algo falló.
Al final, el proceso dejó de ser uno donde una persona revisa cada detalle cada vez. Se acercó más a un proceso donde la IA crea, la IA comprueba, se compara con pruebas externas y solo se reportan los problemas.
Al mirar más, vi que esto se parece bastante a la idea de “Harness Engineering” que OpenAI publicó en 2026.
La persona decide la intención y los límites. El agente ejecuta.
Pero este método, aunque funciona muy bien en un proyecto personal, se vuelve difícil al llevarlo a una empresa.
Un proyecto personal es una dictadura sin política.
En cuanto lo llevas a una empresa, se abre el parlamento.
El punto de partida solo fue “quiero ganar” y “quiero trabajar menos”
El objetivo de nivel alto es sorprendentemente simple.
Si es un juego de cartas, quiero ganar.
Si son artículos o automatización, quiero reducir mi trabajo.
Estos dos objetivos tienen mucha fuerza.
Creé un simulador. Hice correr muchas partidas. Metí algoritmos de búsqueda.
Pero al final todo vuelve a esta pregunta: “¿Y con eso subió el porcentaje de victorias?”.
Automaticé el proceso de artículos. Los pasé a varios idiomas. Creé QA. Añadí colas, hashes y reintentos.
Pero al final todo vuelve a esto: “¿Mi trabajo bajó?”.
Aunque la tecnología se complique, el objetivo no se complica.
Como el objetivo no se mueve, puedo dejar que la IA elija bastante libremente los medios concretos.
No doy instrucciones detalladas. Si hace falta, hago que la IA derive el “estado ideal”
Una persona no necesita diseñar desde cero las condiciones de cierre cada vez.
“Llevar los artículos más recientes hasta publicación, sin intervención humana y en estado correcto”.
Si le das un objetivo de ese tamaño, puedes hacer que la IA piense cosas como estas:
- Qué significa “más reciente”
- Qué significa “correcto”
- Si la traducción corresponde al texto original actual
- Si está bien terminar tras 1 éxito cuando se querían procesar 50 artículos
- Si publicar en GitHub ya cuenta como publicación
- Si hace falta comprobar el sitio real
Es decir, la persona sostiene el objetivo y las condiciones que no deben romperse. La IA despliega los criterios finos de aceptación.
Claro, los criterios que crea la IA también pueden estar mal.
Por eso el siguiente paso es “verificar”.
Uso mucho la IA. Pero “la IA dijo que está hecho” no cuenta como prueba
A primera vista, parece que se lo dejo todo a la IA.
Y sí, le paso el trabajo a la IA y también le paso la revisión.
Si puedo, ni siquiera quiero ver los logs.
El ideal es este:
Trabajar → comprobar automáticamente → si no hay problemas, reportar corto → si hay errores, traer solo la causa y la propuesta de arreglo.
Lo importante aquí es no usar la palabra de la IA como condición de cierre.
No basta con “está hecho”. Hay que ir a buscar cosas que se puedan ver desde fuera: conteos, resultados de tests, hashes, archivos reales en GitHub, URLs reales, HTML del sitio real, etc.
Si le dices a la misma IA, en el mismo contexto, “revisa tu propio trabajo”, puede repetir el mismo malentendido dos veces.
Por eso la forma fuerte separa generación, revisión y pruebas externas.
La persona no necesita leerlo todo.
Pero tampoco debe terminar con un simple “lo comprobé”.
Dicho de forma brusca:
“Yo no lo miro. Compruébalo tú. Pero tráeme pruebas.”
Los puntos de tropiezo son los lugares donde aún queda trabajo humano
Cuando de verdad intentas reducir trabajo, empiezan a molestarte todas las pequeñas tareas manuales del camino.
Cada vez hay que pulsar solo esto.
Solo esta excepción la decide una persona.
Si falla, una persona mira el log.
Solo después de publicar lo comprueba una persona.
Normalmente uno diría: “Bueno, esta parte puede quedar manual”.
Pero si el objetivo es “quiero trabajar menos”, eso sigue incompleto.
Si encuentras un paso que solo funciona porque una persona se esfuerza, el diseño de ese paso aún no terminó.
Con esta forma de verlo, un error deja de ser solo un accidente.
Si el proceso terminó solo tras 1 artículo, no basta con añadir los otros 49 y ya.
Hay que cerrar la causa de “por qué pudo terminar como si todo estuviera bien tras 1 artículo”.
Si una traducción vieja se trató como la versión nueva, no basta con arreglar esa traducción.
Hay que meter en el sistema una regla para que una traducción vieja no pueda pasar como correcta.
Cuando cada fallo sube de rango y se convierte en regla, el trabajo humano desaparece poco a poco.
Un jefe que “no entiende” todavía es manejable. Lo peligroso es una revisión que reescribe la realidad
En agosto de 2026, Zenn publicó “AIで生産性が3倍になった私たちが、チームを置き去りにした話”. El texto muestra una situación donde el uso de IA avanza tanto que el jefe ya no puede revisar bien el contenido.
La reacción simbólica es: “No lo entiendo de inmediato, pero supongo que dice algo correcto”.
Como revisión, es débil.
Pero como gestión hay algo más peligroso.
No entender y luego cambiar los hechos o los criterios para proteger la posición de mando.
No hay criterios previos, pero tras ver el resultado alguien dice: “Normalmente se haría así”.
Si consultas, te dicen “piénsalo tú”. Si avanzas tú solo, te dicen “no lo hagas por tu cuenta”.
En ese punto, el juego de acercarse a la respuesta correcta deja de funcionar.
En cambio, si alguien puede admitir “ahora mismo no puedo revisar esto”, se puede reparar el proceso. Se añade revisión experta, se mecanizan puntos de verificación o se piden bases y puntos no comprobados.
La falta de capacidad se puede cubrir.
Una revisión con criterios móviles rompe el propio sistema de garantía de calidad.
Ahora entiendo un poco por qué no me gustaba el QC
El objetivo original de los círculos de QC es que pequeños grupos del lugar de trabajo mejoren de forma continua la calidad y la forma de trabajar.
La Japanese Union of Scientists and Engineers también explica los círculos de QC como actividades continuas de gestión y mejora hechas por empleados de primera línea.
El problema no es el QC.
El problema aparece en el momento en que el objetivo pasa de mejorar a completar la apariencia de “hicimos QC”.
Crear un tema.
Crear gráficos.
Encajarlo en una historia de QC.
Crear materiales para presentar.
Evaluar.
Aplaudir.
Fin.
Eso ya no es mejora. Es un concurso de cosplay de mejora.
En cambio, el ciclo que hago ahora con IA es mucho más embarrado.
Falla.
Miro la causa.
Busco cuándo puede repetirse.
Arreglo las condiciones de cierre o las pruebas.
Lo ejecuto otra vez.
Compruebo que el mismo fallo no pase como cierre correcto.
No hay presentación.
Pero la próxima vez hay menos trabajo humano.
Irónicamente, esto se acerca más a la forma original de “mejora continua” del QC.
Sin darme cuenta, estaba bastante cerca del Harness Engineering de OpenAI
En febrero de 2026, OpenAI publicó un artículo llamado “Harness Engineering”, donde explicó una forma de desarrollo centrada en agentes con Codex.
Allí cuenta que crearon productos internos con la restricción de escribir 0 líneas de código a mano, y que pudieron construirlos en alrededor de una décima parte del tiempo que habría hecho falta antes.
Lo importante no es solo la velocidad.
Lo importante es que el trabajo principal de la persona pasó de escribir código a diseñar el entorno, indicar la intención y crear bucles de feedback.
OpenAI también dice que las restricciones importantes, como límites, precisión y reproducibilidad, se fuerzan desde el centro. Dentro de ellas, los agentes reciben mucha libertad.
Esto se parece bastante.
No digo en detalle “cómo implementarlo”.
Sí decido “esto no se puede romper”.
Cuando falla, dejo ese fallo para la próxima vez como documentación, test, lint o regla de herramienta.
Aunque mi motivo real sea “me da pereza revisar detalles”, el resultado termina siendo crear una base para que el agente avance por su cuenta.
No llegué a esta idea por filosofía. Subí la misma montaña por pereza.
Eso me parece un poco gracioso.
Un proyecto personal es una dictadura sin política. En una empresa se abre el parlamento
Cuando lo haces solo, este método es muy fuerte.
El dueño soy yo.
El usuario soy yo.
El evaluador soy yo.
Quien define el éxito soy yo.
Si “quiero ganar en un juego de cartas”, miro si sube el porcentaje de victorias.
Si “quiero trabajar menos”, miro si baja la intervención humana.
Como hay una sola función objetivo, incluso una implementación compleja de la IA puede volver al final a una pregunta simple.
¿Con eso gano?
¿Con eso trabajo menos?
Un proyecto personal es una dictadura sin política.
Además, como el dictador es perezoso, la burocracia de IA automatiza cada vez más cosas.
Pero en una empresa no es tan fácil.
Ante “quiero reducir horas”, empiezan a aparecer otros objetivos: operaciones del equipo, auditoría, permisos de aprobación, sistemas existentes, responsabilidad, evaluación y hasta la razón de existir de cada departamento.
Harvard Business Review también explicó en 2025, al hablar de adopción de IA, que las barreras que impiden a las empresas sacar valor de la IA no son solo técnicas. Las ordenó como problemas de people, processes, and politics.
En un proyecto personal, decides el estado ideal y haces que la IA optimice hacia allí.
En una empresa, decidir el estado ideal ya es una negociación.
Y no todo es política absurda.
Puede ser razonable mantener aprobación humana por responsabilidad o auditoría.
Pero también puede ser que alguien quiera mantener una aprobación solo porque no quiere perder poder.
Para la IA, ambas cosas se ven igual: “hace falta aprobación humana”.
Al final, decidir si esa restricción de verdad hace falta le corresponde a la sociedad humana.
Para terminar: quizá las personas solo necesitan sujetar “el objetivo” y “la realidad”
En la era de la IA, cada vez hace menos falta que una persona piense todo, implemente todo y compruebe todo.
Decidir el objetivo.
Hacer que la IA cree el estado ideal y los criterios.
Hacer que la IA implemente.
Hacer que la IA compruebe.
Comparar con pruebas externas.
Si falla, convertir el fallo en una regla para la próxima vez.
Si queda trabajo humano, convertir esa parte en el siguiente punto a mejorar.
Si este ciclo gira, hace falta saber muchos menos detalles de implementación.
Pero hay cosas difíciles de delegar hasta el final.
Qué queremos lograr en primer lugar.
Si ese objetivo encaja con la realidad.
Así que al final quizá el reparto avance hasta algo como esto:
Persona: decide el objetivo. Mira la realidad.
IA: rellena todo lo que hay entre ambos.
Cuando lo haces solo, es bastante cómodo.
Cuando lo haces en una empresa, se abre el parlamento.
Al final, la política pesa mucho.
