5초 결론
AI가 강해질수록 인간의 가치는 “모든 것을 직접 만들 수 있는 능력”에서 조금씩 이동한다.
더 중요해지는 것은 완성물을 보고 “뭔가 이상하다”, “재미가 없다”, “누르고 싶지 않다”를 빨리 감지하고, 그 느낌을 이유·목표·제약으로 바꾼 뒤 AI에게 해결책 탐색과 구현을 맡기고 실제 결과를 다시 판단하는 능력이다.
루프는 이렇다.
위화감 감지 → 대화와 진단 → 0→1 기획 → 구현 → 실제 결과 확인 → 다음 위화감 감지.
겉으로 보면 불평만 하는 CEO처럼 보인다.
하지만 픽셀과 코드까지 지시하지 않는다면 이것은 전형적인 마이크로매니지먼트가 아니다. 인간이 목적 함수와 품질 기준을 잡고, 탐색과 실행을 AI에 위임하는 방식에 가깝다.
1. 시작은 “정리는 잘돼 있는데 엄청 재미없다”였다
어떤 사이트의 첫 화면에는 카테고리와 글 개수가 깔끔하게 정리돼 있었다.
고장 난 것도 없고 설명도 가능하다.
그런데 첫인상은 단순했다.
“재미없다.”
이런 불만은 애매하다. 버튼이 고장 난 것도 아니고 테스트도 통과한다. 그런데 클릭하고 싶지 않다.
대화형 AI와 얘기하다 보면 이유가 보인다.
운영자는 “이 카테고리 98개, 저 카테고리 78개”라는 재고를 보여 주고 있다. 하지만 처음 온 사람은 재고량보다 “지금 나한테 볼 만한 게 있나?”, “이 고민이면 어디를 누르지?”, “그냥 둘러보다 뭐라도 발견하고 싶은데?”를 생각한다.
문제를 0→1 기획 AI에 통째로 넘기면 답은 “카테고리를 더 예쁘게”가 아니라 “독자의 상태와 필요에서 시작하는 입구”가 될 수 있다.
CSS 수정이 아니다.
첫 화면의 존재 이유를 다시 정의한 것이다.
2. 인간의 역할은 점점 “진상 고객”처럼 보인다
AI가 구현까지 해 주면 인간이 하는 말은 이상해진다.
“이거 좀 촌스럽다.” “정확하긴 한데 누르고 싶진 않다.” “기능은 있는데 경험이 죽어 있다.” “좀 더 재밌게 못 하나?”
문장만 보면 최악의 고객이다.
하지만 진짜 마이크로매니지먼트는 “여백 12픽셀”, “카드 3열 고정”, “이 문장은 여기”처럼 해결책까지 인간이 고정하는 것이다.
더 나은 분업은 다르다.
인간은 좋고 나쁨, 목적 적합성, 위화감을 책임진다.
어떻게 고칠지는 기획 AI와 구현 AI에게 넓게 맡긴다.
결국 인간은 진상 고객이 아니라 제품 책임자, 편집장, 크리에이티브 디렉터, 품질 보증을 동시에 하는 셈이다.
키보드는 조용해졌는데 직함은 무거워졌다.
3. 위화감은 고성능 센서지만 그대로 사양서는 아니다
“싫다”는 중요한 신호다.
그러나 그대로 구현 AI에 넣으면 위험하다.
개인 취향일 수도 있고 다른 수정의 부작용일 수도 있다. 순종적인 AI는 나쁜 불만도 성실하게 구현해서 전체를 망칠 수 있다.
그래서 대화 단계에서 다음으로 바꾼다.
- 증상: 무엇을 보고 이상하다고 느꼈는가
- 원인 후보: 왜 그렇게 느끼는가
- 독자: 누구에게 문제가 되는가
- 목표 상태: 무엇이 가능해져야 하는가
- 제약: 무엇은 절대 깨지면 안 되는가
- 완료 기준: 무엇을 보면 개선됐다고 말할 수 있는가
“첫 화면이 재미없다”는 말이 “운영자 중심 분류가 앞에 나와 처음 온 독자가 자신의 필요로 탐색하기 어렵다. 글 개수가 아니라 필요와 기분에서 들어갈 수 있게 하자”로 바뀐다.
그때부터 불만은 설계 입력이 된다.
4. 벽치기 대화는 취향을 검증 가능한 가설로 바꾼다
위화감을 절대화하면 안 된다.
“내가 싫다”와 “사용자에게 나쁘다”는 다르다.
그래서 연구, 설계 원칙, 반례, 실제 이용 데이터를 불만에 부딪쳐 본다.
정보가 너무 많아서 문제인가?
운영자 기준으로 묶어서 문제인가?
목적 없이 온 사람의 입구가 없어서 문제인가?
반대로 재방문자는 빽빽한 목록이 더 빠르지 않은가?
이 과정을 거치면 인간의 감각은 살리면서 감각의 독재는 줄일 수 있다.
위화감은 센서다.
대화는 진단이다.
구현은 치료다.
센서가 한 번 울렸다고 바로 수술실로 뛰어가면 안 된다.
5. “대형 매장을 걷다 뜻밖의 걸 발견하는 느낌”은 꽤 좋은 지시다
“더 재미있게”는 너무 넓다.
하지만 “큰 매장을 걷다가 원래 살 생각 없던 것도 발견하는 느낌”이라고 말하면 원하는 경험이 선명해진다.
우연한 발견, 탐색, 이동, 호기심, 원래 목적 밖의 유용한 정보.
중요한 것은 다른 회사의 색이나 카드 모양을 복사하는 게 아니다.
브랜드 사례를 한 단계 추상화해 “목적 외 발견이 일어나는 경험”으로 바꾸는 것이다.
구체적 사례는 해답을 고정하기 위해서가 아니라 방향을 고정하기 위해 쓴다.
그래야 AI도 여전히 생각할 공간이 있다.
6. 0→1 기획과 구현을 분리하면 강해진다
알려진 버그는 전략 회의가 필요 없다.
원인을 찾고 고치고 테스트하면 된다.
하지만 “첫 화면 자체를 근본적으로 재미있게 만들자”는 문제는 0→1에 가깝다. 이런 경우 구현 전에 강한 기획 패스를 한 번 넣을 가치가 있다.
대화 AI는 불만을 분해하고 요구사항을 만든다.
0→1 기획 AI는 구조와 대안을 탐색한다.
구현 AI는 코드와 테스트, 회귀 확인을 맡는다.
인간은 목적, 제약, 우선순위, 채택 여부를 잡는다.
계획 문서만 만드는 회의를 무한 반복할 필요는 없다.
기획은 구현으로 이어질 때 가치가 있다.
7. 연구도 “인간+AI=자동 최강”이라고 말하지 않는다
2024년 Nature Human Behaviour의 메타분석은 인간 단독, AI 단독, 인간-AI 조합을 직접 비교한 106개 실험과 370개 효과크기를 분석했다.[1]
평균적으로 인간-AI 조합은 인간 단독보다 좋았다.
하지만 인간과 AI 중 더 잘한 쪽과 비교하면 조합은 평균적으로 더 나빴다.
마지막에 인간을 붙인다고 무조건 강해지지 않는다.
의사결정 과제에서는 조합의 손실이 더 두드러졌고, 창작 과제는 상대적으로 가능성이 높았다.
핵심 질문은 “AI를 쓸까?”가 아니다.
“누가 어느 부분을 맡을까?”다.
업무 분해 자체가 성능 변수다.
8. AI의 능력 경계는 울퉁불퉁하다
2026년 Organization Science에 실린 758명 지식노동자 실험에서는 AI 능력 범위 안의 18개 과제에서 AI 사용자가 평균 12.2% 더 많은 과제를 끝내고 25.1% 더 빨랐으며 품질도 높았다.[2]
하지만 능력 범위 밖의 복잡한 경영 과제에서는 AI 사용자가 정답에 도달할 확률이 19% 낮았다.
사람 눈에는 비슷한 지적 작업처럼 보여도 AI에게는 하나는 잘하고 하나는 못할 수 있다.
그래서 운영은 “AI가 똑똑하니 맡긴다”가 아니라 “이 종류는 AI, 이 판단은 인간”으로 나눠야 한다.
대규모 탐색, 초안, 요약, 구현, 기계적 검사는 AI.
의도, 중요한 절충, 전체 일관성, 이상한 느낌의 포착은 인간.
9. 인간이 초안 작성자에서 편집자로 이동하는 흐름은 다른 연구와도 맞는다
2023년 Science의 453명 실험에서 생성형 AI를 사용한 전문직 참가자는 글쓰기 과제 시간을 평균 40% 줄였고 평가 품질은 18% 높였다.[3]
2025년 Quarterly Journal of Economics의 5,172명 고객지원 연구에서도 AI 지원으로 시간당 해결 건수가 평균 15% 늘었고, 특히 경험이 적은 노동자에게 효과가 컸다.[4]
이 연구들이 “CEO는 위화감만 말하면 된다”를 증명하는 것은 아니다.
다만 초안, 반복 처리, 후보 생성이 싸지면 인간의 시간을 “무엇을 만들지”, “무엇을 채택할지”, “무엇이 이상한지”로 옮기기 쉬워진다는 방향과는 맞는다.
손으로 만드는 능력이 사라지는 게 아니다.
그 능력만이 병목이 아니게 된다.
10. 가장 큰 함정은 모든 불만을 고쳐 국소 최적화에 빠지는 것이다
카드를 고친다.
광고을 고친다.
추천을 고친다.
검색을 고친다.
각 부품은 좋아진다.
전체는 더 복잡해진다.
충분히 일어날 수 있다.
그래서 불만 기반 운영에는 별도의 전체 감사가 필요하다.
누가 오는가?
무엇을 하러 오는가?
첫 행동은 무엇이어야 하는가?
다음에 무엇을 발견해야 하는가?
무엇을 가져가야 하는가?
오히려 없애야 할 기능은 없는가?
또한 인간의 판단도 AI에 끌릴 수 있다. 인간-AI 상호작용이 판단의 편향을 키울 수 있는 피드백 루프를 보여 준 실험도 있다.[5]
“AI도 내 말에 동의했다”는 증거가 아니다.
연구, 실제 행동, 반례, 외부 현실로 돌아가야 한다.
11. “알아서 좋게 해줘”는 공유 문맥이 쌓인 뒤에만 통한다
문맥이 없다면 “알아서 좋게”는 복권이다.
하지만 목표, 반목표, 제약, 참고 경험, 완료 기준이 쌓여 있으면 한마디의 의미가 달라진다.
증상: 첫 화면은 깔끔하지만 생기가 없다.
이유: 운영자 중심 분류가 앞에 나온다.
목표: 독자가 필요와 기분에서 들어갈 수 있다.
참고: 큰 매장을 둘러보다 뜻밖의 것을 발견하는 경험.
금지: 다른 사이트를 픽셀 단위로 복사.
완료: 처음 온 사람이 필요 기반 입구에서 관련 콘텐츠를 찾고, 실제 데이터에서도 탐색과 다음 이동이 개선된다.
이것은 무책임한 떠넘기기가 아니다.
긴 공유 문맥을 짧게 호출하는 것이다.
12. 구현 AI가 멈춰도 개발 전체가 멈추면 안 된다
구현 앱이 중요한 작업 시간 직전에 멈췄다고 하자.
생각과 실행이 붙어 있으면 전부 정지한다.
더 나은 구조는 생각 큐와 실행 큐를 나누는 것이다.
구현 에이전트가 없어도 위화감 수집, 진단, 조사, 우선순위, 제약, 완료 기준까지는 만들 수 있다.
복구되는 순간 구현 AI는 문제 파악부터 다시 하지 않는다.
준비된 일을 처리한다.
비용 절감이기도 하지만 더 중요한 것은 복원력이다.
하나의 공급자 장애가 조직 전체의 뇌정지가 되어서는 안 된다.
13. AI 시대의 CEO는 모든 해답을 아는 사람이 아니다
모든 코드를 직접 쓸 필요는 없다.
처음부터 완벽한 화면을 그릴 필요도 없다.
해결책을 미리 알고 있을 필요도 없다.
하지만 이것은 잡아야 한다.
“이건 아니다.”
“이유는 이렇다.”
“누구에게 무엇이 좋아져야 한다.”
“이것들은 깨지면 안 된다.”
“이 결과는 채택해도 된다.”
AI는 해결책을 많이 만들고 구현하고 검사할 수 있다.
그러나 “좋음의 정의”까지 완전히 외주화하면 최적화할 목표 자체가 사라진다.
인간의 일은 없어지는 것이 아니라 상류로 압축된다.
새로운 경영 문장은 이렇다.
“이건 아니야. 이유는 이거야. 방향은 저쪽이야. 가장 좋은 방법으로 가.”
“알아서 좋게 해줘”가 점점 기술이 되고 있다.
[1] Vaccaro, M., Almaatouq, A., & Malone, T. (2024). When combinations of humans and AI are useful: A systematic review and meta-analysis. Nature Human Behaviour, 8, 2293–2303. https://doi.org/10.1038/s41562-024-02024-1
[2] Dell’Acqua, F., et al. (2026). Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality. Organization Science, 37(2), 403–423. https://doi.org/10.1287/orsc.2025.21838
[3] Noy, S., & Zhang, W. (2023). Experimental evidence on the productivity effects of generative artificial intelligence. Science, 381(6654), 187–192. https://doi.org/10.1126/science.adh2586
[4] Brynjolfsson, E., Li, D., & Raymond, L. (2025). Generative AI at Work. The Quarterly Journal of Economics, 140(2), 889–942. https://doi.org/10.1093/qje/qjae044
[5] Glickman, M., & Sharot, T. (2025). How human–AI feedback loops alter human perceptual, emotional and social judgements. Nature Human Behaviour, 9, 345–359. https://doi.org/10.1038/s41562-024-02077-2

