1. 시작은 단순했다: 카드게임에서 이기고 싶었다
처음 목표는 학문이 아니었다. PP를 늘리고, 수호를 치우고, 질주로 얼굴을 친다. 이긴다.
그런데 AI에게 수천 판을 시켜 덱을 비교하자 질문이 커졌다. 이 차이는 운인가? 평균 승률이면 충분한가? 한 매치업이 처참하면? 상대 손패는 숨겨져 있는데 어떻게 판단하지? 정책이 약해졌다면 원인은 무엇인가?
갑자기 몬테카를로법, 베이즈 갱신, 내시 균형, 동적 계획법, POMDP, 강건 최적화, 인과추론, 반사실 같은 단어가 등장한다.
사람이 이것을 전부 머리로 계산할 필요는 없다. 작업기억이 먼저 터진다. 사람은 무엇을 알고 싶은지 정하고, AI와 코드는 반복·기록·통계·비교를 담당한다.
2. “카드게임 선생님”이라는 직무를 만든다고 생각해 보자
사람처럼 플레이하는 AI를 만드는 것은 신규 직원 교육과 비슷하다.
“인턴”은 멀리건, 카드 보존, 진화 자원, 상대의 반격, 2~3턴 계획, 리설, 손패 상한, 보드 공간까지 배워야 한다.
한 번에 너무 많으니 업무를 나눈다. 먼저 승리 조건, 다음은 아직 쓰면 안 되는 자원, 마지막은 다음 턴에 죽는지 확인.
그 뒤 AI에게 수천 판을 시킨다.
실습 4,000판이면 인턴십이 아니라 공장형 연수다.
3. 사람의 조언을 문자 그대로 따르면 오히려 약해질 수 있다
“이 카드는 아껴라”, “SEP는 남겨라”, “램프는 빨리”, “콤보 파츠는 피니시까지.” 대체로 맞지만 항상 조건이 붙는다.
아껴라. 단 지금 안 쓰면 죽는다면 써라. 진화를 남겨라. 단 지금 쓰면 상대의 다음 턴을 완전히 막는다면 써라. 램프해라. 단 보드를 잃고 죽는다면 하지 마라.
사람은 경험으로 예외를 자동 보충한다. AI는 그럴 수 없다.
사람: “보통은 아껴.” AI: “확인했습니다.” AI: 사망.
지시를 따르는 능력과 지시의 목적을 이해하는 능력은 다르다.
4. 트리 탐색: “이 수, 다음 수, 그다음 수”를 나무로 읽는다
A: 제거, B: 얼굴 공격, C: 카드 보존이라고 하자.
각 선택 뒤에는 다른 미래가 있고, 상대도 여러 반응을 한다. 이 가지들을 나무처럼 연결한 것이 트리 탐색이다.
하지만 후보가 매번 10개면 4단계만 가도 약 10,000개가 된다.
그래서 깊이 제한, 좋은 후보만 남기는 빔 탐색, 최대 탐색량을 정하는 노드 예산을 쓴다.
문제는 너무 빨리 자르면 “지금 약하지만 두 턴 뒤 최고인 수”가 사라진다는 점이다. 특히 콤보 덱에서 치명적이다.
탐색의 핵심은 단순히 멀리 보는 것이 아니라 어떤 미래를 계속 살려 둘 것인가다.
5. 다른 이론들도 각각 맡은 일이 있다
몬테카를로법은 여러 번 시험해 평균을 본다. 베이즈 갱신은 상대 행동을 보고 보유 카드 확률을 바꾼다. POMDP는 숨은 정보가 있는 상태에서 판단한다. 미니맥스는 상대가 최선으로 반격한다고 본다.
내시 균형은 한쪽만 전략을 바꿔도 쉽게 이득이 늘지 않는 상태를 본다. 무후회 학습은 장기적으로 “다른 걸 고를걸”을 줄인다. 강건 최적화는 나쁜 매치업에서도 무너지지 않게 한다. CVaR은 나쁜 결과 영역을 본다.
대응 A/B는 같은 seed와 조건에서 정책만 바꾼다. 신뢰구간은 차이가 우연일 범위를 본다. 어블레이션은 부품을 하나씩 뺀다. 반사실은 같은 상태에서 다른 선택을 시험한다. 인과추론은 정말 원인인지 확인한다.
영어로는 보스 이름 같지만, 실제론 여러 번 시험하기, 추측 갱신하기, 나쁜 경우 보기, 공정하게 비교하기, 하나씩 범인 찾기다.
6. 대학과 대학원 느낌은 어디서 갈릴까
통계, 몬테카를로, 동적 계획법, 게임이론, 베이즈, 최적화는 대학에서 만날 수 있다.
대학원스럽게 되는 부분은 연구 절차다.
성능 저하를 발견하고, 원인 가설을 나누고, 어떤 증거가 나와야 하는지 정하고, 로그를 추가하고, 부품을 하나씩 바꾸고, 같은 상태에서 다른 행동을 시험하고, 개발 중 사용하지 않은 데이터로 최종 시험한다.
대학은 도구 상자를 준다. 연구는 어떤 도구로 설득력 있는 증거를 만들지 묻는다.
7. 문과냐 이과냐? 실제 문제에서는 섞인다
트리 탐색, 알고리즘, 확률, 강화학습은 정보·이과 쪽이다.
게임이론, 내시 균형, 파레토 최적, 위험과 의사결정은 경제학과 경영과학에서도 다룬다.
인과추론은 경제학, 의학, 사회과학, AI에서 모두 쓴다.
현실 문제는 학과 경계를 지켜주지 않는다.
카드게임 보드가 갑자기 융합 연구실이 된다.
8. 대학이나 전문학교의 가치는 전부 기억하는 데 있지 않다
몇 년 뒤 공식을 잊는 것은 정상이다.
하지만 “몬테카를로라는 방법이 있다”, “베이즈로 확률을 갱신한다”, “최적화와 게임이론은 다른 도구”라고 한 번 알아두면 문제가 생겼을 때 이름을 붙일 수 있다.
완전한 미지라면 검색어도 모른다.
한 번 봤다면 “이거 베이즈 쪽?”, “최적화 문제?”라고 출발할 수 있다.
교육은 머릿속에 도구의 목차를 만든다.
전문학교도 같다. 기초를 익히고, 실무에서 필요할 때 깊게 간다.
9. AI가 있으면 “기초만 안다”의 가치가 커진다
예전에는 이론 이름을 알아도 수식을 못 풀고, 구현을 못 하고, 통계를 못 돌리면 멈추기 쉬웠다.
이제는 “여기 몬테카를로가 맞아?”, “숨은 정보니까 POMDP처럼 보면 돼?”, “이 차이가 우연인지 계산해 줘”, “어블레이션으로 원인을 나눠 줘”라고 방향을 줄 수 있다.
AI가 구현과 계산을 돕는다.
기초 지식은 “혼자 전부 풀기 위한 지식”에서 AI에게 올바른 일을 맡기기 위한 색인으로 넓어진다.
10. 지식 알레르기가 없다는 것은 강점이다
POMDP, PSRO, CVaR, 클러스터 부트스트랩.
단어만 보면 압박감이 있다.
하지만 “무리”가 아니라 “이게 뭘 하는 거야?”로 들어가면 된다.
POMDP는 숨은 정보, PSRO는 강한 대응 추가, CVaR은 나쁜 결과 영역, 클러스터 부트스트랩은 관련 데이터 묶음을 고려한 오차 측정이다.
처음부터 완벽히 이해할 필요는 없다. 먼저 만지고 AI와 함께 파면 된다.
11. 작업기억이 부족하면 머리 밖으로 빼면 된다
카드게임만 해도 손패, 보드, PP, 진화, 상대 대응, 수호, 회복, 리설, 다음 턴을 기억한다.
연구에는 seed, hash, config, 가설, 신뢰구간, 실험 이력까지 붙는다.
전부 머리에 넣을 필요가 없다.
조건은 config, 계산은 코드, 이력은 로그, 대량 비교는 AI.
사람은 “무엇을 알고 싶은가”와 “이 결과 이상한데?”를 잡는다.
이건 꼼수가 아니라 판단에 뇌를 남기는 방법이다.
12. 결론: 질주로 얼굴 치고 싶었을 뿐인데 교육의 의미를 알게 됐다
카드게임 하나가 탐색, 확률, 통계, 게임이론, 인과추론, 교육, AI 활용까지 연결했다.
학교에서 배운 기초는 그 자리에서 전부 능숙하게 쓸 필요가 없다.
본 적 있고, 이름을 알고, 무섭지 않다면 몇 년 뒤 실전으로 들어가는 입구가 된다.
AI는 “들어본 적 있다”에서 “실제 문제로 시험한다”까지 가는 비용을 크게 줄인다.
사람은 질문한다. 기계는 계산한다. 결과가 이상하면 사람이 다시 질문한다.
그리고 원래 목표는 여전히 간단하다.
수호 치우고, 진화하고,
질주로 얼굴.
교육의 복선 회수 장소가 왜 여기냐.
