뇌사 AI에게 3턴 미래를 보여줬더니 더 약해졌다 — 섀도우버스 WB 시장 시뮬레이션 46,900전과 별도 AI 연구가 보여 준 “미래는 보이는데 채점이 틀린다” 문제

소재: 『Shadowverse: Worlds Beyond』

처음 목표는 단순했다. 현재 가장 강한 덱을 알고 싶다. 공개 덱을 모으고 규칙을 고정한 뒤 CPU끼리 수만 판 싸우게 하면 끝이라고 생각했다.

읽기 기능 사용법

듣기는 본문을 읽어 줍니다. 속독은 구절을 차례로 표시하며 속도를 조절할 수 있습니다. 언어 연습은 다른 언어판과 번역을 비교합니다. 저장한 북마크는 이 브라우저의 플레이어 목록에서 다시 열 수 있습니다.

이 글 공유하기

이 글 공유하기

광고
광고

1. 그냥 명치에 질주 꽂고 싶었는데 연구소가 생겼다

처음 목표는 단순했다. 현재 가장 강한 덱을 알고 싶다. 공개 덱을 모으고 규칙을 고정한 뒤 CPU끼리 수만 판 싸우게 하면 끝이라고 생각했다.

하지만 규칙을 정확히 실행하는 AI와 게임을 잘하는 AI는 전혀 다른 문제였다. Set 8을 카드 826장, 엔진 커밋, 환경 해시, 합법 덱과 seed까지 고정했다. 과거 기준 실험 12,480전에서 rule coverage 100%, unsupported 0, rule gap 0을 달성했는데도 원시 AI는 로얄 약 79.8%, 엘프 63.7%, 드래곤 60.9%, 위치 25.6%라는 이세계 성적표를 냈다.

1만 번 돌렸다고 진실이 되는 게 아니다. 1만 번 빠르게 같은 착각을 할 수도 있다.

2. 인간 조언을 넣었더니 약해졌다

human-prior-v1에는 중요한 카드 보존, setup 존중, 진화 자원 관리 같은 인간식 조언을 넣었다. exact A/B는 2,016 paired units, 4,032 engine games. baseline 50.99%에 비해 human-prior-v1은 49.36%, -1.64pt였다.

AI가 인간 말을 듣고 약해졌다.

인간 조언은 조건부인데 fixed weight는 조건을 죽인다. “아껴라”도 지금 안 쓰면 죽는 상황에서는 틀리고, “필드를 잡아라”도 유일한 콤보를 부수라는 뜻은 아니다.

3. Adaptive v2는 평균을 올리고 위치를 죽였다

LETHAL, SURVIVE, STABILIZE, SETUP, RESOURCE, PRESSURE를 바꾸는 Adaptive v2는 전체 +0.74pt였지만 Runecraft가 -6.25pt로 사전등록 leader floor -5pt를 넘겨 REJECT. T11도 v1 대비 +0.30pt였지만 reference-v5 대비 -2.38pt, Abyss -16.67pt로 탈락했다.

평균 점수는 합격인데 한 과목 시험지가 불타고 있었다.

4. 원인 분석을 하다 연구자부터 잡혔다

max_nodes=160이 실제 planner에 연결되지 않아 명목 한도를 넘은 decision 9,067건이 발견됐다. 그러나 연결 후에도 광범위 성능은 좋아지지 않았다. 진짜 버그지만 범인은 아니었다.

더 큰 사고는 actor attribution이었다. “loss→win”이라고 판단한 개입이 fixed player 관점이었고, 실제 행동 actor 관점에서는 win→loss였다. 연구자가 피해자를 범인으로 체포한 셈이다.

분석 시스템의 actor/direction/invariant는 고쳤지만 AI 성능의 본범은 도망쳤다.

5. 31,406전 끝에 “아직 모른다”를 공식 결론으로 만들었다

Set 8 정책 연구는 20 experiments, 확인된 actual engine games 31,406전으로 종료했다. discordant 439개 중 성능 원인을 완전히 인과 설명한 것은 0, 부분 설명 11, 미해결 428. 상태는 PAUSED_COMPLETE_NO_PROMOTION, active는 human-prior-v1 유지. 예정된 final unseen holdout 8,064전도 사용하지 않았다.

성과는 최강 AI가 아니라 강해 보인다는 이유만으로 잘못 승격시키지 않는 연구 장치였다.

6. 이후 시장 52덱을 46,900전 돌렸다

시장 corpus는 52 decks, 25 archetypes, 7 leaders. quick/broad, 1~3장 국소 최적화, unseen-seed ranking, guide trace까지 합쳐 시장 분석은 46,900 actual engine games가 됐다.

마지막 추천 7덱 직접 round robin은 21 unordered pairs, 1,512 games. 각 비대각 cell 72전, reference-v5와 human-prior-v1 각각 756전, 선후공도 756/756. coverage 100%, unsupported/rule gap/hidden-info violation 모두 0.

7. “뇌사끼리 랭킹” 탄생

순위 추천 덱 직접 7×7 평균 최악 매치업
1 버프 엘프 71.99% 나이트메어 59.72%
2 연계 로얄 65.97% 엘프 31.94%
3 미드레인지 나이트메어 54.17% 40.3%
4 아티팩트 네메시스 54.17% 36.1%
5 램프 드래곤 53.70% 엘프 25.0%
6 진화 비숍 31.71% 드래곤 12.5%
7 칼기덴슬라형 위치 18.29% 엘프 1.4%

매턴 지금 강한 행동이 미래에도 대체로 강한 덱일수록 현 AI가 잘 다뤘다. 현재 약한 행동으로 미래 폭발력을 사는 덱은 어려워 보였다. 그래서 별명이 “뇌사끼리 랭킹”이 됐다.

8. 인간 대회에서는 위치가 다른 우주에 있었다

2026년 8월 8일 Dexel Rising Cup #2는 64팀 192명, 제출 384덱. 마수 위치가 116덱, 약 30.2%로 압도적 1위였다. AF 질주 네메시스 52, 진화 비숍 34, 연계 진화 로얄 29, 램프 드래곤 25가 뒤를 이었다.

인간 상위권에서는 위치가 최상위 메타인데 AI 직접 7×7의 칼기덴슬라형 위치는 18.29% 꼴찌였다. 정확히 같은 40장 리스트라고 단정할 수는 없지만 인간과 AI의 위치 운용 차이는 매우 컸다.

반면 연계 로얄은 인간과 AI 모두 강했다. “간단한 AI로도 강하고 인간 대회에서도 강하다 = 실수 내성이 높을 가능성”이라는 거친 초보자 지표가 생겼다.

9. Future Optionality 감사

7리더 24 메커니즘을 RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH, PLAN으로 분해했다.

27,810 decisions, 118,575 root candidates 중 explicit future value가 있던 candidate는 8,878, 7.49%. rule/state/immediate value는 24/24 지원됐지만 sequence는 23/24 MISSING, plan은 20/24 MISSING이었다.

AI는 규칙과 “지금 이득”은 알지만 순서와 긴 계획은 거의 모른다는 결론이었다.

10. 위치 — Spellboost를 안다고 Spellboost의 의미를 아는 건 아니다

Spellboost의 rule/state는 있었지만 visibility/future value는 PARTIAL, sequence/plan은 MISSING. 특히 DRAW → SPELL과 SPELL → DRAW는 미래가 다르다. 먼저 뽑은 카드는 이후 boost를 받을 수 있지만 나중에 뽑은 카드는 그 1회를 못 받는다.

synthetic 12개는 DRAW_FIRST_BETTER 4, SPELL_FIRST_BETTER 0, EQUIVALENT 8. 실제 대표 50상태는 전체적으로 STATE_DEPENDENT였다. 따라서 “항상 드로우 먼저”라는 새로운 뇌사 규칙이 아니라 드로우 후 재계획이 필요했다.

11. 드래곤 — PP+1은 미래 행동권 구매다

램프는 현재 보드에서 손해처럼 보여도 다음 턴 사용 가능한 고비용 카드, 복수 행동, 회복, 제거, 피니셔를 연다. 특히 6→7은 각성 threshold를 넘는다.

Future Optionality 감사의 MYOPIC_REVERSAL은 Dragoncraft에서 총 12개. ramp 6, Awakening 6. 즉시 control이 높았지만 t+2 diagnostic continuation에서 setup이 뒤집히는 사례였다.

여기서 “램프를 더 해라”라고 hard-code하면 또 다른 바보 AI가 된다.

12. 다른 클래스도 같은 병의 변형이 있었다

엘프는 combo threshold, 저비용 생성, bounce 순서. 로얄은 Rally 9→10과 다중 소환. 나이트메어는 Shadows, reanimate pool 구성, HP 지불. 비숍은 Countdown과 Act 보존. 네메시스는 0-cost token과 copy가 같은 턴 sequence space를 폭발시킨다.

EP, SEP, Extra PP, 손패 9장, 보드 5칸, leader area 5칸도 현재 사용과 미래 선택권의 교환이다.

13. 그래서 실제 3턴 closed-loop planner를 만들었다

최소 3개의 미래 turn boundary까지 실제 engine state를 진행했다. 3 actions가 아니다. 그리고 3턴 스크립트를 고정하지 않고 한 action만 실행한 뒤 draw/generation/random 결과를 관찰하고 다시 3턴을 계산했다. Receding Horizon / MPC와 비슷한 구조다.

미래 draw order나 상대 실제 손패를 훔쳐보지 않고 belief sampling을 사용했다. FutureRelevantState에는 Spellboost, Extra PP, Countdown, Act, Rally, Shadows, destroyed-follower pool 등을 보존했다. fixed optionality/Witch/ramp bonus는 넣지 않았다.

14. 구현은 성공했고 성능은 폭발했다 — 아래로

Ablation 56 actual engine games. root action 3,979 / 3,979 전부 평가, three-turn completion 100%, hidden-info violation 0. observation replan 81,621회, plan change 35,821회.

그런데 base/widen은 human-prior-v1 대비 -37.5pt, replan/state/robust는 -25.0pt. 모든 후보가 사전 -10pt floor를 깨서 REJECT_ACTIVE_UNCHANGED. targeted, broad, market 7×7, final holdout은 NOT_RUN.

미래를 더 멀리 보면서 더 자신 있게 틀리는 AI가 완성됐다.

15. 이것은 3턴이면 충분하다는 증명이 아니다

사라진 것은 “구현상 3턴을 못 봤다”는 의심이다. “3턴이면 전략적으로 충분하다”는 것은 미해결이다. 또한 base -37.5 → replan -25.0의 방향성은 흥미롭지만 candidate당 8 conditions라 인과 확정은 불가능하다.

기존 Dragon reversal 12개를 실엔진 3턴 search로 다시 보니 ramp 방향으로 실제 순위가 바뀐 것은 1/12뿐이었다. old proxy는 ground truth가 아니었다.

새 유력 용의자는 3턴 leaf를 평가하는 terminal evaluator와 opponent response다.

16. 다음 질문 — “-150점 미래라며? 거기서 100번 하면 몇 번 이기는데?”

다음 연구에서는 leaf를 고정하고 evaluator term을 raw feature→normalization→weight→contribution까지 분해한다. -150급 이상치를 어떤 항목이 만드는지 찾는다.

그 후 같은 leaf에서 종료까지 32~128회 rollout해 empirical win rate를 만든다. raw score를 확률로 착각하지 않고 별도 calibration 후 Brier score, log loss, reliability를 측정한다. 순위 성능은 Spearman, Kendall, same-root argmax accuracy, pairwise concordance, decision regret로 본다.

opponent response는 human-prior-v1, reference-v5, search-based stress response로 cross-play한다. 이 과정이 leaf scoring, opponent model, weight/scale, state representation, horizon 부족을 분리한다.

17. 결론 — 미래는 보인다. 채점표가 수상하다

현재 상태는 한 문장이다.

AI는 “지금 뭐가 세지?” 단계에서 “3턴 미래를 실제로 본다” 단계까지 왔지만, 그 미래의 좋고 나쁨을 채점하는 방법은 아직 못 믿는다.

로얄 79.8%에서 시작해 인간 조언 실패, 위치 붕괴, actor bug, 46,900전 시장 랭킹, Future Optionality 감사, 그리고 3턴 미래 예측까지 왔다.

최신 결론은 미래는 보인다. 채점이 구리다.

명치만 치고 싶었는데 다음 과목이 Brier score가 됐다. 섀도우버스 대학원은 휴강이 없다.

데이터 부록

  • Set 8 카드 DB: 826
  • 과거 baseline: 12,480 games
  • 정책 연구: 31,406 actual engine games
  • 상태: PAUSED_COMPLETE_NO_PROMOTION
  • active: human-prior-v1
  • 시장: 52 decks / 25 archetypes / 7 leaders
  • 시장 분석: 46,900 actual engine games
  • 직접 7×7: 1,512 games
  • Future Optionality: 27,810 decisions / 118,575 root candidates / future-value 7.49%
  • sequence MISSING 23/24, plan MISSING 20/24
  • Dragon reversal: 12 = ramp 6 + Awakening 6
  • 3-turn Ablation: 56 games
  • root coverage: 3,979 / 3,979
  • 3-turn completion: 100%
  • replans: 81,621 / plan changes: 35,821
  • 판정: REJECT_ACTIVE_UNCHANGED
  • final holdout: NOT_RUN
  • Shadowverse: Worlds Beyond 공식 Deck Portal 및 클래스 설명
  • Dexel Rising Cup #2 환경/덱 리스트
  • Silver & Veness (2010), POMCP
  • Cowling, Powley & Whitehouse (2012), ISMCTS
  • Model Predictive Control / Receding Horizon Control 연구
  • Brier score 및 calibration / clustered validation 연구

이 글 공유하기

광고

오늘은 이 글

이 글을 읽은 분이 다음에 품는 질문에 각각 답하는 글입니다.

전체 글에서 찾기‘카드·보드게임’ 글 더 보기

다른 글 찾기

모든 기사

Mendoi-chan

사이트 운영자

Mendoi-chan

직장과 일상의 불편함을 구조화해 이해하기 쉬운 다음 행동으로 연결하는 글을 씁니다.

광고

새 글

  1. 1속옷 도둑 신부는 잡히는데 ‘씨뿌리기 아저씨’는 영웅? 만화는 취향 타는 부분을 덜어내고 원작은 《상상임신》까지 각성한다
  2. 2인류, 이거 못 이깁니다 — 『PRAGMATA』를 달의 미술관처럼 구경하다가 기계 문명의 물량에 절망한 이야기
  3. 3왜 내 공격만 전부 지는가 — 호무라·히카리 유저, 카즈야의 비실체와 악어 배에 분노하다
  4. 4혼자 행동하기 어려운 사람에게: “누가 없으면 못 움직인다”를 분해하고 ‘혼자 행동 OS’를 키우는 법
  5. 5달 기지보다 먼저 내 조작 체계가 붕괴했다
광고