AI로 최강 AI를 만들자――미래를 보고도 약해진 섀도우버스 WB AI가 승리 루트·패배 루트·강제 결과의 증명까지 역산하기 시작했다

소재: 『Shadowverse: Worlds Beyond』

1만 번 반복하면 진실이 되는 것이 아니라 1만 번 빠르게 같은 실수를 할 수도 있다.

읽기 기능 사용법

듣기는 본문을 읽어 줍니다. 속독은 구절을 차례로 표시하며 속도를 조절할 수 있습니다. 언어 연습은 다른 언어판과 번역을 비교합니다. 저장한 북마크는 이 브라우저의 플레이어 목록에서 다시 열 수 있습니다.

이 글 공유하기

이 글 공유하기

광고
광고

1. 명치에 질주를 꽂고 싶었는데 연구소가 생겼다

목표는 현재 가장 강한 덱을 AI로 찾는 것이었다. Set 8, 카드 826장 DB, engine commit, 환경 hash, 합법 deck, seed를 고정했다. 과거 기준 12,480전은 rule coverage 100%, unsupported 0, rule gap 0이었지만 raw AI는 Sword 약 79.8%, Rune 25.6%라는 이상한 성적표를 냈다.

1만 번 반복하면 진실이 되는 것이 아니라 1만 번 빠르게 같은 실수를 할 수도 있다.

2. 인간 조언을 넣자 약해졌고 평균값의 함정이 보였다

human-prior-v1 exact A/B는 2,016 paired units / 4,032 games. baseline 50.99% 대 49.36%, -1.64pt. Adaptive v2는 전체 +0.74pt였지만 Runecraft -6.25pt로 floor를 깨고 REJECT, T11도 Abysscraft -16.67pt 등으로 REJECT됐다.

인간 조언은 조건부인데 fixed weight는 문맥을 죽일 수 있다. 평균은 합격인데 한 과목은 화재일 수 있다.

3. 원인 분석 중 연구 시스템의 버그도 잡았다

max_nodes=160이 실제 planner와 분리된 문제, actor와 fixed-player 관점을 뒤집은 인과분석 문제를 수정했다. 그러나 broad performance는 복구되지 않았다.

정책 연구는 20 experiments / 31,406 confirmed engine games에서 PAUSED_COMPLETE_NO_PROMOTION. 439 discordant units 중 완전 설명 0, 부분 설명 11, 미해결 428. active는 human-prior-v1, final unseen 8,064게임은 사용하지 않았다.

4. 시장 52덱을 46,900전 돌리니 “뇌사끼리 랭킹”이 나왔다

52 decks / 25 archetypes / 7 leaders 시장 분석은 46,900전. 별도 직접 7×7은 1,512전이었다. 평균은 Buff Forest 71.99%, Rally Sword 65.97%, Midrange Abyss 54.17%, Artifact Portal 54.17%, Ramp Dragon 53.70%, Evolution Haven 31.71%, Calgidensula Witch 18.29%.

이는 ladder WR이 아니라 simulator-direct 값이다. 지금 좋은 행동이 미래에도 좋은 덱이 AI에게 쉬웠고, 지금 손해를 보고 미래를 사는 덱은 어려워 보였다.

5. 인간 대회에서 Witch는 다른 우주에 있었다

2026-08-08 Dexel Rising Cup #2의 384 제출 덱 중 Hand Witch는 116개, 약 30.2%로 최다였다. 반면 AI 7×7의 Calgidensula Witch는 18.29% 최하위. 같은 40장이라고 단정할 수 없지만 인간과 AI의 Witch 운용 차이는 매우 컸다.

Rally Sword는 양쪽에서 강해, 단순한 판단에서도 덜 망가지는 전략이 초보자에게도 안정적일 수 있다는 가설이 생겼다.

6. Future Optionality: 규칙은 알고 순서와 계획은 거의 없었다

7 leaders / 24 mechanics를 RULE, STATE, VISIBILITY, IMMEDIATE VALUE, FUTURE VALUE, SEQUENCE, SEARCH, PLAN으로 감사했다. 27,810 decisions / 118,575 root candidates 중 explicit future value는 8,878, 7.49%. rule/state/immediate는 24/24 supported지만 sequence는 23/24, plan은 20/24 MISSING.

Witch는 draw 순서, Dragon은 PP와 Awakening이 미래 선택지를 바꿨다. Dragon MYOPIC_REVERSAL 12건은 ramp 6 + Awakening 6이었지만 hard bonus로 사용하지 않았다.

7. 실제 3턴 closed-loop planner를 만들었다

최소 세 future turn boundaries를 실 engine으로 진행하고 한 action만 실행한 뒤 관측마다 재계획했다. hidden hand나 future draw order는 보지 않았다.

56-game Ablation에서 root 3,979/3,979, 3-turn completion 100%, hidden-info 0, replans 81,621, plan changes 35,821. 구현은 성공했지만 human-prior-v1 대비 -25.0~-37.5pt. 더 멀리 보며 더 멀리 틀렸다.

8. leaf calibration으로 어디서 순위가 깨지는지 나눴다

3,979 root-action leaves, 1,009 unique leaves, 54,208 terminal rollout rows. first divergence 73건은 leaf weighting 59, chance aggregation 12, opponent backup 2였다.

따라서 문제는 단순 horizon만이 아니라 leaf state 평가였다. 기존 Dragon reversal 12건도 실 3-turn search에서 ramp 쪽으로 실제 변경된 것은 1/12뿐이었다.

9. learned value는 예측을 개선하고 최선의 수 선택을 악화시켰다

fresh holdout v1.1은 727 leaves / 104 roots / 22,768 terminal rollouts, 7 leaders. Brier 0.1144→0.0972, pairwise 75.7→78.9% 개선.

그러나 root argmax 59.6→39.4%, top2 73.1→64.4%, top3 82.7→76.0%, mean regret 4.42→5.29pt로 악화. Forest/Haven/Portal floor 실패. HOLD_OFFLINE.

확률을 잘 맞히는 것과 실제 가장 좋은 action을 고르는 것은 다르다.

10. 이제 lethal에서 거꾸로 생각한다

LETHAL ← damage ← PP ← cards ← Spellboost/Awakening/Rally threshold ← current action으로 goal regression한다. Ramp에 +8점, draw-first에 +10점을 주지 않는다.

실제 승리 루트가 그 조건을 요구할 때만 setup action에 가치가 생긴다. 뒤에서 승리 조건을 만들고 앞방향 engine으로 진짜 통하는지 확인한다.

11. 내가 죽는 루트도 거꾸로 계산한다

SELF_LOSS에서 상대 damage, board damage, 추가 hand damage, Ward 제거, PP와 공개정보를 역산한다. 현재 action이 상대 win route를 끊는지 기록한다.

안전만 최적화하면 회복만 하다 패배하는 AI가 된다. RISK_REQUIRED에서는 safe line이 사실상 무승이면 forced loss가 아닌 범위에서 승리 가능성이 가장 큰 위험을 택한다.

12. “강제”는 증명 범위를 가져야 한다

승리는 PROVEN_WIN_NOW, FORCED_WIN_FULLY_OBSERVABLE_SUBTREE, FORCED_WIN_WITHIN_ENUMERATED_RESPONSE_SET, ROBUST_WIN_BELIEF, CONDITIONAL_WIN으로 분리한다. 패배도 같은 원칙으로 proof / belief / conditional을 나눈다.

proof search는 self=OR, opponent=AND. chance를 확정이라 부르려면 모든 reachable outcome을 처리한다. hidden hand truth, future draw order, strategy fusion은 금지하고 관측 뒤에만 replan한다.

13. 우선순위는 점수 더하기가 아니라 단계 gate다

순서는 proven win now → fully observable forced → enumerated forced → 피할 수 있는 forced loss 제거 → expected final win probability → near-tie safety → robustness → route progress/cut → validated continuation value다.

belief/conditional win은 forced가 아니다. 승률도 낮고 loss risk도 높은 action만 dominated로 제거한다.

14. 3턴은 최소거리, 필요한 가지에만 5턴

H_MIN=3, selective H_MAX=5. lethal, forced response, threshold, delayed payoff, near tie가 남은 branch만 연장한다.

rollout은 32에서 시작해 애매한 상위만 64→128→256. root는 UNIQUE_BEST / PRACTICAL_TIE / UNRESOLVED. epsilon 0.02/0.03/0.05는 development에서만 비교하고 새 holdout 전 고정한다.

15. 새 QC는 예쁜 수치보다 올바른 1수를 먼저 본다

hidden-info, future-draw, rule gap, strategy fusion, false proven, forced scope mislabel, chance completeness, lethal miss, avoidable forced loss, leakage를 모두 0으로 요구한다. 이후 7 leader coverage, argmax, mean/p90/p95 regret, leader floor, top2 best-set을 Primary로 본다.

Brier/pairwise/calibration은 Secondary이며 Primary 실패를 구하지 못한다. v1.1 holdout은 영구 소비 완료.

미래를 보여줬더니 약해졌다. 승률을 학습했더니 예측은 좋아지고 최선의 수는 더 틀렸다. 그래서 이제 승리와 패배에서 모두 역산하고, 증명한 범위만 “강제”라 부른다.

AI로 최강 AI를 만든다. 현재는 게임 AI보다 QC가 더 강할지도 모른다. 정상적인 순서다.


이 글 공유하기

광고

하나 더, 뭐 재미있는 거 없어?

다 읽은 김에. 가까운 이야기 몇 편과, 전혀 다르지만 재미있는 이야기를 골랐어요.

  1. 가까운 이야기위화감은 버그 리포트다“대전 말고 다른 것과 싸우게 하지 마라”에서 시작하는 서비스·환경·관계 설계론
  2. 왜 내 공격만 전부 지는가호무라·히카리 유저, 카즈야의 비실체와 악어 배에 분노하다
  3. 전혀 다르지만 재미있는성인이 된 뒤 친구를 만드는 일은 거리감이 90%다처음부터 절친을 만들려고 하지 말자
  4. 건강검진 전에 자위하면 소변검사로 들킬까?“첫 소변으로 씻겨 나간다”는 말이 진짜인지 논문까지 파봤다
  5. 혼자 행동하기 어려운 사람에게“누가 없으면 못 움직인다”를 분해하고 ‘혼자 행동 OS’를 키우는 법
  6. 인류, 이거 못 이깁니다『PRAGMATA』를 달의 미술관처럼 구경하다가 기계 문명의 물량에 절망한 이야기

오늘은 이 글

이 글을 읽은 분이 다음에 품는 질문에 각각 답하는 글입니다.

전체 글에서 찾기‘카드·보드게임’ 글 더 보기

다른 글 찾기

모든 기사

Mendoi-chan

사이트 운영자

Mendoi-chan

직장과 일상의 불편함을 구조화해 이해하기 쉬운 다음 행동으로 연결하는 글을 씁니다.

광고

새 글

  1. 1속옷 도둑 신부는 잡히는데 ‘씨뿌리기 아저씨’는 영웅? 만화는 취향 타는 부분을 덜어내고 원작은 《상상임신》까지 각성한다
  2. 2달 기지보다 먼저 내 조작 체계가 붕괴했다
  3. 350년 주택대출은 집을 싸게 만드는 마법이 아니다 — 부채 게임·금리 위험·일본 금융청 감시를 쉽게 풀어보기
  4. 4RPG 랭킹 1위를 봐도 “음…”이 나오는 이유 — BG3와 『Clair Obscur: Expedition 33』로 보는 “고평가”와 “나한테 맞음”의 차이
  5. 5SNS 소개문은 ‘요약’이 아니라 ‘예고편’이어야 한다 — 낚시 없이 다음 문장을 읽게 만드는 법

함께 읽으면 좋은 글

광고