“826장을 손으로 입력해야 하나?” 했는데 반나절 만에 연구소가 생기기 시작했다

읽기 기능 사용법

듣기는 본문을 읽어 줍니다. 속독은 구절을 차례로 표시하며 속도를 조절할 수 있습니다. 언어 연습은 다른 언어판과 번역을 비교합니다. 저장한 북마크는 이 브라우저의 플레이어 목록에서 다시 열 수 있습니다.

이 글 공유하기

이 글 공유하기

광고
광고

카드게임 시뮬레이터라고 하면 카드 이름, 비용, 스탯, 효과, 특수 처리까지 수백 장을 직접 입력하는 지옥부터 떠올리기 쉽다.

하지만 카드 데이터가 JSON 같은 구조화 형태로 있고, 이미 쓸 만한 대전 엔진까지 공개되어 있으면 이야기가 완전히 달라진다. DB를 한 번에 읽고, 공통 효과는 기존 처리기를 재사용하며, 정말 새로운 기믹만 추가하면 된다.

이번 사례에서 Beyond Decks는 카드 데이터 연동, 덱, seed, replay, Battle Sim, AI, benchmark까지 상당 부분 갖춰져 있었다.

즉 게임을 다시 만드는 것이 아니라 이미 존재하는 샌드박스 위에 연구 장비와 더 좋은 두뇌를 올리는 작업이었다.

1. 연출을 빼면 카드게임 한 판은 놀랄 만큼 짧다

실제 클라이언트에는 드로우 연출, 카드 드래그, 보이스, 진화, 공격 모션, 데미지 표시, 인간의 고민 시간이 있다.

시뮬레이터는 거의 이것뿐이다.

상태 A
→ 합법 행동 생성
→ 행동 선택
→ 상태 갱신
→ 상태 B

승부가 날 때까지 반복한다.

그래서 화면에서는 몇 분 걸리는 게임도 내부 계산에서는 매우 빠르게 끝난다. 느려지는 핵심은 연출이 아니라 AI에게 미래를 얼마나 깊게 생각시키느냐다.

2. 기반 시뮬레이터는 장난감이 아니라 꽤 본격적이었다

기존 엔진에는 deterministic seed, replay inspection, target selection, tactical look-ahead, full-turn planning, lethal solver, 클래스별 메커니즘, benchmark, 카드 커버리지 감사와 runtime check가 있다.

다만 제작자도 이 AI를 완벽한 대회 플레이어가 아니라 중간 수준이라고 설명한다.

이게 오히려 좋다. 룰, 카드, 재현 seed, replay, 대전 장치는 이미 상당히 갖춰져 있다. 남은 핵심은 사람처럼 상황을 판단하는 의사결정층이다.

3. 12,480판에서 로얄 약 79.8%—대량 실험은 AI의 버릇도 증폭한다

이전 12,480판에서는 규칙 커버리지가 양호했는데도 로얄 약 79.8%, 위치 약 25.6%라는 극단적인 결과가 나왔다.

이걸 “12,480판이나 했으니 로얄이 진짜 최강”이라고 읽으면 안 된다.

로얄 AI가

추종자 낸다
필드 잡는다
얼굴 열린다
때린다
이긴다

만으로도 꽤 굴러가고, 복잡한 덱 AI가

콤보 파츠? 지금 사용!
진화? 지금 사용!
손패 제한? 모름!
3턴 뒤? 미래의 나에게 맡김!

이라면 결과가 당연히 기울어진다.

대량 표본은 잘못된 AI도 아주 정확하게 측정한다.

4. 그래서 인간 플레이 지식을 넣었다—정답 암기가 아니라 사고 습관으로

멀리건, 보존 카드, 진화/초진화 예약, 손패·필드 공간, 매치업별 공격/수비 전환, 상대의 강한 턴, 대체 승리 플랜, 2~3턴 킬각, 흔한 실수를 구조화했다.

하지만 “이 상황이면 무조건 이 카드”로 고정하면 공략집 bot이 된다.

그래서 지식을 점수로 쓴다.

hold_value +20
future_combo_value +30
opponent_counter_cost +25
조기 사용 -40

인간 지식은 답안지가 아니라 탐색 방향을 잡는 습관이다.

5. 지금 도는 것은 실제 4,032판—2,016은 비교 조건 수다

현재 A/B는 56개 매치업 그룹 × 2방향 × 18seed다.

56 × 2 × 18 = 2,016 A/B 조건

각 조건에서 기준 정책과 인간 지식 정책이 각각 1판씩 하므로 실제 엔진은 4,032판을 처리한다.

즉 2,016은 성스러운 숫자가 아니라 두 AI가 같은 시험 문제를 푸는 비교 셀의 수다.

6. 큰 실행 전에 멈춰서 검사한다

4,032판 전에 피니셔를 너무 일찍 쓰는 회귀 문제를 먼저 수정했다. 준비 카드 우선 조건을 통과시키고, 실제 DB와 실제 덱으로 선후공 스모크를 돌린다.

카드 대응률, 미지원 카드, 규칙 누락, DB hash, 중복 ID, 관련 카드 누락, 코퍼스 버전까지 확인한다.

이유는 단순하다. AI가 이상한 채로 12,000판을 돌려 본 적이 있기 때문이다.

표본 수보다 먼저 전제가 정상인지 검사한다.

7. 인간 지식 v1도 아직 완전한 임기응변은 아니다

같은 램프 드래곤도 상황에 따라 목적이 바뀐다.

평상시 → 램프
다음 턴 죽음 → 램프 중단, 수비
상대 자원 고갈 → 공격
피니셔 있지만 준비 부족 → 보존
준비 완료 → 피니셔 사용

“드래곤은 램프한다”가 아니라 지금 무엇이 가장 중요한지 매턴 다시 계산해야 한다.

8. Adaptive AI는 ATTACK / SURVIVE / SETUP / RESOURCE / LETHAL을 바꾼다

다음 단계에서는 내부 모드를 동적으로 계산한다.

HP, 필드, 손패, PP, 진화 자원, 상대 압박, 다음 턴 예상 피해, 콤보 완성도를 보고 공격·생존·준비·자원·킬각의 점수를 다시 만든다.

죽기 직전이면 효율 좋은 램프보다 제거가 더 높은 점수를 받아야 한다.

임기응변은 카드별 금지 규칙이 아니다. 지금 쓰는 가치와 기다리는 가치를 매번 비교하는 것이다.

9. 2~3턴을 보되, 인간 지식으로 가지를 줄인다

모든 합법 행동의 모든 미래를 읽으면 경우의 수가 폭발한다.

그래서:

합법 행동 50
→ 인간 지식으로 20
→ 가벼운 평가로 10
→ 상위 10개만 2~3턴 탐색

으로 줄인다.

지금 +8이지만 다음 턴 죽는 행동보다, 지금 +3이어도 생존과 반격이 가능한 행동이 낫다.

10. 상대 손패를 그냥 보면 치트다—“있을 수도 있다”를 확률로 처리한다

숨은 손패를 AI에게 보여주면 투시 능력자가 된다.

대신 리더, 아키타입, 사용 카드, 남은 카드, 손패 수, 이전 행동 같은 공개 정보로 가능한 손패 세계를 만든다.

AoE 보유 30%
미보유 70%

여러 세계에서 같은 행동을 평가한다.

그 결과 “있을 수 있으니 케어하지만, 모든 걸 케어하다가 지지는 않는다”에 가까워진다.

11. 순서가 중요하다—현재 4,032판 중간에 AI를 업그레이드하면 안 된다

실행 중간에 v2를 넣으면 앞부분과 뒷부분이 다른 AI가 되어 실험이 깨진다.

순서는:

human-prior v1 고정
→ 4,032판 완료
→ 남은 실수 분석
→ Adaptive v2
→ quick A/B
→ 약 2,016조건 재검증
→ 12k급 full
→ 40장 최적화
→ 매치업 진단

이다.

특히 “어디서 아직 바보였는지”를 실제 결과로 확인한 뒤 v2를 만들어야 한다.

12. 목표는 공략집 암기 CPU가 아니라 공략집을 깨도 되는 CPU다

인간 지식, 게임 트리, 미래 평가, 상대 손패 확률, 동적 목적 전환을 결합한다.

그러면 “기본은 램프지만 죽으면 수비”, “기본은 보존하지만 지금 킬이면 전부 사용”, “기본은 전개하지만 광역기가 강하게 의심되면 일부 보존”이 가능해진다.

공략을 참고하되, 실제 필드가 공략보다 우선한다.

13. 이 방식은 한 게임에만 해당하지 않는다—게임 대신 승리 연구소를 만든다

포켓몬이라면 기존 시뮬레이터 위에서 파티, 선출, 교체, 기술 선택을 최적화할 수 있다. 카드게임이라면 덱, 멀리건, 자원, 매치업 정책을 최적화한다.

게임 전체를 다시 만드는 것과 이기는 의사결정을 연구하는 것은 다른 일이다.

좋은 시뮬레이터가 있으면 빌리면 된다.

경기장을 다시 짓지 말고, 그 경기장에서 이기는 연구소를 짓는다.

그리고 로얄이 또 80% 가까이 나오면 먼저 확인하자.

“얘 또 ‘내고 때리기’ 과목만 만점 받은 거 아니냐?”


이 글 공유하기

광고

하나 더, 뭐 재미있는 거 없어?

다 읽은 김에. 가까운 이야기 몇 편과, 전혀 다르지만 재미있는 이야기를 골랐어요.

  1. 가까운 이야기만두는 10분, 덱은 3초 안에 고르자9탄 출시 첫날에 찾은 “생각을 적게 해도 강한” 덱 선택법
  2. RPG 랭킹 1위를 봐도 “음…”이 나오는 이유BG3와 『Clair Obscur: Expedition 33』로 보는 “고평가”와 “나한테 맞음”의 차이
  3. 전혀 다르지만 재미있는성인이 된 뒤 친구를 만드는 일은 거리감이 90%다처음부터 절친을 만들려고 하지 말자
  4. 글 1왜 사람은 집안일이나 일을 줄이지 못할까
  5. 혼자 행동하기 어려운 사람에게“누가 없으면 못 움직인다”를 분해하고 ‘혼자 행동 OS’를 키우는 법
  6. 『하나만마』에서 “여동생을 지켜라”는 왜 토시키의 인생 규칙이 되었나

오늘은 이 글

이 글을 읽은 분이 다음에 품는 질문에 각각 답하는 글입니다.

전체 글에서 찾기‘카드·보드게임’ 글 더 보기

다른 글 찾기

모든 기사

Mendoi-chan

사이트 운영자

Mendoi-chan

직장과 일상의 불편함을 구조화해 이해하기 쉬운 다음 행동으로 연결하는 글을 씁니다.