RESEARCHResearch Statement

연구의 출발점

왜 AI 연구를 게임 안에서 했을까?

Statement — 왜 게임인가

게임은 사람이 AI의 제안을 여러 번 마주하고 판단하게 만드는 실험기구입니다. 선택과 그 뒤의 변화를 같은 형식으로 기록할 수 있습니다.

핵심 주장

  • 측정 대상은 AI가 만든 콘텐츠가 아니라 AI 제안 앞에서 사람이 내리는 선택입니다.
  • 모델 검증과 사람 행동 관찰을 두 층으로 나누어 기록합니다. 기구 오류가 행동 해석에 미치는 한계도 함께 적었습니다.
  • 모델을 바꿀 때 평가 실행 프로그램(러너)으로 다시 확인하며, 러너 수정과 기준 예외도 기록했습니다.

해석 주의. 시스템 검증은 모델 역할별 통과 여부이고, 사람 행동 근거는 작은 탐색적 관찰입니다. 두 층의 측정을 하나의 성능 주장으로 합치지 않습니다.

전체 연구 기록과 근거 표 보기 ↓

용어를 쉽게 읽기 배경지식 없이 읽는 연구
실험환경 Testbed
조건을 정해 두고 같은 과정을 반복해서 실험할 수 있는 환경입니다.
AI 제안 수용 Acceptance
사람이 AI가 제안한 방법을 선택하는 행동입니다. AI를 믿는 마음 자체를 측정한 것은 아닙니다.
이벤트 기록 Event-level trace
제안, 선택, 규칙 적용 같은 일이 일어날 때마다 남긴 기록입니다.
형식 통과율 Schema pass rate
AI가 프로그램이 읽을 수 있도록 정해진 응답 형식을 지킨 비율입니다.
대체 처리 Fallback
AI 응답에 문제가 있을 때 준비된 다른 처리로 넘어가는 것입니다. 평가에서는 정상 응답과 구분합니다.
통과 기준 Gate
다음 평가 단계로 넘어가기 위해 미리 정한 조건입니다.
러너 Runner
정해진 문항을 실행하고 응답·시간·실패를 모으는 평가 프로그램입니다.
GPU 동주
여러 모델을 같은 GPU 메모리에 함께 올려 사용하는 조건입니다. 동시 접속자 수와는 다른 개념입니다.
탐색적 관찰 Exploratory
적은 사례에서 어떤 일이 일어나는지 살펴보는 초기 관찰입니다. 전체 사람들의 경향으로 일반화하지 않습니다.
사전등록 Preregistration
결과를 보기 전에 질문, 방법, 판정 기준을 고정해서 공개하는 것입니다.
응답 지연 p95
측정한 요청의 약 95%가 이 시간 안에 응답했다는 뜻입니다. 평균 응답 시간과 다릅니다.
미실행 NOT RUN
아직 측정하지 않았다는 뜻입니다. 측정 결과가 0이라는 뜻이 아닙니다.
FULL RECORD

상세 연구 기록

요약으로 ↑

방법, 수치, 판단 근거와 당시의 한계를 담은 전체 기록입니다. 먼저 위의 설명을 읽고, 필요한 절을 목차에서 찾아보세요.

저희는 AI로 게임을 만든 것이 아니라, AI 제안에 대한 사람의 수용을 측정하는 실험환경을 게임의 형태로 설계하고 검증했습니다.

실제 문제

AI 에이전트가 제안하고 사람이 승인하는 루프는 이제 코드 리뷰, 업무 자동화, 에이전트 운영 등에서 나타납니다. 저희는 AI 제안의 수용과 거부를 반복 가능한 조건에서 기록할 실험환경을 만들고자 했습니다. 여기서 직접 센 것은 신뢰라는 마음 자체가 아니라 제안 수용과 규칙 선택 행동입니다.

AI 제안 수용을 실험으로 관찰한 선행 사례로는 199명이 참여한 과수용 비교실험인 Buçinca et al. (2021)과 모델 예측·설명 노출을 달리한 속임수 탐지 실험인 Lai & Tan (2019)이 있습니다. 이 두 사례는 체계적 문헌 고찰이나 같은 게임기구의 존재 증명이 아닙니다. 이번 프로젝트의 기여는 반복 실패–규칙 수정 과정을 게임으로 구현하고 그 안의 선택을 기록한 데 있습니다.

만든 것

REMAKE DAY는 실패→설명→AI 제안→사람의 승인→규칙 수정→재실행 루프를 가진 추리 게임이며 이 루프에서 정의한 선택·제출·규칙 적용 이벤트를 기록하는 반복 실행 가능한 Human–AI Interaction 실험환경입니다. 이벤트 종류와 측정 상태는 실험환경 설계에 정리했습니다. 내적 판단이나 로그의 완전성까지 검증한 것은 아닙니다.

게임은 이 연구의 실험기구입니다. 반복 플레이를 통해 AI와의 판단 루프에 참여하도록 설계했습니다. 자발적 반복과 몰입의 정도, 다른 실험환경 대비 속도는 측정하지 않았습니다.

실제로 수행한 검증

이 환경으로 두 층의 검증을 실측으로 수행했습니다.

① 시스템 검증: 16GB GPU 예산 안에서 로컬 모델 후보를 5단계 게이트(스키마 통과율·폴백률·지연 p95·동시 상주·루프 완주)로 실측해 Core/NPC 모델 채택을 결정했습니다. → Exp 1

② 행동 관찰: 기존 6판(확정 5·유력 1)에서 적용된 규칙 20건 중 AI 계열은 14건(원숭이손 수락 6·추천 옵션 8, 70%), 직접 작성은 6건(30%)이었습니다. 같은 판의 반복 선택이 포함된 탐색적 집계이며 기구 버전이 섞여 있어 경향을 주장하지 않습니다. 후속 9/16 사례 1판은 별도로 제시합니다. 판수는 고유 참가자 수가 아닙니다. → Exp 2

원칙은 하나입니다: 측정하지 않은 것은 주장하지 않는다.

게임에서 모델과 사람의 선택을 함께 검증하다

새 모델이 나올 때마다 “우리 서비스에 충분한가?”를 판단하는 비용은 계속 커집니다. 저희는 게임이라는 반복 루프를 검증 벤치로 사용해 모델 교체 결정(Core gemma4:12b 채택 기록은 9/14, NPC kanana → gemma4:12b 교체 기록은 9/15)을 하루 단위 실측으로 내렸습니다. 9/17 개발 구성에는 다시 kanana1.5:8b가 기록돼 있습니다. 복귀 결정·적용 시점과 정책 버전은 아직 연결 확인이 필요하므로 이 기록을 현재 구성으로 통일하지 않습니다.

심사용 서빙을 외부 API로 옮길 때도 같은 평가 체계를 사용했고 어댑터·러너를 수정했습니다. 측정한 의미 품질 게이트는 통과했으나 지연 게이트는 1회·3회 반복에서 엇갈렸습니다. 여기서 비열등은 사전 통과선에 따른 운영 판정이며 통계적 비열등성 검정이 아닙니다. 2026-09-17 제출 조합(Core Sonnet 5 · NPC Haiku 4.5)을 확정했고 원숭이손·채점 캘리브레이션·누설 평가는 남아 있습니다. → Exp 1 · A.19

이 게임 환경에서 모델 교체를 하루 단위로 평가하고 사람의 선택도 관찰했습니다.