REMAKE DAY RESEARCH / HUMAN–AI INTERACTION
게임으로 관찰하는 사람과 AI진행 중인 연구

AI 제안 수용 측정을 위한
게임 기반 Human–AI 상호작용
실험환경의 설계 및 검증

사람은 언제 AI의 제안을 받아들일까요?

실패하고 다시 도전하는 게임 속에서, 사람이 AI의 제안을
선택하거나 직접 수정하는 순간을 기록합니다.

SUMMARY S1반복되는 선택, 쌓이는 관찰
게임 공간, AI 제안 카드, 사람의 선택, 기록 장치를 순서대로 배치한 실험환경의 3D 개념 모형
  1. 01게임에서 관찰단서를 보고 질문합니다
  2. 02AI가 제안다음 방법을 제시합니다
  3. 03사람이 선택수용하거나 직접 씁니다
  4. 04선택을 기록수정하고 다시 관찰합니다
요약 그림 S1. 게임이 실험환경이 되는 과정. 선택과 규칙 적용을 기록하고 다음 회차에서 다시 관찰합니다. 작동 원리를 설명하는 개념 모형입니다. 실험환경 자세히 읽기 ↗
AT A GLANCE

지금까지 확정한 것

5분 안에 볼 근거 다섯 줄
  1. 사람 14판 중 10판이 5회차를 완주했습니다. 테스터 기록의 판 ID를 게임 DB와 대조했고, 적용된 규칙 60건 중 48건(80%)이 AI 계열 선택이었습니다. Exp 2 · 14판 집계 ↗
  2. 372개 역할-문항 실행에서 최종 폴백 0, 오류 0. 4셀 × 31문항 × 3반복의 하네스 결과이며, 재생성 9회는 성공으로 세지 않고 따로 적었습니다. Exp 1 · A.7 ↗
  3. 채점 일관성·극성 게이트를 로컬 Core와 제출 Core가 모두 통과했습니다. 극성쌍을 함께 판정하는 통제에서 gemma4:12b, Sonnet 5, Opus 5가 통과했고 한쪽만 통과한 이력은 회귀로 기록했습니다. Exp 1 · 비교표 ↗
  4. NPC 모델의 상업 라이선스 블로커를 찾아 교체했습니다. 기존 모델이 연구 전용임을 확인하고 Apache 2.0 후보 3종을 같은 기준으로 재어 kanana 1.5 8B로 바꿨습니다. 롤백은 설정 한 줄입니다. Exp 1 · A.17 ↗
  5. 제출 구성을 확정했습니다. Core Sonnet 5 · NPC Haiku 4.5 · 임베딩 gemini-embedding-001(2560차원). 의미 품질 게이트는 통과했고 지연 게이트는 반복에서 엇갈려 예외를 기록한 채택입니다. A.19 ↗ A.21 ↗

우리가 아는 약점

  • 채점기 안정성은 입증되지 않았습니다. 같은 자유서술이 67.9에서 53.3으로 채점된 이력이 있고, 이후 넣은 단조 잠금은 하향을 막는 장치이지 안정성의 증거가 아닙니다. Limitations ↗
  • 재미는 측정하지 않았습니다. 완주율과 이탈 지점은 기록되지만 재미 게이트는 돌리지 않았고, 14판 중 4판은 5회차 전에 끝났습니다. Limitations ↗
  • 제출 구성의 실판 재측정은 부족합니다. planner 항목 수 초과 재생성(Sonnet 5회차 실행에서 재생성 2회·폴백 1회)은 2026-09-18 엔진 절단으로 닫았지만, 절단 뒤 외부 API 완주 재측정과 채점 캘리브레이션·누설·원숭이손 평가는 남아 있습니다. Exp 1 · A.19 ↗
01 / ABSTRACT

이 연구가 묻는 것

배경지식 없이 읽는 요약

AI가 방법을 제안해도, 마지막 선택은 사람이 합니다.
그 선택을 반복해서 관찰할 수 있을까요?

REMAKE DAY는 실패, 설명, 제안, 선택, 재실행이 이어지는 게임입니다. 플레이어가 AI의 제안을 받아들이는지, 직접 규칙을 쓰는지, 이후 어떤 설명을 적는지를 기록합니다. 게임을 실제로 작동하는 사람–AI 상호작용 실험환경으로 설계했습니다.

먼저 AI 모델과 측정 도구가 제대로 작동하는지 평가했습니다. 그 환경에서 사람 14판의 플레이를 기록했고, 10판이 5회차를 완주했으며 적용된 규칙 60건 중 48건이 AI 계열 선택이었습니다. 표본이 작고 기구 버전이 섞여 있어 탐색적 관찰로 읽습니다. AI의 설명이 선택을 바꾸는지는 다음 실험으로 사전등록해 두었습니다.

정식 Abstract와 전체 연구 설명 읽기
02 / CONTRIBUTIONS

무엇을 만들고 검증했나

03 / EVIDENCE

지금까지 확인한 범위

측정하지 않은 것은 주장하지 않는다.

관찰한 사실, 아직 모르는 것, 실험환경의 한계를 함께 기록합니다.

한계 읽기 ↗
용어를 쉽게 읽기 배경지식 없이 읽는 연구
실험환경 Testbed
조건을 정해 두고 같은 과정을 반복해서 실험할 수 있는 환경입니다.
AI 제안 수용 Acceptance
사람이 AI가 제안한 방법을 선택하는 행동입니다. AI를 믿는 마음 자체를 측정한 것은 아닙니다.
이벤트 기록 Event-level trace
제안, 선택, 규칙 적용 같은 일이 일어날 때마다 남긴 기록입니다.
형식 통과율 Schema pass rate
AI가 프로그램이 읽을 수 있도록 정해진 응답 형식을 지킨 비율입니다.
대체 처리 Fallback
AI 응답에 문제가 있을 때 준비된 다른 처리로 넘어가는 것입니다. 평가에서는 정상 응답과 구분합니다.
통과 기준 Gate
다음 평가 단계로 넘어가기 위해 미리 정한 조건입니다.
러너 Runner
정해진 문항을 실행하고 응답·시간·실패를 모으는 평가 프로그램입니다.
GPU 동주
여러 모델을 같은 GPU 메모리에 함께 올려 사용하는 조건입니다. 동시 접속자 수와는 다른 개념입니다.
탐색적 관찰 Exploratory
적은 사례에서 어떤 일이 일어나는지 살펴보는 초기 관찰입니다. 전체 사람들의 경향으로 일반화하지 않습니다.
사전등록 Preregistration
결과를 보기 전에 질문, 방법, 판정 기준을 고정해서 공개하는 것입니다.
응답 지연 p95
측정한 요청의 약 95%가 이 시간 안에 응답했다는 뜻입니다. 평균 응답 시간과 다릅니다.
미실행 NOT RUN
아직 측정하지 않았다는 뜻입니다. 측정 결과가 0이라는 뜻이 아닙니다.
FULL RECORD연구 전문과 English Abstract

Abstract

사람 판 14판(2026-09-18 재집계)에서 적용 규칙 60건의 출처를 집계했다(AI 계열 48·직접 작성 12). 5회차 완주 10판의 회차별 게임 점수를 기록했다. 기존 6판·20건 집계는 병기한다.

Agentic systems increasingly place humans in loops where AI suggests interventions and humans accept, reject, or revise them. However, this reliance is difficult to observe repeatedly under controlled and reproducible conditions.

We introduce REMAKE DAY, a game-based experimental testbed that reproduces an execution–failure–explanation–revision loop. The environment records defined choice, submission, and rule-application events. We report exploratory counts of applied-rule sources (48 of 60 AI-linked across 14 human sessions, 10 of which completed all five rounds) and per-round game-score records. Rationale effects, side-effect recognition, question quality, and understanding change remain unmeasured or require operational definitions.

The game supports repeated execution and behavioral recording for studying human–AI decision making. Independent reproduction of behavioral results and validation of psychological measures remain to be established.


포지셔닝

이 프로젝트가 보여주려는 것은 “AI를 이용해 게임을 만들었다”가 아니다.

AI Agent가 개입하는 반복적 실패–수정 환경을 만들고 그 안에서 사람이 AI의 제안을 수용·거절하고 규칙을 선택했는지를 행동 기록으로 관찰했다.

We built a repeatable game environment that records defined choices about AI-generated interventions; the current behavioral evidence is exploratory.

                    REMAKE DAY

┌──────────────────────────────────────────┐
│ 1. GAME                                  │
│ 실제 플레이 가능한 제품                  │
└──────────────────────────────────────────┘
                    │
                    ▼
┌──────────────────────────────────────────┐
│ 2. EXPERIMENT DASHBOARD                  │
│ Acceptance / Rationale / Understanding   │
│ Side-effect / Question Quality           │
└──────────────────────────────────────────┘
                    │
                    ▼
┌──────────────────────────────────────────┐
│ 3. RESEARCH REPORT                       │
│ Question → Hypothesis → Method           │
│ → Results → Limitations                  │
└──────────────────────────────────────────┘

Contributions

C1 — Experimental Environment. 실패 → 설명 → AI 제안 → Human Approval → 규칙 수정 → 재실행 과정을 반복 가능한 게임환경에서 실행·기록할 수 있도록 구현했다(operationalize).

C2 — Behavioral Measurement. 정의한 선택·제출·규칙 적용을 event-level trace(이벤트별 기록)로 남겼다. AI 계열 규칙과 직접 작성 규칙의 출처를 14판 60건에서 집계했다(기존 6판 20건 병기). explanation exposure(설명 표시 여부)는 향후 Rationale A/B의 조건이며 질문 품질·이해 변화·부작용 인지는 로그 보유만으로 측정 완료라고 하지 않는다.

C3 — Reproducible Evaluation. LLM 판단과 deterministic domain logic(같은 입력에 같은 결과를 내는 게임 규칙)을 분리했다. 반복 실행과 행동 기록을 지원하며 공개한 집계는 명시된 수집 시점·기구 조건의 기록을 기준으로 한다. 독립 재현 묶음과 행동 척도의 타당도는 별도 과제다. → 재현 범위와 한계


미측정 항목

부작용 인지율은 NOT RUN이며 측정 가능성부터 미해결이다. Rationale A/B는 사전등록·미실행이고 질문 품질·이해도 변화는 조작적 정의와 분석이 아직 확정되지 않았다.

현재 상태

트랙 상태 페이지
System Evaluation — 모델 선정 (E7/E6) 역할별 실측·채택: Funnel 5단계 실행과 Core·NPC 채택 기록. manager_paw 등 미측정 축은 Exp 1에서 별도 확인 Exp 1
System Evaluation — 외부 API 서빙 (A.19) 2026-09-17 채택: Core Sonnet 5 · NPC Haiku 4.5. 측정한 의미 품질 게이트 통과, 지연 게이트는 1회·3회 반복에서 엇갈림. 남은 평가: 원숭이손·채점 캘리브레이션·누설 Exp 1 · A.19
Behavioral Observation — 사람 플레이 2026-09-18 재집계: 사람 판 14판(5회차 완주 10판), 규칙 출처 AI 계열 48/60. 기존 6판 집계 병기, 기구 버전 혼재. 판수는 고유 참가자 수가 아님 Exp 2
Rationale A/B (Anchor Experiment) 사전등록·미실행: 공개 원문 고정, 배정·분모·분석 등 미정 항목은 읽기 안내 참조 사전등록

이 사이트의 원칙은 하나다. 측정하지 않은 것은 주장하지 않는다. 미측정 항목은 NOT RUN으로 표기하고 표본이 작으면 작다고 쓴다.