RESEARCHBehavioral Evaluation

Exp 2 · 탐색적 관찰

실제 플레이어는 AI 제안과 직접 작성 중 무엇을 골랐을까?

Exp 2 — Human Behavioral Observations

사람 판 14판에서 규칙 선택 60건의 출처를 세었고(2026-09-18 재집계), 기존 6판 집계와 완주 사례는 병기합니다.

집계와 사례를 분리해서 읽기

  • AI 개입 수락, AI 추천 선택, 직접 작성을 서로 나누어 셌습니다. 14판에서 60건 중 48건이 AI 계열이었습니다.
  • 14판 중 10판이 5회차를 완주했고, 회차별 총점은 기록된 값을 그대로 보여 줍니다.
  • 아래 그림의 6판 집계와 완주 사례는 2026-09-15·16 기록이며, 14판 재집계는 본문 표에 있습니다.

SUMMARY S4A · 2026-09-15 집계

6판에서 기록된 규칙 선택 20회

AI 개입 수락 6회AI 추천 선택 8회직접 작성 6회

AI 개입 수락
밤에 제시된 원숭이손 제안을 받아들여 규칙에 반영한 경우입니다.
AI 추천 선택
규칙 작성 단계에서 AI가 보여 준 선택지 중 하나를 고른 경우입니다.
직접 작성
플레이어가 규칙을 직접 입력한 출처입니다. 적용 과정에서 내용이 달라졌는지는 별도 확인이 필요합니다.

확정·유력 사람 세션 6판의 탐색적 집계입니다. 관찰 기간의 기구 버전이 섞였고, 선택은 무작위 배정이 아닙니다. 20건은 적용 규칙의 출처 분모이며, 원숭이손 제안 수락률 6/9와 구분합니다. AI에 대한 신뢰 자체를 측정한 값은 아닙니다.

출처: Exp 2 · 집계 결과

요약 그림 S4A · 2026-09-15. AI 계열 선택 14회는 AI 개입 수락 6회와 AI 추천 선택 8회를 합친 값입니다. 직접 작성은 6회였습니다.

SUMMARY S4B · 2026-09-16 별도 사례

Tester 6의 회차별 게임 총점

Tester 6의 5회차 게임 총점 선 그래프 점수는 차례로 8.8점, 64.2점, 94.2점, 94.2점, 94.2점입니다. 3회차부터 5회차까지 제출문 길이는 각각 266자이며 내용 동일성은 독립 검증하지 못했습니다. 3–5회차: 각 266자 · 내용 동일 미검증
  1. 1회차 8.8점
  2. 2회차 64.2점
  3. 3회차 94.2점 266자 제출문
  4. 4회차 94.2점 266자 제출문
  5. 5회차 94.2점 266자 제출문

이 사례는 위 6판 집계에 포함하지 않았습니다. 당시 기록은 3–5회차를 같은 제출문이라고 설명하지만, 보관된 원문·해시가 없어 독립 대조하지 못했습니다. 앞 회차에서 인정된 문장이 그대로 남으면 해당 판정을 낮추지 않는 처리(단조 잠금)가 있었으나, 이 구간의 실제 작동 여부는 확인되지 않았습니다. 점수 정체를 학습이나 채점기 안정성으로 해석할 수 없습니다.

출처: Exp 2 · Case — Tester 6

요약 그림 S4B · 2026-09-16. 다른 기구 버전에서 수집된 단일 완주 사례입니다. 원문에 기록된 당시 총점을 그대로 표시합니다.

해석 주의. 표본이 작고 기구 버전이 섞였으며 선택은 무작위 배정이 아닙니다. 판수는 고유 참가자 수가 아닙니다. 점수 정체나 4→5회차 하락 소멸을 학습이나 채점 안정성의 증거로 쓰지 않습니다.

전체 연구 기록과 근거 표 보기 ↓

용어를 쉽게 읽기 배경지식 없이 읽는 연구
실험환경 Testbed
조건을 정해 두고 같은 과정을 반복해서 실험할 수 있는 환경입니다.
AI 제안 수용 Acceptance
사람이 AI가 제안한 방법을 선택하는 행동입니다. AI를 믿는 마음 자체를 측정한 것은 아닙니다.
이벤트 기록 Event-level trace
제안, 선택, 규칙 적용 같은 일이 일어날 때마다 남긴 기록입니다.
형식 통과율 Schema pass rate
AI가 프로그램이 읽을 수 있도록 정해진 응답 형식을 지킨 비율입니다.
대체 처리 Fallback
AI 응답에 문제가 있을 때 준비된 다른 처리로 넘어가는 것입니다. 평가에서는 정상 응답과 구분합니다.
통과 기준 Gate
다음 평가 단계로 넘어가기 위해 미리 정한 조건입니다.
러너 Runner
정해진 문항을 실행하고 응답·시간·실패를 모으는 평가 프로그램입니다.
GPU 동주
여러 모델을 같은 GPU 메모리에 함께 올려 사용하는 조건입니다. 동시 접속자 수와는 다른 개념입니다.
탐색적 관찰 Exploratory
적은 사례에서 어떤 일이 일어나는지 살펴보는 초기 관찰입니다. 전체 사람들의 경향으로 일반화하지 않습니다.
사전등록 Preregistration
결과를 보기 전에 질문, 방법, 판정 기준을 고정해서 공개하는 것입니다.
응답 지연 p95
측정한 요청의 약 95%가 이 시간 안에 응답했다는 뜻입니다. 평균 응답 시간과 다릅니다.
미실행 NOT RUN
아직 측정하지 않았다는 뜻입니다. 측정 결과가 0이라는 뜻이 아닙니다.
FULL RECORD

상세 연구 기록

요약으로 ↑

방법, 수치, 판단 근거와 당시의 한계를 담은 전체 기록입니다. 먼저 위의 설명을 읽고, 필요한 절을 목차에서 찾아보세요.

이 페이지의 지위

탐색적(exploratory) 관찰 기록이다. DB 전수 판별로 확정·유력 사람 세션 6판을 분리했다 (문서 대조 5판 + 정황 유력 1판, 신원 미상 사람 시그니처 5판은 별도 보류). 이후 들어온 9/16 테스터6 완주 판 1건은 기구 버전이 달라 합산하지 않고 케이스로 따로 적었다. 통계적 유의성을 주장하지 않는다. AI 선택과 직접 작성은 참가자의 자발적 선택이므로 selection bias가 존재한다. 인과가 아니라 연관성만 서술한다. 판수는 고유 참가자 수가 아니다. 상태 확인일 2026-09-18 기준으로 기존 6판 집계는 공개됐고 Tester 2–4 상세 사례·버전별 분리 집계는 미완료다. 부작용 인지율은 NOT RUN이다.

연구 질문 (관찰 대상)

반복적인 실패–수정 과정에서 인간은 AI가 제안한 개입을 언제 수용하고 언제 직접 수정하며 그 선택은 이후 문제 이해와 어떤 관계인가?

관찰·측정 항목 현재 상태
AI 계열 vs 직접 작성 적용된 규칙 출처 60건 집계(14판, 2026-09-18); 기존 20건(6판) 병기, 제안 수락률과 분모 구분
회차별(초반/후반) 선택 변화 사례 기록; 버전별 분리 분석 미완료
다음 회차 이해도 변화 (Δ Understanding) 게임 총점 사례만 제시; 검증된 이해도 변화 척도는 미확정
부작용 인지율 NOT RUN; 이벤트 정의와 기구의 측정 가능성 미해결
질문의 질 · 최종 이해도 조작적 정의·분석 미완료
Rationale 효과 별도 사전등록·미실행

세션 분리 — DB 전수 판별 (2026-09-15)

게임 DB를 읽기 전용으로 전수 조회했다 (attempt 248판). 판별 축은 세 가지다. ① 문서 대조(테스터 기록·핸드오프의 판 ID), ② 셀프플레이 로그(.selfplay_attempts.log) 제외, ③ 행동 시그니처다. 이벤트 간격 변동계수(CV)는 보조 단서로 제시됐다. CV ≥ 1.5와 CV ≈ 1.0이 실제 분류 문턱인지 관측 범위를 요약한 수치인지는 추가 확인이 필요하다. 계산 대상 이벤트·제외 간격·최소 이벤트 수·문턱 결정 시점·검증 표본이 공개되지 않아 오분류 범위를 평가하지 못한다. 문서 대조와 자동 로그 제외보다 신원 판정 근거로 우선하지 않으며 미상 5판은 보류한다.

분류 판수 근거
사람 · 문서 대조 확정 5 테스터1 b56dca9d(9/09) · 테스터3 f7f2e402(9/10) · 9/14 실플레이 da38de28(피드백 6건 접수) · 9/15 0468b70c·806122f3
사람 · 정황 유력 1 테스터2 e84af6ab: 준비 문서의 식별 규칙(“9/09 17:17 이후 새 attempt”)에 부합, 접속 확인 2분 뒤(17:30) 생성. 3루프 · 자유서술 677자
사람 시그니처 · 신원 미상 5 bdf80b97·7718dbd0·c36e842b(9/09 밤~10 새벽) · bba17899(9/10) · 80ff8d0d(9/14), CV 1.6~3.9
자동 추정 9 셀프플레이 로그 2판 + 9/06 균일 페이싱 클러스터 7판 (CV 0.9~1.1, 동일 프로파일 5루프 일괄 실행)
초기 개발기 · 미분류 나머지 활동 판 9/05~07 개발 중 플레이, 사람/자동 판별 보류
빈 판 178 /play 로드 즉시 세션 생성 구조가 적립. 루프 0 · 이벤트 ≤ 1

이 표는 2026-09-15 스냅샷에 대한 기존 분류 기록이다. 빈 판은 루프 0·이벤트 1건 이하라는 기록 기준을 따른다. 범주의 상호 배타성·날짜 경계·248판 전체 포괄 여부는 미검증이므로 나머지를 차감해 미분류 50판이라고 확정하지 않는다. 총계 대조가 남아 있다.

테스터2 준비 문서는 “표본 미수집”으로 끝나 있었지만 문서에 적힌 식별 규칙을 DB에 적용하자 해당 판이 나왔다는 기록이다. 규칙 부합이 신원 확정은 아니므로 유력 등급을 유지한다. 식별 규칙의 원 작성 시점·접속 기록 연결은 추가 확인이 필요하다. 확정 5판만의 보조 집계와 세션별 선택 건수도 아직 공개하지 못해 유력 1판의 영향이나 같은 판의 반복 선택 집중도를 이 합계만으로 평가할 수 없다.


집계 결과 (확정 + 유력 6판, exploratory)

규칙 적용 20건의 출처 분해 (rules.source 기준):

14/20은 적용된 규칙의 출처 비율이며 참가자 비율이 아니다. 제시된 원숭이손 제안 중 수락한 비율은 6/9로 별도 계산한다. 직접 작성 후 서버가 의미를 바꾼 기록도 custom 출처로 남을 수 있어 선택 출처와 실제 적용 내용의 일치 여부는 별도로 검증해야 한다(아래 Tester 1 사례).

측정값 값
AI 계열 규칙 선택 14/20 (70%): 원숭이손 수락 6 + AI 추천 옵션 선택 8
직접 작성 규칙 6/20 (30%)
원숭이손 제안 수락률 6/9 (67%): 9/15 개선 배치 이후 2판은 모두 거절
신의 질문 사용 기존 기록: 9/09~14 완주 판 12회, 9/15 판 0회. 12회의 판별 값/기간 합계 구분과 제공 기회 수는 미확인
회차별 점수 궤적 기존 기록: 5루프 완주 3판의 중반 상승 후 5회차 하락. 해당 3판 ID와 질문 사용 집계 대상의 대응은 추가 확인 필요(아래 주의)
부작용 인지율 NOT RUN (이벤트 정의 확정 후 집계)

5회차 하락은 행동으로 단정할 수 없다. 테스터3의 4→5회차는 자유서술 md5가 동일한 제출이 67.9 → 53.3으로 채점된 사례로 문서화되어 있다. 자유서술의 동일성은 전체 채점 요청의 동일성을 뜻하지 않는다. 회차·근거 탭·적용 규칙·프롬프트·모델·상태와 provider 변동의 영향을 분리하지 못했으므로 이 차이를 행동 변화로 해석하지 않는다. 전체 요청 해시나 조건을 고정한 재생 검증이 남아 있다.

기구 버전 혼재 주의. 9/15 두 판은 개선 배치 3/3 이후, 나머지는 이전 판이다. 위 집계는 전 기간 합산이므로 경향 주장에 쓰지 않고 버전별 분리 집계를 후속으로 남긴다.

집계 갱신 — 사람 판 14판 (2026-09-18)

위 6판 집계 이후 2026-09-16~18에 테스터 6~12의 판이 들어왔다. 앱 저장소의 테스터 기록 (review-verification/2026-09-16-tester6 … 2026-09-18-tester12)에 적힌 판 ID를 게임 DB 읽기 전용 조회(loops·nights·rules·events)로 대조해 사람 판 14판을 확정했다. 기존 6판(테스터1·2·3, 9/14 실플레이, 9/15 두 판)에 테스터4(9/12 피드백 접수 기록의 판 ID로 대응, 위 표의 “신원 미상” bba17899)와 테스터6~12를 더했다. 집계 규칙은 위와 같다 (rules.source 기준: 원숭이손 수락 = AI 개입 수락, 추천 옵션 = AI 추천 선택, 직접 입력 = 직접 작성). 테스터12 판의 원숭이손 부수 효과 규칙 3건(paw_effect)은 플레이어의 선택이 아니므로 분모에서 뺐다. 테스터7의 9/16 후보 판 e7aa6a4f는 첫 장면에서 멈춘 판이라 제외하고 9/17 완주 판을 넣었다.

측정값 14판 (2026-09-18) 기존 6판 (2026-09-15)
적용 규칙 출처 분모 60건 20건
AI 계열 규칙 선택 48/60 (80%): 원숭이손 수락 17 + AI 추천 옵션 선택 31 14/20 (70%)
직접 작성 규칙 12/60 (20%) 6/20 (30%)
원숭이손 제안 수락률 17/21 (81%) 6/9 (67%)
5회차 완주 10/14 3/6
5회차 전 종료 4/14 — 3회차 밤 미제출 1, 2회차 낮 시간 부족 종료 1, 1회차 밤 제출 뒤 종료 1, 밤 제출 없이 이탈 1 3/6

세션별 기록. 판 ID는 앞 8자리, 점수는 회차별 게임 총점(0~100, 검증된 이해도 척도가 아님)이다.

세션 판 날짜 루프 규칙 출처 (수락·추천·직접) 회차별 총점
테스터1 b56dca9d 9/09 5 2·1·3 0.0 → 50.2 → 36.5 → 55.2 → 47.9
테스터2 (유력) e84af6ab 9/09 3 1·0·2 21.9 → 21.9 → (3회차 밤 미제출)
테스터3 f7f2e402 9/10 5 2·4·0 20.4 → 32.1 → 76.7 → 67.9 → 53.3
테스터4 bba17899 9/10 5 2·4·0 7.3 → 66.5 → 46.5 → 46.5 → 43.1
9/14 실플레이 da38de28 9/14 5 1·3·1 13.1 → 21.9 → 74.2 → 70.8 → 59.6
9/15 판 a 0468b70c 9/15 1 0·0·0 (제안 1회 거절) 8.8
9/15 판 b 806122f3 9/15 1 0·0·0 (제안 1회 거절) (밤 제출 없이 이탈)
테스터6 2338ec9f 9/16 5 1·2·2 8.8 → 64.2 → 94.2 → 94.2 → 94.2
테스터7 61acc8ef 9/17 5 2·4·0 33.5 → 40.8 → 66.9 → 66.9 → 94.2
테스터8 7cf7484d 9/17 5 1·2·2 0.0 → 14.6 → 29.2 → 29.2 → 47.9
테스터9 e6290e17 9/17 5 2·4·0 55.4 → 64.2 → 55.4 → 55.4 → 85.4
테스터10 973b9869 9/17 5 1·2·2 8.8 → 8.8 → 0.0 → 0.0 → 31.9
테스터11 8523078a 9/17 2 1·1·0 14.6 → (2회차 낮에서 종료)
테스터12 7ac456d8 9/18 5 1·4·0 (부수 효과 3 제외) 8.8 → 8.8 → 27.5 → 27.5 → 27.5

읽을 때 주의:

  • 80%는 적용 규칙의 출처 비율이며 참가자 비율도, AI에 대한 신뢰 측정값도 아니다. 6판에서 14판으로 늘어도 방향은 같지만 무작위 배정이 없으므로 경향 주장에 쓰지 않는다.
  • 판수는 고유 참가자 수가 아니다. 테스터12는 팀 내부(Scenario Director)이고 테스터8 기록에는 주제를 아는 개발자라고 적혀 있다. 테스터9 판은 기록에 “보조 플레이”로 표시돼 있다. 참가자 모집 경로가 공개돼 있지 않으므로 외부 표본이라고 주장하지 않는다.
  • 테스터10의 5회차 점수(31.9)는 정답을 모르는 상태의 결과가 아니다. 5회차 낮 진행 중에 진실 명제를 테스터에게 공개했다고 기록돼 있다.
  • 4→5회차 하락은 단조 잠금 도입 전 판에만 있다. 완주 10판 중 잠금 도입(9/14, da38de28 진단 이후) 전 4판은 모두 하락했고, 이후 6판은 상승 4·동일 2·하락 0이다. 잠금은 앞 회차에서 인정된 문장이 남으면 판정을 낮추지 않는 장치이므로 이 차이는 잠금이 작동했다는 뜻이지 채점기가 같은 입력에 같은 판정을 낸다는 증거가 아니다. → Limitations · 채점 안정성
  • 기구 버전은 여전히 섞여 있다. 9/16 이후 판은 개선 배치 3/3 이후이고, 9/17 판부터 테스터 피드백 수정이 순차 반영됐다. 전 판 로컬 모델 구성이며 세션별 모델·프롬프트· 채점기·커밋 매핑은 미확인이다(아래 세션별 기구 조건 표).
  • 부작용 인지율은 NOT RUN이다. 위 표의 어떤 값도 부작용 인지를 뜻하지 않는다.

세션별로 현재 확인 가능한 기구 조건은 다음과 같다. 판별·관찰 기록을 연결한 표이며 전체 실행 구성을 복원한 표는 아니다.

세션 확인 가능한 시점·변경 미확인 실행 조건
b56dca9d · e84af6ab 9/09, 개선 배치 3/3 이전; 두 번째 판은 유력 모델·프롬프트·채점기·커밋의 세션별 매핑
f7f2e402 9/10, 개선 배치 이전 모델·프롬프트·채점기·커밋의 세션별 매핑
da38de28 9/14, 개선 배치 이전 모델·프롬프트·채점기·커밋의 세션별 매핑
0468b70c · 806122f3 9/15, 개선 배치 3/3 이후 같은 날 NPC 교체와 각 판의 적용 시점·정책·커밋 연결
2338ec9f 9/16 후속 사례; F1·F3~F6 수정 전 전체 호출 역할별 모델·프롬프트·채점기·커밋 연결
bba17899 9/10, 개선 배치 이전(테스터4, 9/12 피드백 기록으로 대응) 모델·프롬프트·채점기·커밋의 세션별 매핑
61acc8ef · 7cf7484d · e6290e17 · 973b9869 · 8523078a 9/17, 9/16 테스터 피드백 수정 이후, Google 로그인 판 세션별 모델·프롬프트·채점기·커밋 매핑, 같은 날 순차 수정과 각 판의 대응
7ac456d8 9/18, 확인 신호(인정 문장·빈 칸 힌트·추천 질문) 반영 이후, 최종 배포 전 로컬 구성 세션별 모델·프롬프트·채점기·커밋 매핑

케이스 기록 (정성 관찰)

표본이 작으므로 집계값과 함께 세션별 사례를 제시한다. 각 세션은 “무엇을 했고 → 무엇이 관찰됐고 → 무엇이 어긋났나”로 남긴다.

Case — Tester 1 (2026-09-09) 발췌

판 b56dca9d 완주, 최종 47.9점. 실험기구 자체의 결함이 행동 관찰에서 드러난 사례:

  • 직접 작성 규칙 3건에서 의미 변형이 발생했다. “답한다”를 요청했는데 “질문한다”로 바뀌면서 기존 원숭이손의 질문 금지와 충돌했다.
  • 3회차 원숭이손의 설명과 저장된 규칙이 달랐다. 설명은 검진을 통한 건강 확인을 말하지만 저장된 규칙은 검진 금지였다.

이 발견들은 행동 결과이기 전에 instrument validation(실험기구 검증) 이슈로 분류한다. 수정 전후를 구분하는 것이 원칙이지만 위 기존 6판 집계에는 버전이 섞여 있어 경향 주장에 쓰지 않는다. 버전별 재집계는 남아 있다.

Case — 실플레이 판 0468b70c (2026-09-15, 개선 배치 3/3 이후)

RQ1 관련 이벤트가 실제로 관찰된 첫 정리 사례. 게임 DB 읽기 전용 조회 근거.

  • 1회차 밤 제출까지 완료 (09:30~09:37). 낮 발화 26건. 5회차 완주를 뜻하지 않는다.
  • 원숭이손(AI 개입) 1회 제안 → 거절. 신의 질문 3회는 전부 미사용.
  • 밤 제출은 “채연이 아픈거 같아,” 11자 단문 → cause-1만 confirmed(25.0), 나머지 셀 0으로 총점 8.8 · fail. 단서를 탭하지 않은 11자 단문 제출 한 건이 8.8점으로 채점된 사례이며 최소 허용 길이나 가능한 최저 점수를 측정한 것은 아니다.

같은 날 판 806122f3은 낮 3비트·발화 26건까지 진행 후 밤 제출 없이 이탈했다. 완주율·이탈 지점도 관찰 대상이다.

이 한 판에서 어떤 경향도 주장하지 않는다. 이 판은 AI 제안 거절과 밤의 자유서술 제출을 구분해 기록했음을 확인한 사례다. 밤 추리 작성은 규칙 직접 작성과 다르며 이 판의 직접 규칙 작성·적용 증거는 확인되지 않았다. 규칙 출처 기록은 Tester 1의 직접 작성 사례와 아래 Tester 6의 R1·R2를 따로 읽는다.

Case — Tester 6 (2026-09-16) · 5회차 완주

판 2338ec9f (09:48~11:06). 당일 이벤트가 가장 많은 판(580건)이다. 테스터 기록 (review-verification/2026-09-16-tester6)에 DB events 읽기 전용 조회로 확인했다고 기록돼 있다. 이번 원고 대조는 이 집계 보고서를 확인했으며 원시 DB를 다시 조회하지 않았다. 위 6판 집계 이후에 들어온 판이고 기구 버전도 다르므로 집계에 합산하지 않고 따로 적는다.

총점은 검증된 심리적 이해도 척도가 아닌 게임 채점 결과다. 하위 항목은 cause(원인), motive(동기), identity(정체), side_effect(부작용)이며 범위는 0~100점이다. 공개 스냅샷 기준 앱 커밋 1568438의 scoring_rules.py· game_constants.py에서 확인한 산식은 원인×0.35 + 동기×0.35 + 정체×0.30이고 소수 첫째 자리로 반올림한다. 부작용 점수는 총점에 포함하지 않는다. 하위 점수는 confirmed=1·partial=0.5·none=0의 평균을 0.8로 나눠 100을 곱하되 100점이 상한이며 소수 첫째 자리로 반올림한다. 이는 아래 수치와 부합하지만 당시 실행 커밋 연결은 미확인이다. 탭한 근거는 기존 DB 집계의 선택 건수이며 중복 포함 여부는 추가 확인이 필요하다.

회차 총점 cause motive identity side_effect 제출문 탭한 근거
1 8.8 25.0 0 0 0 136자 7
2 64.2 100 83.3 0 0 249자 12
3 94.2 100 83.3 100 0 266자 12
4 94.2 100 83.3 100 0 266자 16
5 94.2 100 83.3 100 0 266자 18

side_effect 0을 부작용 미인지로 읽지 않는다. 이 기구로 인지 여부를 측정할 수 있는지부터 미해결이다.

규칙 적용 5건의 출처:

규칙 회차 출처
R1 채연: 검진을 받는다 1 직접 작성
R2 준: 가진 것을 보여준다 2 직접 작성
R3 원숭이손 (“채연이 직접 한 일을 말로 설명”) 3 AI 개입 수락 (제안 2회 중 1회 수락)
R4 준: 손목띠를 만진다 3 AI 추천 옵션 선택
R5(규칙 내용 생략) 4 AI 추천 옵션 선택

이 판의 적용 규칙 5건에서는 AI 계열 3/5, 직접 작성 2/5다. 원숭이손 제안은 2회 중 1회 수락했고 신의 질문은 15회 썼다. 위 6판의 규칙 20건 분모와 합치지 않는다.

관찰 — 행동과 기구가 맞물린 지점:

  • 추천 옵션이 이미 하는 행동을 제안했다. 채연: 배급을 남긴다가 1~4회차 추천에 매번 들어 있었지만 채연은 규칙 없이도 매 회차 배급을 남긴다. 테스터는 4회 중 2회를 직접 작성으로 우회했다. 추천 옵션의 질과 직접 작성 선택이 연관될 가능성을 보여 주는 사례지만 N=1이므로 인과로 읽지 않는다. 이 필터(F5)는 세션 뒤에 기구에 반영됐다.
  • side_effect 셀이 5회차 내내 0점이었다. 원숭이손 부작용은 고정 1종(발화 예산 -1)이고 제안 문구에 대가가 드러나지 않는다(F11). 부작용 인지율을 이 기구로 측정할 수 있는지부터 미해결이며 “플레이어가 부작용을 인지하지 못했다”는 행동 결론으로 쓰지 않는다.
  • 신의 질문 15문답이 전부 status: unknown이었다. 답 뒤에 붙는 해금 단서가 질문과 무관하게 회차 순서대로 붙었다(F7·F9). 이후 판정·근거·조언 3부 고정형으로 재설계됐다.
  • 3~5회차 제출문 길이는 모두 266자였고 점수도 94.2로 같았다. 당시 보고서는 같은 제출문이라고 기록했으나 회차별 원문·해시가 남아 있지 않아 독립 대조는 못 했다. 길이 일치만으로 내용 동일성을 입증하지 못한다. 09-14에 도입한 단조 잠금은 같은 문장의 하향을 막으므로 채점기 안정성의 증거로 쓰지 않는다.
  • 기존 DB 집계 보고서에는 관찰 기록 264건 중 서로 다른 문장 87건, 중복 문장 177건(약 67%, 약 2/3)으로 기록돼 있다. 정확 일치·정규화 기준과 같은 회차/이전 회차의 중복 구분은 미확인이다. 이를 모두 이전 회차에서 넘어온 반복이라고 귀속하지 않는다. 근거 탐색 행동을 해석할 때 UI 부담을 고려해야 한다(F6, 세션 뒤 중복 제거 반영).

Tester 7 (2026-09-17) — 완주 판 확인, 14판 집계에 포함

2026-09-16 기록은 UI 피드백 2건뿐이었고(출력 텍스트 드래그 선택 방지, 장면에 없는 NPC 딤 처리) 후보 판 e7aa6a4f는 1회차 첫 장면에서 멈춘 판(이벤트 15건)이라 표본에서 뺐다. 2026-09-17 10:08~10:56에 같은 테스터가 완주한 판 61acc8ef(이벤트 606건, 5루프)를 테스터 기록에서 확인해 14판 집계에 넣었다. 총점 33.5 → 40.8 → 66.9 → 66.9 → 94.2. 규칙 6건은 원숭이손 수락 2·AI 추천 4·직접 작성 0이다.

2026-09-18 상태: 14판 재집계를 게시했다. Tester 2–4·8–12의 상세 사례는 미게시이며 원문 기록은 앱 저장소 review-verification/에 있다. 버전별 분리 집계는 미완료이고 부작용 인지율은 NOT RUN이다.


읽는 법

  • 이 실험의 결과는 사전등록된 Rationale A/B와 다르다. 여기는 통제 없는 자연 관찰(naturalistic observation)이다.
  • “직접 작성이 더 효과적이었다” 같은 인과 표현은 쓰지 않는다. 다음은 실제 분석에서 뒷받침될 때 사용할 서술 예시이며 현재 결과가 아니다: “직접 작성 선택과 이후 이해도 상승 사이에 더 큰 연관성이 관찰되었다.” 이해도 척도 정의와 분석이 먼저 필요하다.