RESEARCHAppendix
날짜별 연구 기록
어떤 측정과 결정이 언제 바뀌었을까?
Lab Notes
실험 설계, 모델 평가, 사람 세션, 기구 수정과 판단을 최신 날짜부터 추적하는 변경 기록입니다.
이 페이지를 읽는 방법
- 각 날짜는 새 측정, 수정, 결정이 생긴 시점을 보여 줍니다.
- 후속 측정이 앞선 결론을 좁히거나 바꾼 경우 그 경위를 함께 남깁니다.
- 정확한 표와 조건은 연결된 실험 기록에서 확인할 수 있습니다.
해석 주의. 날짜별 메모는 서로 다른 조건의 수치를 포함합니다. 같은 이름의 지표라도 모델, 반복 수, 데이터 세트가 다르면 직접 비교하지 않습니다.
용어를 쉽게 읽기 배경지식 없이 읽는 연구
- 실험환경 Testbed
- 조건을 정해 두고 같은 과정을 반복해서 실험할 수 있는 환경입니다.
- AI 제안 수용 Acceptance
- 사람이 AI가 제안한 방법을 선택하는 행동입니다. AI를 믿는 마음 자체를 측정한 것은 아닙니다.
- 이벤트 기록 Event-level trace
- 제안, 선택, 규칙 적용 같은 일이 일어날 때마다 남긴 기록입니다.
- 형식 통과율 Schema pass rate
- AI가 프로그램이 읽을 수 있도록 정해진 응답 형식을 지킨 비율입니다.
- 대체 처리 Fallback
- AI 응답에 문제가 있을 때 준비된 다른 처리로 넘어가는 것입니다. 평가에서는 정상 응답과 구분합니다.
- 통과 기준 Gate
- 다음 평가 단계로 넘어가기 위해 미리 정한 조건입니다.
- 러너 Runner
- 정해진 문항을 실행하고 응답·시간·실패를 모으는 평가 프로그램입니다.
- GPU 동주
- 여러 모델을 같은 GPU 메모리에 함께 올려 사용하는 조건입니다. 동시 접속자 수와는 다른 개념입니다.
- 탐색적 관찰 Exploratory
- 적은 사례에서 어떤 일이 일어나는지 살펴보는 초기 관찰입니다. 전체 사람들의 경향으로 일반화하지 않습니다.
- 사전등록 Preregistration
- 결과를 보기 전에 질문, 방법, 판정 기준을 고정해서 공개하는 것입니다.
- 응답 지연 p95
- 측정한 요청의 약 95%가 이 시간 안에 응답했다는 뜻입니다. 평균 응답 시간과 다릅니다.
- 미실행 NOT RUN
- 아직 측정하지 않았다는 뜻입니다. 측정 결과가 0이라는 뜻이 아닙니다.
FULL RECORD
요약으로 ↑상세 연구 기록
방법, 수치, 판단 근거와 당시의 한계를 담은 전체 기록입니다. 먼저 위의 설명을 읽고, 필요한 절을 목차에서 찾아보세요.
읽는 법: top-1/top-3는 정답이 1위/상위 3개 안에 든 비율이다. 골든은 기준 답을 정한 평가 문장을 뜻한다. 동주는 모델을 GPU 메모리에 함께 유지하는 것이고 폴백은 최종 실패 시의 대체 처리다. 아래 수치는 각 날짜·조건의 기록이다.
2026-09-18
- Exp 1 스냅샷 — A.23 제출 조합 세 축 실측 추가: 키를 넣은 서버에서 Sonnet 5 채점 캘리브레이션(정답형 100·절반형 54.8·오답형 0, n=1), Haiku 4.5 정체 누설(하네스 on 0%·off 50%), self-play 5회차(오류·폴백 0)를 한 번에 쟀다. 같은 코드의 로컬 조합과 나란히 두면 제출 조합의 이점은 오답 무득점(0 vs 14.6) 하나에 집중되고, 누설은 하네스 on이면 둘 다 0이다. 판당 비용은 기록된 호출을 토큰으로 세어 $0.46, 기록에 남지 않는 NPC 발화까지 환산하면 약 $0.9~1.2(추정). 원숭이손 ① 아침 억제 반영 뒤 2차 실측도 같은 그림. 세 축 모두 n=1~2라 게이트 통과 선언이 아니라 실측 기록이다. → Exp 1 · A.23
- Exp 2 — 사람 판 14판 재집계: 9/15 집계(6판·20건) 이후 들어온 테스터 6~12 판을 테스터 기록의 판 ID로 DB와 대조해 14판으로 다시 셌다. 적용 규칙 60건 중 AI 계열 48(원숭이손 수락 17·추천 선택 31)·직접 작성 12, 원숭이손 수락률 17/21, 5회차 완주 10/14. 테스터7은 9/16 “미포함”에서 9/17 완주 판으로 정정. 4→5회차 하락은 단조 잠금 도입 전 4판에만 있고 이후 6판은 0건 — 잠금 작동의 증거이지 채점기 안정성의 증거가 아니다. 기존 6판 집계는 병기하고 그림 S4A·S4B는 그대로 둔다. → Exp 2 · 14판 집계
- 첫 화면 진입 순서 변경: 게임 링크를 맨 위 버튼으로 두고 “지금까지 확정한 것” 다섯 줄과 “우리가 아는 약점” 세 줄을 Abstract 앞에 뒀다. 다섯 줄은 전부 기존 공개 문장의 재배치이며 각 줄이 근거 절로 연결된다. Abstract의 미측정 나열은 “미측정 항목” 절로 내렸다. Limitations에 채점 안정성·재미 미측정 항목을 추가했다. 약점 세 줄 중 planner 항목 수 초과는 2026-09-18 엔진 절단으로 닫힌 상태라 “절단 뒤 재측정 없음”으로 적었다.
- 임베딩 슬롯 — 왜 비교가 없었는지 먼저 적었다(A.20): Core·NPC는 로컬·외부 모두 평가했는데 임베딩만 로컬 대 외부 비교가 없었다. 코드·DB 실사 결과 호출 0 — 누락이 아니라 09-06 채점 밸런스 조정에서 임베딩 top-3 절단 경로를 제거했기 때문이다 (절단이 “정답에 도달해도 21~42%”의 원인, 8개 전부 심판에게 주니 골든 정답형 65.3→100.0). 두 번째 용도(노트 검색)는 미구현. 비교 대상이 먼저 사라진 것.
- 한 자리에만 되살리고 3모델을 같은 기준으로 평가(A.21): 직접 작성 규칙이 거부됐을 때 주는 대안 3개의 순위를 비교했다. 추천 순위는 이 구현에서 채점·게이트 계산에 직접 쓰이지 않지만 제시된 후보는 사람의 선택에 영향을 줄 수 있어 변경 이후 행동 관찰은 기구 버전을 구분한다. 실패 시에는 어간 겹침 순위로 폴백한다. 초안 30문장을 Scenario Director가 검수해 8문장을 제외하고 14·15번의 의미도 수정했다. 검수 22문장 top-1은 어간 겹침 0.364 / Qwen3-Embedding-4B 2560차원 0.909 / bge-m3 1024차원 0.909 / gemini-embedding-001 1024·1536·2560차원 각각 0.955다. 검수 세트에서 측정한 임베딩 셀의 top-3는 모두 1.000이었다. 별도로 미검수 1차 골든 30문장을 3회 반복했을 때 적중률·top-1 오답 위치가 같았다. 이 입력·설정의 세 번 결과이며 검수 22문장의 반복 결과나 일반적인 결정론을 뜻하지 않는다. → Exp 1 · A.21 검수·반복 조건
- 모델 간 “같은 결과”는 벡터가 아니라 순위로 쟀다: 차원이 같아도 공간이 다르다. Kendall τ — Qwen↔Gemini 0.31~0.36, bge-m3↔Gemini 0.59~0.63, Qwen 2560↔1536 0.90이다. 다만 검수 22문장 top-1은 Qwen 2560차원의 0.909에서 1536차원의 0.818로 내려갔다. 이 검수 세트에서 여섯 셀이 공통으로 틀린 문장 1개 (“본 대로 얘기하게” → 전부 “들은 것을 그대로 전한다”)가 있었으며 모델 전체의 일반적인 한계로 확대하지 않는다.
- GPU 동주가 결정을 갈랐다: 16GB에서 로컬 Core+NPC(13.4GB)에 Qwen 4B(실상주 4.4GB)를 더하면 두 LLM이 모두 축출됐다(2/2). bge-m3(0.66GB)는 셋 다 상주·축출 0. 채택: 서빙은 Gemini@2560, 로컬 개발·롤백은 bge-m3@1024. 서버 실경로에서 임베딩 순위와 실패 시 대체 처리의 HTTP 200 응답까지 확인했다. → Exp 1 · A.21 최종 구성
- A.19 출력 상한 처리 결함 수정: Anthropic 구조화 출력의 상한 제한 때문에 planner가 재생성되던 결함을 응답 후 결정적 절단으로 수정했다(advisor 목록 2필드 포함). 남은 평가: 원숭이손·채점 캘리브레이션·누설. 최종 시나리오 확정 뒤 실행 예정이며 코드 수정 완료를 이 평가의 완료로 읽지 않는다. → Exp 1 · A.19
- 정본 재확인 — 내용 변동 없음: 앱 저장소
main최신 커밋(dd7f6d8)까지docs/model_evaluation.md·docs/metrics.yml을 직전 스냅샷 기준 (docs/research-review-2026091800d4f86)과 다시 대조했다. 그 사이 두 파일 모두 바이트 단위로 변경이 없어, 스냅샷 갱신 라벨만dd7f6d8로 다시 찍었다(scripts/snapshot_model_eval.py --ref dd7f6d8).check_public.py금지어 0건,refresh_research_data.py --check·유닛 테스트 16건 통과. → Exp 1 · 최종 구성과 증거 범위
2026-09-17
- 제출 서빙 조합 확정 — Core
claude-sonnet-5· NPCclaude-haiku-4-5: 조합 확인 self-play 5회차 1판(305d77a6)을 261.5초에 완주했다. 점수는 11.7→11.7→16.0→24.8→29.8이며 n=1은 이 한 판을 뜻하고 모델 순위 근거가 아니다. 크래시와 최종 실패 시 대체 처리인 폴백은 0건이었다. planner는 5회차에beats7개(상한 6)라는 형식 위반으로 1회 재생성 후 복구했다. NPC 발화 100건에서 메타 표현 0건은 이 한 판의 관측이며 정식 누설 평가 전체 통과가 아니다. → Exp 1 · A.19 조합 확인·남은 평가 - 판당 비용 재계산 (추정, 실측 토큰 아님): 기록된 입출력 문자를 1자=0.7~1.0토큰으로
환산한 뒤 모델별 입력·출력 단가를 적용했다.
사람 5회차 완주 판(테스터6
2338ec9f기준) $0.68~0.97, self-play 판 $0.54~0.78. 비용의 87~94%가 Core이고 그중 관리자 검사가 Core 입력의 56~68%다. thinking 토큰· 재생성·임베딩은 넣지 않았다(어댑터가response.usage를 기록하지 않음). 산식·당시 단가·통화는 비용 추정의 한계를 따른다. - 이날 기록의 개발 구성은 Core
gemma4:12b· NPCkanana1.5:8b다. 9/15 NPC gemma4 교체 기록 뒤 kanana로 돌아온 결정·적용 시점·정책 버전은 연결 확인이 필요하다.
2026-09-16
- 외부 API 서빙 평가 (Exp 1 · A.19):
당시 로컬 구성의 동시 플레이 1명 운영 전제와 가용성 제약을 이유로 외부 API를
평가했다. GPU 한 장의 일반적 한계나 부하 실측 결과를 뜻하지 않는다. 같은 평가
체계를 사용했으나 어댑터·러너 수정도 있었다. 비열등은 사전 통과선에 따른 운영
판정이며 통계적 비열등성 검정이 아니다.
- Core: PCA·극성·eval 게이트는 Sonnet 5(같은 통제 세트 3회 반복, PCA 0.9667· eval 0.7143)와 Opus 5(1회 실행, eval 0.5714로 경계값)에서 통과했다. 지연 게이트는 Sonnet의 1회·3회 반복에서 엇갈렸고 Opus는 advisor p95가 로컬보다 38% 높아 미달했다. Opus의 3회 반복 통과 근거는 확인되지 않았다.
- NPC 의미 품질: Haiku 4.5·Sonnet 5 모두 구조 실패 0이었다. 선별한 10케이스의 사람 검토에서는 “방금 들음 vs 기억” 구분을 통과했다. 이 표본의 품질 관찰과 채택 결정을 구분하며 원숭이손·채점 캘리브레이션·누설 평가는 남아 있다.
- Gemini 무료 키는 하루 20요청 상한(80턴 중 14턴 성공)으로 NPC 후보에서 제외.
- 채점기 교체
gemma3:12b→gemma4:12b(think off): 16 GiB GPU에서 채점기와 백엔드 모델이 스와핑하며 평가가 40분 넘게 멈춘 것이 계기다. Haiku 1차 로그의 같은 발화 20건을 두 채점기로 각각 2회 재채점했을 때 발화 기준 일치 19/20(95%), 파싱 실패 0이었다. 별도로 새 응답을 생성해 재측정한 7세 정책에서는 kanana·Haiku·Sonnet 모두 정책 평가 5항목 중 4항목 통과였다. 1차(gemma3) Haiku의 2/5·3/5는 VRAM 경합과 파싱 문제의 영향으로 해석했다. 다만 채점기·프롬프트·생성 응답 등 조건을 고정해 원인을 하나씩 분리한 비교는 별도 확인이 필요하다. 두 비교의 근거는 A.19 §4에 구분돼 있다. 공통 약점은 항목 3(3턴 망각). Sonnet은 “유저가”라는 메타 표현 누출이 1건 있었다. - 테스터6 사람 세션 (
2338ec9f, 09:48~11:06): 5회차 완주. 점수 8.8→64.2→94.2×3, side_effect 셀은 끝까지 0. 피드백 11건을 DB와 대조했다. 추천 규칙이 이미 하는 행동을 제안한 사례(F5)가 있었고 신의 질문 15문답은 전부unknown, 원숭이손 부작용은 불분명했다(F11). 기구 수정 5건(F1·F3~F6)은 세션 뒤에 반영. → Exp 2 · Tester 6 케이스와 F5 - 테스터7: UI 피드백 2건(출력 텍스트 선택 방지, 장면에 없는 NPC 딤 처리)만 기록했다. 판 완주·확정이 미확인이라 표본에 넣지 않는다.
2026-09-15
- DB 세션 전수 판별 + RQ1 예비 집계: attempt 248판을 문서 대조·셀프플레이 로그·
행동 시그니처(이벤트 간격 CV) 3축으로 판별. 사람 세션 확정 5판 + 유력 1판(테스터2
e84af6ab, 준비 문서의 사전 식별 규칙으로 사후 판별). 확정+유력 6판에서 규칙 20건: AI 계열 14/20(70%, 원숭이손 수락 6·추천 옵션 8), 직접 작성 6/20(30%)이다. 원숭이손 제안 수락률은 별도로 6/9이며 판수는 고유 참가자 수가 아니다. 5회차 점수 하락 사례는 동일 자유서술이 67.9→53.3으로 달리 채점된 기록이다. 전체 채점 입력·provider 변동을 분리하지 못했고 6판의 기구 버전도 섞여 있어 경향 주장을 보류한다. CV 분류·집계의 미확인 사항은 Exp 2에 적었다. - 개선 배치 3/3 이후 첫 실플레이 2판: DB 이벤트 근거.
0468b70c는 1회차 밤 제출까지 완료했고 5회차 완주는 아니다. 원숭이손 제안 거절·신의 질문 미사용이 기록됐고 11자 단문 제출 한 건이 총점 8.8 fail로 채점됐다.806122f3은 밤 제출 없이 이탈했다. 같은 날 attempts 121건 중 실플레이는 2판. 로드 즉시 세션 생성이 빈 판을 다량 적립함을 확인. - NPC 모델 교체
kanana→gemma4:12b(think=off, temperature 0.3): 정책npc-dialogue-2기준 재평가. Gemma 41문답 실패·재생성 0, 중간값 2.599초·p95 3.053초(초기 목표 3초 소폭 초과). 전언 출처 구분·행동 근거 답변의 정확성을 근거로 교체하되 최초 의미 품질 목표(중요 모순 0·관련성 90%)에는 미달임을 그대로 기록한다. Exp 1 · NPC 정책·교체 기록과 9/17의 kanana 개발 구성은 날짜가 다른 기록이며 복귀 경위는 미확인이다.think=true는 1024토큰 상한에서 3건 전부 답변 실패로 미적용. - research.remakeday.com 사이트 개설: 리서치 허브 구조(옵션 B)로 스캐폴딩.
2026-09-14
- Core 슬롯
gemma4:12b-N채택: Funnel Stage 0~4 실측 근거. 극성쌍(RM1) 통과는 측정된 로컬 셀 중 유일했다. RM1은 질문의 긍정·부정과 기록 속 사건의 긍정·부정을 혼동하는 오류다. 같은 기록에 반대 방향의 질문을 던지는 쌍과, 기록을 뒤집은 합성 통제로 점검했다. → Exp 1 · A.7–A.8 - NPC 슬롯
kanana1.5:8b-q4km채택: 상업 라이선스(Apache 2.0)가 결정 축. 교체 전 루프 스모크 통과 (크래시 0 · 폴백 0/16). - E6 formal 실행 기록: 정책 ON/OFF × 5모델 × 조건별 5회 반복으로 평가했다. 정책 ID·항목 정의·조건별 산출물은 Exp 1 · A.12–A.13에 있다. 반복 횟수를 참가자 수나 게임 판수로 읽지 않는다.
2026-09-13
- E7 설계 확정: 비대칭 요인 설계 9셀, Hard 게이트 C1~C13. 설계한 셀 전체의 측정 완료를 뜻하지 않는다. → Exp 1 · 설계·A.6
- Stage 0 (프로토콜 호환) · Stage 1 (smoke) 실측.
gemma4:e4b발견: 디스크 8.95 GiB, 실상주 3.06 GiB. 예산 판정을 실측 VRAM으로 전환.
2026-09-10
- 5-loop 종단간 검증 기록: 5회차 게임플레이 검증을 수행했다고 기록했다. 조건별 판수·구성·산출물 연결은 이 짧은 노트에서 확인되지 않아 별도 확인이 필요하다. Exp 1의 후속 loop 평가 A.10는 다른 날짜의 실행이며 이 기록을 대신하지 않는다.
2026-09-09
- Tester 1 · Tester 2 사람 플레이 세션: event-level DB 로그 보존. 직접 작성 규칙의 의미 변형, 원숭이손 설명-저장 규칙 불일치 등 instrument 이슈 발견.
- Core
advisor_answer에서 근거 필드를 채운 응답(EGR)이 12응답 중 0건에서 코드 수정 후 11건으로 늘었다는 기록이다. EGR은detail과evidence_ids를 모두 채운 응답 수/전체 응답 수이며 폴백률이나 의미 정답률과 다르다. → Exp 1 · §3.2.5·A.1
2026-09-08
- 게임 리뷰 검증: DB 스냅샷은 attempt 66판 / loop 81회차 / 밤 제출 65건이었다.
docs/review-verification/2026-09-08/db-summary.json의submitted=65,passed=2를 대조해 밤 제출 2/65건 통과(3.1%)임을 확인했다(스냅샷 2026-09-08 05:05 UTC, 14:05 KST). 성공은 당시 기록의passed판정이며 세션 완주가 아니다. 당시 성공 문턱의 실행 버전과 사람·자동 구성은 미확인이라 사람의 성공률로 읽지 않는다. “채점기 문제” 등 리뷰 결론 일부는 근거 부족으로 기각했다.