RESEARCHAppendix

날짜별 연구 기록

어떤 측정과 결정이 언제 바뀌었을까?

Lab Notes

실험 설계, 모델 평가, 사람 세션, 기구 수정과 판단을 최신 날짜부터 추적하는 변경 기록입니다.

이 페이지를 읽는 방법

  • 각 날짜는 새 측정, 수정, 결정이 생긴 시점을 보여 줍니다.
  • 후속 측정이 앞선 결론을 좁히거나 바꾼 경우 그 경위를 함께 남깁니다.
  • 정확한 표와 조건은 연결된 실험 기록에서 확인할 수 있습니다.

해석 주의. 날짜별 메모는 서로 다른 조건의 수치를 포함합니다. 같은 이름의 지표라도 모델, 반복 수, 데이터 세트가 다르면 직접 비교하지 않습니다.

전체 연구 기록과 근거 표 보기 ↓

용어를 쉽게 읽기 배경지식 없이 읽는 연구
실험환경 Testbed
조건을 정해 두고 같은 과정을 반복해서 실험할 수 있는 환경입니다.
AI 제안 수용 Acceptance
사람이 AI가 제안한 방법을 선택하는 행동입니다. AI를 믿는 마음 자체를 측정한 것은 아닙니다.
이벤트 기록 Event-level trace
제안, 선택, 규칙 적용 같은 일이 일어날 때마다 남긴 기록입니다.
형식 통과율 Schema pass rate
AI가 프로그램이 읽을 수 있도록 정해진 응답 형식을 지킨 비율입니다.
대체 처리 Fallback
AI 응답에 문제가 있을 때 준비된 다른 처리로 넘어가는 것입니다. 평가에서는 정상 응답과 구분합니다.
통과 기준 Gate
다음 평가 단계로 넘어가기 위해 미리 정한 조건입니다.
러너 Runner
정해진 문항을 실행하고 응답·시간·실패를 모으는 평가 프로그램입니다.
GPU 동주
여러 모델을 같은 GPU 메모리에 함께 올려 사용하는 조건입니다. 동시 접속자 수와는 다른 개념입니다.
탐색적 관찰 Exploratory
적은 사례에서 어떤 일이 일어나는지 살펴보는 초기 관찰입니다. 전체 사람들의 경향으로 일반화하지 않습니다.
사전등록 Preregistration
결과를 보기 전에 질문, 방법, 판정 기준을 고정해서 공개하는 것입니다.
응답 지연 p95
측정한 요청의 약 95%가 이 시간 안에 응답했다는 뜻입니다. 평균 응답 시간과 다릅니다.
미실행 NOT RUN
아직 측정하지 않았다는 뜻입니다. 측정 결과가 0이라는 뜻이 아닙니다.
FULL RECORD

상세 연구 기록

요약으로 ↑

방법, 수치, 판단 근거와 당시의 한계를 담은 전체 기록입니다. 먼저 위의 설명을 읽고, 필요한 절을 목차에서 찾아보세요.

읽는 법: top-1/top-3는 정답이 1위/상위 3개 안에 든 비율이다. 골든은 기준 답을 정한 평가 문장을 뜻한다. 동주는 모델을 GPU 메모리에 함께 유지하는 것이고 폴백은 최종 실패 시의 대체 처리다. 아래 수치는 각 날짜·조건의 기록이다.

2026-09-18

  • Exp 1 스냅샷 — A.23 제출 조합 세 축 실측 추가: 키를 넣은 서버에서 Sonnet 5 채점 캘리브레이션(정답형 100·절반형 54.8·오답형 0, n=1), Haiku 4.5 정체 누설(하네스 on 0%·off 50%), self-play 5회차(오류·폴백 0)를 한 번에 쟀다. 같은 코드의 로컬 조합과 나란히 두면 제출 조합의 이점은 오답 무득점(0 vs 14.6) 하나에 집중되고, 누설은 하네스 on이면 둘 다 0이다. 판당 비용은 기록된 호출을 토큰으로 세어 $0.46, 기록에 남지 않는 NPC 발화까지 환산하면 약 $0.9~1.2(추정). 원숭이손 ① 아침 억제 반영 뒤 2차 실측도 같은 그림. 세 축 모두 n=1~2라 게이트 통과 선언이 아니라 실측 기록이다. → Exp 1 · A.23
  • Exp 2 — 사람 판 14판 재집계: 9/15 집계(6판·20건) 이후 들어온 테스터 6~12 판을 테스터 기록의 판 ID로 DB와 대조해 14판으로 다시 셌다. 적용 규칙 60건 중 AI 계열 48(원숭이손 수락 17·추천 선택 31)·직접 작성 12, 원숭이손 수락률 17/21, 5회차 완주 10/14. 테스터7은 9/16 “미포함”에서 9/17 완주 판으로 정정. 4→5회차 하락은 단조 잠금 도입 전 4판에만 있고 이후 6판은 0건 — 잠금 작동의 증거이지 채점기 안정성의 증거가 아니다. 기존 6판 집계는 병기하고 그림 S4A·S4B는 그대로 둔다. → Exp 2 · 14판 집계
  • 첫 화면 진입 순서 변경: 게임 링크를 맨 위 버튼으로 두고 “지금까지 확정한 것” 다섯 줄과 “우리가 아는 약점” 세 줄을 Abstract 앞에 뒀다. 다섯 줄은 전부 기존 공개 문장의 재배치이며 각 줄이 근거 절로 연결된다. Abstract의 미측정 나열은 “미측정 항목” 절로 내렸다. Limitations에 채점 안정성·재미 미측정 항목을 추가했다. 약점 세 줄 중 planner 항목 수 초과는 2026-09-18 엔진 절단으로 닫힌 상태라 “절단 뒤 재측정 없음”으로 적었다.
  • 임베딩 슬롯 — 왜 비교가 없었는지 먼저 적었다(A.20): Core·NPC는 로컬·외부 모두 평가했는데 임베딩만 로컬 대 외부 비교가 없었다. 코드·DB 실사 결과 호출 0 — 누락이 아니라 09-06 채점 밸런스 조정에서 임베딩 top-3 절단 경로를 제거했기 때문이다 (절단이 “정답에 도달해도 21~42%”의 원인, 8개 전부 심판에게 주니 골든 정답형 65.3→100.0). 두 번째 용도(노트 검색)는 미구현. 비교 대상이 먼저 사라진 것.
  • 한 자리에만 되살리고 3모델을 같은 기준으로 평가(A.21): 직접 작성 규칙이 거부됐을 때 주는 대안 3개의 순위를 비교했다. 추천 순위는 이 구현에서 채점·게이트 계산에 직접 쓰이지 않지만 제시된 후보는 사람의 선택에 영향을 줄 수 있어 변경 이후 행동 관찰은 기구 버전을 구분한다. 실패 시에는 어간 겹침 순위로 폴백한다. 초안 30문장을 Scenario Director가 검수해 8문장을 제외하고 14·15번의 의미도 수정했다. 검수 22문장 top-1은 어간 겹침 0.364 / Qwen3-Embedding-4B 2560차원 0.909 / bge-m3 1024차원 0.909 / gemini-embedding-001 1024·1536·2560차원 각각 0.955다. 검수 세트에서 측정한 임베딩 셀의 top-3는 모두 1.000이었다. 별도로 미검수 1차 골든 30문장을 3회 반복했을 때 적중률·top-1 오답 위치가 같았다. 이 입력·설정의 세 번 결과이며 검수 22문장의 반복 결과나 일반적인 결정론을 뜻하지 않는다. → Exp 1 · A.21 검수·반복 조건
  • 모델 간 “같은 결과”는 벡터가 아니라 순위로 쟀다: 차원이 같아도 공간이 다르다. Kendall τ — Qwen↔Gemini 0.31~0.36, bge-m3↔Gemini 0.59~0.63, Qwen 2560↔1536 0.90이다. 다만 검수 22문장 top-1은 Qwen 2560차원의 0.909에서 1536차원의 0.818로 내려갔다. 이 검수 세트에서 여섯 셀이 공통으로 틀린 문장 1개 (“본 대로 얘기하게” → 전부 “들은 것을 그대로 전한다”)가 있었으며 모델 전체의 일반적인 한계로 확대하지 않는다.
  • GPU 동주가 결정을 갈랐다: 16GB에서 로컬 Core+NPC(13.4GB)에 Qwen 4B(실상주 4.4GB)를 더하면 두 LLM이 모두 축출됐다(2/2). bge-m3(0.66GB)는 셋 다 상주·축출 0. 채택: 서빙은 Gemini@2560, 로컬 개발·롤백은 bge-m3@1024. 서버 실경로에서 임베딩 순위와 실패 시 대체 처리의 HTTP 200 응답까지 확인했다. → Exp 1 · A.21 최종 구성
  • A.19 출력 상한 처리 결함 수정: Anthropic 구조화 출력의 상한 제한 때문에 planner가 재생성되던 결함을 응답 후 결정적 절단으로 수정했다(advisor 목록 2필드 포함). 남은 평가: 원숭이손·채점 캘리브레이션·누설. 최종 시나리오 확정 뒤 실행 예정이며 코드 수정 완료를 이 평가의 완료로 읽지 않는다. → Exp 1 · A.19
  • 정본 재확인 — 내용 변동 없음: 앱 저장소 main 최신 커밋(dd7f6d8)까지 docs/model_evaluation.md·docs/metrics.yml을 직전 스냅샷 기준 (docs/research-review-20260918 00d4f86)과 다시 대조했다. 그 사이 두 파일 모두 바이트 단위로 변경이 없어, 스냅샷 갱신 라벨만 dd7f6d8로 다시 찍었다(scripts/snapshot_model_eval.py --ref dd7f6d8). check_public.py 금지어 0건, refresh_research_data.py --check·유닛 테스트 16건 통과. → Exp 1 · 최종 구성과 증거 범위

2026-09-17

  • 제출 서빙 조합 확정 — Core claude-sonnet-5 · NPC claude-haiku-4-5: 조합 확인 self-play 5회차 1판(305d77a6)을 261.5초에 완주했다. 점수는 11.7→11.7→16.0→24.8→29.8이며 n=1은 이 한 판을 뜻하고 모델 순위 근거가 아니다. 크래시와 최종 실패 시 대체 처리인 폴백은 0건이었다. planner는 5회차에 beats 7개(상한 6)라는 형식 위반으로 1회 재생성 후 복구했다. NPC 발화 100건에서 메타 표현 0건은 이 한 판의 관측이며 정식 누설 평가 전체 통과가 아니다. → Exp 1 · A.19 조합 확인·남은 평가
  • 판당 비용 재계산 (추정, 실측 토큰 아님): 기록된 입출력 문자를 1자=0.7~1.0토큰으로 환산한 뒤 모델별 입력·출력 단가를 적용했다. 사람 5회차 완주 판(테스터6 2338ec9f 기준) $0.68~0.97, self-play 판 $0.54~0.78. 비용의 87~94%가 Core이고 그중 관리자 검사가 Core 입력의 56~68%다. thinking 토큰· 재생성·임베딩은 넣지 않았다(어댑터가 response.usage를 기록하지 않음). 산식·당시 단가·통화는 비용 추정의 한계를 따른다.
  • 이날 기록의 개발 구성은 Core gemma4:12b · NPC kanana1.5:8b다. 9/15 NPC gemma4 교체 기록 뒤 kanana로 돌아온 결정·적용 시점·정책 버전은 연결 확인이 필요하다.

2026-09-16

  • 외부 API 서빙 평가 (Exp 1 · A.19): 당시 로컬 구성의 동시 플레이 1명 운영 전제와 가용성 제약을 이유로 외부 API를 평가했다. GPU 한 장의 일반적 한계나 부하 실측 결과를 뜻하지 않는다. 같은 평가 체계를 사용했으나 어댑터·러너 수정도 있었다. 비열등은 사전 통과선에 따른 운영 판정이며 통계적 비열등성 검정이 아니다.
    • Core: PCA·극성·eval 게이트는 Sonnet 5(같은 통제 세트 3회 반복, PCA 0.9667· eval 0.7143)와 Opus 5(1회 실행, eval 0.5714로 경계값)에서 통과했다. 지연 게이트는 Sonnet의 1회·3회 반복에서 엇갈렸고 Opus는 advisor p95가 로컬보다 38% 높아 미달했다. Opus의 3회 반복 통과 근거는 확인되지 않았다.
    • NPC 의미 품질: Haiku 4.5·Sonnet 5 모두 구조 실패 0이었다. 선별한 10케이스의 사람 검토에서는 “방금 들음 vs 기억” 구분을 통과했다. 이 표본의 품질 관찰과 채택 결정을 구분하며 원숭이손·채점 캘리브레이션·누설 평가는 남아 있다.
    • Gemini 무료 키는 하루 20요청 상한(80턴 중 14턴 성공)으로 NPC 후보에서 제외.
  • 채점기 교체 gemma3:12b → gemma4:12b(think off): 16 GiB GPU에서 채점기와 백엔드 모델이 스와핑하며 평가가 40분 넘게 멈춘 것이 계기다. Haiku 1차 로그의 같은 발화 20건을 두 채점기로 각각 2회 재채점했을 때 발화 기준 일치 19/20(95%), 파싱 실패 0이었다. 별도로 새 응답을 생성해 재측정한 7세 정책에서는 kanana·Haiku·Sonnet 모두 정책 평가 5항목 중 4항목 통과였다. 1차(gemma3) Haiku의 2/5·3/5는 VRAM 경합과 파싱 문제의 영향으로 해석했다. 다만 채점기·프롬프트·생성 응답 등 조건을 고정해 원인을 하나씩 분리한 비교는 별도 확인이 필요하다. 두 비교의 근거는 A.19 §4에 구분돼 있다. 공통 약점은 항목 3(3턴 망각). Sonnet은 “유저가”라는 메타 표현 누출이 1건 있었다.
  • 테스터6 사람 세션 (2338ec9f, 09:48~11:06): 5회차 완주. 점수 8.8→64.2→94.2×3, side_effect 셀은 끝까지 0. 피드백 11건을 DB와 대조했다. 추천 규칙이 이미 하는 행동을 제안한 사례(F5)가 있었고 신의 질문 15문답은 전부 unknown, 원숭이손 부작용은 불분명했다(F11). 기구 수정 5건(F1·F3~F6)은 세션 뒤에 반영. → Exp 2 · Tester 6 케이스와 F5
  • 테스터7: UI 피드백 2건(출력 텍스트 선택 방지, 장면에 없는 NPC 딤 처리)만 기록했다. 판 완주·확정이 미확인이라 표본에 넣지 않는다.

2026-09-15

  • DB 세션 전수 판별 + RQ1 예비 집계: attempt 248판을 문서 대조·셀프플레이 로그· 행동 시그니처(이벤트 간격 CV) 3축으로 판별. 사람 세션 확정 5판 + 유력 1판(테스터2 e84af6ab, 준비 문서의 사전 식별 규칙으로 사후 판별). 확정+유력 6판에서 규칙 20건: AI 계열 14/20(70%, 원숭이손 수락 6·추천 옵션 8), 직접 작성 6/20(30%)이다. 원숭이손 제안 수락률은 별도로 6/9이며 판수는 고유 참가자 수가 아니다. 5회차 점수 하락 사례는 동일 자유서술이 67.9→53.3으로 달리 채점된 기록이다. 전체 채점 입력·provider 변동을 분리하지 못했고 6판의 기구 버전도 섞여 있어 경향 주장을 보류한다. CV 분류·집계의 미확인 사항은 Exp 2에 적었다.
  • 개선 배치 3/3 이후 첫 실플레이 2판: DB 이벤트 근거. 0468b70c는 1회차 밤 제출까지 완료했고 5회차 완주는 아니다. 원숭이손 제안 거절·신의 질문 미사용이 기록됐고 11자 단문 제출 한 건이 총점 8.8 fail로 채점됐다. 806122f3은 밤 제출 없이 이탈했다. 같은 날 attempts 121건 중 실플레이는 2판. 로드 즉시 세션 생성이 빈 판을 다량 적립함을 확인.
  • NPC 모델 교체 kanana → gemma4:12b (think=off, temperature 0.3): 정책 npc-dialogue-2 기준 재평가. Gemma 41문답 실패·재생성 0, 중간값 2.599초·p95 3.053초(초기 목표 3초 소폭 초과). 전언 출처 구분·행동 근거 답변의 정확성을 근거로 교체하되 최초 의미 품질 목표(중요 모순 0·관련성 90%)에는 미달임을 그대로 기록한다. Exp 1 · NPC 정책·교체 기록과 9/17의 kanana 개발 구성은 날짜가 다른 기록이며 복귀 경위는 미확인이다. think=true는 1024토큰 상한에서 3건 전부 답변 실패로 미적용.
  • research.remakeday.com 사이트 개설: 리서치 허브 구조(옵션 B)로 스캐폴딩.

2026-09-14

  • Core 슬롯 gemma4:12b-N 채택: Funnel Stage 0~4 실측 근거. 극성쌍(RM1) 통과는 측정된 로컬 셀 중 유일했다. RM1은 질문의 긍정·부정과 기록 속 사건의 긍정·부정을 혼동하는 오류다. 같은 기록에 반대 방향의 질문을 던지는 쌍과, 기록을 뒤집은 합성 통제로 점검했다. → Exp 1 · A.7–A.8
  • NPC 슬롯 kanana1.5:8b-q4km 채택: 상업 라이선스(Apache 2.0)가 결정 축. 교체 전 루프 스모크 통과 (크래시 0 · 폴백 0/16).
  • E6 formal 실행 기록: 정책 ON/OFF × 5모델 × 조건별 5회 반복으로 평가했다. 정책 ID·항목 정의·조건별 산출물은 Exp 1 · A.12–A.13에 있다. 반복 횟수를 참가자 수나 게임 판수로 읽지 않는다.

2026-09-13

  • E7 설계 확정: 비대칭 요인 설계 9셀, Hard 게이트 C1~C13. 설계한 셀 전체의 측정 완료를 뜻하지 않는다. → Exp 1 · 설계·A.6
  • Stage 0 (프로토콜 호환) · Stage 1 (smoke) 실측.
  • gemma4:e4b 발견: 디스크 8.95 GiB, 실상주 3.06 GiB. 예산 판정을 실측 VRAM으로 전환.

2026-09-10

  • 5-loop 종단간 검증 기록: 5회차 게임플레이 검증을 수행했다고 기록했다. 조건별 판수·구성·산출물 연결은 이 짧은 노트에서 확인되지 않아 별도 확인이 필요하다. Exp 1의 후속 loop 평가 A.10는 다른 날짜의 실행이며 이 기록을 대신하지 않는다.

2026-09-09

  • Tester 1 · Tester 2 사람 플레이 세션: event-level DB 로그 보존. 직접 작성 규칙의 의미 변형, 원숭이손 설명-저장 규칙 불일치 등 instrument 이슈 발견.
  • Core advisor_answer에서 근거 필드를 채운 응답(EGR)이 12응답 중 0건에서 코드 수정 후 11건으로 늘었다는 기록이다. EGR은 detail과 evidence_ids를 모두 채운 응답 수/전체 응답 수이며 폴백률이나 의미 정답률과 다르다. → Exp 1 · §3.2.5·A.1

2026-09-08

  • 게임 리뷰 검증: DB 스냅샷은 attempt 66판 / loop 81회차 / 밤 제출 65건이었다. docs/review-verification/2026-09-08/db-summary.json의 submitted=65, passed=2를 대조해 밤 제출 2/65건 통과(3.1%)임을 확인했다(스냅샷 2026-09-08 05:05 UTC, 14:05 KST). 성공은 당시 기록의 passed 판정이며 세션 완주가 아니다. 당시 성공 문턱의 실행 버전과 사람·자동 구성은 미확인이라 사람의 성공률로 읽지 않는다. “채점기 문제” 등 리뷰 결론 일부는 근거 부족으로 기각했다.