allmy.prism · 측정 기록 2026-09-06

군주론은 예측하는가

2500년 동안 아무도 정치 이론에 점수를 매긴 적이 없다. 뉴스 사건 하나를 여러 철학 렌즈에 통과시키고, 각 렌즈가 내놓은 원인을 실제 기록과 대조해 채점하는 장치를 만들었다. 마흔여덟 건을 채점했고, 아직 아무것도 증명하지 못했다.

71,465수집된 기사
48채점된 사건
±0.16측정 노이즈 폭
0노이즈를 넘은 발견
장치

기계는 미래를 볼 수 없다

사후 해석은 언제나 그럴듯하다. 사건이 벌어진 뒤에 "그래서 그랬던 것"이라고 말하는 건 누구나 한다. 그래서 이 장치의 핵심은 예측 모델이 아니라 시간 봉인이다.

사건 발생 시각 이전에 발행된 문서만 검색된다. 데이터베이스 함수 하나를 통해서만 조회가 가능하고, 그 함수는 published_at < 사건시각을 강제한다. 사건 이후의 해설 기사는 구조적으로 존재하지 않는 세계에서 원인을 복원하는 것이다.

사건 발생 봉인 컨텍스트 — 기계가 보는 유일한 세계 2024-07 → 사건시각 · 최대 30,062건 사후 분석 — 정답지로만 쓰인다 기계는 이쪽을 볼 수 없다 과거 미래
기계가 복원한 원인 목록과 사후 분석 문서에서 뽑은 정답 목록을 의미 단위로 맞춰 recall(정답 중 복원한 비율)과 precision(복원 중 맞은 비율)을 낸다.

발견 하나 · 그리고 그 철회

표본을 늘리자 발견이 죽었다

2026년 8월, 스물일곱 건을 채점하고 이렇게 적었다 — 같은 사건, 같은 기계인데 어떤 문서를 정답지로 쓰느냐에 따라 점수가 갈린다. 세력 관계를 다룬 기사를 정답지로 쓰면 0.190, 언론 해설을 쓰면 0.074. 격차 0.116. 표본은 여섯 건이었다.

그 격차를 세 번 더 쟀다.

측정 노이즈 폭 ±0.16 — 이 안의 차이는 차이가 아니다 2026-08  0.116 2026-08  0.047 2026-09  0.128 n=6 n=16 — 표본 확대 n=15 — 판정자 교체 같은 질문에 세 번 답했는데 값이 0.047에서 0.128 사이를 오갔다. 셋 다 노이즈 폭 안이다.
가로 막대는 「세력 관계 정답지」와 「언론 해설 정답지」의 recall 격차. 옅은 사각형이 측정 노이즈 폭이다 — 같은 설정을 반복해도 이만큼은 흔들린다.

표본을 여섯에서 열여섯으로 늘리자 격차가 0.116에서 0.047로 줄었다. 판정자 모델을 바꾸자 다시 0.128로 벌어졌다. 세 값 모두 노이즈 폭 안에 있다.

발견은 없었다. 여섯 건으로 본 순위가 그럴듯했을 뿐이다.

이 페이지의 이전 판은 그 순위를 「발견 하나」로 게시하고 있었다. 3주 동안 그랬다. 표본이 작다는 사실(n=6)은 적혀 있었지만, 제목과 순위표는 확정된 사실처럼 읽혔다. 지금 이 문단이 그 정정이다.


발견 둘

렌즈는 다르게 말한다. 그런데 더 맞히지는 않는다

같은 봉인 문서 열여섯 건을 주고 관점만 바꿨다. 무렌즈 대조군, 군주론(권력 유지 극대화), 관료정치 모델(부처 간 흥정의 산물).

렌즈는 분명히 일했다. 군주론은 "야당이 표결 시점을 여유 있게 잡았다"를 원인으로 집어냈고, 관료정치는 "야당 압력과 시민 집회가 결합되어 두 번째 발의로 이어졌다"를 짚었다. 무렌즈는 둘 다 보지 못하고 여론 지표만 봤다. 출력 간 거리는 0.18~0.34로, 이론끼리의 거리가 각자 무렌즈와의 거리보다 멀었다.

렌즈recallprecision판정
무렌즈 대조군0.108 ± 0.1330.143기준선
군주론0.096 ± 0.1400.114차이 없음
관료정치 모델0.178 ± 0.1220.229차이 없음

관료정치가 대조군보다 0.07 높다. 솔깃하지만 표준편차가 0.12다. 실험 전에 "표준편차를 넘게 앞서야 우위로 인정한다"고 기준을 적어뒀고, 그대로 적용했다. 우위 없음.

설계 문서에 미리 적혀 있던 결말이다. "모든 렌즈가 대조군에 진다"도 유효한 발견으로 취급한다고 써두었다. 지금 상태는 그보다 약한 "구별은 되지만 개선은 미확인" — 다르게 말하지만 더 맞히지는 않는다.

발견 셋 · 2026-08-16

기계가 자기 개선 보고를 기각한 날

어떤 사건의 정의를 바꿨더니 점수가 0.00에서 0.17로 올랐다. 가설이 실증됐다고 기록했다.

그런데 정답지를 고정하고 다시 재자 0.00으로 돌아왔다. 사건 정의를 바꾸면서 정답지를 뽑는 심판도 다른 답을 냈고, 그 우연한 표현 일치가 매칭 두 건을 만들었던 것이다. 개선이 아니라 계측 잡음이었다.

같은 설정을 세 번 돌리면 0.17 · 0.33 · 0.33이 나온다. 이 폭을 모르면 잡음을 성과로 읽게 된다.

같은 날 같은 실수를 세 번 했다 — 개선인 줄, 퇴행인 줄, 실증인 줄. 세 번 다 인프라가 뒤집었다. 그래서 지금은 반복 측정과 중앙값이 기본값이고, 모든 시행값이 결과 파일에 남는다. 잡음 폭을 감추지 않기 위해서다.


발견 넷 · 2026-09-02

파라미터를 다섯 배로 키워도 달라지지 않았다

같은 마흔다섯 건을, 같은 정답지로 세 모델에게 채점했다. 120억 파라미터부터 350억까지.

예측 모델크기recall판정
qwen3.6-35b36.7GB0.227 ± 0.235
gemma4-12b6.7GB0.179 ± 0.190차이 없음
qwen3-vl-30b18.3GB0.156 ± 0.218차이 없음

최고와 최저의 격차는 0.071. 노이즈 폭의 절반도 안 된다. 순위는 크기순으로 보이지만, 주장할 수 없는 순위다.

세 모델이 동일한 정답지를 봤다는 것이 이 비교의 전부다. 정답지가 흔들리면 모델 차이는 그 아래 묻힌다.

규율

이 기계가 자신을 속이지 못하게 하는 것들

인용 없는 원인은 노드조차 만들지 않는다

그럴듯한 이야기는 근거 문서를 지목해야만 살아남는다. 지목하지 못한 원인은 기록되지 않고 폐기된다. 현재 인용 없는 원인 비율 0.0%.

채점하는 모델과 채점당하는 모델은 계열이 달라야 한다

같은 계열이면 시스템이 자기 자신을 채점하게 된다 — 성능이 아니라 자기일관성을 재는 꼴이다. 설정이 겹치면 실행 자체가 거부된다.

정답지에 없는 원인은 자동으로 판정하지 않는다

통찰일 수도, 환각일 수도 있다. 사람이 라벨을 붙일 때까지 미결로 남는다. 실제로 기계가 정답지에 없는 "명태균 녹취록 공개"를 원인으로 짚었는데, 이후 공식 조사가 지목한 요인과 겹쳤다.

답이 나올 수 없는 문제는 성적에서 뺀다

어떤 사건은 그 이전 기사가 24건뿐이었다. 성능이 낮은 게 아니라 측정이 불가능한 것이다. 이런 케이스는 감사에서 걸러 평균에서 제외하고, 제외했다는 사실을 함께 표시한다.


현재

지금 서 있는 자리

기사 71,465건이 쌓였고, 그중 2024년 8월부터 2026년 9월까지의 한국 정치·경제 구간이 두껍다. 사건 245건, 인과 연결 248건, 채점된 평가 사건 48건.

아직 답하지 못한 질문이 이 프로젝트의 본론이다 — 어떤 이론이 어떤 영역에서 예측력을 갖는가. 그걸 가리려면 지금 잡음 폭(±0.16)보다 작은 차이를 분간할 수 있어야 하고, 그러려면 사건 수가 훨씬 많아야 한다. 48건도 아직 시작이다.

첫 커밋(2026-08-13)에서 여기까지 24일. 그 사이 스스로 기각한 발견이 셋이다. 남은 것은 두 줄이다. 하나, 렌즈는 출력을 실제로 바꾼다. , 그 차이가 정확도로 이어진다는 증거는 아직 없다.