🌀 LLM agent drift 리더보드

같은 입력(persona × 시장 시나리오)을 반복해서 줬을 때 행동 분포가 얼마나 흔들리는가. within = 모델 자신의 반복 흔들림(노이즈 바닥) · cross = 모델 간 거리(신호).

핵심 발견 요약
  1. 모호할수록 흔들린다 — 명확한 시장엔 거의 결정론적, 횡보장에서만 drift 큼
  2. 모델별 drift가 다르다 (본 KPI) — 게다가 "크기=안정성"은 회사 안에서만: Claude는 큰 게 안정, OpenAI는 작은 게 안정(4o-mini ≪ 4o)
  3. 정보 효과는 모델 의존적(부호까지 뒤집힘) — 같은 카드가 모델 따라 반대로 작용: '남들 행동'은 Haiku를 흔들지만(+0.14) glm-4.5-air는 살짝 안정(−0.02), '직전 손익'은 Haiku를 안정시키지만(−0.08) glm-4.5-air는 흔듦(+0.05) — ⑦ 참고
  4. 눈치(herding) — 남들 결과가 보이면 작은 모델×모호 상황에서만 쏠림(50→80%)
  5. 흔들림의 주인공은 스윙·소액 persona — 고래·비활성은 어느 모델이든 바위처럼 고정

① 모델 리더보드 — within drift (낮을수록 반복에 안정)

② 모델 간 거리 — cross vs 노이즈 바닥

③ 시나리오 × 모델 히트맵

④ agent별 flip rate (모델 내 반복 흔들림, 평균)

⑤ 행동 로그 뷰어

⑥ 눈치 실험 — 남들 결과가 보이면? (궤적 실험 · 순수 drift와 별도 트랙)

라운드 1은 블라인드(기존 측정과 동일), 라운드 2부터는 각 agent에게 "지난 라운드 10명의 선택 집계"를 보여주고 재결정시킨다. 같은 시나리오 고정이므로 라운드 간 변화의 원인은 '남들 결과' 하나뿐. 행이 균일해질수록 herding(쏠림).

⑦ 정보 카드 ablation — 풍부화가 drift를 바꾸나 (모델 4 시나리오)

프롬프트에 정보 카드(시장지표/남들행동/직전손익)를 켰다 껐다 하며 drift 변화 측정. baseline(회색) 대비 막대가 높으면 그 정보가 모델을 더 흔든다는 뜻.

⑧ 참고 — 현업 벤치마크와 우리 지표의 위치 (외부 자료 요약 · 2026)

"성능(능력)" 축과 "행동 흔들림(반복 일관성)" 축은 서로 다른 질문을 잰다. 이 리더보드의 within-drift가 업계 표준의 어디에 닿는지 정리.

A. 성능 위주 벤치마크 — 능력 측정, 대부분 single-run pass@1
대표 벤치마크측정 대상
종합 지식MMLU · MMLU-Pro57과목 지식 (MMLU는 88%+ 포화 → Pro로 이동)
추론GPQA Diamond · AIME 2025 · HLE · ARC-AGI 2박사급 과학 · 수학 · 최난도 · 추상추론
코딩SWE-bench Verified/Pro · Aider polyglot실제 GitHub 버그를 스스로 수정
툴/함수 호출BFCL v4함수 선택·인자 정확도 — 우리 실험(강제 function-call)과 최근접
지시 따르기IFEval형식·제약 지시 준수
종합 랭킹LMArena · Artificial Analysis · HF Open LLM v2사람 선호 Elo / 가격·속도 포함 / 오픈웨이트
B. 에이전트 행동 흔들림 · 신뢰성 벤치마크 — 반복 일관성, 우리 within-drift와 같은 가족
지표 / 벤치무엇을 재나대표 수치 · 포인트
τ-bench pass^k같은 task를 k번 반복해 전부 성공할 확률GPT-4o: pass@1 61% → pass^8 25% (반복하면 급락)
Behavioral Consistency에이전트의 자기모순(행동 일관성)우리 실험의 학술판
ReliabilityBench · Beyond pass@1장기 에이전트 신뢰성 과학 프레임pass@1 너머 reliability 정량화
Determinism 벤치 (QAnswer)temperature=0의 재현성개방형선 Claude·GPT도 붕괴, 모델별 편차 큼
Semantic Entropy반복 샘플 답분포의 엔트로피우리 drift와 동일 수학 (불확실성·환각 검출)
우리 지표(within-drift)의 위치 — 작업 형태는 BFCL(툴 선택) 계열, 측정 각도는 τ-bench pass^k · semantic entropy 계열. 주류 성능 리더보드는 대부분 single-run이라 "반복 일관성" 축이 빠져 있어, 본 실험은 그 빈틈을 메우는 보완 지표다. 다만 절대수치는 작업이 달라(우리는 5지선다 단일 결정) 직접 비교 불가 — 랭킹/상대 패턴만 전이된다.
출처
[A·성능] LMArena · Artificial Analysis · llm-stats · BFCL (Berkeley Function-Calling) · HELM · lm-eval-harness · MMLU-Pro 논문
[B·흔들림] τ-bench (Sierra) · τ-bench 논문 · Behavioral Consistency in Agents · Beyond pass@1 · ReliabilityBench · QAnswer 결정성 · Numerical Nondeterminism · Semantic Entropy
⚠ 다른 persona set / prompt 버전의 결과는 리더보드에서 제외되고 아래 참고로만 표시: