같은 입력(persona × 시장 시나리오)을 반복해서 줬을 때 행동 분포가 얼마나 흔들리는가. within = 모델 자신의 반복 흔들림(노이즈 바닥) · cross = 모델 간 거리(신호).
라운드 1은 블라인드(기존 측정과 동일), 라운드 2부터는 각 agent에게 "지난 라운드 10명의 선택 집계"를 보여주고 재결정시킨다. 같은 시나리오 고정이므로 라운드 간 변화의 원인은 '남들 결과' 하나뿐. 행이 균일해질수록 herding(쏠림).
프롬프트에 정보 카드(시장지표/남들행동/직전손익)를 켰다 껐다 하며 drift 변화 측정. baseline(회색) 대비 막대가 높으면 그 정보가 모델을 더 흔든다는 뜻.
"성능(능력)" 축과 "행동 흔들림(반복 일관성)" 축은 서로 다른 질문을 잰다. 이 리더보드의 within-drift가 업계 표준의 어디에 닿는지 정리.
| 축 | 대표 벤치마크 | 측정 대상 |
|---|---|---|
| 종합 지식 | MMLU · MMLU-Pro | 57과목 지식 (MMLU는 88%+ 포화 → Pro로 이동) |
| 추론 | GPQA Diamond · AIME 2025 · HLE · ARC-AGI 2 | 박사급 과학 · 수학 · 최난도 · 추상추론 |
| 코딩 | SWE-bench Verified/Pro · Aider polyglot | 실제 GitHub 버그를 스스로 수정 |
| 툴/함수 호출 | BFCL v4 | 함수 선택·인자 정확도 — 우리 실험(강제 function-call)과 최근접 |
| 지시 따르기 | IFEval | 형식·제약 지시 준수 |
| 종합 랭킹 | LMArena · Artificial Analysis · HF Open LLM v2 | 사람 선호 Elo / 가격·속도 포함 / 오픈웨이트 |
| 지표 / 벤치 | 무엇을 재나 | 대표 수치 · 포인트 |
|---|---|---|
| τ-bench pass^k | 같은 task를 k번 반복해 전부 성공할 확률 | GPT-4o: pass@1 61% → pass^8 25% (반복하면 급락) |
| Behavioral Consistency | 에이전트의 자기모순(행동 일관성) | 우리 실험의 학술판 |
| ReliabilityBench · Beyond pass@1 | 장기 에이전트 신뢰성 과학 프레임 | pass@1 너머 reliability 정량화 |
| Determinism 벤치 (QAnswer) | temperature=0의 재현성 | 개방형선 Claude·GPT도 붕괴, 모델별 편차 큼 |
| Semantic Entropy | 반복 샘플 답분포의 엔트로피 | 우리 drift와 동일 수학 (불확실성·환각 검출) |