AI 안전 다이제스트

2026-03-21 · 1건

BenchBench: 자동 벤치마크 생성 성능을 평가하는 파이프라인(2026.3.21)

DB · arXiv

LLM 벤치마크는 정적 테스트셋의 포화·오염·갱신 비용 문제와 LLM 판정의 편향/프롬프트 민감성이 있어, “답변 성능”뿐 아니라 “벤치마크 설계 능력”까지 평가해야 한다고 제안한다. 이를 위해 BenchBench는 (1) 시드 벤치마크에서 도메인 카드 추출, (2) 여러 디자이너 LLM이 쿼터 제어된 문항 세트를 생성, (3) 다중 모델 답변자 패널과 검증기(가능한 경우 exact/numeric/symbolic, 아니면 루브릭 기반)로 문항을 검증하는 3단계 파이프라인을 제시한다. 컴퓨터과학·수학·의학·이론적 사고(다국어/멀티모달 포함) 9개 변형에서 1.67만 개 문항을 만들고, 설계자-답변자 행렬을 통해 설계 능력과 답변 강도의 상관이 중간 수준(스피어만 rho≈0.37)이며 무효 문항은 변별도와 음의 연관이 있음을 보고한다.