[Educational Measurement] 벤치마크 점수는 어디까지 말할 수 있을까요?
LLM과 AI 에이전트 평가를 공부하다 보면 자연스럽게 데이터셋, 평가 지표, LLM-as-a-Judge, 리더보드 같은 주제에 관심이 갑니다. 저 역시 처음에는 더 좋은 벤치마크를 만들기 위해 어떤 태스크를 넣어야 하는지, 정확도를 어떻게 계산해야 하는지, 평가자를 어떻게 설계해야 하는지를 주로 살펴봤습니다. 그런데 평가를 계속 고민해볼 수록, 기초를 알아야겠다는 생각을 하였습니다. 우리가 계산한 이