The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models
Abhinav Singh, Harsha Vardhan Khurdula, Yoeven D. Khemlani, Vineet Agarwal
SOB는 LLM이 텍스트, 이미지, 오디오 등 다양한 소스에서 구조화된 데이터를 추출하는 능력을 평가하는 최초의 다중 소스 벤치마크로, 스키마 준수와 값 정확도를 동시에 측정한다.
기존 벤치마크는 단일 소스 도메인에서 스키마 준수나 값 정확도만 평가하거나, 구조화 출력 능력을 비전/음성 처리 능력과 혼합하여 평가했다. 따라서 LLM의 구조화 출력 자체의 품질을 공정하게 비교할 수 있는 벤치마크가 부족했다.
SOB는 텍스트(5,000개), 이미지(209개), 오디오(115개) 세 가지 소스 모달리티로 구성된다. 모든 모델은 소스 모달리티와 무관하게 텍스트 정규화된 표현을 입력받아, 구조화 출력 능력만을 분리하여 평가한다. 각 레코드는 자연어 질문, JSON 스키마, 정답을 포함하며, 7가지 메트릭(스키마 준수, 값 정확도 등)으로 평가한다.
21개 모델 평가 결과, 스키마 준수는 거의 완벽했지만 값 정확도는 텍스트 83.0%, 이미지 67.2%, 오디오 23.7%에 그쳤다. 오디오에서 긴 컨텍스트가 추출을 크게 어렵게 만듦을 발견했다. 데이터셋과 평가 파이프라인을 공개하여 LLM 구조화 출력 연구의 기준을 제공한다.