BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese
Peilin Zhou, Bruce Leon, Xiang Ying, Can Zhang, Yifan Shao, Qichen Ye, Dading Chong, Z. Jin 외
중국어 웹 검색 능력을 평가하기 위해 설계된 고난도 벤치마크로, 289개의 다중 홉 질문을 통해 LLM 에이전트의 검색 및 추론 능력을 종합적으로 측정한다.
기존 BrowseComp 벤치마크는 영어에 집중되어 있어, 중국어 웹의 언어적, 인프라적, 검열 관련 복잡성을 반영하지 못한다. 중국어 웹 환경에서 LLM의 실제 검색 능력을 평가할 수 있는 벤치마크가 부재하다.
각 질문은 짧고 객관적이며 검증 가능한 답변(날짜, 숫자, 고유명사 등)을 갖도록 역설계되었고, 2단계 품질 관리 프로토콜을 통해 난이도와 답변의 유일성을 보장했다. 20개 이상의 최신 LLM 및 에이전트 검색 시스템을 평가했다.
대부분의 모델이 10% 미만의 정확도를 보였고, 최고 성능 시스템(OpenAI DeepResearch)도 42.9%에 그쳤다. 이는 중국어 웹 검색에서 효과적인 검색 전략뿐만 아니라 정교한 추론과 정보 통합 능력이 필요함을 보여준다. 데이터셋, 구축 가이드라인, 벤치마크 결과를 공개했다.