Evaluating large language models for multilingual vulnerability detection at dual granularities
Honglin Shu, Michael Fu, Junji Yu, Dong Wang, C. Tantithamthavorn, Junjie Chen, Yasutaka Kamei
LLM과 PLM의 다국어 취약점 탐지 성능을 함수·라인 수준에서 비교 평가한 실증 연구입니다.
기존 연구는 특정 언어(예: C/C++)와 함수 수준 탐지에 집중하여, PLM과 LLM이 다국어 및 다중 수준 시나리오에서의 장단점이 충분히 탐구되지 않았습니다.
7개 프로그래밍 언어의 30,000개 이상의 실제 취약점 수정 패치를 사용하여, SOTA PLM과 LLM의 성능을 함수 수준과 라인 수준에서 체계적으로 평가합니다. GPT-4o는 지시 튜닝과 퓨샷 프롬프팅을 통해 강화되었습니다.
지시 튜닝과 퓨샷 프롬프팅이 적용된 GPT-4o가 모든 평가된 모델(CodeT5P 포함)을 크게 능가합니다. LLM 기반 접근 방식은 특히 위험도가 높고 심각한 취약점을 탐지하는 데 뛰어난 성능을 보이며, PLM 접근 방식에 비해 상당한 개선을 보여줍니다.