dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching
Zhiyuan Liu, Yicun Yang, Yaojie Zhang, Junjie Chen, Chang Zou, Qi Wei, Shaobo Wang, Linfeng Zhang
확산 LLM의 추론 속도를 높이기 위해 프롬프트와 응답의 안정성을 활용한 학습 없는 적응형 캐싱 기법.
확산 기반 LLM(dLLM)은 반복적 잡음 제거 과정으로 인해 추론 지연 시간이 길다. 기존 ARM의 KV-캐싱은 양방향 어텐션 특성상 dLLM에 적용 불가능하다.
dLLM 추론 시 프롬프트는 정적이고 응답 토큰 대부분이 인접 잡음 제거 단계에서 안정적임을 관찰. 이를 바탕으로 긴 간격 프롬프트 캐싱과 특징 유사도 기반 부분 응답 업데이트를 결합한 학습 없는 적응형 캐싱 프레임워크 dLLM-Cache를 설계.
LLaDA 8B와 Dream 7B 모델에서 LongBench-HotpotQA 벤치마크 기준 최대 9.1배 FLOPs 감소, 출력 품질 유지. dLLM 추론 지연을 ARM 수준에 근접하게 개선.