The Era of 1-bit LLMs: All Large Language Models are in 1.58 Bits
Shuming Ma, Hongyu Wang, Lingxiao Ma, Lei Wang, Wenhui Wang, Shaohan Huang, Lifeng Dong, Ruiping Wang 외
BitNet b1.58은 모든 가중치를 1.58비트(삼진값)로 양자화하여 FP16 수준의 성능을 유지하면서도 극도로 효율적인 LLM 추론을 가능하게 한다.
대규모 언어 모델(LLM)은 막대한 메모리와 에너지를 소비하여 배포 비용이 높고, 특히 엣지 디바이스에서의 사용이 어렵다. 기존 양자화 방법은 성능 저하를 피하기 어려웠다.
BitNet b1.58은 가중치를 -1, 0, 1의 세 가지 값으로만 표현하는 1.58비트 양자화를 도입한다. 훈련 과정에서 양자화를 고려한 학습(quantization-aware training)을 통해 성능 저하를 최소화하고, 삼진 가중치에 최적화된 행렬 곱셈 커널을 사용하여 추론 속도와 에너지 효율을 극대화한다.
동일한 모델 크기와 학습 토큰 수에서 FP16 모델과 퍼플렉서티 및 다운스트림 태스크 성능이 일치한다. 지연시간은 2~4배, 메모리 사용량은 3~4배, 처리량은 2~4배, 에너지 소비는 5~10배 개선되었다. 이는 1비트 LLM 시대를 열며, 전용 하드웨어 설계의 새로운 패러다임을 제시한다.