연구진, ternary LLM의 1.58-bit 저장 장벽 낮추는 BITCOS 제안…실측 모델에서 추론 최대 1.27배 개선
편집자 요약
arXiv 논문은 ternary LLM의 {-1,0,+1} 가중치가 균등 분포한다는 기존 가정과 달리, 29개 모델에서 0 값 비중이 최대 51.5%에 이른다고 보고합니다. 연구진은 dense presence bitmap과 compacted sign vector를 결합한 BITCOS 레이아웃을 제안했으며, 26개 모델에서 five-trit packing보다 저장 효율이 높고 최저 1.485 bits per weight를 달성했습니다. AVX-512, AVX2, Intel Xe2 GPU용 unpacking 최적화와 end-to-end 추론 실험에서 처리량은 CPU 최대 1.18배, GPU 최대 1.27배 개선됐습니다.
인사이트
이번 연구는 ternary LLM 최적화가 산술 정밀도 축소를 넘어 실제 가중치 분포를 반영한 memory layout 설계로 확장되고 있음을 보여줍니다. 특히 decode가 메모리 대역폭에 민감한 환경에서 분포 적응형 압축은 모델 크기 절감과 추론 가속을 동시에 노릴 수 있어 client CPU와 integrated GPU 배포에 의미가 큽니다. 다만 성능 이득은 0 값 밀도와 hardware unpacking 비용에 좌우되므로, 다양한 모델 계열과 비 Intel GPU에서의 재현성이 채택의 핵심 변수가 될 전망입니다.
댓글
토론
> geekhaus:~$ 다음 읽을거리?
