GEEK HAUS
피드로 돌아가기

vLLM v0.28.0 공개, Kimi-K3·DeepSeek V4 최적화와 speculative decoding 성능 개선 확대

·github.com
원문 보기

편집자 요약

vLLM v0.28.0은 270명의 기여자가 참여한 584개 commit을 포함한 대규모 릴리스입니다. 이번 버전은 Kimi-K3 전반의 성능 최적화, DeepSeek V4의 sparse MLA 지원, speculative decoding 개선, Model Runner V2 성숙화에 초점을 맞췄습니다.

인사이트

이번 릴리스는 vLLM이 단순한 LLM serving 엔진을 넘어 최신 대규모 모델별 실행 경로를 빠르게 흡수하는 추론 인프라로 진화하고 있음을 보여줍니다. 특히 ROCm, AMD Quark NVFP4, GPU 메모리 절감 기능이 함께 강화되면서 NVIDIA 중심 생태계를 넘어 하드웨어 선택지를 넓히려는 흐름도 뚜렷합니다.

댓글

토론

> geekhaus:~$ 다음 읽을거리?

다음 읽을거리 추천