2026/07/29/developer-releases-turbofieldfare-an-open-source
Swift·Metal 기반 TurboFieldfare, M-series Mac에서 2GB RAM으로 Gemma 4 26B 실행 지원
편집자 요약
개발자가 4-bit Gemma 4 26B-A4B-IT를 약 2GB RAM으로 구동하는 오픈소스 추론 엔진 TurboFieldfare를 공개했습니다. 모델의 14GB 규모 양자화 가중치를 RAM에 모두 올리지 않고, 공유 레이어와 KV cache는 메모리에 유지하며 필요한 routed expert만 SSD에서 스트리밍하는 방식입니다. 8GB M2 MacBook Air에서는 56 tok/s, M5 MacBook Pro에서는 3135 tok/s 성능을 기록했습니다.
인사이트
이번 구현은 대형 MoE 모델을 저사양 온디바이스 환경에서 실행하기 위한 메모리 절감 전략이 현실적인 수준에 접근하고 있음을 보여줍니다. SSD 스트리밍과 GPU 연산을 겹치는 방식은 온디바이스 AI가 고가 메모리 구성에 덜 의존하도록 만드는 중요한 실험입니다. OpenAI 호환 로컬 서버까지 제공해, 개인용 Mac을 로컬 AI 개발·테스트 환경으로 활용하려는 흐름도 강화될 수 있습니다.
댓글
토론
> geekhaus:~$ 다음 읽을거리?