Cerebras, public API에 Qwen 3.8 27B 추가…128k context와 초당 1500 tokens 처리 지원
편집자 요약
Cerebras가 public endpoints에서 Qwen 3.8 27B 모델을 제공하며, 유료 기준 최대 128k context와 약 1500 tokens/s 속도를 지원합니다. 해당 모델은 free trial 및 pay-as-you-go tiers에서 이용할 수 있으며, 더 높은 처리량과 production SLA는 Dedicated Endpoints를 통해 제공됩니다.
인사이트
이번 추가는 Cerebras가 고속 추론 인프라를 앞세워 open-source LLM 수요를 흡수하려는 흐름을 보여줍니다. 특히 unpruned 모델 제공과 storage 단계의 선택적 weight-only quantization 정책을 명시해, 속도 경쟁 속에서도 품질과 투명성을 차별화 요소로 내세우고 있습니다.
댓글
토론
> geekhaus:~$ 다음 읽을거리?
