git.kernel.org, AI 크롤러의 비효율적 HTML 스크래핑으로 정상 이용보다 큰 CPU 부하 겪어
편집자 요약
본 기사는 git.kernel.org가 AI 크롤러 때문에 지속적인 시스템 부하를 겪고 있으며, 5개 지리 분산 노드에서 상시 14개 CPU 코어가 git commit을 HTML로 렌더링하는 데 쓰이고 있다고 전합니다. 문제는 필요한 데이터가 git clone으로 효율적으로 확보될 수 있음에도, 크롤러들이 가장 비효율적인 방식으로 웹 페이지를 대량 요청한다는 점입니다.
인사이트
LLM 학습용 데이터 수요가 공개 개발 인프라에 새로운 비용을 전가하고 있음을 보여주는 사례입니다. 특히 pre-AI 코드·메일링리스트 아카이브처럼 가치가 높은 데이터 소스일수록 무차별 크롤링의 표적이 되며, 향후 오픈소스 프로젝트는 접근 정책, rate limiting, 데이터 제공 방식 재설계를 더 적극적으로 검토해야 합니다.
댓글
토론
> geekhaus:~$ 다음 읽을거리?
