GEEK HAUS
피드로 돌아가기
2026/07/27/humanlayer-tests-claude-opus-5-on-slopcodebench

장기 코드베이스 유지보수 벤치마크 SlopCodeBench 평가에서 Opus 5가 24% 통과율로 선두, 전반적 성능은 여전히 낮아

·github.com
원문 보기

편집자 요약

본 기사는 UW Madison 연구진의 SlopCodeBench가 코딩 모델의 코드베이스 품질 유지 능력을 더 현실적으로 평가한다고 소개합니다. 기존 벤치마크와 달리 요구사항을 단계별 checkpoint로 공개해 모델이 장기적으로 코드베이스를 변경하도록 하며, 저자는 Opus 4.8, Sonnet 5, Opus 5를 일부 과제에 실행한 결과 Opus 5가 24% 통과율로 가장 높았지만 전반적 성과는 낮았다고 평가합니다.

인사이트

SlopCodeBench의 낮은 통과율은 최신 LLM 기반 코딩 agent가 단발성 문제 해결보다 지속적 유지보수와 요구사항 변화 대응에서 여전히 취약하다는 점을 보여줍니다. 코딩 모델 평가의 중심은 점차 정답 생성 능력에서 장기 코드 품질 관리, 회귀 방지, 점진적 설계 변경 수행 능력으로 이동하고 있습니다.

댓글

토론

> geekhaus:~$ 다음 읽을거리?

다음 읽을거리 추천