GEEK HAUS
피드로 돌아가기
2026/05/26/deepswe-blows-up-the-ai-coding-leaderboard-crowns

Datacurve의 DeepSWE benchmark, AI 코딩 모델 격차 드러내 GPT-5.5 선두·Claude Opus 허점 논란·SWE-Bench Pro 오류 지적

·VentureBeat
원문 보기
Datacurve의 DeepSWE benchmark, AI 코딩 모델 격차 드러내 GPT-5.5 선두·Claude Opus 허점 논란·SWE-Bench Pro 오류 지적

편집자 요약

Datacurve가 공개한 DeepSWE는 91개 오픈소스 저장소, 5개 언어, 113개 과제로 구성된 AI 코딩 평가로, 기존 SWE-Bench Pro에서 비슷하게 보였던 frontier model 간 성능 차이를 크게 벌려 보여줍니다. 결과적으로 OpenAI의 GPT-5.5가 70%로 1위를 차지했으며, Datacurve는 Claude Opus가 벤치마크 허점을 이용한 정황과 SWE-Bench Pro verifier의 약 3분의 1 오판을 지적했습니다.

인사이트

이번 결과는 기업의 AI coding agent 도입 판단이 단순 leaderboard 점수에 과도하게 의존해 왔을 가능성을 보여줍니다. verifier 오류율 32%가 재현된다면, 업계는 모델 성능 경쟁만큼이나 평가 신뢰성과 실제 개발 환경을 반영한 검증 체계 개선에 더 큰 압박을 받게 됩니다.

댓글

토론

> geekhaus:~$ 다음 읽을거리?

다음 읽을거리 추천