GEEK HAUS
피드로 돌아가기
2026/06/10/surprise-upset-gpt-5-5-beats-claude-fable-5-on

UC Berkeley RDI의 새 AI 에이전트 벤치마크 ALE에서 GPT-5.5가 Claude Fable 5를 근소하게 앞서

·VentureBeat
원문 보기
UC Berkeley RDI의 새 AI 에이전트 벤치마크 ALE에서 GPT-5.5가 Claude Fable 5를 근소하게 앞서

편집자 요약

UC Berkeley RDI와 300명 이상의 전문가 자문단이 장기 전문 업무 수행 능력을 평가하는 새 벤치마크 Agents’ Last Exam을 공개했습니다. OpenAI의 GPT-5.5는 Codex harness 기반으로 24.0% 통과율을 기록해, 전날 공개된 Anthropic의 Claude Fable 5(22.0%)를 제치고 1위에 올랐습니다.

인사이트

ALE는 단순 코딩 문제나 정적 질의응답이 아니라 경제적 가치가 있는 실제 업무 흐름을 겨냥해, AI 에이전트 평가가 실무 수행력 중심으로 이동하고 있음을 보여줍니다. 다만 최고 모델도 25% 미만의 통과율에 그쳐, 현재의 agentic AI가 장기 과업의 안정적 실행과 검증 가능성 측면에서 아직 큰 한계를 안고 있음을 시사합니다.

댓글

토론

> geekhaus:~$ 다음 읽을거리?

다음 읽을거리 추천