Google Research·Technion 연구, GPT-5·Gemini-3가 직접 답하지 못한 사실도 추론 시간을 늘리면 최대 65% 회수 가능

편집자 요약
Google Research와 Technion 연구진은 frontier LLM이 오답을 내는 경우에도 관련 사실을 실제로는 파라미터에 보유한 사례가 많다고 분석했습니다. 실험에서 GPT-5와 Gemini-3는 테스트된 사실의 95~98%를 인코딩했으며, 추론 시간을 늘리면 직접 회상하지 못한 사실의 최대 65%를 회수할 수 있었습니다.
인사이트
이번 결과는 LLM의 사실성 문제가 단순한 지식 부족이 아니라 회상 병목일 수 있음을 보여줍니다. 개발팀은 더 큰 모델이나 외부 검색 시스템에만 의존하기보다, 추론 단계의 계산량·프롬프트 전략·검증 절차를 조정해 정확도를 개선하는 방향을 검토할 필요가 있습니다.
댓글
토론
> geekhaus:~$ 다음 읽을거리?


