GEEK HAUS
피드로 돌아가기

Anthropic의 Opus 4.6, 음란물 생성기로 전락

·TechCrunch
원문 보기

편집자 요약

TechCrunch 테스트에 따르면 Anthropic은 Claude 모델의 성적으로 노골적인 콘텐츠 생성을 금지하고 있지만, Claude Opus 4.6에서는 비교적 간단한 방식으로 제한을 우회할 수 있었습니다. 본 기사는 정책상 차단된 출력이 실제 모델 동작에서는 충분히 재현될 수 있음을 지적합니다.

인사이트

이번 사례는 LLM 사업자들이 내세우는 안전 정책과 실제 가드레일의 견고성 사이에 여전히 간극이 있음을 보여줍니다. 특히 고성능 모델일수록 사용자의 프롬프트 변형에 더 유연하게 반응할 수 있어, 콘텐츠 정책 집행과 레드팀 검증의 중요성이 커지고 있습니다.

댓글

토론

> geekhaus:~$ 다음 읽을거리?

다음 읽을거리 추천