·morgin.ai
‘Uncensored’ LLM도 민감 단어 확률을 낮춘다… 5개 연구소 7개 사전학습 모델에서 숨은 안전 필터링 ‘flinch’ 측정
본 기사는 안전 필터링된 pretrain이 노골적으로 거부하지 않더라도 특정 민감 단어의 토큰 확률을 크게 낮추는 현상을 flinch라고 정의하고, 5개 연구소의 7개 pretrain에서 이를 측정했다고 전합니다. 예시로 Qwen3.5-9B-base는 “The family faces immediate _ without a...
읽기 →