2026/08/07/deepseek-v4-flash-0731-posts-strong-arc-agi
DeepSeek, V4 Flash 0731 벤치마크 공개… 3개 reasoning variant와 ARC-AGI-2 61.4%로 저비용 추론 성능 부각
편집자 요약
DeepSeek는 V4 Flash 0731의 ARC-AGI 벤치마크 결과와 3개 reasoning variant(Max, High, Low)를 공개했습니다. Max 설정은 ARC-AGI-1 Semi-Private에서 89.0%, ARC-AGI-2 Semi-Private에서 61.4%를 기록했으며, 비용은 각각 작업당 $0.02와 $0.04로 제시됐습니다.
인사이트
이번 결과는 고난도 추론 벤치마크에서 성능뿐 아니라 작업당 비용을 함께 전면에 내세우는 흐름을 보여줍니다. 특히 reasoning effort 수준별 성능 차이를 공개한 점은 기업 고객이 추론 비용과 정확도 사이의 균형을 조정하는 방향으로 LLM 경쟁이 이동하고 있음을 시사합니다.
댓글
토론
> geekhaus:~$ 다음 읽을거리?

