2026/04/30/standard-intelligence-bets-raw-computer-use-video
Standard Intelligence가 텍스트와 tool call 중심 접근 대신 픽셀 기반 비디오 사전학습으로 범용 컴퓨터 에이전트 개발에 나섭니다
편집자 요약
Standard Intelligence는 언어 토큰이나 스크린샷 기반 도구 호출이 아니라, 컴퓨터 사용 영상을 원시 픽셀 단위로 학습하는 픽셀 기반 비디오 사전학습을 범용 에이전트 개발의 핵심 경로로 보고 있습니다. 이 회사는 1,100만 시간 규모의 컴퓨터 행동 데이터셋과 경쟁 방식 대비 약 50배 토큰 효율적인 video encoder를 내세우며, 다음 마우스 이동·클릭·키 입력을 예측하는 모델을 훈련하고 있습니다.
인사이트
이 접근은 LLM 위에 복잡한 agent framework를 얹는 현재 주류와 달리, Tesla FSD식으로 대규모 행동 데이터를 축적해 일반성을 끌어내려는 bitter lesson 성격의 전략입니다. 성공할 경우 소프트웨어 자동화 경쟁의 무게중심이 prompt engineering과 tool orchestration에서 비디오 데이터, encoder 효율, 대규모 추론 인프라로 이동할 수 있습니다.
댓글
토론
> geekhaus:~$ 다음 읽을거리?
