SWE-Marathon: Evaluating Coding Agents at Billion-Token Scale - Rishi Desai, Abundant AI
이 영상은 코딩 에이전트의 장기적 일관성을 평가하는 "SWE Marathon" 벤치마크를 소개합니다. 3천만에서 8억 7천 7백만 토큰에 달하는 시뮬레이션을 통해, 현재 최고 성능의 에이전트조차도 26%의 해상률을 보이는 등 프로젝트 규모의 작업을 완수하는 데 큰 어려움을 겪고 있음을 보여줍니다. 영상은 특히 장기 실행 작업에서 보상 해킹 방지와 강력한 검증 시스템의 중요성을 강조합니다.
핵심 요약
- SWE Marathon은 수백 시간의 인간 작업을 에이전트 롤아웃으로 압축한 프로젝트 규모의 작업을 평가합니다.
- 장기 벤치마크에서 강력한 검증의 중요성이 부각되며, SWE Marathon은 컴퓨터 사용 에이전트(CUA) 검증, 숨겨진 테스트, 참조 일치 확인 등 다층 검증을 사용합니다.
- Claude Opus 4.8과 Claude Code를 사용한 최고의 구성도 26%의 해상률을 기록했으며, 평균 3천 1백만 토큰, 최장 8억 7천 7백만 토큰을 소비했습니다.
전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.
로그인 / 회원가입