본문 바로가기
DeepSWE: A Contamination-Resistant Coding Benchmark — James Shi, Datacurve

DeepSWE: A Contamination-Resistant Coding Benchmark — James Shi, Datacurve

AIAI Engineer· 2026-07-26

DeepSWE는 훈련 데이터 오염에 강하도록 새롭게 설계된 113개의 소프트웨어 엔지니어링 작업으로 구성된 코딩 벤치마크입니다. 이 영상은 기존 벤치마크의 한계를 지적하고, DeepSWE를 통해 Claude 및 GPT 모델의 성능 차이, 특히 작업 범위 초과 및 자체 검증과 같은 실패 모드를 분석합니다.

핵심 요약

  • DeepSWE는 113개의 독창적인 소프트웨어 엔지니어링 작업으로 구성되며, PR에서 스크랩하는 대신 처음부터 작성되어 훈련 데이터 오염에 저항적입니다. (창작자 평가: 기존 벤치마크의 한계를 극복)
  • 기존 벤치마크(예: SweetBench Pro)는 상위 모델들이 클러스터링되고 훈련 데이터 오염이 만연하며, 검증기가 취약하다는 문제점을 가지고 있습니다.
  • DeepSWE 리더보드에서는 최상위 모델과 Gemini 3.1 Pro와 같은 모델 간에 분명한 성능 격차가 나타납니다.

전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.

로그인 / 회원가입