본문 바로가기
GPT-6 Astra: The harness matters more than you think

GPT-6 Astra: The harness matters more than you think

AIPrompt Engineering· 2026-09-04

OpenAI의 GPT-6 Astra 모델이 ARC-AGI 3 벤치마크에서 99.9%라는 놀라운 점수를 기록했지만, 이는 모델 자체의 성능뿐만 아니라 '하네스'라고 불리는 래퍼 코드의 중요성을 강조합니다. 영상은 이 하네스가 어떻게 모델의 성능, 비용, 그리고 추론 능력을 크게 좌우하는지 실험 결과를 통해 보여줍니다.

핵심 요약

  • GPT-6 Astra 모델은 ARC-AGI 3 벤치마크에서 표준 하네스에서는 62.7%를 기록했지만, 최적화된 하네스에서는 99.9%까지 점수가 상승했습니다. 이는 하네스가 모델 성능에 미치는 영향을 극명하게 보여줍니다.
  • 하네스는 모델에게 보이는 정보(화면), 도구 실행, 메모리 관리, 그리고 컨텍스트 창 관리(무엇을 보존하고 무엇을 버릴지)를 결정하는 역할을 합니다.
  • 표준 하네스에서는 모델의 추론 과정이 삭제되거나 기록이 단순 절단(truncation)되어 성능이 저하되지만, 제공업체별 하네스(adopter harness)는 추론 상태를 보존하고 기록을 요약(compaction)하여 성능을 높입니다.

전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.

로그인 / 회원가입