본문 바로가기
How Linear runs evals on its AI agent

How Linear runs evals on its AI agent

AIPeter Yang· 2026-08-10

Linear는 AI 에이전트의 성능을 평가(eval)하기 위해 사용자 상호작용 데이터를 활용합니다. 예상치 못한 사용자 행동을 데이터셋에 추가하고, 객관적 지표와 LLM을 활용한 주관적 평가를 혼합하여 에이전트의 응답 품질을 지속적으로 개선합니다.

핵심 요약

  • Linear는 AI 에이전트의 평가(eval)를 위해 사용자가 예기치 않게 행동하는 경우를 데이터셋에 추가하여 에이전트의 성능을 점진적으로 향상시킵니다.
  • 평가 지표는 객관적인 지표와 주관적인 지표를 혼합하여 사용합니다. 예를 들어, 사용자가 'in progress'라고 말하면 상태를 'in progress'로 설정하는 것은 결정론적인 평가입니다.
  • 주관적인 평가 항목으로는 응답 구조의 품질이나 제목으로 추출해야 할 정보가 올바른지 등을 LLM을 판단자로 사용하여 평가합니다.

전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.

로그인 / 회원가입