How Linear runs evals on its AI agent
Linear는 AI 에이전트의 성능을 평가(eval)하기 위해 사용자 상호작용 데이터를 활용합니다. 예상치 못한 사용자 행동을 데이터셋에 추가하고, 객관적 지표와 LLM을 활용한 주관적 평가를 혼합하여 에이전트의 응답 품질을 지속적으로 개선합니다.
핵심 요약
- Linear는 AI 에이전트의 평가(eval)를 위해 사용자가 예기치 않게 행동하는 경우를 데이터셋에 추가하여 에이전트의 성능을 점진적으로 향상시킵니다.
- 평가 지표는 객관적인 지표와 주관적인 지표를 혼합하여 사용합니다. 예를 들어, 사용자가 'in progress'라고 말하면 상태를 'in progress'로 설정하는 것은 결정론적인 평가입니다.
- 주관적인 평가 항목으로는 응답 구조의 품질이나 제목으로 추출해야 할 정보가 올바른지 등을 LLM을 판단자로 사용하여 평가합니다.
전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.
로그인 / 회원가입