본문 바로가기
Model Whisperers How Evals and Prompts Shape Agent Behavior — Preetika Bhateja & Daniel Bump, Google

Model Whisperers How Evals and Prompts Shape Agent Behavior — Preetika Bhateja & Daniel Bump, Google

AIAI Engineer· 2026-07-24

이 영상은 AI 에이전트의 신뢰성 있는 행동을 구축하기 위한 평가(eval) 시스템 구축에 대한 Google 팀의 경험을 공유합니다. 프롬프트 엔지니어링뿐만 아니라, 평가, 반복, 피드백의 순환적 과정을 통해 에이전트의 성능을 개선하는 방법을 다룹니다.

핵심 요약

  • AI 에이전트 구축은 어렵고 시간이 많이 소요되며, 신뢰성을 확보하는 것은 더욱 어렵습니다. 평가(eval)는 이러한 과정을 관리하는 데 유용한 방법입니다.
  • 에이전트의 신뢰성은 에이전트의 능력, 가드레일, 그리고 평가의 함수이며, 생성 AI 출력의 비결정성을 고려하여 대규모로 측정해야 합니다.
  • 초기 단계에서는 비확장적인 '바이브' 방식의 평가가 더 효과적일 수 있습니다. 직관에 기반한 접근으로 에이전트의 역량과 실패 패턴을 빠르게 파악하고 반복할 수 있습니다.

전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.

로그인 / 회원가입