2026년 QA 컨퍼런스 여섯 번째 발표, 당신의 에이전트는 믿을만한가요에 대한 발표 내용을 정리해 보겠습니다.
AI에게 원하는 답을 얻기 위한 하네스 엔지니어링과 이를 검증하는 이밸류에이션 엔지니어링 관련 발표해 주셨습니다.
공식적으로 정리하는 것이 아닌 개인적으로 정리할 겸 작성하는 포스팅이라서 주관적인 의견이 담겨있을 수 있습니다. 해당 포스팅은 컨퍼런스가 어떤 식으로 진행됐었는지 참고하는 용으로만 확인해 주세요
발표 내용의 일부분을 활용해서 포스팅이 가능하다는 사전 협의를 받았고, QA 컨퍼런스에 참여하시면 더 많은 자료를 보실 수 있으니, 내용을 참고하시어 다음 회차에 참여하고 많은 정보를 받아가시는 것을 추천드립니다!

유저스틴님의 당신의 에이전트는 믿을만한가요? 발표 내용을 정리해 보겠습니다.

Agent가 운영되기 위한 내용을 그림으로 표시해 주시고, LLM은 Brain에 해당하는 역할, Instructions은 역할 부여 및 지침으로 손과 발의 역할, Tools은 맨손으로 땅을 파는 것보다 삽을 가지고 땅을 판다면 더 잘되는 것처럼 도구에 해당하는 역할로 비유를 많이 해주시며 전체 관계성을 알기 쉽게 설명해 주셨습니다.
입력에서 이벤트나, 사용자 요청, 다른 Agent 요청 등으로 Agent가 실행되며, 사용할 수 있는 도구, 환경을 파악해서 원하는 출력으로 전달하는 과정들을 설명해 주시며 기본적인 Agent 작동 원리를 설명해 주셨습니다.

원하는 응답을 얻기 위해 스스로 생각할 수 있는 환경을 만들어주고, 내가 선택한 모델이 더 잘할 수 있도록 실행 규칙이나 작업 전반의 환경을 구성하는 하네스 엔지니어링에 대해 간략하게 설명해 주셨습니다.
이후 발표 내용에 대해 설명해 주시며 하네스 엔지니어링은 어떤 것을 해결해 주고, 잘 작동하기 위해 확인해야 할 것, 평가 지표를 토대로 개선하는 과정들에 대해 알려주셨습니다.

하네스 엔지니어링 방식은 원하는 응답을 위해 AI에게 요청하는 기준들을 프롬프트로 전달했다면 이런 기준들이 명확하게 지켜졌는지 결과물을 확인하는 과정이 필요하다는 것을 알려주셨습니다.
같은 하네스 환경이라도 모델이나 느슨하게 연결된 하네스 구조인 경우 AI가 자체적으로 판단한 생각이 섞여서 원하는 결과를 주지 않는 경우도 있으며, 너무 강한 구조의 하네스를 구성한 경우 AI는 할 수 없다는 의견을 줄 수 있기 때문에 Evaluation Engineering 방식으로 행동 결과를 측정해서 하네스 구조를 수립하는 것이 필요하다고 설명해 주셨습니다.

이밸류에이션 엔지니어링이 운영되는 방식은 Agent를 선택하고 평가 한 뒤 최적화 후 운영을 통해 결과를 확인하며 운영 결과에 따라 모델을 변경할 것인지 하네스 구조를 변경할 것인지 파악하고 다시 평가하는 사이클 구조를 가지고 있다고 설명해 주셨습니다.
이 과정 중 최적화가 가장 중요하며, 모델이나 하네스, 평가를 위한 데이터셋 변경으로 최적화를 진행하며 실무에서는 모델은 정해두고 하네스를 지속적으로 개선하며 좋은 결과를 얻는 방식으로 진행한다고 설명해 주셨습니다.

평가를 위한 이밸류에이션 엔지니어링의 기본 구조는 정상, 경계, 정책 우회 등 여러 기준으로 질문할 Dataset과, 평가 대상 모델과 평가를 수행할 모델이 분리되어 있으며, 신뢰할 수 있는 결과를 전달해 주는지 검토하는 기준인 Evaluator, 평가 관점으로 산정된 점수와 판정된 이유를 전달해 주는 방식으로 구조가 잡혀있다는 것을 알려주셨습니다.

평가 관점은 지침과 제약을 지켰는지, 주어진 대로 명령을 잘 수행했는지, 사용자의 의도를 파악하고 의도대로 해결했는지, 질문과 관련이 있는지, 논리적인지 5가지로 구분해서 평가하며 특정 평가가 낮다고 해서 실패한 결과는 아닐 수 있기에 결과지를 확인하여 여러 관점에서 바라봐야 한다는 것을 알려주셨습니다.

평가 기준으로 도출된 평가 결과를 사람이 확인하여 실패 원인과 결과를 분석한 뒤 하네스를 개선하는 방식으로 질문에 대한 응답의 품질이 좋아질 수 있도록 작업한다는 것을 설명하셨습니다.

예를 들어 초기 응답 결과에는 명확한 결과만 전달받을 수 있다면, 평가를 기반으로 하네스를 개선하여 질문에 답변 수준을 끌어올려서 질문의 결과와 대안까지 포함된 응답을 얻을 수 있다는 예시도 보여주셨습니다.

요청에 동일한 거절이지만, 처리 기준은 유지하되, 응답의 품질을 향상해 사용자에게 도움 되는 정보를 함께 제공하는 방식으로 개선하여 사내에 적합한 Agent를 만드는 것을 권장한다는 것을 알려주시며 이번 발표가 마무리되었습니다.
AI를 많이 활용하게 되면서 ~~ 엔지니어링처럼 여러 방법론이 알려지고 이렇게 써야 한다는 유튜브 영상들이 많았는데, 이번 발표에서는 실제로 써보고 개선하는 과정들을 이해하기 쉬운 사례로 접목시켜 주시고, 발표에 활용된 HR 관련 하네스를 평가할 수 있는 이밸류에이션 엔지니어링 데모 자료도 공유해 주셔서 어떤 구조로 구성되어 있는지 확인해 볼 수 있었습니다.
이전에도 원하는 응답을 잘 이끌어내기 위해 하네스 구조가 필요하다는 것은 알고 있었지만, 하네스 자체도 평가하여 품질이 높은 응답을 얻도록 하는 과정도 필요하다는 것을 알게 되었습니다.
어려울 수 있는 주제였는데 최대한 쉽게 풀어서 설명해 주시는 것 같아서 듣기 편했고, 기술적인 설명도 배울 수 있었지만 발표하는 방식도 배울 수 있었던 시간이었습니다. 이번 포스팅은 여기서 마무리하겠습니다 🫡
'IT Conference > QA Conference (2026, 5th)' 카테고리의 다른 글
| 8. 테스트 경제학 - 테스트 용이성이 비용을 결정한다 (0) | 2026.09.08 |
|---|---|
| 7. 커머스 iOS 자동화 입문기 - 복잡함이 성장이 되기까지 (0) | 2026.09.07 |
| 5. AI를 활용해 QA가 더 잘할 수 있는 것에 집중하기 (0) | 2026.09.07 |
| 4. 자율주행 개발 프로세스와 AI 품질 확보의 현실적 과제 (0) | 2026.09.07 |
| 3. 전문 리테일IT사의 반박자 늦은 AI플랫폼, 품질이 써먹기까지 (0) | 2026.09.06 |