B Builder로그
Builderlog ·필드 테스트·운영 시스템·구매 판단·플레이북 ·빌더로그 필드 매뉴얼 52 ·2026.08.16 ·5 분 읽기

AI 에이전트 구매 전, 먼저 기록할 여섯 가지

#AI에이전트평가#에이전트구매#사람승인#실패복구#AI체크리스트

2026-08-16에 검토한 공식 자료만으로는 에이전트 평가가 실제 운영 성과를 보장한다고 말할 수 없었습니다. 그래서 저는 데모의 인상보다 입력·출력·근거·사람 승인·실패 복구·중단 조건을 같은 표에 기록하는 쪽으로 판단 기준을 바꾸게 됐어요.

먼저 내린 결론

에이전트를 처음 비교할 때 필요한 것은 복잡한 점수판보다 행동 경계를 드러내는 평가표였습니다. 무엇을 받았고, 무엇을 만들었으며, 그 결과를 왜 믿을 수 있는지가 한눈에 보여야 했어요. 잘못됐을 때 사람이 어디서 멈추고 되돌릴지도 함께 보여야 했고요.

세 줄로 줄이면 이렇습니다.

  • 통과한 데모보다 입력과 근거의 추적 가능성이 먼저였습니다.
  • 사람 승인은 버튼 하나가 아니라 승인 전후의 행동 경계였습니다.
  • 복구 방법과 중단 조건이 비어 있다면 구매 판단도 보류 상태였습니다.

좋은 데모는 성공 장면을 보여주지만, 좋은 평가표는 실패했을 때의 운영을 보여줍니다.

제가 한 표에 모은 여섯 칸

아래 카드는 빌더로그의 교육용 구조입니다. 특정 기관이나 제품의 공식 템플릿은 아닙니다.

평가 항목기록할 내용구매 판단에서 보는 지점
입력데이터의 출처, 형식, 민감도허용되지 않은 정보가 섞이지 않는가
출력기대 형식과 실제 결과사람이 검토할 수 있는 형태인가
근거출처, 계산 과정, 확인 가능한 연결결과를 다시 확인할 수 있는가
사람 승인승인자와 승인 전후의 행동승인 없이 외부 변화가 일어나지 않는가
실패 복구오류 감지, 되돌림, 재시도 범위실패가 조용히 누적되지 않는가
중단 조건즉시 멈출 사건과 보류 기준애매한 상태에서 계속 움직이지 않는가

평가 기준과 데이터 구성을 함께 두는 방식은 공식 평가 자료의 설명과 맞닿아 있습니다. 해당 자료는 평가 실행과 상태를 다루고, 모델이나 매개변수에 따른 실행을 비교할 수 있다고 설명합니다. 다만 그것이 실제 운영 결과를 예측한다고 약속하지는 않습니다.
출처: OpenAI Evals API reference, 2026-08-16 검토.

첫 시험은 아무것도 바꾸지 않는 일

첫 예시는 가상의 ‘편의점 행사 앱’으로 잡았습니다. 승인된 비민감 상품 목록을 입력하고, 행사 후보를 정리한 초안을 출력하는 상황입니다. 이 단계에서는 메시지 전송, 결제, 게시, 삭제, 권한 변경이 일어나지 않습니다.

평가표에는 입력 목록의 출처와 허용 범위, 출력 표의 필수 열, 각 후보의 근거 위치가 들어갑니다. 사람이 초안을 확인하기 전에는 외부 동작이 없어야 합니다. 잘못된 상품명이 나오면 해당 결과를 보류하고 원본 목록으로 돌아갈 수 있어야 해요. 근거가 없거나 승인 경계가 흐려지면 실행을 중단하는 식입니다.

[이미지 캡션: 가상의 상품 목록이 평가표의 입력·출력·근거 칸으로 연결되고, 사람 승인 전에는 외부 행동이 차단된 비교 도식]

첫 평가는 에이전트가 얼마나 많은 일을 하는지가 아니라, 어디까지 하지 않는지를 확인하는 일이었습니다.

검증 과정에서 빠지기 쉬운 것

NIST AI RMF Core는 위험 작업을 Govern, Map, Measure, Manage로 구성하고, 배포 전과 운영 중의 시험·평가를 문서화할 필요가 있다고 설명합니다. 측정에는 지표, 불확실성, 벤치마크, 보고, 문서화, 독립적 검토가 포함됩니다.
출처: NIST AI RMF Core, 2026-08-16 검토.

또한 NIST AI Metrology Center는 사용 사례에 맞는 측정 접근과 도구 선택을 강조합니다. 저는 여기서 “평가표가 존재한다”와 “그 평가가 이 업무에 맞는다”를 분리해 보게 됐어요.
출처: NIST AI Metrology Center, 2026-08-16 검토.

검색 관심도 역시 같은 경계가 필요했습니다. 2026-08-16 수집에서 정확한 질의인 ‘AI agent evaluation framework’에 여섯 개의 자동완성 제안이 관찰됐습니다. 이는 관심의 흔적일 뿐 검색량, 순위, 구매 의도, 트래픽, 전환, 매출의 증거는 아닙니다.

통과표가 안전 증명서가 되지는 않았다

작은 시험 묶음은 드문 실패를 놓칠 수 있고, 모든 운영 맥락을 대표하지 못합니다. 사람 검토와 중단 규칙도 통제되지 않은 행동을 줄이는 장치일 뿐, 그 자체로 안전을 보장하지는 않아요.

가상의 시험이 통과하더라도 운영 안전성, 정확성, 신뢰성, 규정 준수, 비용 절감, 매출을 증명한 것은 아닙니다. 모델명, 기능, 가격도 바뀔 수 있으므로 실제 구매나 배포 시점에는 연결된 공식 문서의 현재 내용을 다시 확인할 필요가 있습니다.

평가의 실패는 오답만이 아니라, 무엇을 근거로 멈춰야 하는지 설명하지 못하는 상태였습니다.

제가 남긴 중단 체크리스트

아래 항목 가운데 하나라도 확인되지 않으면 제 판단은 ‘통과’가 아니라 ‘보류’입니다.

  • 입력 출처와 사용 허용 범위의 확인
  • 출력 형식과 사람이 읽을 수 있는 검토 흔적
  • 결과를 다시 확인할 근거
  • 외부 행동 이전의 사람 승인
  • 오류 감지와 되돌림 경로
  • 근거 누락, 승인 우회, 복구 불가 시 중단
  • 민감 정보와 권한 변경의 시험 범위 제외
  • 실제 배포 전 공식 문서의 재확인

이 체크리스트의 일차 산출물은 점수가 아니라 빈칸이 드러난 평가표입니다. 빈칸이 남아 있으면 더 멋진 데모를 보는 대신 구매 판단을 멈추는 편이 제게는 더 정직했습니다.

최종 판단은 간단합니다. 여섯 칸을 같은 표에서 설명할 수 없는 에이전트라면, 기능 비교나 가격 비교로 넘어갈 근거도 아직 부족합니다.

이번 판단의 한 가지 행동: 첫 후보 에이전트의 데모를 위 평가표 한 장으로 다시 기록해 보는 것입니다.

이어지는 기록

한 줄로 정리하면

에이전트 구매 판단은 성공한 출력보다 근거·승인·복구·중단이 연결된 기록에서 시작됐습니다.

다음 편에서는 사람 승인이 형식적인 확인으로 무너지는 지점을 운영 기록으로 구분해봅니다.