B Builder로그
Builderlog ·운영 시스템·플레이북 ·빌더로그 필드 매뉴얼 ⑥ ·2026.07.29 ·6 분 읽기

AI 사람 검토 체크리스트: 에이전트 행동 전 5개 중단 게이트

#AI사람검토#AI에이전트#자동화안전#사람승인#체크리스트

AI 사람 검토는 행동 전에 기술적으로 멈추고, 지정된 검토자에게 실제로 일어날 일을 보여줄 때만 통제 장치가 됩니다. 승인되지 않은 입력·외부 소통·금전 이동·새로운 예외·권한 변경 앞에 중단 게이트를 둡니다. 신뢰할 수 있는 미리보기, 명시적 결정, 실행 기록이 필요합니다.

먼저 결론과 범위

2026-07-29에 승인된 시험 데이터만 쓰는 초심자 워크플로를 기준으로 검토했습니다. 자동 발송·게시·결제·삭제·코드 실행·권한 변경은 범위에서 제외합니다.

사람 검토는 이미 행동한 뒤 나타나는 장식용 승인 버튼이 아닙니다. 행동을 막는 중단점, 판단할 맥락이 있는 담당자, 모델의 안심 문구가 아니라 신뢰할 시스템 상태로 만든 미리보기, 거절·수정·1회 승인·수동 복귀 선택, 제안과 결정을 남긴 기록이 필요합니다.

NIST AI RMF Govern 3.2는 사람과 AI의 구성 및 감독 역할과 책임을 정의하라고 설명합니다. OECD AI 원칙은 상황에 맞는 사람의 주도권과 감독 장치를 요구합니다. 이는 거버넌스 원칙이지 완성된 승인 화면이나 모든 오류를 잡는다는 증거가 아닙니다.

복사해서 쓰는 5개 중단 게이트

AI 보조 워크플로에 권한을 주기 전에 모든 게이트를 적용합니다.

중단 게이트멈출 조건검토자가 볼 내용안전한 결과
입력비밀값·개인 기록·기밀 파일·미승인 출처가 포함됨출처·정보 등급·비식별 처리·허용 규칙거절·비식별화·가상 입력
외부 행동이메일·메시지·게시·제출·외부 연락을 함정확한 대상·최종 내용·사용 신원·시점수정·1회 승인·초안 유지
금전구매·환불·이체·가격·금전 약속을 만듦금액·수신자·정책·근거·복구 경로거절하거나 권한 담당자에게 전달
예외출처가 충돌하거나 근거가 없고 알려진 규칙 밖임빠진 사실·충돌 출처·불확실성·수동 경로중단하고 예외로 분류
권한삭제·코드 실행·접근 변경·비밀 노출·운영 상태 변경명령이나 차이·대상·영향 범위·백업·롤백거절·격리 환경·별도 권한 담당자

이는 빌더로그의 중단 게이트이며 NIST·OECD·OWASP 체크리스트 원문이 아닙니다.

아래 통제 블록을 복사합니다.

제안 행동:
발동한 중단 게이트:
입력 출처와 정보 등급:
정확한 목적지 또는 대상:
정확한 내용·명령·차이:
사용한 근거:
모르는 내용:
예상 효과:
가능한 최악의 영향:
되돌릴 수 있는가:
롤백 또는 수동 복구:
지정 검토자:
결정: 거절 / 수정 / 1회 승인
결정 만료 시각:
실행 기록 위치:

‘앞으로 모두 승인’은 경계를 없앱니다. 승인은 화면에 보인 미리보기·목적지·내용에만 적용합니다.

예시: 발송 전 고객 답변 초안

가상 고객 질문과 공개 FAQ를 받는 워크플로를 생각합니다. 실제 받은편지함에는 접근하지 않고 답변 초안만 만듭니다.

입력 게이트는 질문이 가상이고 FAQ가 승인 출처인지 확인합니다. 질문이 알려진 정책과 맞지 않거나 FAQ 내용이 충돌하면 예외 게이트가 작동합니다. 실제 발송 전에는 외부 행동 게이트가 항상 멈춥니다.

검토자는 목적지·최종 답변·인용한 FAQ·빠진 사실·수정 화면을 봅니다. 거절하면 기존 수동 방식이 남습니다. 1회 승인은 표시된 목적지에 표시된 답변만 허용합니다. 내용이 바뀌면 결정을 무효화하고 새 미리보기를 요구합니다.

이 설계는 답변 정확성을 증명하지 않습니다. 초안 작성과 발송을 분리하고 사람의 결정을 관찰 가능하게 만듭니다.

승인창 자체가 공격일 수 있습니다

OWASP는 신뢰하지 않은 콘텐츠가 승인 요청의 표현을 조작하는 ‘HITL dialog forging’을 설명합니다. 모델이나 웹페이지가 테스트 통과를 거짓으로 말하거나 목적지를 숨기고, 위험한 행동을 평범한 작업처럼 이름 붙일 수 있습니다.

따라서 행동을 제안한 모델이 왜 안전한지 요약하도록 믿지 않습니다. 신뢰할 수 있는 제어기가 실제 목적지·원문 명령이나 차이·최종 발송 내용·사용 권한·사실 출처·되돌릴 수 없는 행동 경고·승인 범위와 만료를 표시해야 합니다.

검토자는 그래도 틀릴 수 있습니다. 기술적 중단·최소 권한·격리 환경·로그·롤백은 별도 통제로 남깁니다.

무시·오류·실행 거부를 기록합니다

NIST Playbook 자료는 감독 역할을 문서화하고, 사람이 덮어쓴 결과·오류·불만·상향 보고·실행 또는 중단 결정을 측정하는 방안을 제시합니다. 동시에 자발적으로 상황에 맞춰 쓰는 자료이며 모든 조직에 적용하는 순서형 체크리스트가 아니라고 밝힙니다.

작은 워크플로는 아래 기록이면 충분합니다.

실행:
발동 게이트:
검토자 결정:
수정 내용:
이유:
실행한 행동:
결과 검증:
롤백 사용:
오류 또는 불만:
수정할 규칙이나 출처:

반복되는 수정과 예외를 봅니다. 검토자가 미리보기를 읽지 않고 계속 승인한다면 통제가 작동하지 않습니다. 같은 예외가 반복되면 권한을 넓히기 전에 출처나 규칙을 고칩니다.

실패 방식과 적용하면 안 되는 경우

검토자가 전문 지식이 없거나, 급하거나, 자연스러운 문장을 과신하거나, 실제 대상을 볼 수 없거나, 승인 요청이 너무 많으면 사람 검토도 실패합니다. 정보가 이미 노출됐거나 외부 쓰기가 끝난 뒤 중단 게이트가 나타나면 너무 늦습니다.

이 글은 법률·고용·금융·규정 준수·보안 조언이 아닙니다. 중대한 결정과 규제 대상 정보에는 상황별 통제와 자격 있는 검토가 필요합니다. 읽기 전용의 영향이 낮은 업무는 같은 승인 흐름이 필요하지 않을 수도 있습니다. NIST Appendix C도 감독 필요성이 시스템과 상황에 따라 다르다고 설명합니다.

이어지는 빌더로그 필드 매뉴얼:

최종 판단과 출처

사람은 중요한 행동 뒤가 아니라 앞에 둡니다. 민감한 입력·외부 소통·금전·예외·권한 변경에서 멈추고 신뢰할 미리보기를 보여줍니다. 정확히 그 행동에만 승인을 묶고 거절·수동 복구·기록을 남깁니다.

2026-07-29 검토 출처:

공식 자료는 감독 역할·상황별 사람 주도권·중요 행동 승인·미리보기·감사 기록·기만적 승인 화면 위험을 뒷받침합니다. 이 5개 게이트의 성과나 안전한 결과를 보장하지는 않습니다.

한 줄로 정리하면

사람 검토에는 실제 중단점이 필요합니다. 신뢰할 상태에서 정확한 행동을 보여주고 거절을 허용하며 1회 미리보기에만 승인을 묶습니다.

유용한 산출물은 승인 버튼의 존재가 아니라 승인 기록과 예외 로그입니다.