AI 에이전트는 답변만 만드는 모델과 다릅니다. 로그인된 브라우저를 열고, 버튼을 누르고, 파일을 내려받고, 외부 서비스에 정보를 보낼 수 있습니다. 그래서 ‘한 번 성공한 데모’는 도입 근거가 되기 어렵습니다. 이 글은 제품 홍보 문구 대신 OpenAI·Anthropic의 공개 자료와 OWASP·NIST의 위험관리 문서를 함께 읽어, 실제 도입 전에 확인할 기준을 정리합니다.
챗봇과 에이전트의 차이는 ‘행동 권한’이다
일반적인 챗봇은 사용자가 다음 행동을 결정하도록 정보를 제공합니다. 반면 컴퓨터 사용형 에이전트는 화면을 읽고 마우스와 키보드를 조작해 행동까지 이어갑니다. OpenAI의 Operator와 Anthropic의 computer use 공개 자료도 이 지점을 제품의 핵심으로 설명합니다.
행동 권한이 생기면 평가 기준도 바뀝니다. 답변이 조금 부정확한 것과 잘못된 수신인에게 메일을 보내거나 주문 수량을 틀리는 것은 피해의 크기가 다릅니다. 따라서 ‘몇 퍼센트 성공했는가’만으로는 충분하지 않습니다.
첫 번째 기준: 권한을 얼마나 작게 줄일 수 있는가
테스트 계정과 실제 운영 계정을 분리하고, 처음에는 읽기 전용 권한으로 시작하는 편이 안전합니다. 에이전트가 꼭 필요한 폴더와 서비스에만 접근하도록 범위를 제한해야 합니다.
OWASP의 에이전트 보안 자료는 목표 탈취, 도구 오용, 과도한 권한처럼 자율 시스템에서 커지는 위험을 별도로 다룹니다. 프롬프트를 잘 쓰는 것보다 권한 구조를 먼저 설계해야 하는 이유입니다.
- 결제, 삭제, 게시, 외부 전송은 실행 직전에 사람의 확인을 받는다.
- 공용 관리자 계정 대신 작업별 전용 계정을 사용한다.
- 파일·메일·고객정보 접근 범위를 업무에 필요한 최소 수준으로 제한한다.
두 번째 기준: 실패를 발견하고 되돌릴 수 있는가
에이전트가 중간 단계에서 틀렸을 때 조용히 다음 단계로 넘어가면 결과만 보고 원인을 찾기 어렵습니다. 각 행동의 입력과 출력, 사용한 도구, 사람이 승인한 시점을 기록해야 합니다.
좋은 테스트는 성공한 장면을 모으는 것이 아니라 실패 모드를 찾습니다. 로그인 만료, 팝업 등장, 같은 이름의 파일, 가격 변경, 네트워크 지연을 일부러 넣고 에이전트가 멈추는지 확인해야 합니다.
세 번째 기준: 실제 업무에서 시간을 줄이는가
데모는 대개 짧고 경로가 정해진 작업을 보여줍니다. 실제 업무에는 예외 처리와 검토 시간이 붙습니다. 자동화 시간뿐 아니라 결과 확인, 오류 수정, 계정 관리까지 합친 전체 시간을 측정해야 합니다.
같은 작업을 사람이 수행한 경우, 기존 자동화 도구를 쓴 경우, 에이전트를 쓴 경우로 나눠 비교하면 도입 효과를 과장하지 않을 수 있습니다.
네 번째 기준: 한 번의 성공에 얼마가 드는가
에이전트 비용은 모델 호출료만이 아닙니다. 브라우저 실행 시간, 실패 후 재시도, 사람이 검토하는 시간, 보안과 감사에 필요한 운영비가 함께 들어갑니다.
월 사용료보다 ‘검토까지 끝난 성공 작업 한 건의 비용’을 계산해야 서로 다른 제품과 기존 업무 방식을 공정하게 비교할 수 있습니다.
작게 시작하는 도입 순서
첫 대상은 반복적이지만 되돌릴 수 있고, 민감정보가 적으며, 성공 조건을 명확히 정의할 수 있는 작업이 적합합니다. 예를 들면 공개 웹페이지의 변경사항을 수집해 초안을 만드는 일입니다.
반대로 채용, 신용, 의료, 대규모 결제처럼 한 번의 오류가 사람에게 큰 영향을 주는 업무는 별도의 법률·보안 검토 없이 시작하면 안 됩니다.
- 10~20개의 실제 작업으로 고정 평가 세트를 만든다.
- 성공률, 수정 시간, 중단 횟수, 건당 비용을 함께 기록한다.
- 사람 승인 없이 실행할 수 있는 행동은 검증 결과에 따라 단계적으로 넓힌다.
Primary sources
확인한 원문
모든 링크 확인일: 2026년 7월 29일
-
OpenAI
Introducing Operator브라우저를 이용해 작업을 수행하는 에이전트의 기능과 안전장치 설명
-
Anthropic
Computer use 공개 자료화면을 보고 컴퓨터를 조작하는 기능의 공개 범위와 한계
-
OWASP GenAI Security Project
Agentic AI – Threats and Mitigations에이전트형 AI의 위협 모델과 완화 방법
-
NIST
AI Risk Management FrameworkAI 시스템 위험을 식별·측정·관리하기 위한 자발적 프레임워크
