AI 에이전트의 가드레일과 거버넌스: 정의와 작동 메커니즘

AI 에이전트의 가드레일과 거버넌스는 에이전트가 할 수 있는 일을 규정하는 모든 규칙, 권한, 통제를 아우르며, 에이전트가 실제로 무엇을 했는지 검증할 수 있게 해줍니다.

Atako 에이전트가 작성 · 검토·승인자 Romain Laodicina · Atako CTO

간단한 정의

가드레일과 거버넌스는 AI 에이전트가 행동을 실행하기 전, 실행하는 동안, 실행한 뒤에 무엇을 할 수 있는지를 규정하는 모든 규칙, 권한, 통제를 말합니다. 행동별 권한, 민감한 판단에 대한 사람의 검증, 실제로 벌어진 일에 대한 감사, 언제든 접근을 차단할 수 있는 능력을 포함합니다.

AI 에이전트에게 자기 도구로 혼자 행동할 힘을 준다는 것은 곧바로 신뢰의 문제를 불러옵니다. 무엇을 할 권한이 있는지 누가 결정하며, 그 한계를 넘지 않았는지 사후에 어떻게 확인할 것인가. 가드레일과 거버넌스는 이 질문에 함께 답합니다. 하나는 각 행동의 기술적 층위에서, 다른 하나는 시스템 전체의 조직적 층위에서 말입니다.

상세 정의

가드레일은 AI 에이전트가 할 수 있는 일을 제한하는 구체적인 메커니즘입니다. 행동별 정밀한 권한, 제한된 접근 범위, 쿼터, 민감한 판단에 대한 사람의 검증 지점이 여기에 해당합니다. 거버넌스는 이런 가드레일이 설계되고 결정되고 감사되는 더 넓은 틀입니다. 누가 이를 설정할 권한이 있는지, 위험을 어떻게 문서화하는지, 시스템이 예상대로 작동했는지 사후에 어떻게 검증하는지를 다룹니다.

오늘날 AI 거버넌스 논의를 이끄는 두 개의 기준이 있으며, 서로 다른 접근 방식을 취합니다. 2023년 1월 미국에서 발표된 NIST의 AI 위험 관리 프레임워크(AI RMF 1.0)는 네 가지 기능, 즉 거버넌스(문화와 책임을 정의하는 횡단적 기능), 매핑(특정 시스템의 위험을 파악), 측정(그 위험을 측정), 관리(위험을 다룸)를 중심으로 구성된 자율적 프레임워크입니다. 반면 유럽연합의 AI Act는 구속력 있는 규제입니다. 고위험으로 분류된 시스템에 대해 위험 관리 체계(제8조), 학습 데이터 거버넌스(제10조), 기술 문서화(제11조), 이벤트 자동 로깅(제12조), 사용자 대상 투명성, 실질적인 사람의 감독(제13조, 제14조)을 의무화합니다. 고위험 시스템에 대한 주요 의무는 부속서 III에 해당하는 시스템은 2027년 12월부터, 부속서 I에 해당하는 시스템은 2028년 8월부터 적용됩니다.

성격이 다른 이 두 프레임워크(자율 대 구속력)의 공통점은, 관할권이 무엇이든 진지한 AI 거버넌스를 구성하는 타협 불가능한 요소로서 추적 가능성(무슨 일이 일어났는지 기록하는 것)과 사람의 감독을 강조한다는 점입니다.

작동 원리

효과적인 가드레일 시스템은 가장 넓은 층위부터 가장 정밀한 층위까지 여러 단계에서 작동합니다. 가장 넓은 층위에서는 어떤 도구를 시스템에 연결할지, 어떤 종류의 행동을 애초에 고려할지를 결정합니다. 중간 층위에서는 사람이든 에이전트든 누가 어떤 도구를 어떤 범위(읽기 전용, 또는 읽기와 쓰기)로 사용할 권한이 있는지 정의합니다. 가장 정밀한 층위에서는 개별 행동 하나하나가 요청되는 순간 검증됩니다. 권한이 존재하는지, 그 권한이 정확히 이 행동을 포함하는지, 인자가 유효한지를 확인합니다.

이런 가드레일을 구축하는 데 가장 견고한 원칙은 디폴트 거부(deny-by-default)입니다. 명시적인 권한이 부여되기 전까지는 아무것도 허용되지 않으며, 넓은 접근 권한을 먼저 주고 사안별로 제한하는 방식을 따르지 않습니다. 도입하기는 더 번거롭지만, 보안에서 가장 흔한 실수, 즉 허가를 빠뜨리는 것이 아니라 제한을 빠뜨리는 실수를 막아줍니다.

거버넌스는 여기에 책임과 검증 가능성이라는 층위를 더합니다. 누가 언제 이 가드레일을 설정했는지, 문제가 생겼을 때 감사를 통해 실제로 무슨 일이 있었는지 재구성할 수 있는지를 다룹니다.

아타코의 실제 사례

아타코의 권한 모델은 정확히 이 디폴트 거부 원칙 위에 서 있습니다. 기업 단위로 도구(Slack, GitHub, HubSpot, 그 밖의 인테그레이션)를 연결해도, 명시적인 '그랜트'가 만들어지기 전까지는 어떤 에이전트도 접근할 수 없습니다. 그랜트는 특정 에이전트를 특정 연결과 연결하며, 허용된 행동의 정확한 목록(GitHub 전체에 대한 일반적인 접근이 아니라 예를 들어 list_issuescreate_issue만), 범위(읽기 전용 또는 읽기-쓰기), 선택적인 만료 기한을 지정합니다. 실수로 쓰기 행동이 읽기 전용 그랜트의 목록에 추가되더라도, 범위가 그 실행을 여전히 차단합니다. 이중 통제인 셈입니다.

아타코가 문서화한 판단 경로는 다음과 같습니다. 에이전트가 행동 실행 의사를 표현하면, 플랫폼은 그랜트가 존재하는지, 행동이 허용 목록에 있는지, 범위가 충분한지, 인자가 유효한지를 확인한 뒤에야 비로소 외부 공급업체에 실제 호출을 실행하고 결과를 에이전트에게 돌려줍니다. 접근 비밀 정보 자체는 절대 전달되지 않습니다. 어느 단계든 실패하면 거부가 발생하고 이는 기록되며, 이 기록은 곧바로 에이전트 관찰 가능성에 반영됩니다.

접근 철회 측면에서는, 접근을 차단하는 것이 즉각적이고 최종적입니다. 연결을 철회하면 암호화된 비밀 정보가 그 자리에서, 유예 기간 없이 삭제되며, 그에 의존하던 모든 에이전트는 즉시 접근 권한을 잃습니다. 의심스러운 상황에서 빠르게 대응하도록 설계된 최후의 가드레일입니다.

흔한 오해

흔한 오해 중 하나는 도구에 대한 접근을 부여하는 것이 그 도구에 대한 완전한 접근을 부여하는 것과 같다고 믿는 것입니다. 좋은 거버넌스 시스템은 서비스에 대한 접근(연결)과 그 위에서 행동할 권한(정확한 행동과 범위를 지정한 그랜트)을 항상 구분합니다.

두 번째 오해는 AI 거버넌스가 실질적인 효과 없는 규제 서류 작업에 불과하다고 생각하는 것입니다. NIST 같은 자율적 프레임워크를 따르든 유럽의 AI Act 같은 구속력 있는 법률을 따르든, 같은 구체적 요구사항이 반복해서 등장합니다. 위험을 문서화하고, 행동을 기록하며, 민감한 판단에 사람을 개입시키는 것입니다. 이것은 형식이 아니라 운영 메커니즘입니다.

세 번째 오해는 기술적 가드레일과 사람의 검증을 혼동하는 것입니다. 권한과 쿼터는 매번 사람이 개입하지 않아도 자동으로 적용됩니다. 사람의 검증은 다른 종류의 가드레일로, 위험이 커서 일부러 절차를 늦춰 누군가 실행 전에 확인해야 하는 행동에만 적용됩니다.

마지막으로, 접근 가능한 감사 체계의 필요성을 과소평가하는 것도 흔한 실수입니다. 잘못된 행동을 제대로 막는 가드레일은 유용하지만, 허용되거나 거부되거나 실행된 내용을 조회할 수 있는 이력이 없다면, 고객이나 규제 당국이 언젠가 던질 질문, 즉 이 에이전트가 정확히 무엇을 했고 왜 그랬는지에 침착하게 답하는 것이 불가능해집니다.

관련 용어

자주 묻는 질문

AI 에이전트의 가드레일이란 무엇인가요?

가드레일은 AI 에이전트가 행동하기도 전에 무엇을 할 수 있는지를 제한하는 규칙이나 통제입니다. 특정 행동에 대한 정밀한 권한, 읽기 전용으로 제한된 범위, 쿼터, 또는 민감한 행동이 실행되기 전에 반드시 거쳐야 하는 사람의 검증 지점이 여기에 해당합니다.

가드레일과 AI 거버넌스는 어떻게 다른가요?

가드레일은 특정 행동을 제한하는 구체적이고 기술적인 메커니즘(권한, 쿼터, 검증)입니다. 거버넌스는 이런 가드레일이 어떻게 결정되고 적용되고 감사되는지를 정의하는, 정책과 역할과 책임을 포함한 더 넓은 틀입니다.

AI 거버넌스는 법적으로 의무인가요?

관할권과 시스템의 위험 수준에 따라 다릅니다. 유럽연합에서는 AI Act가 고위험으로 분류된 시스템에 위험 관리, 기술 문서화, 사람의 감독 의무를 부과하며, 2026년까지 단계적으로 시행됩니다. 미국의 NIST 프레임워크 같은 다른 체계는 자율적이지만, 규제 당국과 감사자들이 널리 참고 기준으로 사용합니다.

AI 에이전트에서 디폴트 거부(deny-by-default) 원칙은 무슨 뜻인가요?

명시적인 권한이 부여되기 전까지는 에이전트가 어떤 행동도 실행할 수 없다는 뜻입니다. 도구를 플랫폼에 연결하는 것만으로는 충분하지 않으며, 전체 접근 권한을 먼저 주고 나중에 제한하는 방식이 아니라, 특정 에이전트에게 행동별로 정확한 권한을 부여해야 합니다.

다음으로 읽을거리

출처

Romain Laodicina

Atako CTO

이 콘텐츠는 Atako의 AI 에이전트가 작성한 후, Atako CTO인 Romain Laodicina가 검토, 수정 및 승인했습니다.

첫 AI 에이전트를 배포하세요

무료로 계정을 만들고 코드 없이 몇 분 만에 에이전트를 실행하세요.

AI 트렌드에서 한 발 앞서세요.

제품 업데이트, 신규 에이전트, AI 분석 콘텐츠를 이메일로 바로 받아보세요. 스팸은 없으며 언제든 구독을 취소할 수 있습니다.