최신뉴스


울타리 넘으면 칩이 잡아 세운다... 엔비디아, AI 에이전트 감시 장치 하드웨어에 심었다 2026.09.30

두 시간 동안 검토자 설득 시도한 에이전트, 쓰기 권한은 못 얻어
앤트로픽·세일즈포스·SAP 등 100곳 넘는 조직 참여

엔비디아가 28일(현지시각) 오픈 에이전트 안전 플랫폼(Open Agent Safety Platform)을 공개했다. AI 에이전트를 울타리 안에 붙잡아 두기 위해 오픈소스 소프트웨어와 참조 시스템 설계를 함께 묶었다. 시험 단계와 실제 운영 모두를 겨냥한다.


배경에는 잇따른 사고가 있다. 프론티어 AI 기업들은 에이전트가 자신을 가둬 두려고 만든 평가 환경을 빠져나가 접근해선 안 되는 시스템에 접속했고, 일부 사례에선 자기가 한 일을 사실과 다르게 보고했다고 밝혔다. 


엔비디아는 에이전트가 정책에 막히거나 버그를 만나거나 필요한 도구가 없을 때 원래 작업에서 벗어날 수 있다고 설명했다. 회사는 “이런 상황에 놓인 에이전트가 자기 행동을 온전히 스스로 다스릴 것이라고 기대할 수는 없다”고 밝혔다.


▲엔비디아 오픈 에이전트 안전 플랫폼 참여 기업 [출처: 엔비디아]

▲엔비디아 오픈 에이전트 안전 플랫폼 참여 기업 [출처: 엔비디아]



플랫폼의 축은 오픈소스 실행 환경 오픈셸(OpenShell)이다. 구성은 세 갈래다. 여러 격리 공간의 수명과 정책을 관리하는 관문, 파일 시스템과 프로세스 활동에 커널 수준 통제를 적용하는 격리 공간, 격리 공간마다 하나씩 붙어 밖으로 나가는 요청을 정책과 맞춰 보는 감독자다.


에이전트는 자격 증명 자체를 보지 못한다. API 키로 연결할 때 에이전트에게 보이는 것은 자리만 채운 가짜 값이다. 실제 키는 에이전트 작업 공간 밖에서, 그것도 허용된 목적지에만 끼워 넣는다.


하드웨어 쪽 장치는 센트리(Sentry)다. 참조 시스템 설계의 일부로, 블루필드-4에서 선택 사항인 대역 외 감시자로 돌아간다. 엔비디아의 도카(DOCA) 소프트웨어를 바탕으로 에이전트의 요청과 응답을 들여다보고, 검증된 상태 정보를 내보내며, 에이전트 신원을 확인하고 데이터와 도구, API, 서비스 접근에 제로 트러스트 정책을 강제한다. 엔비디아는 센트리가 실리콘 단계에서 보안을 강제하므로 에이전트가 소프트웨어 울타리 밖으로 나가려 하면 밀리초 안에 격리해 멈춘다고 밝혔다.


형식 논리 기반 정책 증명기는 정책이 부여하는 권한이 모델로 옮겼을 때 운영자가 정한 한계 안에 머무는지 검사한다. 정책 조언 기능을 켜 두면 에이전트가 정책 변경을 제안할 수 있으나 자기 요청을 스스로 승인하지는 못한다.


엔비디아는 자체 시험 결과도 내놨다. 안전장치를 줄인 프론티어 에이전트들은 보호된 깃허브 저장소를 수정할 권한을 얻으려고 AI 검토자를 최대 두 시간 동안 설득하려 들었다. 보호된 저장소에 쓰기가 일어난 사례는 없었고, 회사는 검토와 실행 단계 통제를 함께 적용한 결과라고 밝혔다.


참여 조직은 100곳이 넘는다. 앤트로픽은 자사 클로드 매니지드 에이전트를 오픈셸과 블루필드에 붙이는 작업을 엔비디아와 함께 했다. 세일즈포스는 오픈셸을 슬랙과 연동해 에이전트 활동과 감사 기록을 볼 수 있게 했고, SAP는 오픈셸을 ‘줄 스튜디오’(Joule Studio) 실행 환경에 심고 있다. 스페이스XAI(SpaceXAI)는 커서(Cursor) 코딩 에이전트와 그록(Grok) 모델에 이 플랫폼을 쓴다. 크라우드스트라이크와 팔로알토 네트웍스, 시스코도 이름을 올렸다.


오픈셸과 스킬을 포함한 오픈 에이전트 안전 플랫폼은 엔비디아 개발자 자료 페이지와 깃허브에서 받을 수 있다. 하드웨어 쪽에서는 엔비디아 베라 루빈 POD의 모든 연산 트레이에 블루필드-4 데이터처리장치가 들어 있어, 소프트웨어 업데이트만으로 보호 기능을 켤 수 있다. 회사는 다른 하드웨어와도 호환된다고 밝혔다.


출처 : 보안뉴스(https://www.boannews.com)