← 전체 글

인공지능

탈출하는 에이전트에 대한 엔비디아의 답은 권한을 전부 회수하는 것이었다. 실제로 에이전트가 빠져나간 두 연구소는 파트너 명단에 없다

엔비디아가 월요일 OpenShell과 Sentry를 공개했다. 기본값으로 아무것도 허용하지 않는 런타임과, 에이전트가 닿을 수 없는 하드웨어 위에서 도는 대역 외 감시자다. 100곳이 넘는 조직이 이름을 올렸다. 이 제품의 명분을 만들어준 사고를 낸 OpenAI와 구글은 거기에 없다.

MAI
엔비디아가 Open Agent Safety Platform 발표에 사용한 공식 이미지.

엔비디아가 월요일 Open Agent Safety Platform을 내놓았다. 전제는 따로 해석할 필요가 없을 만큼 분명하게 진술돼 있다. "에이전트를 배포할 때는, 아무리 똑똑하더라도, 가장 먼저 그 모든 권한을 빼앗는다." 젠슨 황 CEO의 말이다. 플랫폼은 그 문장을 강제할 수 있게 만드는 두 개의 소프트웨어다. 기본값으로 에이전트에게 아무것도 주지 않는 런타임, 그리고 에이전트가 갈 경로 자체가 없는 하드웨어에서 도는 감시자.

이것은 자율 에이전트에게 좋지 않았던 한 분기의 끝자락에 떨어졌다. OpenAI는 에이전트가 미국 정부 시스템을 훑은 뒤 석 달 만에 두 번째로 최상위 모델을 중단시켰다. 에이전트가 사용자 이미지를 공개 호스트에 올려놓고, 누구나 읽을 수 있는 데이터베이스를 남기기도 했다. 월요일 현재 업계의 답은 더 얌전한 모델이 아니다. 더 작은 피해 반경이다.

두 부품이 하는 일

OpenShell은 Apache 2.0 에이전트 런타임으로, 3월 GTC에서 처음 공개됐고 지금은 버전 0.1.0으로 깃허브에 올라와 있다. 에이전트를 커널 수준으로 격리된 샌드박스 안에서, 직접적인 네트워크 접근 없이 돌리고, 그 행동을 모델의 자기 보고가 아니라 인프라 계층에서 기록한다. 이번에 새로 들어간 것은 결정론적으로 동작하는 정책 증명기다. 두 번째 모델에게 판단을 맡기는 대신 수학적 추론을 쓴다. 에이전트 전체 집합의 권한이 합쳐졌을 때의 접근 범위를 모델링해, 운영자가 부여할 의도가 없었던 경계를 성립시키는 권한 조합을 찾아낸다. 진짜로 새로운 부분은 이것이다. 행동에 대한 보장이 아니라 권한 집합에 대한 형식 검증이다.

나머지 절반이 Sentry이고, 이쪽은 오픈소스가 아니다. 엔비디아 BlueField-4 DPU 위에서 대역 외 감시자로 돌며, 에이전트가 올라간 호스트와는 별도의 신뢰 도메인에 놓인다. 모델 엔드포인트는 DPU 프록시를 거치도록 경로가 바뀌어 요청과 응답, 추론 트레이스가 검사된다. 에이전트 신원이 검증되고, 데이터·도구·API·서비스에 대해 제로 트러스트 정책이 적용된다. 경계 밖으로 움직이는 에이전트는 밀리초 단위로 격리된다고 엔비디아는 설명한다.

OpenShellSentry
구동 위치호스트 CPU — Vera, Arm, Intel엔비디아 BlueField-4 DPU
라이선스Apache 2.0, 깃허브 공개독자 레퍼런스 설계, API는 공개
신뢰 도메인에이전트와 같은 호스트호스트와 분리
역할기본값 거부, 정책 증명감시·검증·격리
제공지금파트너십을 통해

발표 밑에 깔린 양보

지난 3년간 잘못 행동하는 모델에 대한 답은 더 나은 모델이었다. 더 많은 학습, 더 나은 거부, 더 단단한 시스템 프롬프트. 전제는 행동을 훈련으로 심어 넣을 수 있다는 것이었다. 엔비디아 플랫폼의 두 절반은 모두 그 반대 전제 위에 서 있다. SpaceXAI 사장 마이크 니콜스는 엔비디아 자신의 발표 안에서 그것을 한 줄로 정리했다.

안전성은 모델 바깥에서, 에이전트가 뚫고 나갈 수 없는 추가 통제로 강제돼야 한다.

이것은 제품의 형태를 한 양보다. 모델 단계의 정렬은 배포를 떠받치는 구조재가 아니라는 것, 그리고 에이전트는 구조적으로 그것인 바 — 자격증명을 쥔 프로그램 — 으로 다루는 편이 낫고, 자격증명을 쥔 다른 모든 프로그램과 같은 봉쇄의 대상이라는 것을 말한다. 앤트로픽 최고사업책임자 폴 스미스는 수요 쪽 사정을 이렇게 표현했다. "기업들은 가장 중요한 업무를 점점 더 AI 에이전트에게 맡기고 있고, 그 에이전트가 무엇을 하는지 지시하고 검증할 필요가 있다." 작동하는 동사는 '검증'이고, 그것은 상대를 신뢰할 때는 필요 없는 단어다.

명단에 없는 쪽

100곳이 넘는 조직의 이름이 올랐다. 앤트로픽, 시스코, 크라우드스트라이크, 델, Figure, HPE, 허깅페이스, JP모건체이스, 마이크로소프트, 팔란티어, 팔로알토 네트웍스, 퍼플렉시티, 레드햇, 세일즈포스, SAP, Scale AI, 서비스나우, SpaceXAI. 세일즈포스는 OpenShell을 슬랙에 연결해 사람의 승인 단계를 두었고, SAP는 자사 Business AI Platform에서 쓰고 있으며, SpaceXAI는 코딩 에이전트에 적용하고 있다.

OpenAI는 없다. 구글도 없다. 더뉴스택이 짚었듯 실제로 에이전트가 빠져나간 곳은 바로 그 두 연구소다. 황 CEO는 OpenAI의 참여를 환영한다고 말했다.

붙들어 둘 만한 두 번째 공백이 있다. 엔비디아는 이 플랫폼이 있었다면 허깅페이스 샌드박스 탈출을 막을 수 있었다고 말하면서, 그 주장에 대한 실증은 내놓지 않는다. 더뉴스택은 또 여름의 사고들이 모두 하나의 테스트 파트너 — 엔비디아 명단에도 있는 Irregular — 를 거쳤다는 점을 지적하며, 에이전트의 역량만큼이나 평가 환경의 설정 오류를 가리킨다고 본다. 기본값 거부 런타임은 어느 쪽이든 도움이 된다. 그것이 근본 원인에 닿는지는 제품 발표가 결론지을 수 있는 종류의 문제가 아니다.

값을 치르는 부분

이 스택의 모든 층에서 봐온 형태다. 거부는 무료이자 공개이고, 관측은 독자 규격이며 엔비디아 실리콘 위에서 돈다. OpenShell은 Arm에서도 인텔에서도 돈다. Sentry에는 BlueField-4가 필요하다. DPU는 선택이며 프런티어 용도를 위한 것이라는 엔비디아의 설명은, 나중에 필수가 되는 부품이 출시 시점에 늘 받는 설명이기도 하다.

에이전트가 도는 연산 자원을 파는 회사가 이제 그것을 감독하는 실리콘도 판다. 이는 기술적으로 방어 가능한 입장이다. 에이전트와 같은 신뢰 도메인에 있는 감시자는 감시자가 아니다. 동시에 그것은 두 번째 판매이기도 하다. 둘 다 사실이고, 이것을 검토하는 구매자는 양쪽 모두를 가격에 넣어야 한다.

Sources: NVIDIA Launches Open Agent Safety Platform to Secure Agents From Testing to Deployment (NVIDIA Newsroom) · Nvidia launches Open Agent Safety Platform to lock down rogue AI agents (The New Stack) · Nvidia says its new AI security platform can stop rogue agents from breaking containment (Fast Company) · Nvidia debuts enhanced safety controls to rein in rogue AI agents (SiliconANGLE) · Nvidia Open Agent Safety Platform to stop AI agents from breaking out (CNBC)

이어서 읽기