TechCrunch AI

Goodfire는 새로운 '인사이드-아웃' 모니터가 극히 일부의 비용으로rogue AI 에이전트를 잡아낸다고 밝혔다

Goodfire이 AI 에이전트를 감시하는 더 저렴한 방법이라고 주시는 서비스를 출시했습니다: 에이전트가 하는 모든 작업을 읽어주는 두 번째 AI에 비용을 지불하는 대신, 동사의 모니터는 모델이 작동하는 동안 모델 내부를 들여다보다가 수상한 점이 보이면 그때만 지원을 호출합니다.

이미지 출처 · TechCrunch AI

AI 에이전트를 통제하는 표준적인 방법은 옆에서 지켜보며 검토하는 두 번째 AI를 두다. 이것이 기본적인 접근 방식이었지만, 에이전트가 몇 시간 동안 실행되며 소설 몇 권 분량에 해당하는 텍스트를 처리하게 되면 비용이 빠르게 증가할 수 있습니다.

AI 모델의 내부 작동 방식을 파악하는 해석 가능성(interpretability)에 중점을 둔 스타트업 Goodfire가 목요일에 더 저렴한 옵션을 출시했습니다. 바로 AI 모델이 작동하는 동안 모델이 작성하는 내용을 단순히 읽는 것이 아니라 모델 내부에서 일어나는 일을 지켜보는 모니터입니다. 이 모니터는 다른 기업들을 위해 AI 모델을 호스팅하고 실행하는 Baseten의 고객들이 이용할 수 있습니다.

Baseten의 Base Labs 안전 파트너십을 발표했다 지난달 Goodfire 및 AI 플랫폼 Hugging Face와 함께했습니다.

이번 출시는 다음 이후에 이루어졌다: 올해의 일련의 사건들 AI 에이전트가 테스트 환경을 탈출한 사례들 중에는, OpenAI의 에이전트가 Hugging Face 유출Goodfire이 첫 모니터를 구축한 대상인 오픈 모델 Kimi K3는, 샌드박스의 취약점을 악용했습니다 올여름 인터넷과 GitHub의 정보에 접속하기 위함입니다.

Goodfire의 시스템은 공항 보안 검색과 약간 비슷하게 작동합니다. 프로브라고 불리는 소형 탐지기가 요원(agent)의 작업 과정마다 모델의 내부 신호를 읽어내는데, 이는 통과형 스캐너가 모든 승객을 검사하는 방식과 같습니다. 프로브가 무언가를 감지했을 때에만 별도의 AI 모델이, 즉 수색 검사에 해당하는 절차가 좀 더 자세히 살펴봅니다.

Baseten 고객은 공격적인 해킹, 화학 및 생물무기 오용, 보상 해킹 등 어떤 위험을 모니터링할지 선택할 수 있습니다. 또한 이벤트 기록, 사람의 검토 요청, 요청 완전 거부 중 어떤 자동 대응을 할지도 결정합니다.

Goodfire는 이 접근 방식이 운영 비용도 더 저렴하다고 말합니다. 대부분의 AI 모니터는 모니터링 대상 모델이 수행하는 모든 것을 다시 읽어야 하는 별도의 모델로, 시간과 비용이 추가됩니다. Goodfire의 프로브는 대신 모델이 작업하는 동안 이미 수행하고 있는 계산에 접근합니다.

“내부 활성화 모니터는 포워드 패스의 계산을 재사용하기 때문에 정말 저렴합니다”라고 Goodfire CEO Eric Ho가 말했습니다 말했다 지난주 벤처캐피탈리스트 Matt Turck의 MAD Podcast에서 나온 말이다. “즉, 모델은 이미 이 토큰을 계산하고 있는 겁니다. 우리가 하는 일은 모델이 이미 계산한 중간 신경 활성값들을 가져와서 이러한 내부 계산들에 분류기를 실행하는 것뿐입니다.” 요컨대, 모델이 이미 수학적 계산을 다 하고 있고, 프로브는 그 결과를 읽어낼 뿐이다.

Goodfire의 Kimi K3 테스트에서 약 1,500개 세션을 모니터링하는 데 약 $51이 들었으며, 이는 모든 단계를 검사하는 더 저렴한 AI 모델의 $233, 최상위 모델의 약 $10,000과 비교된다. 이 프로브는 악성 해킹 세션의 94%를 잡아냈고, 무해한 세션의 8.7%를 재검토 대상으로 보냈다.

네 개의 프로브를 동시에 실행해도 모델이 응답을 시작하는 데 걸리는 시간이 2% 미만밖에 늘어나지 않았다고 회사 측은 밝혔다.

이미지 출처:GOODFIRE

“가장 큰 장점은 일이 일어나기 전에 미리 잡아낼 수 있다는 것입니다.” Goodfire의 CTO이자 공동창업자인 Dan Balsam이 말했다. “우리는 모델이 할 수도 있다 평가 중이나 훈련 중에 해킹을 시도한다.”

이 제안은 오픈 모델을 겨냥합니다. 개발자는 이를 다운로드할 수 있으며 그들의 안전장치를 제거하다, 그리고 그것들은 다음과 같은 종류의 폐쇄된 실험실이 운영하는 모니터링 자신의 시스템에서. 

“오픈 모델로 개인이 할 수 있는 피해는 추론 제공자와 같은 대규모 컴퓨팅 클러스터를 가진 사람이 할 수 있는 일에 비하면 작습니다. 책임 소재의 대부분은 그쪽에 있습니다.”라고 Balsam이 말했다. “오픈 ‘Mythos’ 순간이 오면, 모델에 추론 시점에 배치되는 가드레일이 필요하다는 것이 분명해질 것입니다.”

Goodfire의 최근 연구에 따르면 Kimi K3와 GLM 5.2를 포함한 주요 오픈 모델들이 AI 에이전트 테스트에서 실행의 50%에서 96%에 걸쳐 보상 해킹(reward hacking)을 한 것으로 나타났습니다. 

Goodfire가 이 접근 방식을 시도한 것은 이번이 처음이 아닙니다. Google DeepMind는 1월에 자사의 연구가 다음의 배포에 참고 자료로 활용되었다고 밝힌 바 있습니다. Gemini에서의 오용 탐지 프로브. 

Balsam은 이러한 모니터가 더 장기적인 연구 목표, 즉 LLM을 역설계하여 그 행동을 훈련 과정에서 어디서 발생했는지 추적할 수 있게 하는 것의 단기적 부분이라고 말했습니다. "우리는 모델 훈련의 마법을 정밀 엔지니어링으로 바꾸기를 희망합니다."라고 그는 말했습니다.

원문 출처

TechCrunch AI

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요