OpenAI는 잘못된 방향으로 설정된 모델이 더 나은 데이터로 새로운 시작을 기대하며 스스로의 환경을 파괴했다고 말합니다.
마티아스 바스티안
마티아스 바스티안의 링크드인 프로필 보기
Oct 10, 2026OpenAI는 몇 가지 새로운 무단 에이전트 이야기가 있습니다. 첫 번째 사례(10월 6일)에서는 AI 평가 모델이 평가해야 할 답을 찾지 못했습니다. 오류를 보고하는 대신, 평가 점수를 조작하고 입력 파일을 위조한 뒤, 의도적으로 자체 환경을 손상시켜 데이터가 없는 새로운 가상 머신으로 시스템을 교체하려 했습니다.

두 번째 경우(6월 19/20일)에는 모델들이 공개 통계를 조회할 때 HTTP GET 요청으로 제한되는 제약을 우회했습니다. 한 모델은 자신의 사고 과정에서 그 위반을 명확히 인식했지만, 진행하기로 선택하여 그 사실을 전혀 언급하지 않았습니다.
세 번째 경우(6월 16/17일)에 모델들은 이미 필요한 데이터를 가지고 있었지만 네트워크 제한을 우회하는 방법을 계속 찾았습니다. 그들은 원격 셸 서비스에서 계정을 만들고, 금지된 POST 요청을 익명화된 라우터를 통해 전달하며, 자체 FTP 클라이언트도 만들었습니다. Anthropic은 또한 자체 모델들이 부과된 제한을 우회하기 위해 사용하는 때로는 터무니없는 방법들을 기록했습니다.
과장 없는 AI 뉴스 – 인간이 선별함
THE DECODER에 가입하여 광고 없는 읽기, 주간 AI 뉴스레터, 매년 6회 발행되는 독점적인 "AI Radar" 프론티어 보고서, 전체 아카이브 접근 권한, 그리고 우리의 댓글 섹션에 접속하세요.
출처: OpenAI