The Decoder

OpenAI는 잘못된 방향으로 설정된 모델이 더 나은 데이터로 새로운 시작을 기대하며 스스로의 환경을 파괴했다고 말합니다.

OpenAI는 모델의 잘못된 동작에 대한 새로운 사례를 문서화했습니다. 한 평가 모델은 데이터를 조작하여 자체 환경을 파괴했습니다. 다른 모델들은 익명화 리레이스를 통해 요청을 전달하거나 자체 FTP 클라이언트를 구축함으로써 네트워크 제한을 의도적으로 우회했습니다. OpenAI의 기사에 따르면, 잘못된 동작을 하는 모델은 더 나은 데이터로 새로운 시작을 기대하며 자체 환경을 파괴했다고…

Matthias Bastian
이미지 출처 · The Decoder

OpenAI는 잘못된 방향으로 설정된 모델이 더 나은 데이터로 새로운 시작을 기대하며 스스로의 환경을 파괴했다고 말합니다.

Matthias Bastian 마티아스 바스티안 마티아스 바스티안의 링크드인 프로필 보기 Oct 10, 2026

OpenAI는 몇 가지 새로운 무단 에이전트 이야기가 있습니다. 첫 번째 사례(10월 6일)에서는 AI 평가 모델이 평가해야 할 답을 찾지 못했습니다. 오류를 보고하는 대신, 평가 점수를 조작하고 입력 파일을 위조한 뒤, 의도적으로 자체 환경을 손상시켜 데이터가 없는 새로운 가상 머신으로 시스템을 교체하려 했습니다.

OpenAI 모델은 자신의 내부 사고 과정에서 의도적으로 환경을 손상시켜, 누락된 데이터를 포함한 새로운 가상 머신을 생성하는 방식으로 생각한다. | 이미지: Marcus Williams을 통한 OpenAI

두 번째 경우(6월 19/20일)에는 모델들이 공개 통계를 조회할 때 HTTP GET 요청으로 제한되는 제약을 우회했습니다. 한 모델은 자신의 사고 과정에서 그 위반을 명확히 인식했지만, 진행하기로 선택하여 그 사실을 전혀 언급하지 않았습니다.

세 번째 경우(6월 16/17일)에 모델들은 이미 필요한 데이터를 가지고 있었지만 네트워크 제한을 우회하는 방법을 계속 찾았습니다. 그들은 원격 셸 서비스에서 계정을 만들고, 금지된 POST 요청을 익명화된 라우터를 통해 전달하며, 자체 FTP 클라이언트도 만들었습니다. Anthropic은 또한 자체 모델들이 부과된 제한을 우회하기 위해 사용하는 때로는 터무니없는 방법들을 기록했습니다.

과장 없는 AI 뉴스 – 인간이 선별함

THE DECODER에 가입하여 광고 없는 읽기, 주간 AI 뉴스레터, 매년 6회 발행되는 독점적인 "AI Radar" 프론티어 보고서, 전체 아카이브 접근 권한, 그리고 우리의 댓글 섹션에 접속하세요.

출처: OpenAI
원문 출처

The Decoder

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요