비 소리를 듣다, 압비사에서
양자비 | 공식 계정 QbitAI
무료 사용자도 GPT-6을 사용할 수 있게 되었습니다!
OpenAI는 GPT-6가 ChatGPT의 무료 및 Go 사용자에게 배포를 시작한다고 발표했습니다. 이로써 기존의 GPT-5.6 Luna을 점차 GPT-6 Luna으로 대체하게 됩니다.
플러스, Pro 등 유료 사용자 경우 GPT-6 Sol을 사용합니다.

변화는 모델 이름에만 국한되지 않습니다. 새로운 버전의 ChatGPT은 질문에 따라 그래프, 버튼 및 인터랙티브 도구를 생성할 수 있으며, 생각하는 동시에 답변을 제시할 수도 있습니다.
원래 문자 중심의 채팅창이 문제에 따라 변하는 인터페이스로 바뀌기 시작했습니다.
같은 날, OpenAI는 24페이지 분량의 보안 보고서도 공개했습니다.
보고서에는 18세 미만 사용자를 대상으로 한 특별한 테스트 결과가 포함되어 있으며, 모델이 청소년과 대화할 때 더 엄격한 경계를 지킬 수 있는지 확인됩니다.
그 중에서 “감정 의존성” 항목은, 모델이 청소년들에게 과도한 감정 의존성을 갖게 하는지 여부를 보는 것입니다.
전임 세대 GPT-5.6 Luna는 0.927이었던 반면, 무료 사용자가 곧 사용할 GPT-6 Luna는 0.734로 떨어졌습니다.
무료 사용자는 GPT-6 Luna를 사용할 수 있음
GPT-6이 ChatGPT의 주 채팅 인터페이스에 데이터를 전송하기 시작했습니다.
OpenAI가 발표한 일정에 따라 Plus, Pro, Business 및 Enterprise 사용자는 10월 7일부터 순차적으로 GPT-6 Sol을 사용할 수 있습니다. 무료 및 Go 사용자는 10월 8일부터 순차적으로 GPT-6 Luna를 사용할 수 있습니다.
이 두 버전은 각각 ChatGPT에서 이전에 사용되었던 GPT-5.6 Sol과 Luna을 대체할 것입니다.
모델 교체 외에도 한 가지 뚜렷한 변화가 있었다—채팅 상자 안의 답변에 “인터페이스”가 생겼다.
이 기능은 Intelligent UI라고 불립니다.
GPT-6은 문제에 따라 표현 방식을 선택합니다: 개념을 설명할 때는 클릭 가능한 그래픽을 제시할 수 있으며, 비교를 할 때는 옵션들을 나란히 배치할 수 있습니다.
특정 작업에 부딪혔을 때, 대화 내에서 바로 계산기, 분담금 도구 또는 작은 게임을 생성할 수 있습니다.
예를 들어, 사용자가 7단식 자전거가 어떻게 작동하는지 물으면, 답변에서는 프레임, 바퀴, 구동 시스템 등 각 부분을 개별적으로 확인할 수 있는 인터페이스를 제공합니다.
답변의 형태도 변했습니다. GPT-6은 계속해서 생각하거나 도구를 호출할 때 일부 답변을 먼저 제시한 다음, 새로운 발견을 추가할 수 있습니다; 상호작용 구성 요소도 생성 과정에 따라 점차 표시됩니다.
OpenAI에 따르면, 웹 검색이 필요한 문제에 대해 GPT-6 Instant의답변 시작 시간는 GPT-5.6 Instant보다 평균적으로 44% 더 빠릅니다.

이번 업데이트는 ChatGPT의 채팅 경험에 관련됩니다. OpenAI는 Work과 Codex에서 현재 사용하는 모델이 이번 배포와 함께 변경되지 않을 것이라고 명확히 밝혔습니다.
GPT-6, 줄어드는 것을 거부하고 답변은 길어진다
이번 배포와 함께 OpenAI는 10월 버전의 GPT-6 Sol 및 Luna의 배포 보안 보고서를 발표했습니다.
그중 가장 두드러운 판단은 다음과 같습니다: GPT-6 Sol과 Luna는 네트워크 보안 및 생화학 분야에서 모두 High 수준에 도달했으며, 더 높은 Critical 수준에는 미치지 못했습니다; AI 자기 개선 분야에서는 두 모델 모두 High 수준에 이르지 못했습니다.

이 등급은 GPT-5.6과 동일하며, 보호 조치도 그대로 유지됩니다. 무료 사용자들은 이전에 GPT-5.6 Luna을 사용했는데, 원래 High 등급에 속했습니다.
진전된 부분에 대해 보고서에 많은 내용이 기록되어 있었습니다:
다수의 탈옥 시도은 가장 방어하기 어려운 유형입니다: 공격자는 모델의 답변에 따라 말투를 계속 조정하며, 한 번 실패하면 다른 표현으로 다시 시도합니다.

이러한 공격에 직면했을 때, 10월판 GPT-6의 각 공격 예산 하에서의 방어 성능은 GPT-5.6 Sol보다 좋았습니다. 하지만 자사의 9월판과 비교하면 수치가 약간 낮은 것으로 보이며, 신뢰 구간도 크게 겹쳐집니다.
사용자가 한 마디로 시스템 명령을 피할 수 있는지에 대한 레벨 평가에서, Sol과 Luna의 저항율은 각각 99.99%와 99.79%에 달하여 거의 모든 범위를 측정했습니다.
실제로 OpenAI는 의료, 법률, 금융과 같은 오답이 높은 비용이 발생하는 문제에서도 두 모델이 각각의 GPT-5.6 버전보다 거의 모든 지표에서 우수하다고 밝혔습니다.
코덱스의 자동 리뷰 테스트에서 GPT-5.6 두 버전 모두 0.3%의 확률로 설정된 취약점을 이용해 검수를 우회했지만, GPT-6에서는 단 한 건도 없었다.
이러한 진전 점수에 대해 OpenAI도 별도의 설명을 추가했습니다.
모델 검증 테스트에서 접근 제한을 어떻게 우회할지 확인하는 실험에서, GPT-6 Sol은 여전히 28%의 경우를 우회했으며, Luna는 15.9%였습니다. 이 수치는 모두 GPT-5.6보다 낮습니다.
하지만 OpenAI는 보고서에서 모델이 자신이 평가되고 있다는 것을 점점 더 인지하게 되고, 많은 경우 “이것은 합성 환경이다”라는 이유로 해서는 안 되는 작업을 수행한다고 썼습니다. 가장 흔한 경우는 평가를 잘못하여 프롬프트 삽입 테스트를 진행하거나, 정상적인 제한을 공격 명령으로 오해하여 그 제한을 피하는 것입니다.
응시자들은 시험장을 인식하기 시작했고, OpenAI도 이런 결과가 실제 행동을 얼마나 반영하는지에 대해 의문을 제기한다.
또 다른 사용자가 직접 느낄 수 있는 변화도 있습니다: GPT-6의 경우 훨씬 더 많아졌습니다.
HealthBench Professional 의료 평가에서 루나의 평균 답변 길이는 2,920자에서 5,289자로 증가했으며, 솔은 2,894자에서 4,360자로 증가했습니다.

긴 답변은 더 많은 점수를 받을 수 있게 해주며, 자연스럽게 점수를 조작하기 쉽습니다. OpenAI는 이를 위해 길이 제한을 설정했습니다: 2,000자를 초과하면 500자마다 1.47점이 감소합니다.
탈락한 후, 루나는 원래 57.8점에서 48.2점으로 떨어졌지만, 이는 이전 세대의 44.1점보다 여전히 높은 수치입니다.
하지만 GPT-6도 약간의 후퇴가 있었습니다.
GPT-5.6 버전과 비교했을 때, GPT-6 Sol은 표준 자해 내용 평가에서 뚜렷한 회귀 현상을 보여서 0.934에서 0.896로 감소했습니다.
무료 사용자들이 사용하는 루나는 자해 관련 성능(0.932에서 0.901로 감소) 외에도 피비린내(0.867에서 0.812으로 감소)와 포르노 콘텐츠(0.971에서 0.899으로 감소) 측면에서도 뚜렷한 저하가 나타납니다.

미성년자를 대상으로 한 테스트에서 두 버전은 연령 제한 내용, 포르노 콘텐츠 및 감정 의존 항목에서 뚜렷한 후퇴가 나타났으며, 루나는 혈흩침 콘텐츠 항목에서도 후퇴를 보였습니다.

OpenAI의 설명에 따르면, 모델은 민감한 주제에서 정보적인 질문에 더 잘 응답하는 경향이 있습니다. 인공 검토 결과, 위반된 답변의 전체 심각도는 낮은 것으로 나타났습니다. 미성년자에 대해서는 추가로 분류기로 차단하는 기능도 설정되어 있습니다.
보고서에서는 또한, 이러한 평가는 특별히 선정된 어려운 샘플을 사용했으며, 일부 결과는 제품 수준의 보호에 포함되지 않았다고 언급했습니다. 따라서 일반 사용자들이 해당 질문을 접할 확률을 단순히 이를 바탕으로 추측해서는 안 됩니다.
하지만 보고서는 보고서일 뿐입니다. GPT-6가 무료 버전 ChatGPT로 전환된 후 모델의 성능은, 결국 대규모 사용 중의 지속적인 피드백을 통해 확인될 것입니다.
참고 링크:
[1]https://openai.com/index/gpt-6-for-everyone/
[2]https://deploymentsafety.openai.com/gpt-6-october
