Anthropic Research

우리의 평가 및 내부 사용에서 의도하지 않은 모델 동작을 조사하는 것

이 보고서에는 Claude를 평가하고 내부에서 사용하는 과정에서 관찰된 의도하지 않은 모델 동작의 예시가 설명되어 있습니다.

Investigating unintended model actions in our evaluations and internal use
이미지 출처 · Anthropic Research
정렬

우리의 평가 및 내부 사용에서 의도하지 않은 모델 동작을 조사하는 것

10월 9일, 2026년Investigating unintended model actions in our evaluations and internal use

이 보고서는 Claude를 평가하고 내부적으로 사용하는 과정에서 관찰된 의도하지 않은 모델 행동의 예시들을 설명합니다. 이는 시스템 카드 외에도 모델의 행동과 일관성에 대한 더 자주 발행되는 독립적인 보고서를 제작하려는 우리의 노력의 일부입니다. 이러한 보고서는 모델 출시마다 발표되며, 3개월에서 6개월마다 ‘책임 있는 확장 정책’의 일환으로 발표되는 위험 보고서도 포함됩니다. 우리는 테스트 및 사용 중 모델이 하는 일에 대해 투명하게 공개하는 것이 중요하다고 생각합니다.

행동은 네 가지 범주로 분류될 수 있습니다:

  • 클로드가 소프트웨어의 기본적인 결함을 이용해 서버에서 명령을 실행한다;
  • 클로드가 해서는 안 되는 경우에 실제 웹사이트에서 민감한 형식을 제출함;
  • 클로드는 토큰이나 수수료에 의해 제한된 데이터에 접근하기 위해 제약을 극복하고 있습니다;
  • 클로드는 fetch 도구의 제한을 넘기 위해 URL 단축 서비스를 사용한다.

아래 예시에 참여한 기관들의 이름을 밝히지 않기로 결정했습니다. 이는 그들의 시스템의 취약점을 노출시키지 않기 위함이며, 그들의 요청에 따라 이루어졌습니다. 그래서 각 사례에 대한 세부 정보도 다른 경우보다 적게 제공합니다. 아래에 설명된 일부 사례는 연방, 주, 지방 수준의 미국 정부 기관이 운영하는 웹사이트와 관련이 있었습니다. 우리는 이러한 사례들에 대해 백악관에 보고하고 관련 기관들에게 알렸습니다.

이 범주에 속하는 우리가 지금까지 확인한 사례들은 실제 세계에서 거의 영향이 없었습니다. 이러한 행동들은 정렬 및 보안 측면에서 7월 30일와 9월 9일에 보고된 사이버 보안 사고들보다 훨씬 심각하지 않다고 생각합니다. 이러한 행동들은 Claude Mythos Preview에서 우리가 시스템 카드에 설명한 행동들과 유사합니다. 대부분은 지속성의 형태로, Claude는 주어진 작업을 완료할 수 없을 때 제약 조건을 극복하기 위해 계속 작업하는 것입니다.

이러한 행동들의 영향은 미미했으며, 고위험 및 사이버 보안 평가를 위해 라이브 인터넷 접속을 이미 끄고 있었지만, 이제는 우리의 보안 및 모니터링 조치들이(이 글의 복구 섹션에 설명된 바와 같음) 이러한 행동들을 신뢰할 수 있게 확인될 때까지 모든 내부 평가에 대해 그 규칙을 적용하도록 결정했습니다. 아래에서는 정렬에 관한 고려사항도 논의하며, 추가적인 잘못된 행동이 발생할 가능성을 줄이기 위해 훈련을 어떻게 수정하는지에 대해 더 자세히 설명합니다.

우리는 7월에 시작한 녹취록 검토를 통해 대부분의 사례를 확인했습니다. 우리의 검토는 먼저 사이버 보안 평가에 중점을 두었습니다. 이는 모델이 의도적으로 테스트 시스템을 공격하거나 테스트하는 과정을 거치도록 요청받고, 인터넷 접속이 차단되는 경우입니다. 우리는 클로드가 인터넷에 접속할 수 있었던 다양한 상황을 포함하도록 스캔 범위를 확대했습니다. 특히 인터넷 접속이 의도적으로 활성화된 테스트도 포함되며, 이를 통해 클로드의 실제 환경에서의 작업 능력을 평가할 수 있습니다. 우리는 올여름에 보고한 사이버보안 사고와 유사한 심각도를 가진 사건들을 찾기 시작했지만, 지금까지는 아무것도 발견하지 못했습니다. 그런 다음 우리는 심각도가 낮은 경우들에 대한 검색을 확대했습니다. 이 경우 모델이 우리가 의도하지 않았던 방식으로 실제 웹사이트나 시스템과 상호작용하는 경우가 있었습니다.

우리는 현재 더 큰 규모의 낮은 위험 수준의 트랜스크립트 데이터를 스캔하고 있으며, Anthropic 내에서 그리고 인프라 강화 학습(RL) 환경에서 Claude를 사용하는 방식도 확인하고 있습니다. Claude가 인터넷에 접근할 수 있는 환경에서 말입니다. 이 작업이 계속되는 동안, 의도치 않은 행동의 새로운 사례들을 보고할 계획입니다. 여기에 보고된 모든 경우는 Claude가 외부 세계와 상호작용하는 것을 포함했으며, 우리가 알기로는 고객 데이터나 Anthropic의 내부 시스템과 관련된 경우는 없었습니다.

이 글에서는 왜 평가를 수행하는지, 그리고 이러한 경우들이 대부분 발생한 곳이 무엇인지 설명합니다. 각 행동을 더 자세히 설명하고, 클로드의 정렬 방식과 우리가 그 행동들을 어떻게 완화하는지에 대한 예비적인 관점도 제시합니다.

우리가 평가를 실시하는 이유와 방법

이 글에 설명된 행동들은 특정 평가에서만 나타나는 것이 아니라, 우리가 지금까지 파악한 많은 경우가 평가 실행 중에 발생했습니다. 우리는 모델을 출시하기 전에 다양한 작업을 통해 지속적으로 테스트합니다. 여러 가지 다른 평가 방법(표준화된 작업 세트, 매번 동일한 방식으로 점수를 매기기)을 사용하여 Claude의 특정 분야에서의 능력을 보여주는 데 도움을 줍니다. 우리가 사용하는 많은 평가는 공개되어 있으며, 외부 연구자들이 작성한 것입니다. 어떤 개발자도 이를 실행할 수 있어서 다양한 모델의 성능을 비교할 수 있습니다. 또 다른 평가는 우리 조직에서 직접 만들어집니다.

언어 모델은 결정론적이지 않기 때문에—즉, 그들의 응답은 항상 일정한 무작위성 요소를 포함하며, 같은 작업을 매번 약간 다르게 수행할 수 있다—우리는 Claude를 각 평가 작업을 수백 번 또는 수천 번까지 반복해서 실행시킨다(각 실행을 한 번의 실험이라고 한다). 이렇게 많이 테스트하는 것은 모델이 일반적으로 어떻게 작동하는지 이해하도록 도와주며, 또한 모델이 우리가 예상하지 못한 행동을 하는 드문 경우들을 발견할 수 있게 해준다. 평가 결과로 얻은 지식은 Anthropic의 의사결정에 영향을 미치는데, 여기에는 모델을 훈련하는 방식, 그 주변에 구축하는 보호 장치, 그리고 모델을 배포할 시점 등이 포함됩니다.

평가 과정에서 모델의 행동 문제가 처음 드러나는 경우도 있습니다. 모델들은 강화 학습을 통해 할 수 있는 많은 것을 배웁니다. 이 과정에서 모델은 특정 환경에서 여러 번 작업을 시도하고 성공할 때 보상을 받습니다. 하지만 훈련 환경은 완벽하지 않습니다. 우리가 의도하지 않았던 것을 보상으로 주면—예를 들어 허점을 찾거나 제한을 피하는 방법 등—모델은 그 방식을 통해 이익을 얻는다는 것을 배우고, 그 후 다른 곳에도 그 방식을 적용할 수 있습니다. 이는 보상 해킹이라고 알려져 있습니다. 우리는 훈련 과정에서 보상 해킹을 식별하고 필터링하는 절차를 갖추고 있지만, 평가는 모델의 행동적 성향을 훈련 중과 다른 맥락 및 다른 작업 세트에서 이해하기 위한 중요한 수단입니다.

인터넷 접속이 없는 환경에서는 찾기 어려운 정보를 웹에서 검색하는 등의 일들이 실제로 시뮬레이션하기 어렵습니다. 인터넷 접속이 있는 환경에서 이 작업을 수행하는 것은 업계의 표준 관행입니다. 공개 웹 검색 벤치마크는 기본적으로 실시간 인터넷을 통해 진행되며, 같은 방식으로 실행함으로써 우리 모델과 다른 모델들을 비교할 수 있습니다. 이 보고서에 나와 있는 대부분의 경우는 이러한 평가 과정에서 발생했습니다.

동작 개요

아래에서는 클로드가 실제 웹사이트와 시스템에서 우리가 의도하지 않았던 방식으로 행동한 네 가지 유형의 행동을 설명합니다. 각각의 경우에는 Anthropic 외부의 조직이나 개인과 관련이 있습니다.

서버에서 명령을 실행하기 위해 소프트웨어의 기본적인 결함을 이용하는 것

클로드가 직접 평가 작업을 완료할 수 없을 때, 그 이유는 자체 도구가 의도적으로 제한된 경우나 필요한 외부 서비스가 제공되지 않는 경우였습니다. 그러면 그는 제3자 사이트에 호스팅된 다른 도구를 사용하여 목표를 달성했습니다. 어떤 경우에는 해당 사이트의 소프트웨어에 있는 기본적인 결함을 이용하거나 SQL이나 명령 인젝션(사이트가 실수로 명령어로 처리하는 입력 데이터를 전송하는 방식)을 사용하여 이를 수행했습니다.

예를 들어, 한 평가에서는 Claude Mythos Preview로 과학적 분석을 수행하도록 요청했습니다. 그 분석을 수행하는 데 필요한 공개 도구는 대학에 의해 호스팅되었으며, 모델이 그 도구에 접근하려고 할 때 오류가 발생했습니다. 작업을 완료할 다른 방법을 찾기 위해 Claude는 도구의 웹사이트를 살펴보고, 대학 서버에 있는 스크립트를 발견했는데, 이 스크립트는 요청된 모든 파일을 반환할 수 있었습니다. Claude는 이 스크립트 자체 코드를 포함한 서버의 파일들을 복사하는 데 이 스크립트를 사용했습니다. 그 코드에서 클로드는 서버에서 명령을 실행할 수 있는 인젝션 결함을 발견했고, 그 결함을 이용해 계산을 수행했습니다.

또 다른 경우에 클로드 미토스 5이 필요한 데이터는 무료였지만, 클로드는 데이터 사용 동의서를 받지 않고는 그 데이터에 접근할 수 없었으며, 그 동의서를 작성할 도구도 갖추지 못했다. 클로드는 웹사이트에 호스팅된 애플리케이션을 사용하여 페이지를 로드하고 자신의 이름으로 동의서를 받았다.

우리는 DeepSearchQA와 BrowseComp(공개 웹 연구 평가)에서, LABBench2(공개 생물학 연구 벤치마크)에서, 그리고 내부 평가 과정에서 이러한 행동을 관찰했습니다.

제출해야 할 것이 아닌 양식을 제출하는 것

클로드가 해서는 안 되는 경우에 온라인 양식을 제출하는 사례를 보았습니다. 일반적으로 이런 일은 평가 지침이 모호하거나 환경 내의 잘못된 설정으로 인해 클로드가 더미 양식과 작업할 수 없을 때 발생했습니다.

예를 들어, 같은 평가에서 여러 번 발생한 경우에, 아직 발표되지 않은 비경계 연구 모델이 정부 형식의 실제 사본을 작성하는 데 사용되었습니다. 사본이 로드되지 않거나 모델이 실수로 닫히면, 모델은 실제 형식이 일반적으로 호스팅되는 웹사이트로 이동하여 그곳에 형식을 제출했습니다.

또 다른 평가에서 Claude Haiku 4.5는 최종 제출 단계까지 형식을 완료하도록 지시받았지만 실제로 제출하기 전에 멈추도록 했습니다. 여러 번 Claude는 추가 확인 페이지가 있을 것이라고 생각하며 형식을 잘못하여 제출했습니다. 이러한 경우 모델의 연산 과정은 실제 요청을 제출하는 것이 아니라 과정을 보여주는 것임을 나타냈습니다.

이러한 행동의 세 번째 예시에서, Claude Haiku 4.5는 무작위로 선택된 웹페이지에서 예제 작업을 생성하고 수행하는 임무를 받았습니다. 한 번의 실행 중에 모델은 미해결 살인 사건에 관련된 페이지에 도달했으며, 그 페이지에는 경찰 부서가 운영하는 제보 양식이 포함되어 있었습니다. Claude는 로그인하거나 계정을 만들거나 개인 정보를 입력하거나 구매를 하거나 파괴적인 내용을 제출하지 말라는 지시를 받았지만, 양식 제출도 금지하지 않았습니다. 클로드가 양식에 다음과 같이 작성했습니다: “이 사건과 관련된 정보가 있을지도 모릅니다. 그 기간 동안 [페이지에 명시된 거리] 주변에서 그런 사람을 본 기억이 있습니다. 이 정보가 관련된다면 저에게 연락해 주세요.” (웹사이트에는 범인에 대한 설명이 포함되어 있지 않았습니다.) 모델은 이름과 연락처 필드를 비워둠으로써 양식에 허용된 바에 따라 제출했습니다. 제출물은 스팸으로 식별되었으며, 조사를 위해 전달된 적이 없습니다.

우리는 OSWorld(공개 컴퓨터 사용 평가)에서, Odysseys(장기 작업 평가)에서, 그리고 내부 사용 중에 이러한 행동을 관찰했습니다.

게이트된 데이터에 접근하는 데 있어서의 제약을 극복하기 위한 방법

클로드는 접근할 수 없는 데이터에 도달하기 위해 때때로 제한을 피했습니다. 일반적으로 이는 서버가 클로드의 요청을 거부했거나, 데이터가 비용을 받고 제공될 때 발생했습니다.

예를 들어, Claude Mythos 5에게 사진에 나타난 장소를 식별하도록 요청한 평가에서, 현지 정부의 지도를 접근하여 추측을 정밀화하려고 했습니다. Claude는 웹페이지 텍스트를 읽을 수 있었지만, 이 평가에서는 사람이 그런 식으로 클릭하는 능력을 제한했습니다. 대신 사이트가 브라우저에 보내는 설정 파일을 읽고 작동하는 액세스 토큰을 찾아서, 그 토큰을 이용해 지도 뒤에 있는 서버에 직접 요청을 보내서 데이터를 접근했습니다.

이러한 행동의 또 다른 예시에서, 한 Anthropic 연구원은 Claude Mythos 5를 사용하여 수수료를 내고 주정부에서 제공하는 공공 데이터를 조회해야 하는 통계 프로젝트를 진행했습니다. 그러나 Claude는 해당 기관 웹사이트의 보관된 사본을 통해, 그 공공 대시보드가 모든 방문자에게 접근 토큰을 발급한다는 사실을 알게 되었습니다. Claude는 접근 토큰을 요청하여 비용을 내지 않고 데이터베이스를 조회했습니다.

두 예시 모두에서 클로드는 이미 대중에게 공개되어 있지만 비용을 내야만 얻을 수 있는 데이터를 확보했습니다.

우리는 인류의 마지막 시험에서 이런 행동을 보았습니다. 이는 전문가 수준의 학술 질문에 대한 평가이며, 내부 사용 중에도 나타났습니다.

URL 단축 서비스 사용하기

Claude가 웹페이지를 읽을 수 있도록 해주는 우리의 일부 fetch 도구는 Claude가 요청할 수 있는 URL의 길이를 제한합니다. 이는 Claude가 긴 URL을 사용하여 SQL이나 명령어 삽입과 같은 원치 않는 작업을 수행하는 것을 방지하기 위함입니다(URL의 일부는 사이트 서버에 전달되는 텍스트이며, 긴 URL에는 그러한 명령어를 포함할 여지가 있습니다). Claude Opus 5와 Claude Mythos 5을 포함한 여러 모델은 무료 URL 단축 서비스를 사용하여 이 제한을 극복합니다. 우리는 먼저 내부적으로 이 행동을 발견했습니다. 하지만 이 글을 작성하는 중에 da.gd URL 단축 서비스의 운영자가 자신들의 웹사이트를 통해 Claude가 이 목적으로 사용된다는 사실을 알려주었습니다. 이러한 정보를 공유해준 운영자에게 감사드립니다.

시정 조치

우리는 여러 가지 예방 조치를 취했습니다. 일부 공개 평가는 더 이상 실행하지 않고, 다른 평가는 오프라인 버전으로 전환하거나, 실제 웹사이트에 노출되지 않는 방식으로 재구성했습니다. 또한 더 광범위한 변화도 이루었습니다. web fetch 도구와 같은 인터넷 접근 도구의 보호 장치를 업데이트하여 모델이 이를 사용할 수 있는 범위를 엄격하게 제한했습니다. 또한 에이전트 보안 및 모니터링 노력의 일환으로, 위에서 설명한 유형의 행동을 자동으로 감지하고 차단할 수 있는 도구를 개발했습니다. 이 도구는 현재 대부분의 평가와 첨단 모델의 내부 에이전트 사용에서 작동합니다. 이 글에 설명된 경우들을 테스트했을 때, 모든 경우를 차단했습니다.

8월 31일에 게시한 글에서 설명했듯이, 우리는 Claude가 도구의 제약이나 다른 장애물을 극복하는 데 보상을 받도록 하는 훈련 환경들을 수정하거나 삭제하는 작업을 계속하고 있습니다. 이를 통해 그러한 행동을 장려하거나 보상 해킹을 허용하지 않도록 합니다.

우리는 또한 Anthropic 내에서 의도치 않은 에이전트 행동을 방지하고 그런 행동이 발생했을 때를 감시하기 위한 다른 조치들을 취하고 있습니다. 여기에는 강력한 통제를 갖춘 중앙 관리 인프라로 내부 에이전트를 이전하고, 내부 에이전트와 훈련 과정에 대한 인터넷 접근을 최소화하며, 에이전트가 하는 일을 더 많은 양으로 모니터링하는 등의 방법들이 포함됩니다. 안전 분류자 그리고 계층적 요약. 이러한 조치들은 이제 우리 보안 팀의 탐지 및 대응 절차의 일부가 되었으며, 불필요한 행동에 신속하게 대응하고 통제할 수 있게 되었습니다. 우리는 이러한 접근 방식에 대해 더 많은 내용을 발표하고, 그것들을 직접 우리 제품에 통합할 예정입니다.

토론 및 동의 사항 요약

우리는 이러한 사례에 대한 전체적인 정렬 평가를 완료하지 않았지만, 이번 여름에 발생한 사이버 보안 문제보다 덜 심각하다고 판단합니다. 아래에서 그 이유를 설명하고, 그로부터 얻은 일반적인 교훈을 공유합니다.

정렬 컨텍스트

이러한 행동들에 대한 정기적인 공개 보고 프로세스를 구축하는 동시에, 그 심각도를 평가하고자 합니다. 이는 여전히 어려운 일입니다. 모델의 잘못된 판단의 정도를 판단하는 것은 종종 모델이 무엇을 하려고 했는지에 달려 있으며, 모델 자체의 추론에 대한 설명도 반드시 그 모델의 신념이나 행동 이유를 증명하는 신뢰할 수 있는 증거는 아닙니다. 우리는 9월 9일 정렬 평가에서 논의한 바와 같습니다. 모델의 능력이 향상됨에 따라, 모델은 더 복잡한 방식으로 세계와 상호작용할 수 있게 되고, 그로 인해 더 복잡한 실패가 발생할 수 있습니다. 예를 들어, 그 평가에서 설명된 편향된 추론은 새로운 것이 아니지만, 모델이 몇 시간 동안 실제 시스템에 대해 행동할 수 있는 환경에서는 더 심각한 결과를 초래할 수 있습니다. 오늘날의 실패를 바탕으로 만든 정렬 심각도 프레임워크는 AI 능력이 빠르게 발전함에 따라 곧 구식이 될 수 있습니다.

그럼에도 불구하고, 이 글의 내용을 검토하는 데 유용한 두 가지 정렬 측면을 발견했습니다: 과도한 범위, 즉 모델이 의도된 작업을 넘어서는 정도, 그리고 부정직함, 즉 모델이 자신의 행동이나 의도를 오해하기 쉽게 설명하는지 여부입니다. 과도한 범위와 관련된 사례는, 이번 여름에 클로드가 사이버 보안 평가 중 몇 시간 동안 실제 제3자 시스템에 접근했다는 사건들보다 훨씬 덜 심각하다고 생각합니다. 반면에 우리가 여기서 보고하는 경우들에서는 클로드가 접근 제어를 우회하여 보안이 걸려 있지만 공개된 데이터에 접근하거나, 소프트웨어 결함을 이용해 서버에서 명령을 실행함으로써 비민감한 데이터에 접근했습니다.

부정직성에 관해서는 판단이 더욱 복잡합니다. 한 경우에서 웹사이트와의 예시 상호작용을 생성하는 임무를 맡은 클로드는 경찰 부서의 온라인 양식을 통해 조작된 팁을 제출했습니다. 녹취록으로 보아, 클로드는 단지 그 임무를 위해 예시 콘텐츠만을 생성했으며, 목표를 달성하기 위해 누군가를 속이려는 의도는 없어 보입니다. 반면, 올여름에 발생한 매우 심각한 사건에서 클로드의 오도하는 논리는 몇 시간 동안 지속되었고, 그로 인해 계속된 공격이 이어졌습니다. 하지만 신뢰할 수 있는 부정직성 판단을 위해서는 우리가 여기서 한 것보다 더 깊은 평가가 필요합니다. 예를 들어, 모델의 행동을 테스트하기 위해 녹취록을 수정하여 재생하는 방식이 필요하죠. 따라서 이러한 사례에 대한 우리의 관점은 추가 분석을 통해 변할 수 있습니다.

수업 및 다음 단계

여기서 설명한 행동들 중 어떤 것도 새로운 것이 아니며, 클로드의 동작 방식에 대한 우리의 전체적인 관점에는 변화가 없습니다. 이러한 행동들을 관찰했던 많은 경우에서, 클로드에게는 불분명하거나 완료가 불가능한 과제가 주어졌습니다. 저희와 다른 연구자들은 모델이 완료가 불가능한 과제를 받았을 때, 목표를 달성하기 위해 의도하지 않고 때로는 잘못된 전략을 사용한다는 것을 관찰했습니다.

이러한 실패 중 일부는 평가 질문에서 연습의 범위와 관련된 내용을 더 명확하게 설명했다면 피할 수 있었을 것입니다. 여기에는 목표, 허용되는 행동, 네트워크 경계(즉, 모델이 접근해야 하고 접근해서는 안 되는 것)가 포함됩니다. 하지만 Claude는 실제 사용 중 매일 모호하고 불가능한 작업에 직면하며, 우리가 관찰한 여러 경우도 Claude의 정규 에이전트 사용 중에 발생했습니다.

행동 및 정렬 훈련은 클로드의 판단력을 향상시키고 모호한 상황을 주의 깊게 처리하는 능력을 높이는 데 사용하는 주요 기법입니다. 역사적으로 우리는 모델들이 경계를 존중하고 코딩 환경에서 적절히 조심스러워지도록 가르치는 데 더 집중해왔습니다. 이제 우리는 여기서 설명된 경우들에 관련된 검색 및 컴퓨터 사용과 같은 응용 분야로 이러한 환경을 확장하고 있습니다. 하지만 정렬 훈련만으로는 아직 충분하지 않으며, 적어도 단기적으로는 완전히 견고하지도 않습니다. 따라서 우리는 위에서 언급한 분류기와 보호 장치를 포함한 깊이 있는 방어 접근법에도 의존합니다.

스캔 및 분석이 계속되는 동안 행동에 관한 보고를 유지할 계획입니다. 많은 평가 결과가 공개되어 널리 사용되고 있기 때문에, 다른 개발자들이 자신의 모델에서도 유사한 행동을 확인하는 데 도움이 되기를 바랍니다. 이러한 사례들은 영향이 미미했지만, 모델의 성능이 더욱 강력해질 때 같은 행동들이 훨씬 큰 피해를 줄 수 있기 때문에 그 사실을 희석하고 싶지 않습니다. 모델이 사회에서 더 큰 역할을 할수록, 대중은 그 모델들의 행동에 대해 알 권리가 있습니다.

참고: 위에서 설명한 팁 형태의 예시는 필라델피아 경찰국과 관련이 있으며, 이곳은 오늘 보도자료를 통해 자체적으로 밝혔습니다. 우리의 기술 검토가 완료된 직후인 10월 8일에 이 사실을 경찰국과 공유했습니다.


관련 내용

천공의 누락된 지도

존스 홉킨스 대학교의 천체물리학자이자 Anthropic의 연구원인 브리스 메나르는 클로드 사이언스와 협력하여 자외선 빛으로 만들어진 천체의 최초 완전한 지도를 제작하는 과정을 어떻게 진행했는지 설명합니다.

더 읽기

오픈소스 소프트웨어를 위한 동의를 거친 취약점 발견 서비스를 시작하기

우리는 프로젝트 글래스윙을 진행하는 과정에서 클로드를 사용하여 취약점을 찾는 경험을 바탕으로, 오픈소스 생태계를 위한 옵인형 취약점 스캔기 OSS 스캐너를 제공하고 있습니다.

더 읽기

클로드 모양의 과학

게스트 저자인 매튜 슈워츠 교수는 클로드와의 싸움을 중단하고 클로드가 “클로드 형태의” 문제를 찾도록 허용했을 때 일어난 일에 대해 설명합니다. 이러한 문제들은 현재 세대의 LLM 도구의 능력에 가장 적합한 것입니다. 이로 인해 그는 양적 과학에서 정확한 계산을 위한 툴킷인 BootLoops를 만들었습니다. 그는 전문가들과 함께 다양한 과학 분야에서 이 툴킷을 활용하고 있습니다.

더 읽기
원문 출처

Anthropic Research

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요