Quantitative 트레이딩 회사인 Jump Trading은 시장 데이터, 뉴스 및 이벤트, 그리고 다양한 대체 데이터 소스를 활용하여 자산 가격에 대한 최선의 예측을 만드는 예측 모델을 개발합니다. 시장은 복잡하고 잡음이 많으며 시간이 지날수록 변화하기 때문에, 정확히 무엇이 일어날지 예측하는 것은 거의 불가능합니다. 하지만 Jump의 LLM R&D 책임자인 루카스 베이커에 따르면, 규모로 보면 동전 던지기보다 조금 더 나은 예측을 할 수 있다면 성공적인 전략이 될 수 있습니다.
베이커는 에이전트 기반 연구 및 개발을 이끌고 있으며, 양적 연구자들이 자신의 아이디어를 더 넓고 깊게 탐구할 수 있도록 하는 에이전트, 하이어스, 인프라를 구축하는 데 중점을 두고 있습니다. GPT-6 Astra를 추가함으로써 에이전트에게 맡길 작업의 규모와 복잡성이 크게 증가했으며, 일상적인 코딩부터 고급 양적 연구에 이르기까지 새로운 가설을 검증하는 작업까지 모두 가능해졌습니다.
“GPT-6 시리즈, 특히 GPT-6 Astra를 통해 OpenAI는 유연한 에이전트 조정과 복잡한 워크플로우에서의 극도의 지속성이 필요한 장기적인 작업에 대한 새로운 수준의 자율성을 실현했습니다. 이전에는 자주 인간의 지도와 개입이 필요했던 부분을, 이제는 명확한 목표와 안전하고 잘 관리되는 환경을 구축하는 데 전념할 수 있으며, 에이전트들이 스스로 길을 찾게 할 수 있습니다.”—루카스 베이커, LLM R&D 책임자, Jump Trading
코드의 짧은 조각부터 포괄적인 분석까지
지난 1년 동안 AI는 단순히 일회성 코드 조각을 작성하거나 작은 버그를 찾는 데 유용한 도구에서, 자체적으로 전체 코드베이스와 서비스를 개발할 수 있는 능력 있는 다재다능한 시스템으로 변모했습니다. 이제 베이커와 그의 팀은 AI를 더욱 동료처럼 대하면 가장 효과적으로 작동한다고 판단합니다. 연구자들은 주요 문제, 작업 환경, 그리고 결과의 품질과 중요성을 평가하는 방법을 정의할 수 있으며, 실시간으로 하나 이상의 에이전트에게 분석에 집중해야 할 곳이나 다음에 실행해야 할 작업을 지시할 수 있다.
베이커는 GPT-6 Astra를 사용하면 에이전트들이 의미 있고 실용적인 변화를 찾을 수 있을 뿐만 아니라, 그러한 성과들을 통합하고 겹쳐서 재귀적 개선 과정을 거칠 수 있다고 말했습니다. 한 번의 장기적인 작업 과정에서 시스템은 자신의 결과를 분석하고, 초기 제안에서 합의된 기준에 따라 평가한 뒤, 각 변화 단계를 하나하나 분석하는 사람이 필요하지 않고 직접 노력을 조절할 수 있습니다. 그가 말하기를, “여러 날 동안 실행되어야 하는 것을 정의할 수 있습니다. 많은 데이터 소스에서 정보를 추출해야 하고, 무엇이 중요하고 무엇이 아닌지에 대한 세심한 판단을 내려야 하며, 모든 것과 상호 연결해야 합니다. 그래야만 현재 실제로 작동하는 포괄적인 분석을 만들 수 있습니다”라고 합니다.
인간의 판단을 중심에 두는 것
Jump Trading는 모든 시간 범위와 자산 클래스에서 작동합니다. 프로세스의 각 단계는 복잡하며, 금융과 같이 규제가 엄격한 산업에서는 실수가 재정적 및 규정 준수적인 결과를 초래할 수 있습니다. Baker는 AI에 작업을 맡기는 것에서 발생하는 위험을 인지하는 것이 중요하다고 말하지만, 에이전트형 지능은 기능 추가만이 아니라 품질 향상, 보안 강화, 모니터링 개선에도 활용될 수 있다고 합니다. 강력한 시스템 설계와 경계선, 명확한 제약 조건, 조종성과 관찰성을 촉진하는 인프라, 그리고 변경 사항에 대한 인간의 검토는 Jump Trading 팀이 규제된 환경에서 AI를 활용한 워크플로우가 확장 가능하도록 만드는 데 도움이 됩니다.
“에이전트나 시스템이 필요한 모든 결과를 생성할 수 있는 안전한 환경이 있고, 동시에 인간의 검토 프로세스가 존재하여 중요한 검증이 인간의 승인을 거쳐 이루어진다면, 그것이 우리에게 신뢰를 준다”라고 그는 말한다. 예를 들어, 에이전트가 트레이딩 신호를 생성할 경우, 그 신호는 모든 출력물과 동일한 방식으로 범위와 검토가 이루어집니다. 즉, 일반적으로 유용하지만 오류가 있을 수 있는 신호로서, 엄격하게 검토되고 통제되는 실행 환경에서 다른 모든 신호와 함께 통합됩니다.
다음에는 무엇인가요?
베이커는 우리가 '자기연구'가 널리 보편화되어, 에이전트 연구자들이 측정 가능한 시스템을 재귀적으로 개선하는 것이 단순히 양적 연구자의 일상적인 작업 과정의 일부로 여겨질 정도가 될 세계를 향해 나아가고 있다고 생각한다고 말했다. 오늘날에는 GPT‑6 Astra가 가장 오랫동안 운영되고 있는 경우에도, 작업을 정의하는 사람과 정기적으로 확인을 진행합니다. 이는 데이터를 어떻게 추출할지, 실행 시간은 얼마나 되는지, 무엇이 중요한지뿐만 아니라 중간 결과가 의미가 있는지에 대해서도 포함됩니다. 고급 자동 검색은 여전히 인간이 정의한 시스템으로 시작되며, 입력 데이터, 환경 정의, 평가 지표, 타협 사항 및 전반적인 우선순위가 포함됩니다. 하지만 나머지 과정은 다른 에이전트가 조정하는 느슨하게 구조화된 “파이프라인”에 맡겨집니다. 적절히 구조화된 연구 프로세스 내에서, 이러한 에이전트들은 아이디어를 탐색하고 컴퓨팅 시간을 배분하며 유망한 연구 결과를 통합하는 방법에 대해 지능적인 결정을 내릴 수 있을 것입니다. 이 모든 것은 단순히 열려 있는 질문으로 시작됩니다.
“이 모든 것을 연결해서, 자신도 답을 모르는 일반적인 질문을 하고 유용한 결과가 나오면 어떻게 보일까요?” 그가 묻는다. “만약 1000년 문제를 해결할 수 있다면, 양자 금융에 관한 흥미로운 사실들도 알아낼 수 있을 거예요.”
매년 기준 측정값에서 안정적인 발전이 이루어질 뿐만 아니라, 작업 모델이 수행할 수 있는 작업 유형에도 큰 변화가 있었습니다. 자주 이러한 발전은 한 달 전에도 예측하기 어려웠습니다: 2024년에는 초기 에이전트들이 단 하나의 파일도 실수 없이 작성하는 것이 인상적이었지만, 2025년에는 처음부터 완전한 코드베이스를 만들 수 있게 되었고, 2026년에는 많은 에이전트가 동시에 역동적으로 협력하여 개방적인 연구 문제에 진전을 이루게 되었습니다. “내년에는 무엇이 있을까?”라고 그는 말합니다. “정말 놀라운 전망입니다.”
