作为一家量化交易公司,Jump Trading 构建预测模型,利用市场数据、新闻和事件以及一系列另类数据源,对资产价格做出尽可能好的预测。由于市场复杂、充满噪音且随时间变化,很难精确预测将会发生什么。但据 Jump 的 LLM 研发负责人 Lucas Baker 说,只要在大规模上比抛硬币预测得稍微好一点,就足以带来成功的策略。
Baker 负责智能体研发,他专注于构建让量化研究人员能够更广更深地探索想法的智能体、工具框架和基础设施。引入 GPT‑6 Astra 大幅扩展了可以交给智能体的工作流的规模和复杂度,从日常编码到验证新假设的高级量化研究。
“凭借 GPT-6 系列,尤其是 GPT-6 Astra,OpenAI 为需要灵活智能体协调和在复杂工作流上极致坚持的长周期任务解锁了一个新的自主层级。过去我们需要频繁的人工指导和干预,而现在我们可以完全专注于定义一个安全且监控良好的环境,设定清晰的目标,然后让智能体自己寻找路径。”——Lucas Baker,Jump Trading LLM 研发负责人
从简短的代码片段到全面分析
在过去一年里,AI 已经从一种用于编写一次性代码片段或查找小 bug 的实用工具,转变为一个能够独立开发完整代码库和服务的多功能强大系统。如今,Baker 和他的团队发现,把 AI 更像同事一样对待时效果最好。研究人员可以定义一个关键问题、一个工作环境以及评估结果质量和意义的方法,然后实时引导一个或多个智能体将分析聚焦到哪里或接下来运行哪个任务。
Baker 说,借助 GPT‑6 Astra,智能体现在不仅能够找到有意义且实用的改动,还能在递归改进的过程中将这些成果合并和叠加起来。在一次长时间运行的任务中,系统可以分析其发现,依据初始提案中商定的标准进行评判,并主动调整其工作方向,而不需要人来分析每一轮改动。正如他所说:“你可以定义一个需要运行数天的任务——它需要从多个数据源提取信息,需要对什么是重要的、什么不重要做出微妙判断,还需要将所有内容相互关联——从而创建一个现在真正可行的全面分析。”他说。
将人类判断置于核心
Jump Trading 涉及所有时间跨度和资产类别。流程的每一步都很复杂,而在金融这样的高度受监管行业中,错误可能带来财务和合规两方面的后果。Baker 说,认识到将工作委托给 AI 所产生的风险至关重要,但智能体智能也可以用于提升质量、安全性和监控,而不仅仅是增加功能。强大的系统设计与边界、清晰的约束、促进可操控性和可观测性的基础设施,以及对改动的人工审核,帮助 Jump Trading 团队确保 AI 驱动的工作流在受监管环境中可以扩展。
“如果你有一个安全的环境,智能体或系统可以自由产生它需要的任何输出,但在末端还有一个关键验证和人工验收的人工审核流程,这就是给我们信心的原因。”他说。例如,如果智能体产生一个交易信号,它会像任何其他输出一样被限定范围并接受审核:作为一个信号,通常有参考价值但可能有误,并融入经过严格审核和控制的执行环境中的所有其他信号。
下一步是什么
Baker 说,他认为我们正在走向一个“自动化研究”(autoresearch)——即由智能体研究员对可度量系统进行递归改进——变得如此普遍以至于被视为量化研究人员日常工作流程一部分的世界。如今,即使是 GPT‑6 Astra 运行时间最长的任务,仍需要与定义任务的人定期沟通——不仅涉及提取哪些数据、运行多长时间、什么算重要,还涉及中间结果是否合理。高级自动化研究仍会从一个由人类定义的系统开始,包括输入、环境定义、评估指标、权衡取舍和总体优先级,但会将其余流程交给一个松散结构的“智能体集群”,这些智能体本身由其他智能体协调。在一个结构良好的研究流水线中,这些智能体将能够就如何探索想法、分配算力时间以及整合有前景的发现做出智能决策,而这一切只需从一个开放性问题开始。
“当你能将这一切端到端地串联起来,提出一个连你自己都不知道答案的一般性问题,并得到一个有用的结果时,那会是什么样子?”他问道。“如果你能解决一个千禧年大奖难题,你可能也能发现一些关于量化金融的非常有趣的事实。”
每一年不仅带来了基准测试成绩的稳步提升,也带来了模型所能执行的工作类型的阶跃式变化。这些进展往往即使在几个月前也难以预测:在2024年,早期智能体能够不出错地编写单个文件就被认为令人印象深刻,而在2025年,已经可以从零开始创建完整的代码库,到了2026年,则可以借助多个智能体动态协同并肩工作,在开放性研究问题上取得进展。“明年我们又会有什么?”他说,“这是一个相当不可思议的前景。”
