En tant que société de trading quantitatif, Jump Trading crée des modèles prédictifs qui utilisent des données de marché, les actualités et les événements, ainsi que diverses sources de données alternatives, afin de faire les meilleures prédictions possibles concernant les prix des actifs. Comme les marchés sont complexes, bruyants et en constante évolution, il est rarement possible de prévoir avec précision ce qui va se passer. Cependant, selon Lucas Baker, chef de la R&D en LLM chez Jump, prédire légèrement mieux qu’une loterie à grande échelle suffit pour que la stratégie soit efficace.
Baker dirige la recherche et le développement agentique, et il se concentre sur la création d’agents, de systèmes et d’infrastructures qui permettent aux chercheurs quantitatifs d’explorer leurs idées avec plus de profondeur et de largeur. L’ajout de GPT‑6 Astra a considérablement augmenté l’échelle et la complexité des processus qui peuvent être confiés aux agents, depuis le codage quotidien jusqu’aux études quantitatives avancées pour valider de nouvelles hypothèses.
Avec la série GPT-6, en particulier GPT-6 Astra, OpenAI a révélé une nouvelle étape d’autonomie pour les tâches à long terme qui nécessitent une coordination flexible des agents et une persistance extrême dans des processus complexes. Alors que nous devions autrefois compter sur une supervision et une intervention humaines fréquentes, nous pouvons désormais nous concentrer entièrement sur la création d’un environnement sécurisé et bien surveillé, avec des objectifs clairs, et permettre aux agents de trouver leur propre chemin.—Lucas Baker, Chef du développement des LLM, Jump Trading
Des extraits de code courts à des analyses complètes
Au cours de l’année dernière, l’IA est passée d’un outil utile pour écrire des snippets de code ponctuels ou détecter de petits bugs à un système capable et polyvalent, capable de développer des bases de code et des services entiers par lui-même. Aujourd’hui, Baker et son équipe constatent que l’IA fonctionne le mieux lorsqu’on la traite plus comme une collègue. Les chercheurs peuvent définir un problème clé, un environnement de travail et une méthode d’évaluation de la qualité et de l’importance des résultats, puis guider un ou plusieurs agents en temps réel sur où concentrer l’analyse ou quelle tâche exécuter ensuite.
Baker affirme que, avec GPT‑6 Astra, les agents sont désormais capables non seulement de trouver des changements significatifs et pratiques, mais aussi de fusionner et de combiner ces succès dans un processus d’amélioration récursive. Au cours d’une tâche longue et continue, le système peut analyser ses résultats, les évaluer en fonction des critères convenus dans la proposition initiale, et orienter activement ses efforts, sans avoir besoin qu’une personne analyse chaque cycle de changements. Comme il l’explique : « On peut définir quelque chose qui doit fonctionner pendant des jours – cela doit puiser dans de nombreuses sources de données, effectuer ces appels subtils pour déterminer ce qui est important et ce qui ne l’est pas, et interconnexer tout cela – afin de créer une analyse complète qui fonctionne réellement aujourd’hui », dit-il.
Conserver le jugement humain au centre
Jump Trading fonctionne à tous les horizons temporels et pour toutes les classes d’actifs. Chaque étape du processus est complexe, et dans une industrie fortement régulée comme la finance, les erreurs peuvent avoir des conséquences financières et de conformité. Baker affirme qu’il est essentiel de prendre conscience des risques liés à la confiance accordée à l’IA, mais que l’intelligence agentique peut également être utilisée pour améliorer la qualité, la sécurité et le suivi, plutôt que simplement pour ajouter des fonctionnalités. Un design de système robuste et des frontières claires, des contraintes évidentes, une infrastructure qui favorise la directionabilité et l’observabilité, ainsi que un examen humain des modifications, permettent à l’équipe de Jump Trading de s’assurer que les workflows alimentés par l’IA sont prêts à évoluer dans un environnement réglementé.
« Si vous disposez d’un environnement sûr où l’agent ou le système peut produire n’importe quel résultat nécessaire, mais qu’il y a également un processus de revue humaine à la fin, permettant une validation critique avec acceptation humaine, c’est cela qui nous donne confiance », dit-il. Par exemple, si un agent produit un signal de trading, il est circonscrit et examiné de la même manière que tout autre output : en tant que signal, généralement informatif mais potentiellement erroné, et intégré avec tous les autres signaux dans un environnement d'exécution strictement contrôlé et vérifié.
Quel est l’étape suivante
Baker dit qu’il pense que nous sommes en train de nous diriger vers un monde où « l’autorecherche », ou l’amélioration récursive de systèmes mesurables par les chercheurs en agents, deviendra si omniprésent qu’on le considérera simplement comme une partie intégrante du flux de travail normal d’un chercheur quantitatif. Aujourd’hui, même le projet le plus ancien de GPT‑6 Astra implique encore des vérifications régulières avec la personne qui définit la tâche – non seulement concernant les données à extraire, la durée de l’exécution et ce qui est important, mais aussi pour déterminer si les résultats intermédiaires sont cohérents. L’autorerecherche avancée commencerait toujours avec un système défini par l’humain, incluant les entrées, la définition de l’environnement, les métriques d’évaluation, les compromis et les priorités générales, mais confierait le reste du processus à une « flotte » de agents de structure souple, coordonnés par d’autres agents. Dans un pipeline de recherche bien structuré, ces agents seraient capables de prendre des décisions intelligentes concernant la manière d’explorer des idées, l’allocation du temps de calcul et l’intégration de résultats prometteurs, tout en partant d’une question ouverte.
« À quoi ressemble-t-il lorsque l’on peut mettre tout cela en ordre, poser une question générale à laquelle on ne connaît même pas la réponse, et que l’on obtient une résolution utile ? » demande-t-il. « Si vous pouvez résoudre un problème du millénaire, vous pouvez probablement aussi découvrir quelques faits intéressants sur le finance quant. »
Chaque année a apporté non seulement des progrès stables dans les mesures de référence, mais aussi des changements majeurs dans le type de tâches que les modèles pouvaient effectuer. Souvent, ces développements étaient difficiles à prévoir même un mois à l’avance : alors que, en 2024, il était impressionnant que les agents initiaux écrivent un seul fichier sans erreur, en 2025, il est devenu possible de créer des bases de code entières à partir de zéro, et en 2026, il est possible de progresser sur des questions de recherche ouvertes avec de nombreux agents collaborant dynamiquement l’un à côté de l’autre. « Qu’aurons-nous l’an prochain ? » dit-il. « C’est une perspective vraiment incroyable. »
