Como empresa de trading cuantitativo, Jump Trading crea modelos predictivos que utilizan datos del mercado, noticias y eventos, así como una serie de fuentes de datos alternativas, para hacer las predicciones más precisas posibles sobre los precios de los activos. Dado que los mercados son complejos, ruidosos y en constante cambio, es raro poder anticipar con exactitud lo que sucederá. Pero, según Lucas Baker, jefe de I+D en LLM en Jump, predecir incluso algo mejor que una apuesta al azar a gran escala es suficiente para lograr una estrategia exitosa.
Baker lidera la investigación y el desarrollo agentic, y se enfoca en construir los agentes, las herramientas y la infraestructura que permiten a los investigadores cuantitativos explorar sus ideas con mayor amplitud y profundidad. La incorporación de GPT‑6 Astra ha ampliado drásticamente la escala y la complejidad de los flujos de trabajo que pueden ser asignados a los agentes, desde el código diario hasta los estudios cuantitativos avanzados para validar nuevas hipótesis.
“Con la serie GPT-6, especialmente GPT-6 Astra, OpenAI ha logrado un nuevo nivel de autonomía para tareas de largo alcance que requieren coordinación flexible de agentes y persistencia extrema en procesos complejos. Mientras antes necesitábamos la guía e intervención frecuente de seres humanos, ahora podemos concentrarnos completamente en definir un entorno seguro y bien monitoreado con objetivos claros, permitiendo que los agentes encuentren su propio camino.”—Lucas Baker, Jefe de I+D en LLM, Jump Trading
Desde pequeños fragmentos de código hasta análisis completos
En el último año, la IA se ha transformado de una herramienta útil para escribir fragmentos de código únicos o encontrar errores pequeños, en un sistema capaz y versátil que puede desarrollar bases de código e servicios completos por sí mismo. Ahora, Baker y su equipo descubren que la IA funciona mejor cuando se trata más como un colega. Los investigadores pueden definir un problema clave, un entorno de trabajo y una forma de evaluar la calidad y la importancia de los resultados, luego guiar uno o muchos agentes en tiempo real sobre dónde concentrar el análisis o qué tarea ejecutar a continuación.
Baker dice que, con GPT‑6 Astra, los agentes ahora son capaces no solo de encontrar cambios significativos y prácticos, sino también de fusionar y acumular esos logros en un proceso de mejora recursiva. Durante una tarea larga y prolongada, el sistema puede analizar sus hallazgos, juzgarlos según los criterios acordados en la propuesta inicial y redirigir activamente sus esfuerzos, sin necesidad de que una persona analice cada ronda de cambios. Como él dice: “Se puede definir algo que debe funcionar durante días; necesita obtener datos de muchas fuentes, realizar llamadas sutiles sobre qué es importante y qué no, y relacionar todo esto entre sí; para crear un análisis completo que funcione realmente ahora”, dice.
Mantener el juicio humano en el centro
Jump Trading funciona en todo horizonte temporal y clase de activos. Cada paso del proceso es complejo, y en una industria altamente regulada como las finanzas, los errores pueden tener consecuencias tanto financieras como de cumplimiento normativo. Baker dice que es crucial conocer los riesgos que surgen al confiar el trabajo a la IA, pero también que la inteligencia agente puede aplicarse para mejorar la calidad, la seguridad y el monitoreo, no solo para agregar funciones. Diseño de sistema sólido y límites claros, restricciones definidas, infraestructura que promueve la capacidad de dirección y observabilidad, y revisión humana de los cambios ayudan al equipo de Jump Trading a garantizar que los flujos de trabajo basados en IA estén listos para escalar en un entorno regulado.
“Si existe un entorno seguro en el que el agente o el sistema puede producir cualquier resultado que necesite, pero también hay un proceso de revisión humana al final del mismo, donde se realiza una validación crítica con la aceptación humana, eso es lo que nos da confianza”, dice él. Por ejemplo, si un agente genera una señal de trading, se le da un alcance y se revisa de la misma manera que cualquier otro resultado: como una señal, generalmente informativa pero potencialmente errónea, y se integra con todas las demás señales en un entorno de ejecución estrictamente revisado y controlado.
¿Qué sigue?
Baker dice que cree que estamos en camino hacia un mundo en el que “autoresearch”, o la mejora recursiva de sistemas medibles por parte de investigadores de agentes, se volverá tan omnipresente que simplemente será considerado como parte del flujo de trabajo habitual de un investigador cuantitativo. Hoy en día, incluso el trabajo de más larga duración de GPT‑6 Astra sigue implicando controles regulares con la persona que define la tarea: no solo se trata de determinar qué datos extraer, cuánto tiempo ejecutarlo y qué es importante, sino también de verificar si los resultados intermedios tienen sentido. El autoresear avanzado seguiría comenzando con un sistema definido por humanos, que incluye entradas, definición del entorno, métricas de evaluación, compromisos y prioridades generales, pero confiaría el resto del proceso a una “fleet” de agentes de estructura laxa, coordinados por otros agentes. Dentro de una cadena de trabajo de investigación bien estructurada, estos agentes podrían tomar decisiones inteligentes sobre cómo explorar ideas, asignar tiempo de computación y integrar hallazgos prometedores, todo comenzando con algo más que una simple pregunta abierta.
“¿Cómo se ve cuando puedes resolver todo esto de forma integral, hacer una pregunta general para la que ni siquiera tú conoces la respuesta, y obtener un resultado útil?”, pregunta. “Si puedes resolver un problema del milenio, probablemente también podrás descubrir algunos hechos bastante interesantes sobre las finanzas cuantitativas.”
Cada año no solo ha traído avances constantes en las mediciones de referencia, sino también cambios significativos en el tipo de modelos de trabajo que eran capaces de realizar. A menudo, estos avances eran difíciles de predecir incluso con meses de anticipación: mientras que en 2024 se consideraba impresionante que los agentes iniciales pudieran escribir un único archivo sin errores, en 2025 se volvió posible crear bases de código completas desde cero, y en 2026 se logró avanzar en preguntas de investigación abiertas con muchos agentes colaborando dinámicamente uno al lado del otro. “¿Qué tendremos el próximo año?”, dice él. “Es una perspectiva bastante increíble”.
