¡Convertimos los problemas matemáticos de @OpenAI en entornos de RL de código abierto en @huggingface!
Primitivo y tosco (el verificador solo acepta la formulación original exacta, por lo que una prueba equivalente todavía puede obtener un puntaje de 0), pero así es como se ve cuando una publicación de investigación se convierte en una infraestructura de entrenamiento ejecutable para todos.
¡Esta es una dirección emocionante, en mi opinión! Convertir la investigación abierta en entornos ejecutables abiertos, que cualquiera pueda crear para entrenar modelos abiertos mejor.
https://huggingface.co/datasets/FineEnvs/openai-math

