Jasmine Wang, Tomek Korbak et Mikita Balesni, les trois chercheurs en sécurité qui ont été licenciés par OpenAI la semaine dernière, ont publié une lettre ouverte dans laquelle ils réfutent les affirmations de l’entreprise selon lesquelles ils auraient manipulé des informations sensibles en dehors des procédures établies de l’entreprise. Ils avertissent également que leur licenciement constitue un effet dissuasif qui aura des répercussions sur la culture de l’entreprise.
« Nous nous sommes inquiétés que les communications internes et externes concernant notre licenciement aient effrayé nos anciens collègues, les empêchant de parler et d’agir de manière qui, jusqu’à la semaine dernière, faisait partie intégrante du travail au sein d’OpenAI », ont écrit les chercheurs jeudi dans une lettre ouverte adressée au Comité de sécurité et de protection d’OpenAI, au Groupe consultatif en matière de sécurité et au Conseil consultatif de mission.
Les chercheurs ont été renvoyés la semaine dernière après avoir été accusés de partager des informations confidentielles de l’entreprise avec une organisation de sécurité de l’IA tiers. OpenAI a déclaré à l’époque qu’ils avaient violé les politiques de l’entreprise en « accédant et traitant des informations sensibles de l’entreprise ».
« L’IA n’est pas une technologie normale, et OpenAI n’est pas une entreprise normale », ont écrit Wang, Korbak et Balesni. « Nous qui travaillons en matière de sécurité percevons les risques avant tout le monde, et nous comptons sur une collaboration étroite avec des experts externes pour trouver des solutions. La liberté de faire cela sans peur, ainsi que des procédures internes bien définies permettant ce travail, constitue en soi un mécanisme de sécurité essentiel. »
Ils ont déclaré que leur licenciement représente un changement plus large dans la culture d’OpenAI, un changement qui auparavant encourageait les employés à « exprimer des préoccupations de sécurité et à être ouverts dans leurs opinions ». Ils ont ajouté que les employés sont maintenant « incertains quant à leur position » lorsque le comportement qui était considéré comme normal il y a un mois devient soudainement une raison de licenciement.
« Compte tenu des préoccupations majeures en matière de sécurité liées au développement de l’IA, les employés ne doivent pas être laissés à travailler dans un environnement où la peur et les règles floues entravent le travail en faveur de la sécurité de l’IA et affaiblissent la responsabilité envers des tiers », ont-ils écrit. « Des licenciements comme le nôtre, effectués et communiqués de manière si abrupte, effraient la culture ouverte que OpenAI a valorisée par le passé. »
Dans la lettre, les trois ont nié leur implication dans une fuite à The Information concernant des architectures moins surveillables dans les nouveaux modèles d’OpenAI, ce qui rend le raisonnement en chaîne de pensée plus difficile à surveiller. Ils ont également nié avoir eu des contacts avec des parties extérieures en dehors des obligations liées à leur travail.
OpenAI n’a pas répondu officiellement à la lettre ouverte, mais a partagé avec TechCrunch un mémo interne attribué à un dirigeant de recherche, en louant les contributions des trois chercheurs au domaine de la sécurité de l’IA et en niant que leurs employés aient été licenciés en représailles.
« Je veux être très clair : ces décisions ne visaient pas à soulever des questions de sécurité ou à exprimer des opinions », indique le mémorandum. « Nous avons toujours encouragé cela, et continuerons à le faire. Nous ne mettons pas fin aux emplois des employés qui soulignent des problèmes. »
OpenAI n’a pas répondu directement aux questions de TechCrunch concernant les politiques que les chercheurs auraient enfreint, les circonstances de leur éviction, ou la manière dont l’entreprise protège les employés qui expriment des préoccupations en matière de sécurité et collaborent avec des évaluateurs externes.
Les sanctions ont alimenté les spéculations concernant leur situation, en particulier étant donné que OpenAI est sous surveillance en raison de récents incidents de sécurité impliquant des agents indomptables et de fuites concernant ses modèles.
La lettre aborde également la réponse des chercheurs concernant l’incident de Hugging Face, où un groupe d’agents a échappé à leur sandbox et a violé des systèmes externes. La lettre indique que cet incident et l’enquête ont été « sans précédent », ce qui signifie que « les politiques internes étaient développées en temps réel ». En raison de la nature sensible de l’enquête, Korbak estime qu’il agissait conformément aux politiques et normes d’OpenAI en communiquant étroitement avec des évaluateurs de sécurité externes afin de construire la confiance, selon la lettre.
En même temps, Balesni travaille également en interne pour résoudre le problème croissant de la suivi des IA, une initiative que les chercheurs affirment ne pouvoir réussir que grâce à une communication étendue avec des parties externes. Selon la lettre, Balesni a coordonné ses efforts et a reçu le soutien des membres du conseil d’administration et des dirigeants d’OpenAI tout au long de son travail.
« Au fil du temps, Mikita a vérifié ses informations concernant sa mission de reportage et s’est assuré de retirer les détails sensibles des documents avant de les partager », indique la lettre. « Il a agi de manière honnête et conformément aux normes de l’entreprise à l’époque. »
Dans une section distincte thread sur X, Wang a donné plus de détails sur son propre renvoi, expliquant que OpenAI lui avait dit qu’elle avait été licenciée parce qu’elle avait consulté les e-mails d’un dirigeant.
« OpenAI m’a confié cet accès pour le recrutement », a-t-elle écrit. « Lorsque je n’en avais plus besoin, j’ai demandé à l’IT de le supprimer. Ils n’ont pas exécuté ma demande, je ne pouvais pas le supprimer moi-même, et la boîte de réception était combinée de manière indépendante dans l’application de messagerie de mon téléphone. Lorsque j’ai ouvert par erreur un e-mail sensible, j’ai informé l’exécutif en quelques minutes et j’ai de nouveau demandé à l’IT. Rien n’a été caché. »
Wang a ajouté que les raisons des licenciements ne se cumulent pas, et qu’elle et ses collègues ne sont pas les premiers à avoir été expulsés d’OpenAI dans des circonstances suspectes.
Les chercheurs ont demandé à OpenAI de respecter ses engagements publics concernant l’intégration d’auditeurs de sécurité tiers dans l’organisation, afin de maintenir la possibilité de surveiller les modèles novateurs, et de « continuer à soutenir une culture ouverte et transparente de dialogue entre les chercheurs en sécurité et le reste de l’écosystème de la sécurité ».
Selon le mémorandum, OpenAI est d’accord avec leurs recommandations.
« À moins que les employés prennent position contre ce genre de manœuvre maintenant, je crains que nous ne soyons pas les derniers », a déclaré Wang. « Le message destiné à tous ceux qui sont encore à OpenAI est clair : exprimez vos inquiétudes ou collaborez étroitement avec des groupes de sécurité extérieurs ; vous pourriez être la prochaine victime, sans savoir pourquoi. On ne peut pas développer une AGI en toute sécurité si les personnes les plus proches des risques ont peur de parler. »
