Récemment, dans le test de performance de génie logiciel SWE-bench-Live (classe Lite), reconnu internationalement pour sa difficulté maximale et son similitude avec les environnements de développement réels, le cadre intelligent de code professionnel TianxiCode, développé par Lenovo Tianxi AI, en collaboration avec DeepSeek-v4.1-Flash, a obtenu des résultats remarquables : il occupe la première place mondiale avec une taux de résolution de problèmes de 71% et a été officiellement approuvé par l’organisation.
Cet résultat marque non seulement que le cadre de l’agent intelligent de code développé par Lenovo entre dans la première étape mondiale, mais montre également les capacités solides de l’écosystème Tianxi AI, qui exploite l’architecture de développement technique pour libérer le potentiel des modèles, et sa capacité à rivaliser avec les meilleurs solutions mondiales dans le champ de compétition des ingénieries logicielles complexes. Tianxi Code est une sous-compétence d’intelligence de code développée par Tianxi AI de Lenovo, axée sur la génération de code et le développement technique, et sera utilisée à l’avenir dans les produits matériels AI de Lenovo.
Scénario réel de service, quel est le niveau de valeur de SWE-bench-Live ?
Contrairement aux tests de code traditionnels qui évaluent simplement la grammaire ou la génération de fonctions unique, SWE-bench-Live est un standard d’évaluation dynamique autoritaire dans le domaine du génie logiciel mondial.
SWE-bench-Live se base sur les problèmes rencontrés dans des projets GitHub réels, évalue la capacité des modèles et des agents intelligents à générer des correctifs de code et à corriger les bugs, et fournit un environnement d’exécution reproductible. Contrairement à l’évaluation se limitant à la génération de fragments de code, ces tests mettent davantage en relation avec le processus réel de résolution des problèmes dans le développement, et posent des exigences complètes concernant la compréhension du code par le système, la localisation des problèmes et la réalisation des corrections.
Pour garantir une impartialité absolue dans les évaluations, SWE-bench-Live a établi un mécanisme de vérification « Verified ». Les solutions participantes doivent soumettre les trajectoires d’exécution des agents intelligents sur l’ensemble du flux, et sont strictement examinées par l’équipe officielle en ce qui concerne les entrées d’évaluation et l’environnement de séparation des informations. Une vérification approfondie est également effectuée pour déterminer s’il existe une possibilité de divulgation des réponses standard, des tests de cas ou des résultats aux agents intelligents. TianxiCode et DeepSeek-v4.1-Flash ont réussi l’examen et ont obtenu la certification « Verified », ce qui prouve pleinement la reproductibilité et la qualité de leurs corrections de code.
L'architecture TianxiCode fait des avancées remarquables, libérant des capacités de mise en œuvre au niveau de l'ingénierie
Si l’ensemble du système « TianxiCode avec DeepSeek-v4.1-Flash » est comparé à un ingénieur logiciel, alors DeepSeek-v4.1-Flash est le cerveau de l’ingénieur : il est responsable de la lecture du code, de la compréhension du sens et de l’élaboration des solutions ; tandis que TianxiCode constitue les yeux, les mains, l’équipement et les normes de workflow de l’ingénieur. Même un cerveau très intelligent ne peut pas résoudre seul les bugs dans des projets complexes sans une paire de mains capables de taper le code et d’analyser les logs, ni sans des habitudes de travail rigoureuses.
Plusieurs données comparatives des classements confirment ce point : sans la coordination de systèmes basés sur une architecture d’intelligence artificielle de niveau supérieur, même en appelant les modèles fermés de haut niveau, on est souvent impuissant face aux problèmes techniques réels. Tout cela témoigne de la valeur technologique de TianxiCode.
Dans le contexte de l'ingénierie logicielle réelle, TianxiCode manifeste trois capacités systémiques majeures : la recherche multi-fichiers avec de nombreux déplacements et la gestion précise du contexte, l'planification auto-animée et les appels multiples à des outils, ainsi que la génération de correctifs en boucle fermée et la réparation automatique guidée par le test.
Recherche multi-hop et gestion de contexte précise (Context Pruning & Slicing) permettent à TianxiCode de trouver les problèmes comme un ingénieur expérimenté, afin de localiser rapidement la cause des défauts dans de grandes bibliothèques de code.
Le planification autonome et la appelation multiple de outils donnent à TianxiCode l’habitude de “coder tout en regardant” comme un programmeur réel : lorsqu’un bug se présente, il établit d’abord un plan de correction, ouvre activement la ligne de commande du terminal pour exécuter des tests, consulte les journaux et compare les modifications. En cas de problème insoluble, il change également de stratégie pour continuer à investiguer, permettant ainsi une progression autonome.
Génération de patchs en boucle fermée (Closed-Loop Patching) et auto-correction guidée par les tests (Test-Driven Self-Correction) permettent à TianxiCode de se tester et de corriger lui-même. TianxiCode exécute automatiquement le code dans un environnement isolé, et dès qu’un nouveau code produit des erreurs ou endommage d’autres fonctionnalités, il effectue immédiatement une réflexion et une modification, jusqu’à ce que le patch soit approuvé par le projet.
On peut dire que le socle de développement indépendant solide de TianxiCode montre la force décisive d’un cadre d’intelligence artificielle puissant dans les scénarios complexes de développement de logiciels réels.
De la première place des classements vers les profondeurs de l'industrie, Tianxi Ecology accélère l'accessibilité de l'IA
En tant que position clé de recherche dans le domaine des technologies professionnelles au sein de l’écosystème TianxiAI, TianxiCode se classe parmi la première catégorie lors des tests internationaux de haut niveau. Ce n’est pas seulement une vérification concentrée de sa capacité technique, mais aussi un chemin ouvert pour l’implémentation des intelligences dans des scénarios de développement réels.
La valeur finale des agents intelligents de code ne réside pas dans la position dans un classement unique, mais dans le fait de réduire les coûts lourds liés aux problèmes de correctifs et à la collaboration technique pour les développeurs. À l’avenir, TianxiCode AI de Lenovo continuera d’amener les résultats technologiques de TianxiCode vers des outils pratiques pour les développeurs. Grâce à une architecture d’agent intelligent autonome et mature, des outils de code professionnels sûrs, efficaces et véritablement capables de résoudre les problèmes de manière autonome seront intégrés en profondeur dans les appareils matériels de Lenovo.
Cet article est fourni par Lenovo, QuantuBit a obtenu l’autorisation de le reproduire, les opinions appartiennent à l’auteur original.
