Hace poco, en el SWE-bench-Live (ranking Lite), que es reconocido internacionalmente como uno de los desafíos más difíciles y que más se acerca al entorno de desarrollo real, el marco de inteligencia de código profesional TianxiCode, desarrollado por Lenovo Tianxi AI, junto con DeepSeek-v4.1-Flash, logró resultados revolucionarios: alcanzó el primer lugar a nivel mundial con una tasa de solución de problemas del 71% y fue oficialmente aprobado por la autoridad oficial.
Este logro no solo marca que el marco de entidades inteligentes de código desarrollado por Lenovo entra en la primera categoría mundial, sino que también demuestra la fuerza sólida del ecosistema Tianxi AI, que utiliza una arquitectura de ingeniería desarrollada por sí mismo para potenciar el potencial de los modelos, y que puede competir con las mejores soluciones globales en el campo de la ingeniería de software compleja. Tianxi Code es una subcapacidad de inteligencia de código desarrollada por Tianxi AI de Lenovo, centrada en la generación de código y el desarrollo de ingeniería, y en el futuro se aplicará en los productos de hardware de IA de Lenovo.
¿Cuál es el valor real de los servicios en escenarios reales? ¿Qué tan valioso es SWE-bench-Live?
A diferencia de los pruebas de código tradicionales que evalúan gramática simple o la generación de funciones individuales, SWE-bench-Live es un referente autoritativo de evaluación dinámica en el campo de la ingeniería de software a nivel mundial.
SWE-bench-Live se basa en problemas reales de proyectos GitHub, evalúa la capacidad del modelo y del agente para generar parches de código y reparar problemas, y proporciona un entorno de ejecución reproducible. En comparación con la mera evaluación de fragmentos de código, este tipo de pruebas se acerca más al proceso real de resolución de problemas en el desarrollo, y plantea requisitos complejos para la comprensión del código por parte del sistema, la localización de los problemas y la realización de las reparaciones.
Para garantizar la imparcialidad absoluta de la evaluación, SWE-bench-Live ha establecido el mecanismo de verificación “Verified”. Los proyectos participantes deben presentar las trayectorias de funcionamiento del agente en toda su cadena de proceso, y el equipo oficial los examina cuidadosamente en cuanto a la entrada de evaluación y al entorno de aislamiento de información, además de investigar exhaustivamente si existe alguna posibilidad de que se revele al agente la respuesta estándar, los casos de prueba o los resultados. TianxiCode y DeepSeek-v4.1-Flash han superado con éxito el examen y han obtenido la certificación “Verified”, lo que demuestra claramente la reproducibilidad y alta calidad de sus correcciones de código.
La arquitectura TianxiCode logra un avance significativo, liberando la capacidad de implementación a nivel de ingeniería
Si comparamos todo el sistema “TianxiCode con DeepSeek-v4.1-Flash” con un ingeniero de software, entonces DeepSeek-v4.1-Flash es el cerebro del ingeniero, responsable de leer código, comprender el significado y idear soluciones; mientras que TianxiCode es los ojos, las manos, la caja de herramientas y las normas de flujo de trabajo del ingeniero. Incluso el cerebro más inteligente, sin un par de “manos” capaces de escribir código y consultar registros, así como un hábito de trabajo riguroso, no puede resolver por sí solo los bugs en proyectos complejos.
Varias cifras de comparación en las listas confirman esto: si falta la colaboración de sistemas basados en arquitecturas de agentes inteligentes de alto nivel, incluso al llamar a modelos cerrados de primera clase, a menudo se quedan sin opciones frente a problemas técnicos reales. Esto demuestra el valor técnico de TianxiCode.
En el escenario de la ingeniería de software real, TianxiCode muestra tres capacidades técnicas de sistemas de ingeniería: búsqueda entre múltiples archivos y gestión precisa del contexto, planificación autónoma y llamadas a herramientas en múltiples rondas, así como generación de parches cerrados y autohecho por pruebas.
Recuperación con múltiples saltos entre archivos (Multi-Hop Retrieval) y gestión precisa del contexto (Context Pruning & Slicing) permiten a TianxiCode encontrar problemas de manera eficiente, como lo harían ingenieros experimentados, y localizar rápidamente las causas de los defectos en grandes repositorios de código.
El planificación autónoma y la llamada de herramientas de varias vueltas otorgan a TianxiCode la capacidad de “escribir mientras ve”: cuando se encuentra un bug, primero elabora un plan de corrección, abre activamente la línea de comandos del terminal para ejecutar pruebas, consulta los registros y compara los cambios realizados. En caso de problemas que no pueden resolverse, también puede cambiar de enfoque de manera flexible para continuar investigando, logrando así un avance autónomo.
Generación de parches de bucle cerrado (Closed-Loop Patching) y auto-corrección guiada por pruebas (Test-Driven Self-Correction) permiten que TianxiCode realice pruebas y correcciones automáticas. TianxiCode ejecutará automáticamente el código en un entorno aislado, y en cuanto detecte errores en el nuevo código o que interfiera con otras funciones, realizará inmediatamente reflexión y modificaciones, hasta que el parche sea aprobado en el proyecto.
Se puede decir que la sólida base de ingeniería desarrollada internamente por TianxiCode demuestra el poder decisivo que brinda un marco de agente inteligente en escenarios complejos de desarrollo de software real.
De los primeros lugares en la lista hacia las profundidades de la industria, Tianxi Ecosistema acelera la inclusión del AI
Como una posición clave en el área de investigación en tecnología profesional dentro de la ecología TianxiAI, TianxiCode se encuentra entre los primeros en los principales evaluaciones internacionales. No solo representa una verificación concentrada de su capacidad técnica, sino que también abre el camino para la implementación de agentes inteligentes en escenarios reales de desarrollo.
El valor final del agente inteligente de código no radica en la clasificación en una lista única, sino en distribuir los costos complejos de resolución de errores y colaboración técnica entre los desarrolladores principales. En el futuro, TianxiAI de Lenovo continuará promoviendo los logros tecnológicos de TianxiCode para convertirlos en herramientas prácticas para los desarrolladores. Con una arquitectura de agente inteligente autónoma y madura, las herramientas de código profesionales que son seguras, eficientes y realmente capaces de resolver problemas de manera autónoma, se empoderarán en profundidad en los dispositivos hardware de Lenovo.
Este artículo fue proporcionado por Lenovo, QuantumBit tiene autorización para reproducirlo, y las opiniones pertenecen al autor original.
