量子位

Lenovo Tianxis selbst entwickelter Code-Agent TianxiCode erringt den weltweiten ersten Platz auf SWE-bench-Live

Der von Lenovo Tianxi AI selbst entwickelte professionelle Code-Agent-Rahmen TianxiCode erreicht mit einer Problemlösungsquote von 71% den weltweiten ersten Platz

Bildquelle · 量子位

Kürzlich erzielte der von Lenovo Tianxi AI selbst entwickelte professionelle Code-Agent-Rahmen TianxiCode in Kombination mit DeepSeek-v4.1-Flash im international anerkannten, anspruchsvollsten und der realen Entwicklungsumgebung am nächsten kommenden Software-Engineering-Benchmark SWE-bench-Live (Lite-Teilwertung) ein bahnbrechendes Ergebnis: mit einer71%Problemlösungsquote belegte er den weltweiten ersten Platz und hat die offizielle Prüfung offiziell bestanden.

Dieses Ergebnis markiert nicht nur den Einzug des selbst entwickelten Code-Agent-Rahmens von Lenovo in die internationale Spitzengruppe, sondern zeigt auch die hardwarenahe Stärke der Tianxi-AI-Ökoystems, modelleigenes Potenzial durch eine eigenentwickelte Engineering-Architektur auszuschöpfen und auf dem Wettkampffeld komplexer Software-Engineering-Aufgaben mit den weltweit führenden Lösungen zu konkurrieren. Tianxi Code ist die auf Codegenerierung und Engineering-Entwicklung fokussierte Code-Intelligenz-Teilfähigkeit von Lenovo Tianxi AI und wird künftig in Lenovos AI-Hardwareprodukten zum Einsatz kommen.

Im Dienst realer Szenarien: Wie hoch ist der Stellenwert von SWE-bench-Live?

Anders als herkömmliche Code-Tests, die einfache Syntax oder die Generierung einzelner Funktionen prüfen, ist SWE-bench-Live derzeit die autoritative dynamische Bewertungsgrundlage im weltweiten Software-Engineering-Bereich.

SWE-bench-Live basiert auf echten Issues aus GitHub-Projekten, bewertet die Fähigkeit von Modellen und Agenten, Code-Patches zu generieren und Probleme zu beheben, und stellt eine reproduzierbare Ausführungsumgebung bereit. Im Vergleich zur bloßen Prüfung der Generierung von Codeausschnitten kommen solche Bewertungen dem tatsächlichen Problemlösungsprozess in der echten Entwicklung näher und stellen umfassende Anforderungen an das Verständnis von Code, die Lokalisierung von Problemen und die Durchführung von Korrekturen.

Um die absolute Fairness der Bewertung sicherzustellen, hat SWE-bench-Live einen „Verified“-Verifizierungsmechanismus eingerichtet. Teilnehmende Lösungen müssen die vollständige Laufspur (Trajectories) des Agenten einreichen; das offizielle Team prüft streng die Bewertungseingaben und die Isolationsumgebung der Informationen und untersucht gründlich, ob Standardantworten, Testfälle oder Ergebnisse an den Agenten durchsickern könnten. TianxiCode und DeepSeek-v4.1-Flash haben die Prüfung erfolgreich bestanden und die „Verified“-Zertifizierung erhalten, was die Reproduzierbarkeit und den hohen Stellenwert ihrer Code-Korrekturergebnisse eindrucksvoll belegt.

Architektonischer Durchbruch von TianxiCode: Freisetzung engineeringfähiger Umsetzungskraft

Vergleicht man das Gesamtsystem „TianxiCode in Kombination mit DeepSeek-v4.1-Flash“ mit einem Softwareingenieur, dann ist DeepSeek-v4.1-Flash das Gehirn des Ingenieurs, das für das Lesen von Code, das Verstehen der Semantik und das Entwerfen von Lösungen zuständig ist; TianxiCode hingegen sind die Augen, Hände, der Werkzeugkasten und die Arbeitsabläufe des Ingenieurs. Selbst das klügste Gehirn kann ohne ein Paar „Hände“, die Code tippen und Logs prüfen, und ohne gewissenhafte Arbeitsgewohnheiten in komplexen realen Engineering-Projekten Bugs nicht eigenständig beheben.

Vergleichsdaten aus mehreren Bewertungen bestätigen dies: Ohne die systemische Koordination einer übergeordneten Agentenarchitektur sind selbst Top-Proprietärmodelle bei echten Engineering-Problemen oft machtlos. Dies zeigt eindrucksvoll den technischen Wert von TianxiCode.

In realen Software-Engineering-Szenarien zeigt TianxiCode drei systemische Engineering-Fähigkeiten: dateiübergreifende Multi-Hop-Suche mit präzisem Kontextmanagement, selbstgesteuerte Planung mit mehrstufigen Tool-Aufrufen sowie geschlossene Patch-Generierung mit testgetriebener Selbstheilung.

Die dateiübergreifende Multi-Hop-Suche (Multi-Hop Retrieval) und das präzise Kontextmanagement (Context Pruning & Slicing) ermöglichen es TianxiCode, wie ein erfahrener Ingenieur dem Faden folgend Probleme aufzuspüren und in großen Codebasen schnell die Grundursache eines Defekts zu lokalisieren.

Selbstgesteuerte Planung (Autonomous Planning) und mehrstufige Tool-Aufrufe (Multi-turn Tool Calling) verleihen TianxiCode die Fähigkeit, wie ein echter Programmierer „beim Lesen zu tippen“: Bei einem Bug erstellt es zunächst einen Fehlerbehebungsplan, öffnet aktiv das Terminal, um Tests auszuführen, Logs zu durchsuchen und Änderungshistorien zu vergleichen. Wenn ein Problem nicht lösbar ist, wechselt es flexibel den Ansatz und setzt die Fehlersuche fort – ein autonomes Vorantreiben.

Geschlossene Patch-Generierung (Closed-Loop Patching) und testgetriebene Selbstkorrektur (Test-Driven Self-Correction) ermöglichen es TianxiCode, sich selbst zu testen und zu korrigieren. TianxiCode führt den Code automatisch in einer isolierten Umgebung aus; sobald neuer Code Fehler verursacht oder andere Funktionen beeinträchtigt, reflektiert und korrigiert es sich sofort, bis der Patch die Projektabnahme besteht.

Man kann sagen: TianxiCodes solides, eigenentwickeltes Engineering-Fundament zeigt die entscheidende Kraft, die ein leistungsstarker Agentenrahmen in komplexen realen Software-Entwicklungsszenarien entfaltet.

Von der Spitze der Ranglisten in die Tiefe der Industrie: Das Tianxi-Ökosystem beschleunigt die demokratisierende Verbreitung von KI

Als eine zentrale Forschungs- und Entwicklungsoffensive des Tianxi-AI-Ökosystems im professionellen Technologiefeld bedeutet der Einzug von TianxiCode in die Spitzengruppe dieses internationalen Top-Benchmarks nicht nur eine gebündelte Validierung der technologischen Stärke, sondern ebnet auch den Weg für die Umsetzung von Agenten in realen Entwicklungsszenarien.

Der eigentliche Wert von Code-Agenten liegt nicht in der Platzierung in einzelnen Ranglisten, sondern darin, Entwicklern an der Basis die aufwendige Fehlersuche und die Kosten der Engineering-Kollaboration abzunehmen. Künftig wird Lenovo Tianxi AI die technologischen Ergebnisse von TianxiCode kontinuierlich in die tatsächlichen Werkzeugketten der Entwickler einfließen lassen und sich auf die ausgereifte autonome Agentenarchitektur stützen, um professionelle Code-Werkzeuge, die sicher, effizient und tatsächlich zur eigenständigen Problemlösung befähigt sind, tiefgreifend in Lenovos Hardware-Geräte zu integrieren.

Dieser Artikel wurde von Lenovo bereitgestellt; QbitAI hat ihn mit Genehmigung nachgedruckt. Die Meinungen liegen beim Originalautor.

Originalquelle

量子位

Hinweise zum Inhalt

Originalveröffentlichung und Rechte liegen bei der Quelle.

Maschinelle Übersetzung · Original beachten