最近、国際的に認められた最も難易度が高く、実際の開発環境に最も近いソフトウェアエンジニアリング評価SWE-bench-Live(Lite分榜)において、聯想天禧AIが独自に開発した専門コードインテリジェントフレームワークTianxiCodeとDeepSeek-v4.1-Flashが画期的な成果を収めました。71%の問題解決率で世界第1位を獲得し、正式に公式の審査を通過しました。
この成果は、聯想が自社開発のコードインテリジェントアーキテクチャフレームワークを国際トップレベルに引き上げたことを示すだけでなく、天禧AIエコシステムが自社開発のエンジニアリングアーキテクチャによってモデルの潜在能力を駆動し、複雑なソフトウェアエンジニアリングの競争場で世界トップクラスのソリューションと対等に戦えるというハードコアな力を示しています。Tianxi Codeは、聯想天禧AIが焦点を当てるコード生成やエンジニアリング開発に関するコードインテリジェントのサブ能力であり、将来的には聯想AIハードウェア製品に応用される予定です。
実際のサービスシナリオにおいて、SWE-bench-Liveの価値はどれほどか?
単純な文法や単一関数生成のコードテストをテストする従来の方法とは異なり、SWE-bench-Liveは現在、世界のソフトウェアエンジニアリング分野における権威ある動的評価基準です。
SWE-bench-Liveは、実際のGitHubプロジェクトにおける問題を基に、モデルとスマートアイテムがコードパッチを生成し、問題を修正する能力を評価します。また、再現可能な実行環境も提供しています。単なるコードセグメントの生成をテストするのではなく、このような評価は実際の開発中に発生する問題処理プロセスにより近いため、システムがコードを理解し、問題を特定し、修正を完成させるための総合的な要求が求められます。
評価の絶対的な公正を保証するため、SWE-bench-Live公式は「Verified」検証メカニズムを設けました。参加するプランは、全チェーンを通じたスマートアイドルの運行軌跡(Trajectories)を提出する必要があり、公式チームが評価入力や情報隔離環境を厳格に審査し、スマートアイドルに標準答え、テストケース、または結果を漏洩する可能性があるかを徹底的に調査します。TianxiCodeとDeepSeek-v4.1-Flashは審査を合格し、「Verified」認証を獲得しました。これは、そのコード修正の成果が再現可能であり、高い価値があることを十分に証明しています。
TianxiCodeアーキテクチャの突破により、エンジニアリングレベルの実装能力が発揮される
「TianxiCode配合DeepSeek-v4.1-Flash」という全体システムをソフトウェアエンジニアに例えるなら、DeepSeek-v4.1-Flashはエンジニアの脳であり、コードを読み、意味を理解し、解決策を考える役割を担います。一方、TianxiCodeはエンジニアの目、手、ツールキット、そして作業プロセスの規範です。どんなに賢い脳でも、コードを打ったりログを調べたりできる「手」や厳格な作業習慣がなければ、複雑な実際のプロジェクトでBugを単独で解決することはできません。
多くのランキング比較データがこれを証明している。最上位のスマートアーキテクチャを持つシステムの連携がなければ、最高級の閉源モデルを呼び出しても、実際の工学問題に対してはしばしば無力である。これらはTianxiCodeの技術の価値を証明するものである。
実際のソフトウェアエンジニアリングのシナリオにおいて、TianxiCodeはファイル間の複数回の検索や正確なコンテキスト管理、自己駆動型計画策定と複数回のツール呼び出し、閉ループパッチ生成とテスト駆動型自己修復という3つのシステム工学能力を発揮します。
ファイル間の複数回の遷移検索(Multi-Hop Retrieval)と正確なコンテキスト管理(Context Pruning & Slicing)により、TianxiCodeは経験豊富なエンジニアのように問題の背景を探り、大規模なコードライブラリ内で欠陥の原因を迅速に特定することができる。
自律的計画策定(Autonomous Planning)と複数回のツール呼び出し(Multi-turn Tool Calling)により、TianxiCodeは実際のプログラマーのように「見ながら作業」することができる。バグに遭遇するとまずトラブル対処計画を立て、端末コマンドラインを開いてテストを実行したり、ログを確認したり、変更記録を比較したりする。解決できない問題に直面すると、柔軟に考え方を変えて調査を続け、自律的に進めていく。
閉環パッチ生成(Closed-Loop Patching)とテスト駆動型自己修正(Test-Driven Self-Correction)により、TianxiCodeは自動的にテストし、自己修正することができる。TianxiCodeは自動的に隔離された環境でコードを実行し、新しいコードにエラーが発生したり他の機能が破損したりすると、即座に自己反省と修正を行い、パッチがプロジェクトの検査を通過するまで続ける。
TianxiCodeのしっかりした自社開発の基盤は、複雑な実世界のソフトウェア開発環境において、強力なインテリジェントアームフレームワークがもたらす決定的な力を示しています。
ランキング上位から産業の深みへと進出、天禧エコロジーはAIの普及を加速する
天禧AIエコシステムとしての専門技術分野における重要な研究展開として、TianxiCodeは今回の国際トップレベルの評価で第一級のグループに入りました。これは技術力の集中的な検証であるだけでなく、スマートアイデアが実際の研究開発環境で実用化される道を開くものです。
コードインテリジェントアバターの最終的な価値は、単一のランキングにありません。第一線の開発者が負う重い障害解決とエンジニアリングの協力コストを軽減することにあります。今後、レノボ・ティエンシーAIは、TianxiCodeの技術成果を実際の開発者向けツールチェーンへと還元し続けます。成熟した自主的なインテリジェントアバターアーキテクチャに依存して、安全で効率的かつ真に自律的な問題解決能力を持つ専門コードツールを、レノボのハードウェア機器に深く活用します。
本文は聯想が提供し、量子位が許可を得て転載したもので、意見は原作者に帰属します。
