量子位

연상이 천희 자체 개발 코드 스마트체 TianxiCode가 SWE-bench-Live 글로벌 1위를 차지함

연상정신AI가 자체 개발한 전문 코드 지능형 프레임워크 티안시코드는 71%의 문제 해결률로 세계 최고 수준을 기록했다

이미지 출처 · 量子位

최근, 국제적으로 가장 어렵고 실제 개발 환경에 가장 가까운 소프트웨어 엔지니어링 평가 SWE-bench-Live(Lite 분榜)에서 레노버 탄시 AI가 자체적으로 개발한 전문 코드 스마트체 프레임 TianxiCode와 DeepSeek-v4.1-Flash가 획기적인 성과를 거두었습니다: 71%의 문제 해결률로 세계 1위를 차지했으며, 공식 심사를 통과했습니다.

이 성과는 레노버 자체 개발 코드 지능형 프레임워크가 국제적인 최고 수준에 도달했음을 보여주는 것뿐만 아니라, 타이신AI 생태계가 자체 개발 엔지니어링 아키텍처를 통해 모델의 잠재력을 발휘하고 복잡한 소프트웨어 엔지니어링 경기장에서 세계 최고급 솔루션과 경쟁할 수 있는 강력한 역량을 보여줍니다. 타이신 코드는 레노버 타이신AI가 코드 생성 및 엔지니어링 개발에 중점을 둔 코드 지능의 하위 능력으로, 향후 레노버 AI 하드웨어 제품에 적용될 예정입니다.

실제 서비스 환경에서 SWE-bench-Live의 가치는 얼마나 될까?

단순한 문법이나 단일 함수 생성의 전통적인 코드 테스트와는 달리, SWE-bench-Live는 현재 세계 소프트웨어 공학 분야의 권위 있는 동적 평가 기준입니다.

SWE-bench-Live는 실제 GitHub 프로젝트의 문제를 기반으로 모델과 스마트알고리즘이 코드 패치 생성 및 수정 능력을 평가하며, 재현 가능한 실행 환경을 제공합니다. 단순한 코드 조각 생성 테스트보다 이러한 평가 방식은 실제 개발 중 발생하는 문제 처리 과정에 더 가깝습니다. 이로 인해 시스템이 코드를 이해하고 문제를 찾아내며 수정을 완료하는 데 대한 종합적인 요구사항이 제시됩니다.

평가의 절대적 공정성을 보장하기 위해 SWE-bench-Live 공식은 “Verified” 검증 메커니즘을 마련했습니다. 평가 대상 솔루션은 전체 라인의 스마트 아티스트 운행 궤적(Trajectories)을 제출해야 하며, 공식 팀이 입력 데이터와 정보 격리 환경을 엄격히 검토하고, 스마트 아티스트에 표준 답변, 테스트 케이스 또는 결과가 유출될 가능성을 철저히 점검합니다. TianxiCode와 DeepSeek-v4.1-Flash는 심사를 통과하여 “Verified” 인증을 받았으며, 이는 그들의 코드 수정 성과의 재현 가능성과 높은 가치를 충분히 입증했습니다.

티안시코드 아키텍처의 혁신으로, 엔지니어링 수준의 실제 적용 능력이 발휘됩니다

“TianxiCode와 DeepSeek-v4.1-Flash” 전체 시스템을 소프트웨어 엔지니어에 비유한다면, DeepSeek-v4.1-Flash는 엔지니어의 뇌로서 코드를 읽고 의미를 이해하며 해결책을 구상하는 역할을 합니다. 반면 TianxiCode는 엔지니어의 눈, 손, 도구 상자 및 작업 프로세스 규칙입니다. 아무리 똑똑한 뇌도 코드를 입력하고 로그를 확인할 수 있는 “손”과 엄격한 작업 습관이 없다면 복잡한 실제 프로젝트에서 버그를 혼자서 해결할 수 없습니다.

여러 목록 비교 데이터가 이를 입증합니다. 최상위 지능체 아키텍처의 협력이 없는 시스템에서는, 최고급 폐쇄형 모델을 호출하더라도 실제 엔지니어링 문제에 직면했을 때 종종 어찌할 수 없게 됩니다. 이러한 사실들은 TianxiCode의 기술적 가치를 증명합니다.

실제 소프트웨어 엔지니어링 환경에서 TianxiCode는 파일 간의 다중 이동 검색 및 정확한 컨텍스트 관리, 자체 구동형 계획 및 여러 단계의 도구 호출,闭环 패치 생성 및 테스트 드라이브 자가 치유 등 세 가지 시스템 공학적 능력을 보여줍니다.

파일 간 다중 홉 검색(Multi-Hop Retrieval)과 정확한 컨텍스트 프린싱 및 슬라이싱(Context Pruning & Slicing)을 통해 TianxiCode는 숙련된 엔지니어처럼 문제의 근원을 찾아내고, 대규모 코드 라이브러리에서 결함의 원인을 빠르게 파악할 수 있습니다.

자율적 계획 수립(Autonomous Planning)과 다단계 도구 호출(Multi-turn Tool Calling)이 TianxiCode에게 실제 프로그래머처럼 "보면서 작성하는" 능력을 부여합니다. 버그가 발생하면 먼저 문제 해결 계획을 작성하고, 터미널 명령어를 열어 테스트를 실행하거나 로그를 살펴보고 수정 기록을 비교합니다. 해결할 수 없는 문제에 부딪히면 유연하게 다른 접근 방식을 시도하여 진단을 계속 진행하며 자율적으로 문제를 해결합니다.

닫힌 루프 패치 생성(Closed-Loop Patching) 및 테스트 주도 자가 수정(Test-Driven Self-Correction)을 통해 TianxiCode는 자체 테스트와 자가 수정을 할 수 있습니다. TianxiCode는 자동으로 격리 환경에서 코드를 실행하며, 새로운 코드에 오류가 발생하거나 다른 기능이 손상될 경우 즉시 자기 성찰과 수정을 진행하여 패치가 프로젝트 검수를 통과할 때까지 이를 유지합니다.

TianxiCode의 견고한 자체 개발 엔진 기반은 복잡한 실제 소프트웨어 개발 환경에서 강력한 지능형 아키텍처가 가져오는 결정적인 힘을 보여줍니다.

순위 상위에서 산업의 깊은 곳으로 나아가는 천희 생태, AI 보급을 가속화하다

천희AI 생태계의 전문 기술 분야에서 중요한 연구 배치로서, 천시코드는 이번 국제 최고급 평가에서 1위 그룹에 속했습니다. 이는 기술적 역량의 집약된 증명일 뿐만 아니라, 스마트 아티브가 실제 연구 개발 환경에서 실제로 활용될 수 있는 길을 열어주었습니다.

코드 스마트체의 최종 가치는 단일 순위에서 나오는 것이 아니라, 개발자들이 직면하는 복잡한 문제 해결 및 엔지니어링 협업 비용을 분담하는 데 있다. 향후 레인지 테크 TianxiAI는 TianxiCode의 기술 성과를 개발자에게 실제 도구 체계로 전환하도록 지속적으로 추진할 것이며, 성숙한 자체 스마트체 아키텍처를 바탕으로 안전하고 효율적이며 진정한 자율 문제 해결 능력을 갖춘 전문 코드 도구를 레인지의 하드웨어 장비에 깊이 통합할 것이다.

이 글은 레인지언이 제공했으며, 쿼크위티는 재출판에 대한 허가를 받았습니다. 의견은 원작자에게 속합니다.

원문 출처

量子位

내용 안내

원문 발행 및 권리는 출처에 있습니다.

기계 번역 · 원문을 참고하세요