《Disney +》 迪士尼、Marvel、彼思、星球大戰…  Razer推出手機玩家專用產品 電競指套「Razer Gaming Finger Sleeve」   日本LAWSON與寶可夢「波加曼」聯名於9月21日開跑!還有炸雞塊君「波加曼 檸檬口味」!   「Fate Project 大晦日TV Special 2021」放送決定!   『仁王Collection』明天登陸PS5,體驗完整的『仁王』系列!   TGS2021 Online King of Fighters XV Special Program!KOF XV全新角色正式登場!   終於前進到「手機平臺」了!「FINAL FANTASY VII EVER CRISIS」將於2022年登陸手機平台!   Rose在《SFV》重現她在《Street Fighter ZERO》系列的根源   《猛毒2:血蜘蛛》——標誌性共生體即將真實現身 

本原智數攜手SWE-Bench ProMax團隊 推動Coding Agent評測走向真實倉庫級重構

商業

香港, 2026年9月8日 - (亞太商訊) - 當 Coding Agent 從代碼補全、函數生成和局部 Bug 修復,逐步走向真實代碼庫中的問題定位、跨文件修改和自主測試,行業對評測基準也提出了新的要求:模型能否理解一個完整任務,識別跨模組依賴,在長鏈路執行中修正錯誤,並最終交付可以通過測試的工程結果?

圍繞這一問題,上海本原智數科技有限公司(以下簡稱「本原智數」)與 SWE-Bench ProMax 團隊展開合作,共同推動這一面向大規模、多語言代碼重構的 Benchmark 在模型研發、Agent 評測和軟件工程研究中的應用與持續建設。

SWE-Bench ProMax 已被 COLM 2026 接收。當前 v1 包含 170 個來自真實 GitHub 項目的軟件工程任務,覆蓋 C、C++、Go、Java、Python、Rust 和 TypeScript 七種編程語言。每個任務平均涉及 11.4 個檔、261.6 行代碼。論文在兩種 Agent Scaffold 下對前沿模型進行評測,最佳解決率為 41.2%,顯示這一基準仍能有效區分當前 Coding Agent 的倉庫級工程能力。

為什麼需要 SWE-Bench ProMax

SWE-bench 建立了以真實 GitHub Issue、代碼倉庫和可執行測試評估模型補丁的基本範式。但隨著模型在傳統任務上的成績不斷提高,評測正在面臨兩個問題:一方面,局部修復任務難以充分覆蓋大型代碼庫中的結構性變更;另一方面,公開歷史補丁可能進入訓練數據,測試用例本身也可能過窄或過寬,從而影響結果的有效性。

SWE-Bench ProMax 選擇代碼重構作為主要任務形態。重構通常要求 Agent 在儘量保持外部行為穩定的前提下,對目錄結構、模塊邊界、依賴關係和代碼組織方式進行協調修改。它考察的不只是代碼生成,而是一組更接近真實軟件研發的複合能力:倉庫檢索、上下文構建、影響面分析、跨文件推理、修改規劃、工具調用、測試反饋利用和錯誤恢復。

ProMax的優勢並非簡單地「把題目做大」,而是通過任務、數據和執行環境的共同設計,提高評測的工程真實性與可解釋性。

第一,任務來自真實倉庫,並通過時間邊界降低數據污染風險

v1 的全部任務來自 2025 年之後創建的真實 GitHub Issue。相較於長期公開、可能已被模型訓練語料覆蓋的歷史任務,較新的時間截點可以顯著降低模型直接記憶已有補丁的風險。

團隊正在準備 v2,將納入更多 2026 年之後創建的任務,並計畫持續更新數據集。動態迭代機制使 Benchmark 能夠跟隨模型能力演進,減少排行榜因任務老化而過快飽和。

第二,大規模、多文件重構更接近生產級工程任務

ProMax 的 170 個任務平均修改 11.4 個檔和 261.6 行代碼,顯著高於常見的局部修復任務。一次修改可能同時影響目錄結構、導入路徑、公共接口、構建配置和測試代碼,任何遺漏都可能導致編譯失敗、補丁無法應用或回歸測試失敗。

這類任務能夠更清晰地區分不同 Agent 在長上下文理解、倉庫級搜索、任務分解和持續執行方面的能力。模型即使能正確修改某個函數,也未必能發現並處理所有關聯文件。

第三,七種語言覆蓋檢驗模型的跨生態泛化能力

ProMax v1 的語言分佈如下:

多語言覆蓋讓研究者能夠進一步觀察模型在不同類型系統、構建工具、依賴管理方式和測試框架中的能力差異,而不再將 Python 生態中的表現直接等同於通用軟件工程能力。

第四,專家重寫任務描述並人工審核測試

真實 Commit 和 Pull Request 的原始描述往往簡短、模糊,無法直接作為高質量評測題目。ProMax 對任務進行多階段專家篩選:從真實重構中識別候選任務,過濾複雜度不足或跨文件範圍有限的實例;重新編寫清晰、無歧義的任務說明;人工審查測試套件,移除可能拒絕正確替代方案的過窄測試,以及檢查了題目未聲明要求的過寬測試。

這套流程減少了「模型做對了但被測試誤判」與「模型沒有真正解決問題卻僥倖通過」的情況,使失敗原因更容易被解釋和覆核。論文也將測試質量與任務描述質量列為 ProMax 區別於既有評測的重要設計目標。

SWE-Bench ProMax 數據採集與策展流程

圖 1:SWE-Bench ProMax 的數據採集與策展流程。候選數據經過倉庫篩選、重構提交提取、Docker 環境構建、Gold Patch 與測試執行、質量過濾、問題重寫和人工覆核後,才進入正式數據集。來源:SWE-Bench ProMax 論文 Figure 3。

第五,以可執行結果驗收,不要求複刻參考補丁

每條ProMax 數據包含instance_id、repo、base_commit、problem_statement、參考patch、test_patch、語言信息及容器環境元數據。評測從指定代碼提交恢復倉庫,將模型生成的補丁應用到乾淨環境,再執行任務對應的測試腳本。

參考補丁用於證明任務存在可行解並支援質量審核,但模型不需要逐行複刻它。只要採用不同實現仍能滿足問題描述並通過行為驗證,就可以被判定為有效解。這比補丁文本相似度更符合真實軟件工程中「一項需求可能存在多種正確實現」的基本事實。

第六,容器化環境與公開執行器提高結果可複現性

ProMax 提供面向容器的環境信息和 Docker 評測執行器,固定代碼版本、依賴環境和任務執行方式。倉庫包含 Benchmark 數據、按實例組織的評測腳本、模型補丁執行器及數據收集工具;當前執行器還支援隔離網絡和離線包管理配置,以減少外部環境變化對結果的干擾。

對於模型團隊而言,這意味著評測不再只是一份靜態題目清單,而是一套可以運行、覆核和擴展的工程化基礎設施。研究者可以在相同任務版本與運行條件下比較不同模型、Agent Scaffold、上下文策略和推理預算。

41.2% 的最佳解決率意味著什麼

ProMax 的分數不應與 SWE-bench Full、Lite 或 Verified 直接橫向換算。任務規模、語言分佈、倉庫類型、測試方式和數據時間範圍不同,決定了各基準測量的是不同難度和不同側面的能力。

在 ProMax 上,解決率同時受到模型能力與 Agent 系統設計的影響。更有意義的評測報告應在同一數據版本、運行環境和推理預算下,披露總體解決率、補丁應用率、分語言結果、平均執行步數、執行時間、成本和失敗原因,並說明上下文構建、工具許可權和模型調用配置。

當前最佳結果為 41.2%,說明大多數任務仍未被前沿模型穩定解決。這個尚未飽和的難度區間,為研究倉庫級檢索、長程規劃、測試驅動修復和錯誤恢復留下了足夠的提升空間。

SWE-Bench ProMax 模型評測結果

圖 2:不同模型在 Mini-SWE-Agent 與 OpenHands 兩類 Scaffold 下的總體解決率、平均執行步數、平均成本及分語言解決率。來源:SWE-Bench ProMax 論文 Table 3。

圖中的橫向對比進一步說明,ProMax 測量的是模型與 Agent Scaffold 共同構成的軟件工程系統。例如,GPT-5.2 在 Mini-SWE-Agent 下的總體解決率為 21.8%,在 OpenHands 下提升至 41.2%;GLM-5 從 22.9% 提升至 36.5%;Claude Sonnet 4.6 則從 30.6% 提升至 38.8%。相同模型在不同執行框架下出現顯著差距,意味著倉庫流覽、工具編排、測試反饋和執行策略本身也是 Coding Agent 能力的重要組成部分。

與此同時,同一系統在不同語言上的解決率也存在明顯差異。對模型研發團隊而言,ProMax 不只提供一個總分,還可以形成分語言、分任務和分失敗類型的能力畫像,為上下文策略、工具鏈設計和後訓練數據建設提供更具體的優化方向。

從一次發佈走向持續維護

圍繞 SWE‑Bench ProMax,本原智數將與SWE-Bench ProMax團隊持續推動數據集的版本迭代、評測執行器的優化以及定期評測報告的發佈,確保基準在多語言、多倉庫任務上的覆蓋度與時效性。

本原智數將發揮在高質量數據集建設、專家組織、數據生產方法、模型評測與優化方面的能力,參與數據生產與質量保障,支持更多真實、複雜、可複現的軟件工程任務進入後續版本。雙方也將圍繞評測結果、任務設計、測試可靠性和 Agent 能力邊界開展持續交流。

專案入口(複製連結至流覽器打開)

  • GitHub:https://github.com/key4127/SWE‑Bench‑ProMax
  • Hugging Face:https://huggingface.co/swe‑bench‑promax/SWE‑Bench‑ProMax
  • 論文:https://arxiv.org/abs/2608.09802

共建多維度AI評測專家社區 

我們正在搭建一個跨領域的 Benchmark 專家社區,當前重點聚焦于代碼智能、高層次推理、視覺語言理解與長程任務等方向——這些領域正是評估下一代多模態模型推理、規劃與跨模態協同能力的關鍵試金石。社區致力於高質量任務設計、數據生產、測試質量分析與 Agent 失敗模式研究,期望為模型能力評估提供更真實、更全面的基礎設施。

我們深知,一個優秀的 Benchmark 不止是數據集的堆砌,更需要對模型能力邊界有敏銳判斷、對測試用例的有效性有嚴謹審視、對不同模型範式有深入理解。因此,我們面向模型研發、數據科學、軟件工程、測試自動化、認知科學、數學與邏輯學等多學科方向,招募真正對「如何科學評估 AI 能力」這一命題有思考、有熱情的夥伴——無論你擅長任務場景構建、數據標注與審核,還是評測執行、失敗分析與範式洞察,都歡迎參與我們的研究合作、任務生產與後續版本共建。對於希望深入投入的同學,我們也開放實習與項目合作機會。



Copyright 2026 亞太商訊. All rights reserved. www.acnnewswire.com
ACN Newswire

隨機商業新聞