阿里雲正式發布其新一代旗艦模型Qwen3.7-Max,現已透過阿里雲百煉平台提供API服務。該模型定位為面向智能體時代的全能基座,涵蓋程式編寫與除錯、辦公流程自動化,以至跨越數百甚至數千步驟的長周期任務自主執行。
Qwen3.7-Max的核心優勢在於智能體能力的廣度與深度。在程式應用方面,該模型可勝任從前端原型開發到複雜多檔案工程等不同層級的任務。在辦公與生產力層面,它透過MCP(Model Context Protocol)集成及多智能體協作,實現工作流程自動化。此外,該模型在長周期自主執行方面表現突出,在一項長達35小時、涉及超過1,000次工具調用的自主內核優化實驗中,維持了連貫的推理,展現持續穩定的執行能力。模型同時具備跨框架泛化能力,無論部署於Claude Code、OpenClaw或Qwen Code等不同框架,均能穩定發揮。

根據該公司公布的測試數據,Qwen3.7-Max在多項基準測試中取得不俗成績。在程式智能體相關測試中,Qwen3.7-Max於SWE-Pro(60.6分)、SWE-Multilingual(78.3分)、SciCode(53.5分)及QwenSVG(1608分)等項目上表現突出。在Terminal Bench 2.0-Terminus測試中,該模型獲得69.7分,超越DS-V4-Pro Max的67.9分。在SWE-Verified測試中,其80.4分的表現與Opus-4.6 Max(80.8分)及DS-V4-Pro Max(80.6分)水平相當。
在通用智能體能力方面,Qwen3.7-Max的表現同樣受到關注。該模型在MCP-Mark測試中獲得60.8分,高於GLM-5.1的57.5分;在MCP-Atlas測試中獲得76.4分,略高於Opus-4.6的75.8分。在Skillsbench測試中,其59.2分的成績優於K2.6的56.2分。在Kernel Bench L3測試中,該模型展示了強大的GPU內核優化能力,實現1.98倍的中位數加速及96%的加速率。在辦公自動化基準SpreadSheetBench-v1上,其87.0分的成績處於頂尖水平。
在推理能力方面,Qwen3.7-Max在GPQA Diamond(92.4分)、HLE(41.4分)、HMMT 2026 Feb(97.1分)、IMOAnswerBench(90.0分)及Apex(44.5分)等測試中均取得領先成績,展現其於高難度推理基準上的實力。在通用能力與多語言方面,該模型在IFBench(79.1分)、WMT24++(85.8分)、MAXIFE(89.2分)及SuperGPQA(73.6分)等測試中亦有出色表現。
值得留意的是,上述評測分數來自多種不同的智能體框架。該公司強調,Qwen3.7-Max並非針對某一特定框架進行優化,而是在Claude Code、OpenClaw、Qwen Code及各類自定義工具框架下均能穩定發揮,因此可作為各類智能體系統的底座。

在實際生產力場景方面,Qwen3.7-Max被定位為深度協作者。憑藉其智能體能力,該模型可處理資訊研讀整合、複雜數據分析建模、出版級文檔與可視化生成等企業級任務。該模型原生支援主流智能體框架,面向長鏈路交付任務,可自主規劃及運行長達數小時,透過上千次工具調用及數十輪版本迭代,持續提升交付品質。以往需專業團隊耗時一至兩周的複雜項目,現由Qwen3.7-Max驅動的智能體可在數小時內完成端到端交付。
該公司指出,模型能力源自於其訓練環境的擴展。在Qwen3.5中引入的環境擴展方法基礎上,Qwen3.7進一步擴大了智能體訓練環境的質量與多樣性。這種環境擴展帶來了清晰且穩定的性能提升,Qwen3.7-Max在綜合排名中位列前三,接近Claude-4.6-Opus-Max的水平。值得注意的是,所有評測中所涉及的環境均為訓練中從未出現過的領域外環境。
為驗證模型的長周期自主執行能力,該公司進行了一項實際測試。讓Qwen3.7-Max優化SGLang中的Extend Attention kernel(一種生產級變長多頭注意力算子),並在訓練中從未見過的硬件平台上運行。該平台搭載平頭哥真武M890 PPUs,模型在沒有任何性能分析數據、硬件文檔或示例kernel的情況下,僅憑任務描述、現有SGLang實現及評估腳本開始工作。
在隨後約35小時的連續自主執行中,模型完成432次kernel評估,跨越1,158次工具調用。它完全自主地編譯、性能分析並迭代改進kernel,診斷編譯錯誤、修復正確性錯誤、定位性能瓶頸,並多次重新設計kernel架構。最終結果顯示,在多個工作負載上,其相對參考實現的幾何平均加速比達到10.0倍。優化軌跡顯示,模型在最初幾小時之後仍持續取得進展,在30多小時後仍發現有意義的改進。
在相同條件下,其他模型完成了同一任務:GLM 5.1達到7.3倍加速;Kimi K2.6達到5.0倍;DeepSeek V4 Pro達到3.3倍;Qwen3.6-Plus達到1.1倍。部分模型因連續五輪未發出任何工具調用而提前停止。
Qwen3.7-Max的推出,為智能體領域提供了一個新的選項。其綜合的智能體能力、跨框架泛化能力及長周期自主執行能力,使其在各類通用及專業場景中展現出具備特色的表現。對於需要處理高複雜度、高強度任務的用戶而言,該模型提供了一個新的工具選擇。





