《Disney +》 迪士尼、Marvel、彼思、星球大戰…  MONSTER HUNTER RISE活動任務開跑!任務完成後即可得到特殊動作或貼圖!   殺怪Roguelike遊戲《Curse of the Dead Gods》明天上市:7個遊戲提示不可不知   華碩發表搭載兼具遊戲模式和遙距辦公模式的遊戲路由器「RT-AX86S」!最大傳輸速度可達4804Mbps!   跟隨最新《Solar Ash》實機遊玩影片進入極空之旅探險   鎖定本週五的State of Play,觀看《Deathloop》的加長版介紹   Fernando Tatis Jr.登上《MLB The Show 21》封面球員   Playful Festival新春購物優惠及線上挑戰賽活動公開   更多《Dirt 5》PS5 DualSense 更多將有7月20日上市! 

Claude Sonnet 4.6 發布:Anthropic 中階模型能力全面升級

商業

Anthropic 正式推出 Claude Sonnet 4.6,宣布這是該公司目前最強大的 Sonnet 系列模型。相較前代,這次更新在多個核心領域帶來顯著改進,包括程式開發、電腦操作、長上下文推理、代理規劃、知識工作與設計等,並在 beta 階段開放 1M token 的上下文視窗。

Anthropic 表示,Sonnet 4.6 已成為 claude.ai 與 Claude Cowork 的預設模型,適用於免費與 Pro 方案用戶,同時在 API 定價上維持與 Sonnet 4.5 相同水準(US$3 / US$15 每百萬 token)。這項更新讓更多用戶能夠以相對親民的成本,獲得接近旗艦級的表現。

一、核心能力全面提升

Sonnet 4.6 的改進重點涵蓋以下六大領域:

  • 程式開發:指令遵循更精準、上下文理解更穩健,能有效閱讀既有程式碼、整合共用邏輯並減少重複。早期測試顯示,用戶在 Claude Code 環境中偏好 Sonnet 4.6 的比例達 70%(相較 Sonnet 4.5),在複雜程式碼修正、大型程式庫導航與錯誤偵測上表現更一致,幻覺現象明顯減少。
  • 電腦操作(Computer Use):模型能更接近人類方式在真實軟體介面執行任務,如操作複雜試算表或填寫多步驟網頁表單。在保險工作流程基準測試中達到 94% 準確率,為目前測試過的最高水準。相較 Sonnet 4.5,對提示注入攻擊的抵抗力也大幅提升,與 Opus 4.6 相當。
  • 長上下文推理:支援 1M token 上下文視窗(beta),可一次處理完整程式庫、長篇合約或數十份研究論文,並進行有效的長程規劃。
  • 代理規劃:在複雜多步驟代理任務、協調評測與長時程工作上表現更穩定。在 Vending-Bench Arena 測試中,Sonnet 4.6 優於前代,展現出早期投資容量並在後期轉向獲利的適應能力。
  • 知識工作:文件理解能力顯著進步,在 OfficeQA 基準上達到與 Opus 4.6 相當的水準;企業文件深度推理問答(Box 評測)較 Sonnet 4.5 提升 15 個百分點;在金融服務基準的答案匹配率也有明顯躍升。
  • 設計:產出的前端介面與資料報告更精美,版面配置、動畫與整體設計感更佳,需要較少的迭代次數即可達到生產級品質。

此外,Sonnet 4.6 還新增上下文壓縮(context compaction)等 beta 功能,能在對話接近長度限制時自動總結舊有內容,進一步延長有效上下文。

二、基準測試表現

根據 Anthropic 公布的數據與內部評測,Sonnet 4.6 在多項關鍵指標上展現穩健進步:

  • SWE-bench Verified:提示優化後達 80.2%(部分獨立來源顯示約 79.6%)。
  • ARC-AGI-2:高努力設定下達 58.3%–60.4%。
  • OfficeQA:與 Opus 4.6 持平,適合處理含圖表、PDF 與表格的企業文件。
  • 金融服務基準:答案匹配率較前代有顯著提升。
  • 保險基準(電腦操作):94% 準確率。
  • 用戶偏好(Claude Code 內部測試):70% 偏好 Sonnet 4.6 勝過 Sonnet 4.5,59% 偏好勝過 Opus 4.5。

整體而言,Sonnet 4.6 在實戰導向任務中縮小了與旗艦 Opus 系列的差距,特別適合需要平衡效能與成本的開發者、企業用戶與知識工作者。

三、與前代及競爭對手的比較

相較 Sonnet 4.5,Sonnet 4.6 在長時程任務與困難問題處理上均有明顯進步。與 Opus 4.5 相比,雖然 Opus 仍保有最深層推理優勢,但 Sonnet 4.6 在多數日常與中高強度工作流程中提供更具性價比的替代方案。

Anthropic 強調,這次更新延續了 Claude 系列在安全與可靠性的高標準,安全評估顯示模型具備溫和、誠實、親社會的特質,且無重大高風險失準跡象。

四、可用性與實際意義

Sonnet 4.6 即日起可在所有 Claude 方案、Claude Cowork、Claude Code、API 以及主要雲端平台使用。免費用戶也已自動升級至此模型,並獲得檔案建立、連接器、技能與壓縮等功能。

對開發團隊而言,這代表能以相同價格獲得更一致的程式開發體驗;對企業用戶來說,則意味著在文件處理、財務分析與代理工作流程上可大幅提升效率。整體來看,Anthropic 透過這次更新,持續強化中階模型的實用性,讓前沿能力更廣泛地被應用。

結語

Claude Sonnet 4.6 的發布,展現 Anthropic 在模型迭代上的穩健步伐。它並未追求單一指標的極致,而是聚焦於多場景實戰表現的全面優化,為廣大用戶提供更平衡且高效的 AI 工具選擇。

用戶現在即可前往 claude.ai 或相關平台切換使用,親身體驗這次升級帶來的差異。後續若有更多實測反饋與更新,Anthropic 預計將持續優化模型效能。

參考來源:https://www.anthropic.com/news/claude-sonnet-4-6

TechApple

隨機商業新聞