《Disney +》 迪士尼、Marvel、彼思、星球大戰…  「新‧美麗新世界」公開全新內容以及發售情報!   MSI 推出高 CP 值 27 吋曲面電競螢幕「Optix G27C7」   NieR、DOD開發團隊的完全新作RPG《Voice of Cards ドラゴンの島》正式發表!   SAMURAI SPIRITS季票3情報公開!第1波追加角色為「Cham Cham」!   「寶可夢傳說 阿爾宙斯」最新情報和其他系列特典公開!   David Goyer談論改編《基地》在Apple TV+ 播出   HyperX將於日本發售「SoloCast USB麥克風」!預購抽籤登記活動開始   日本國內第二間任天堂官方商店「Nintendo OSAKA」決定開幕! 

Anthropic 發布 Claude Opus 4.6 樹立 AI 運算新標準

商業

Anthropic 正式推出旗下性能最為強大的大型語言模型更新版本 Claude Opus 4.6。這款全新模型在程式碼編寫、複雜邏輯規劃以及長文本處理能力上實現了質的飛躍,不僅顯著超越了前代產品,更在多項關鍵基準測試中擊敗了市場上的主要競爭對手。隨著 Opus 4.6 的登場,AI 輔助工作流程正從單純的文字生成,轉向具備自主決策能力的代理人模式,為企業與開發者提供更深度的技術支持。

核心架構與程式碼能力的深度進化

Claude Opus 4.6 在技術底層進行了全面優化,特別是在處理複雜程式庫時展現出卓越的穩定性。與前代模型相比,它在程式開發任務中的規劃能力更為嚴謹,能夠支持時間跨度更長的代理式任務(Agentic Tasks)。對於開發者而言,最顯著的提升在於模型的自我除錯(Debugging)與程式碼審查(Code Review)能力。它現在能夠更敏銳地識別自身邏輯中的錯誤,並在大規模程式碼庫中精準定位需要修改的區域,這使得 AI 在軟體工程中的角色,從簡單的腳本編寫者演變為更具判斷力的系統架構參與者。

在長文本處理方面,Opus 4.6 首次為 Opus 級別的模型引入了高達 100 萬個 Token 的上下文窗口(Context Window)。為了應對長對話常見的「上下文衰減」問題,Anthropic 引入了背景壓縮技術,使模型在處理數十萬字資訊後仍能保持極高的準確性。在測試模型從海量數據中檢索特定資訊的基準測試中,Opus 4.6 取得了 76% 的優異成績,大幅領先於同類模型,這意味著該模型在處理法律文件、財務報表及大型研究報告時,能提供更具深度且不失真、不漂移的分析結果。

基準測試全面領先與經濟價值體現

在多項專業評估中,Claude Opus 4.6 展示了應對真實世界複雜任務的能力。在衡量代理式編程能力的 Terminal-Bench 2.0 測試中,它獲得了目前的最高分;在涵蓋多學科推理的複雜測試 Humanity’s Last Exam 中,同樣領先所有尖端模型。值得關注的是,在衡量金融、法律等高價值經濟知識工作表現的 GDPval-AA 評定中,Opus 4.6 超越了知名廠商的 GPT-5.2 約 144 個 Elo 等級,這標誌著 AI 在專業領域的應用上已達成新的里程碑。

對於日常辦公協作,Opus 4.6 也帶來了實質性的產力提升。模型現在能夠更自主地執行財務分析、市場研究,並能直接處理及創建各種文件、試算表與簡報。特別是在 Anthropic 推出的 Cowork 環境中,Opus 4.6 可以同時處理多項任務,並展現出更好的專業判斷力。這種「自主性」是本次更新的核心重點,合作夥伴反映該模型不再需要頻繁的人工干預,能夠將野心勃勃的計畫拆解為具體步驟並執行到底,這讓 AI 逐漸具備了具備專業素養的數位協作者特質。

全新開發者工具與適應性思維功能

為了讓開發者能更精細地控制模型的運行效率與成本,Anthropic 在 API 端推出了一系列創新功能。其中最重要的莫過於「適應性思維」(Adaptive Thinking)。過去開發者只能選擇開啟或關閉模型的思考過程,而現在 Opus 4.6 可以根據對話場景的複雜度,自主決定何時需要進行深度推理,何時應快速產出結果。此外,系統還提供了四個等級的「努力程度」(Effort)控制參數,包含低、中、高與極大,開發者可以依據任務類型彈性調整性能與成本之間的平衡。

針對長週期運行的代理程序,API 新增了 128k 的單次輸出 Token 上限,這讓模型可以一次性完成更多的工作輸出,而不需要將任務拆解成多個請求。同時,針對企業對於數據主權的需求,該服務也提供了特定區域的推論選項。這些工具的加入,反映出 Anthropic 致力於將 AI 從單次的「問題與回答」框架,轉向能夠處理百萬行程式碼遷移或複雜數據建模的重型生產力支柱。

安全性與對抗誤用的防禦機制

在追求性能峰值的過程中,安全性始終是開發的核心支柱。根據自動化行為審計顯示,Opus 4.6 在涉及欺騙、阿諛奉承或鼓勵不當用途等對齊問題上,表現出極低的發生率。其對齊水平與前代產品持平甚至更佳。針對模型增強的網路安全能力,Anthropic 開發了六種新的防禦探針,專門偵測可能的誤用風險,並積極將模型應用於開源軟體漏洞的修復與防禦。這種「以 AI 強化防衛」的策略,旨在平衡技術進步帶來的潛在威脅。

此外,研發團隊採取了更全面的安全評估體系,包括針對用戶福祉的測試以及過度拒絕(Over-refusal)的優化。這確保了模型在拒絕有害請求的同時,不會因過於保守而影響正常的工作回答。開發團隊甚至使用了可解釋性科學的研究方法,深入探索模型內部的行為動機,力求從根源捕捉傳統測試可能遺漏的問題。

跨領域應用與產業界的高度評價

目前的早期用戶反饋顯示,Claude Opus 4.6 在各大知名軟體開發與創意工具中展現了驚人的潛力。Notion 與 GitHub 等科技巨頭的高階技術負責人皆指出,該模型在處理多步驟、長視野的代碼工作時,能表現出如資深工程師般的規劃能力。在法律科技領域,模型甚至在法律推理基準測試中取得了超過九成的準確率,表現極為精準。而在設計領域,Figma 與 Lovable 等平台也目睹了其在無需微觀管理的情況下,直接生成複雜互動 App 原型的卓越效率。

這種進步不僅體現在單一功能的優化,更體現在模型的整體感知力上。許多專業測試者發現,Opus 4.6 往往能主動提出用戶尚未察覺的細節需求,展現出一種前所未有的「意圖洞察力」。隨著這一技術的普及,無論是處理上百萬行程式碼的遷移工程,還是管理擁有五十名成員組織的複雜決策流程,AI 都展現出足以承擔重任的專業風範。這場由權威技術深度驅動的賽跑,正引領著智慧化生產力邁向下一階段的成熟期。

參考來源:https://www.anthropic.com/news/claude-opus-4-6

TechApple

隨機商業新聞