《Disney +》 迪士尼、Marvel、彼思、星球大戰…  動人的《Kena: Bridge of Spirits》預告片揭露新遊戲畫面與故事細節   Puzzle & Dragons中加入「東京卍復仇者」與「炎炎消防隊」角色!週刊少年合作活動開跑!   目標是成為傳說的貓皇!「貓咪大尋寶」登場!   《零 ~濡鴉之巫女~》重製版登場!官網、PV&初回特典情報公開!   《地平線:西域禁地》:透過巧思戰勝敵人   PS5 次世代 VR:全新控制器   五月份PlayStation Plus遊戲:《戰地風雲5》、《Coffee Talk》、《Wreckfest: Drive Hard, Die Last》   《虹彩六號:圍攻行動》最新賽季「腥紅劫案」即日推出 

DeepSeek-Math-V2 革新數學推理 自驗證能力突破競賽

商業

DeepSeek 團隊發佈了最新的數學推理模型 DeepSeek-Math-V2,在數學競賽和定理證明領域取得了突破性成果。該模型在 IMO 2025 和 CMO 2024 中獲得金牌級別分數,在 Putnam 2024 考試中更是達到了接近滿分的 118/120,展示了當前大語言模型在深度數學推理領域的巨大潛力。

自驗證推理的必要性

大語言模型在數學推理領域已取得顯著進展,通過強化學習和獎勵機制的方式優化最終答案的準確性,使得模型在定量推理競賽中的表現得以大幅提升。然而,傳統的最終答案獎勵方法存在根本性的局限性。正確的最終答案並不能保證推理過程的正確性,而許多數學任務如定理證明則需要嚴謹的逐步推導,而非僅僅一個數值答案。

DeepSeek 團隊認識到,要進一步推進深層數學推理的發展,必須驗證數學推理的完整性和嚴謹性。自驗證能力尤其重要,特別是在擴展測試時間計算的場景中,以及處理沒有已知解決方案的開放性問題時。正是基於這一認識,DeepSeek-Math-V2 的開發工作圍繞自驗證數學推理這一核心方向展開。

模型架構與訓練方法

DeepSeek-Math-V2 的核心創新在於其獨特的生成-驗證框架。該模型首先開發了一個準確且可信的基於大語言模型的驗證器,用於定理證明任務。隨後,研究團隊使用驗證器作為獎勵模型,訓練一個證明生成器。在這個過程中,生成器被激勵去識別和解決自身證明中存在的問題,在最終確定證明之前進行自我修正。

為了維持生成器與驗證器之間的性能差距,促進模型的持續進步,DeepSeek 團隊提出了一種創新的驗證計算擴展方法。該方法能夠自動標記難以驗證的新證明,以此生成訓練數據來進一步改進驗證器。通過這種反覆迭代的方式,驗證器和生成器相互促進,不斷提高模型的整體性能。

競賽成績的突破

DeepSeek-Math-V2 在國際數學奧林匹克(IMO)2025 和中國數學奧林匹克(CMO)2024 中均獲得了金牌級別的分數。金牌級別代表著在這些世界頂級數學競賽中的最高認可,說明模型已能應對最具挑戰性的數學問題。

在美國 Putnam 數學競賽中,DeepSeek-Math-V2 在使用擴展測試時間計算的條件下,達到了 118/120 的分數,這幾乎是滿分的成績。Putnam 競賽以其題目難度著稱,參賽者包括全球頂尖大學的精英數學學生,該分數的取得充分證明了模型在高難度數學問題解決中的能力。

此外,DeepSeek-Math-V2 在 IMO-ProofBench 上的表現也表明了其強大的定理證明能力。IMO-ProofBench 是由開發出 DeepThink IMO-Gold 的 DeepMind 團隊開發的評估平台,設計用於評估模型在嚴謹數學證明方面的能力。

自驗證能力的意義

DeepSeek-Math-V2 所展示的自驗證數學推理能力具有深遠的研究意義。傳統的機器學習方法主要依賴外部監督信號,而自驗證能力使模型能夠在沒有外部參考答案的情況下,自我評估和改進其推理過程。這對於處理沒有已知解決方案的研究問題特別有價值。

在擴展測試時間計算方面,自驗證能力也展現出了優勢。模型可以花費更多時間思考和驗證,而不是簡單地生成答案。通過反覆驗證和修正,模型能夠產生更加嚴謹和可信的數學推導,這在科學研究和定理證明等應用中至關重要。

技術基礎與可用性

DeepSeek-Math-V2 是基於 DeepSeek-V3.2-Exp-Base 構建的,後者可以從 HuggingFace 平台下載獲取。研究團隊為推理支持提供了相應的 GitHub 倉庫資源,便於開發者進行集成和應用。

模型的使用受到相應的模型許可證約束。此外,研究團隊在 GitHub 倉庫中提供了模型預測結果的輸出文件夾,使得用戶能夠查看模型在各項評估任務中的具體表現。

未來研究方向

儘管 DeepSeek-Math-V2 在數學推理領域取得了顯著成果,但研究團隊認為,自驗證數學推理研究方向還有大量工作需要進行。這些成果表明,自驗證數學推理是一個可行的研究方向,可能有助於開發更強大的數學 AI 系統,進一步推動人工智能在科學研究領域的應用。

隨著模型能力的不斷提升,數學推理領域可能會迎來新的突破。自驗證能力為模型的自主學習和持續改進提供了新的可能性,這對於開發能夠協助人類數學家和科研工作者的 AI 系統具有重要意義。

DeepSeek 團隊的工作表明,通過設計合理的訓練框架和獎勵機制,大語言模型在嚴格的數學推理任務中可以達到令人印象深刻的水平。該研究成果不僅推進了數學 AI 的發展,也為其他需要嚴謹邏輯推理的領域的 AI 應用提供了有益的啟示。

參考來源:https://github.com/deepseek-ai/DeepSeek-Math-V2/tree/main?utm_source=www.therundown.ai&utm_medium=newsletter&utm_campaign=deepseek-returns-with-an-imo-crushing-ai&_bhlid=93cc4fecf080f5e57e068dcb8c505d35afa7cbc8

TechApple

隨機商業新聞