Kling AI 近日正式發布了業界首款統一多模態視頻模型 VIDEO O1,這一創新工具將參考影片生成、關鍵幀轉視頻、文本轉視頻、視頻內容編輯、修改和重新設計等多項功能整合到單一強大的引擎中。VIDEO O1 的推出標誌著視頻生成領域的重大突破,為內容創作者提供了一套全新的創意工作流程。
統一多模態模型的創新意義
Kling VIDEO O1 是視頻生成領域首款實現功能統一的模型,它打破了過去用戶需要在不同工具之間切換的困境。傳統的視頻創作流程需要創作者針對不同任務使用多套系統,而 VIDEO O1 則將參考圖像轉視頻、純文本生成、開始和結束幀生成、視頻內容編輯、修改、變換、重新設計以及攝像機延伸等功能集成在一個平台上。這種統一設計讓用戶能夠在從概念到生成,再到修改的整個過程中無縫協作,大幅降低了視頻創作的複雜性。
多模態輸入與創意控制
VIDEO O1 採用了深度語義理解技術,能夠將用戶上傳的任何內容——無論是圖像、視頻、主體或文本——都解釋為創意提示。這一設計突破了不同媒體類型之間的邊界,使 O1 能夠全面理解一張照片、一段視頻或特定主體,並為視頻生成精確的細節表現。
在多模態輸入的基礎上,Kling O1 引入了新型創意界面,使用戶可以輕鬆整合各類媒體資源進入創作過程。更重要的是,VIDEO O1 結合了 Kling O1 的多模態提示輸入區域,將複雜的後期製作編輯轉化為簡單的文本對話。用戶不再需要手動進行遮罩或設定關鍵幀,只需輸入類似「移除旁邊的人」、「將白天改為黃昏」或「更換主角的衣著」等文本提示,模型就能理解視覺邏輯,自動執行像素級語義重建。文本提示因此成為最高效的編輯工具。
VIDEO O1 在多模態提示輸入區域支持的創意任務包括多個維度。用戶可以進行圖像或元素參考,支持參考圖像或元素(包括角色、道具或場景等),實現靈活的創意視頻生成。變換功能允許用戶為視頻添加或移除內容,或切換場景和角度,並可以修改視頻的各個方面,如更改主體、背景、特定區域、視頻風格、物體顏色和天氣效果等。視頻參考功能支持參考視頻內容生成前後鏡頭,用戶也可以將視頻動作或攝像機運動作為創意生成的參考。開始和結束幀視頻功能支持添加開始幀或同時添加開始和結束幀,配合文本描述以引導場景轉換、攝像機運動或角色動作,實現對整個視頻的精確控制。此外,傳統的文本轉視頻功能仍然保持可用。
參考功能的一致性突破
視頻創作中最大的挑戰之一是保持主體在不同鏡頭中的一致性。Kling O1 通過深度強化對輸入圖像和視頻的理解,使用戶能夠從多個角度創建相同的主體。通過使用參考圖像或主體,O1 能夠像人類導演一樣工作,記住用戶的角色、道具和場景特徵。無論攝像機如何移動,主體的特徵都保持穩定一致,確保每一幀都完美連貫。
在角色參考的應用中,用戶可以設定一個參考元素,例如一個特定的人物角色,然後在多個不同的場景和鏡頭中使用這個角色。模型會在每一幀中準確保持該角色的面部特徵、身體特徵和風格一致性。即使場景環境、光線條件、攝像機角度發生了變化,角色的核心特徵也能得到完美保持。同樣的原理也適用於產品參考,用戶可以在不同的背景、光線和角度下展示同一產品,確保產品的設計和外觀始終保持一致。
更進一步,VIDEO O1 不限於單一角色或物體的參考。它擁有強大的多主體集成能力,用戶可以自由組合多個主體或將主體與參考圖像混合。在複雜的群體場景或互動設置中,模型能獨立鎖定並維持每個角色或道具的特徵。無論場景氛圍如何變化,VIDEO O1 都能確保每個元素在不同鏡頭中保持一致,實現工業級的特徵統一性。
強大的組合功能與敘事自由度
VIDEO O1 的功能不限於單一任務,它支持在一個提示中組合不同的任務。例如,用戶可以在同一提示中同時「添加主體並修改背景」,或「改變風格同時使用元素」。這種組合能力讓創作者可以一次性融入多個創意想法,探索無限的創意可能性。
在視頻長度控制方面,VIDEO O1 支持自由生成 3 到 10 秒的視頻,給予用戶定義視頻長度的權力。無論是追求短暫的視覺衝擊還是長篇幅的敘事展開,控制權完全掌握在創作者手中,允許敘事的節奏自由起伏。Kling O1 的開始和結束幀功能也將支持 3 到 10 秒的時長選項,該功能目前在開發中,即將推出。
技術架構的深層創新
VIDEO O1 的技術基礎體現了多項創新。首先,全新的視頻生成模型打破了視頻生成、編輯和理解之間的功能障礙,建立了全新的生成基礎。通過整合多模態 Transformer 和多模態長上下文技術,模型實現了多項任務的深層融合和統一。
其次,VIDEO O1 創新性地引入了互動多模態視覺語言(MVL)作為交互介質。通過 Transformer,它深度融合了文本語義與多模態信號,從根本上增強了模型的理解能力。MVL 支持在單個輸入框內靈活調用和無縫整合多項任務。
在智能推理能力方面,基於 MVL 輸入,模型實現了精確的多模態參考和高度互動的編輯,支持長上下文和時間敘事。結合思維鏈(Chain-of-Thought)技術,模型具備了常識推理和事件推導能力,展現出智能化的視頻生成能力。
行業領先的功能對比
Kling VIDEO O1 模型支持五大類別——「圖像與元素參考」、「變換」、「視頻參考」、「開始和結束幀轉視頻」和「文本轉視頻」,共計多達 18 項技能。此外,這些技能之間支持自由組合,使其成為視頻生成領域的行業領導者。
在圖像參考任務中,基於 Kling AI 團隊構建的內部評估數據集,研究人員將 Kling VIDEO O1 模型與 Google Veo 3.1 的圖像轉視頻功能進行了比較評估。比較結果表明,VIDEO O1 模型在整體性能和多個具體維度上表現優異,相比 Google Veo 3.1 的圖像轉視頻功能的性能勝率達到 247%,鞏固了其行業領先地位。
在變換任務中,基於 Kling AI 團隊構建的內部評估數據集,研究人員將 Kling VIDEO O1 模型與 Runway Aleph 進行了比較評估。結果表明,VIDEO O1 模型在整體性能和多個具體維度上同樣表現優異,相比 Runway Aleph 的性能勝率達到 230%。Kling AI 的評估數據集涵蓋了寬泛的參考類型(如角色、物體、服裝、種族、藝術風格等)和提示類型,確保了評估的代表性和全面性。在評估過程中,Kling AI 組織了多位專業人類評估者進行成對偏好比較,系統地進行了不同維度的效果對比。
與其他競爭對手相比,VIDEO O1 在功能廣度上具有明顯優勢。在圖像與元素參考方面,只有 VIDEO O1 支持元素參考和圖像加元素的組合參考。在變換功能上,VIDEO O1 支持從視頻中移除內容、切換角度或鏡頭大小、修改視頻元素、修改視頻部分、修改視頻風格、修改物體顏色、修改視頻天氣效果以及綠幕摳圖等多項功能,這些功能中的大多數在競爭產品中都不可用。在視頻參考方面,VIDEO O1 支持生成下一個鏡頭、生成上一個鏡頭、參考視頻攝像機運動和參考視頻動作等功能。最重要的是,VIDEO O1 支持組合技能生成,這是其他產品目前都不具備的功能。
創作工作流程的革新意義
VIDEO O1 的推出對內容創作者帶來了實質性的改變。傳統的視頻製作工作流程往往複雜冗長,創作者需要在多個軟件和工具之間不斷切換,處理從生成到編輯的各個環節。VIDEO O1 通過將所有功能整合到一個統一平台上,大幅簡化了這一過程。
創作者現在可以在單一介面內完成從概念構思到最終成品的整個創作過程。無論是快速原型製作、精細編輯還是風格變換,都可以在一個平台上實現。多模態輸入的支持意味著創作者可以靈活地混合使用文本提示、參考圖像、視頻片段等各種資源,激發更多的創意可能性。對於需要保持角色或物體一致性的項目,強大的參考功能確保了專業級的視覺連貫性。
此外,3 到 10 秒的可變長度設定滿足了不同敘事需求。短視頻可以用來製作衝擊力強的宣傳片或社交媒體內容,而較長的視頻則適合講述更複雜的故事。這種靈活性使 VIDEO O1 適用於從短形式內容創作到長形式視頻製作的各種場景。
未來應用與行業影響
Kling VIDEO O1 的推出預示著視頻創作技術將迎來新的發展階段。統一多模態模型的出現標誌著人工智能在視頻生成領域的理解能力達到了新的高度。通過整合多項功能並實現無縫協作,VIDEO O1 不僅提高了創作效率,也降低了視頻製作的技術門檻。
對於專業內容創作者而言,VIDEO O1 提供了一套完整的工具集,可以極大地加速製作週期。對於初學者和業餘愛好者而言,簡化的工作流程和直觀的多模態輸入方式使視頻創作變得更加易於上手。無論是廣告製作、影視後期、遊戲場景生成還是社交媒體內容創作,VIDEO O1 都展現出了廣泛的應用潛力。
在競爭格局方面,VIDEO O1 在功能完整性和性能表現上的領先優勢為 Kling AI 在視頻生成市場中確立了強勢地位。通過持續的技術創新和功能整合,Kling AI 正在塑造視頻生成行業的新標準。
參考來源:https://app.klingai.com/global/release-notes/vaxrndo66h?type=dialog&utm_source=www.therundown.ai&utm_medium=newsletter&utm_campaign=deepseek-strikes-again&_bhlid=2cd054dc3af3fb04338ef6b4daf98cef67e31508









