《Disney +》 迪士尼、Marvel、彼思、星球大戰…  新作MMORPG「ELYON」在12月15日進行第一次更新! 亦會發表新召喚獸!   【實測篇】便於收納隨身攜帶RAYCOP可攜式吸塵器!   與齋藤陽介、橫尾太郎和吉田直樹一起深入了解《Final Fantasy XIV》的《Yorha: Dark Apocalypse》內容   育碧發表多人聯機 FPS「湯姆克蘭西:極惡戰線」!   女性VTuber團體「Hololive」與「BanG Dream! 少女樂團派對」合作活動開跑!   Nintendo Switch Online新收費計劃登場!將可遊玩N64與Mega Drive遊戲!   第15回 TETRIS®王者盃將與瑪利歐聯名!   Cygames 發表以魔術師世界為舞台的家用主機動作遊戲新作「Project GAMM」! 

Krea.ai 開源 FLUX.1 Krea,告別「AI樣貌」

商業

Krea.ai 正式發布了其首個圖像模型 FLUX.1 Krea 的開源權重。這款模型是 Krea.ai 與 Black Forest Labs 合作訓練的結晶,旨在提供卓越的美學控制與圖像品質,並以其獨特的「主觀美學」視角,解決長期困擾AI生成圖像的「AI樣貌」問題。此次開源,無疑為廣大開發者與創作者開啟了無限可能,預示著一個更具藝術性與個性化的視覺生成時代的來臨。

告別「AI樣貌」:Krea 如何定義美學?
長期以來,儘管圖像生成技術取得了長足進步,能夠生成連貫的人臉、手部,理解精確的數量,甚至渲染複雜的排版,但AI生成圖像卻普遍存在一種「獨特的外觀」,即所謂的「AI樣貌」。這種樣貌的特徵包括過度模糊的背景、蠟質般的皮膚紋理、乏味的構圖等等,這些問題共同構成了當前AI圖像生成領域的一個顯著瓶頸。

許多時候,人們過於關注模型的「智能」程度,例如它能否讓宇航員騎馬,或者能否精確地填滿酒杯。學術界也為此制定了各種基準測試,如 Fréchet inception distance (FID)、CLIP Score、DPG、GenEval、T2I-Compbench 和 GenAI-Bench 等,這些指標主要用於衡量模型的技術能力,如提示詞依從性、空間關係、屬性綁定和物體計數等。然而,在追求這些技術能力的過程中,早期圖像模型所具備的真實感、風格多樣性和創意融合卻逐漸被忽視。

對於美學評估,雖然有 LAION-Aesthetics、Pickscore、ImageReward 和 HPSv2 等模型被廣泛使用,但這些模型大多是基於 CLIP 的微調版本,它們處理低分辨率圖像(224×224 像素)且參數數量有限,隨著圖像生成模型能力的提升,這些舊的美學評分模型已不足以有效評估。例如,LAION Aesthetics 就被發現高度偏向描繪女性、模糊背景、過於柔和的紋理和明亮的圖像,這在一定程度上為模型引入了隱性偏見。Krea.ai 的目標從一開始就很明確:「讓AI圖像看起來不像AI。」他們深知,人類的偏好與美學品味高度個人化,難以簡單地歸結為單一數值。因此,FLUX.1 Krea 的開發,正是為了打破這種「AI樣貌」的桎梏,創造出真正符合特定美學偏好的圖像。

雕琢之術:從預訓練到後訓練的藝術
圖像生成模型的訓練大致分為兩個階段:預訓練(Pre-training)和後訓練(Post-training)。Krea.ai 團隊認為,模型的大部分美學特徵是在後訓練階段學習的,但預訓練階段的質量也為最終模型的表現奠定了基礎。

在預訓練階段,模型的重點是「模式覆蓋」(mode coverage)和「世界理解」(world understanding)。此階段旨在賦予模型關於視覺世界的豐富知識,包括風格、物體、地點和人物等,目標是最大限度地增加多樣性。Krea.ai 甚至主張,預訓練模型應該在「不良」數據上進行訓練,只要這些數據中不希望出現的方面能夠通過條件反射準確捕捉。例如,許多圖像生成工作流程會使用「負面提示詞」(negative prompts),如「手指過多、變形的面部、模糊、過飽和」等來改善圖像質量。為了讓負面提示詞有效引導模型避開數據分佈中不理想的部分,模型必須首先學習這些不理想的部分是什麼樣子。這意味著,如果模型從未見過「不良圖像」的例子,負面提示詞將無法發揮作用。因此,儘管後訓練對模型的最終質量影響最大,但預訓練模型決定了模型的質量上限和風格多樣性。

進入後訓練階段,重點則轉向「模式坍塌」(mode collapsing),即調整和剔除分佈中不理想的部分。一個經過預訓練的模型雖然可以輸出多樣化的圖像並理解廣泛的概念,但由於其對生成美學輸出沒有足夠的偏向,因此難以可靠地輸出高品質圖像。這正是模式坍塌發揮作用的地方:將模型偏向於生成我們認為理想的分佈部分。

為了實現這一目標,Krea.ai 需要一個「原始」(raw)模型作為基礎。許多現有的開源模型已經過度微調和後訓練,變得過於「成熟」,不適合用作可塑性強的基礎模型。為此,Krea.ai 與世界級基礎模型實驗室 Black Forest Labs 合作,獲得了 flux-dev-raw,這是一個經過預訓練和引導蒸餾的 120 億參數擴散變換器模型。儘管 flux-dev-raw 作為預訓練基礎模型,其圖像質量遠未達到最先進基礎模型的水平,但它是一個強大的後訓練基礎,原因有三:首先,flux-dev-raw 包含大量世界知識,它已經了解常見的物體、動物、人物、相機角度和媒介等;其次,儘管 flux-dev-raw 是一個原始模型,但它已經提供了引人注目的質量,能夠生成連貫的結構、基本的構圖和渲染文本;最重要的是,flux-dev-raw 並未被「烘烤」,它是一個未受「AI美學」污染的模型,能夠生成從原始到美麗的各種圖像。

Krea 的獨特後訓練管線:SFT 與 RLHF
Krea.ai 的後訓練管線分為兩個階段:監督微調(Supervised Finetuning, SFT)階段和人類反饋強化學習(Reinforcement Learning from Human Feedback, RLHF)階段。

在 SFT 階段,團隊手工策劃了符合其美學標準的最高質量圖像數據集。對於 FLUX.1 Krea [dev] 的訓練,他們還在 SFT 階段納入了來自 Krea-1 的高品質合成樣本,發現合成圖像有助於穩定檢查點的性能。由於 flux-dev-raw 是一個引導蒸餾模型,Krea.ai 設計了一個自定義損失函數,直接在分類器自由引導(Classifier-Free Guided, CFG)分佈上微調模型。經過 SFT 階段後,模型的圖像質量輸出顯著提高。然而,為了使模型更具魯棒性並精準捕捉所需的美學,還需要進一步的工作,這便是 RLHF 發揮作用的地方。

在 RLHF 階段,Krea.ai 應用了一種偏好優化技術的變體,他們稱之為 TPO,以進一步提升模型的美學和風格化效果。他們使用了經過嚴格過濾以確保數據質量的高質量內部偏好數據。在許多情況下,他們應用了多輪偏好優化,以進一步校準模型的輸出。

關鍵發現:質量勝於數量與獨到見解

在探索各種後訓練技術的過程中,Krea.ai 發現了幾個關鍵點:

首先是「質量勝於數量」。他們發現,進行良好的後訓練所需的數據量驚人地少(少於 100 萬)。數量有助於穩定性和緩解偏見,但數據的質量才是最重要的。這一觀察與先前文獻中關於在少量精心策劃的數據集上訓練的有效性報告一致。他們的偏好標籤由對當前模型局限性、改進領域、優勢和劣勢有深刻認識的標註者精心收集。特別是,他們確保偏好標註界面中的圖像具有多樣性,以獲得集中的標註。

其次是「採取獨到見解」。許多開源偏好數據集被用於基準測試偏好微調技術。在探索階段,這些數據集對於測試各種技術很有用。然而,他們發現,在現有數據集上訓練會導致意想不到的行為,例如:偏向對稱、簡單構圖;模糊和過於柔和的紋理;顏色調色板坍塌;以及回歸到「AI樣貌」。Krea.ai 認為,一個在「全球」用戶偏好上進行微調的模型是次優的。對於文本渲染、解剖學、結構和提示詞依從性等具有客觀事實的目標,數據多樣性和規模是有幫助的。然而,對於美學等主觀目標,混合不同的美學品味幾乎是適得其反的。

他們用一個例子來說明:如果一個用戶喜歡高級時裝攝影,而另一個用戶喜歡極簡主義繪畫。在各自用戶的集中標註下,很容易使模型在各自的風格上表現出色。但當你將兩種分佈合併時,就會得到一個邊際偏好分佈,它不足以讓任何一方滿意。這種局限性可以通過提示詞部分解決,但這並不是一個令人滿意的解決方案。大多數人最終往往依賴 LoRA 來獲得他們想要的風格化水平,因為提示詞不足以滿足他們的使用場景。此外,用戶通常希望在沒有大量提示詞和添加修飾符的情況下,從模型中獲得美學輸出。受此直覺的啟發,Krea.ai 決定以一種非常主觀的方式收集他們的偏好數據,這種方式與他們的美學品味和明確的藝術方向保持一致。他們認為,將模型過度擬合到某種特定風格通常會更好、更容易。

未來展望與貢獻

作為一家以產品為導向的公司,Krea.ai 專注於為生成模型構建直觀且令人愉悅的用戶體驗。他們將 Krea 1 視為提供一個能夠滿足創作者渴望的美學標準和質量模型的第一步。隨著 FLUX.1 Krea [dev] 的開源發布,他們對開源社區將在此基礎上構建什麼感到興奮。

Krea.ai 計劃改進模型的核心功能,並擴展到更多的視覺領域,以允許用戶探索、融合和混合多樣化的視覺效果。這項工作是他們在美學研究領域的第一步。他們已經構建了一個能夠提供主觀美學的模型,但他們希望構建一個更具個性化、更符合用戶美學感的模型。在未來的工作中,通過個性化、美學和可控性研究,他們希望為用戶提供一個能夠與其品味契合並能夠完善其作品的模型。

來源 : https://www.krea.ai/blog/flux-krea-open-source-release?utm_source=www.therundown.ai&utm_medium=newsletter&utm_campaign=images-lose-ai-look-with-new-open-model&_bhlid=f5f67602a9b710d044fee3ba70e83e601ad87879

TechApple

隨機商業新聞