有别於普遍採用「從文字直接轉為像素」的傳統擴散模型,Reve 2.0 的技術路徑強調在生成影像前先進行詳盡佈局規劃。該公司解釋,此設計靈感來自軟件開發中的「關注點分離」原則——如同編寫應用程式時,先構建代碼庫,而非直接從提示詞生成二進制檔案。透過這種方式,系統能夠確保影像中各個元素的準確性、一致性,以及細節豐富度,同時讓人類創作者可以在渲染前審視並編輯佈局,從而參與創作過程。
從更密集的提示詞轉向具結構的程式碼
Reve 1.0 模型已嘗試以詳細的數據結構(而非簡短的標題文字)訓練模型。Reve 2.0 則在此基礎上進一步發展,結合全新的圖像規劃與擴散架構,並投入三倍的參數量與更多運算資源。該公司指出,生成可控圖像及編輯的關鍵不在於更密集的提示詞(prompts),而在於一個高度詳細、可靈活操作的程式碼形式中間表示。
由於 Reve 2.0 的影像本質上以程式碼構成,因此對代理(agents)而言具備「原生」可讀性與可推理性。代理能夠「看見」這些影像並對其進行邏輯分析,同時創作者亦可在相同的中間表示上建構直覺化的直接操作工具,這有助於解決語言與像素之間因模糊性及主觀性所造成的資訊損失。
原生 4K 解析度與迭代編輯的穩定性
在輸出能力方面,Reve 2.0 採用新型高效渲染架構,能夠直接生成原生 4K×4K(即 1600 萬像素)影像。該公司表示,其渲染器在 4K 影像模型中具備高速度表現。傳統的 AI 圖像生成流程常在放大步驟(upscaling)中出現細節偏移,而 Reve 2.0 則在高解析度下直接迭代,避免額外的後處理環節,讓所見即所得。
迭代編輯常因合成影像累積擴散與壓縮偽影導致品質持續下降。Reve 2.0 透過兩種方式緩解此問題:若使用影像參考,其新型渲染架構能抵抗這類衰退,使編輯在多次迭代後仍保持穩定;若不使用影像參考,則因影像以程式碼表示,可鎖定圖像元素,達到零偽影積累的效果。這讓生成式影像編輯轉變為真正可反覆修正的創作流程。
文字渲染與美學風格的提升
由於 Reve 2.0 將影像以程式碼表示,文字在構圖、定位、間距及元素關係上能實現更精確的控制。無論是圖形設計中的排版,還是環境文字(如手寫字、路牌、包裝標籤),該模型均可減少合成感,呈現較自然的質感。
自 2025 年 3 月推出預覽模型以來,Reve 已建立偏電影感與紀實攝影風格的影像美學。Reve 2.0 延續此方向,並透過程式碼規劃影像,試圖在技術精準度之外保留視覺上的藝術感。
結語
Reve 2.0 提出的「規劃先行、渲染在後」架構,為 AI 圖像生成帶來了不同於傳統擴散模型的操作方式。以程式碼作為中介,既能提升編輯可控性,亦能讓代理與人類共同參與創作。這套方法是否能改變業界對生成式影像的互動模式,值得持續關注。
資料來源: https://app.reve.com/








