Google Research 推 Diffusion Controller 統一 AI 圖像生成控制

商傳媒/[email protected] (商傳媒 SUN MEDIA)
10 小時前
圖/本報資料庫

商傳媒|何映辰/台北報導

Google Research 昨日發布了名為「Diffusion Controller」的全新架構,目的是統一並簡化當前人工智慧(AI)圖像生成技術的複雜控制流程。這項創新解決了長期以來 AI 圖像生成領域面臨的挑戰,有望大幅提升創作者的操控精準度與效率。

長期以來,AI 圖像生成技術(透過演算法從文字或圖像提示生成全新圖像的技術)在引導或微調方面存在諸多限制。現有的方法,無論是推論時期的調整技術,或是耗時的深度微調,都像是各自為政的獨立解方,使得工程師在平衡使用者偏好與圖像品質時,往往只能憑藉經驗摸索。業界一直缺乏一套統一且數學上嚴謹的語言,來分析並最佳化生成式模型(generative models)的控制方式。

Google Research 提出的 Diffusion Controller 架構,徹底改變了這種局面。它將整個去噪過程(將隨機雜訊逐步轉化為清晰影像的過程)重新定義為一個流暢、連續的「控制問題」,擺脫了過去將圖像生成視為一系列僵硬獨立步驟的做法。簡單來說,這種技術讓 AI 生成圖像的調整過程變得更加直觀與一致。

這項輕量級附加網路(add-on network)的表現令人驚艷。根據 Google Research 指出,Diffusion Controller 在比對人類偏好方面,超越了業界標準,顯示其能產生更符合使用者期望的圖像。此外,完全解鎖版的 Diffusion Controller 相較於基礎模型,更獲得了高達 90% 的勝率,證明其在提升圖像品質與使用者體驗上的顯著成效。

此技術的出現,不僅能簡化開發者在使用如 Stable Diffusion、Nano Banana 和 Flux 等模型時的複雜性,更為未來的 AI 圖像生成工具奠定了更穩固的基礎。透過 Diffusion Controller,創作者將能以更精準、更具藝術性的方式控制 AI,開啟 AI 圖像生成應用程式的新篇章。