无主之地2配置高吗|看真人裸体BBBBB|秋草莓丝瓜黄瓜榴莲色多多|真人強奷112分钟|精品一卡2卡3卡四卡新区|日本成人深夜苍井空|八十年代动画片

網易首頁 > 網易號 > 正文 申請入駐

AdaGen: 讓圖像生成模型學會自適應策略

0
分享至



當前主流的圖像生成模型——擴散模型(如 DiT)、自回歸模型(如 VAR)、掩碼生成模型(如 MaskGIT)、流模型(如 SiT)——都遵循一個共同范式:將復雜的圖像生成任務拆解為多個可控的子步驟,逐步迭代完成。然而,這種多步策略引入了一個不可忽視的問題:每一步都需配置大量超參數(如噪聲水平、采樣溫度、引導尺度等),而現有方法普遍依賴手工設計的靜態調度規則來管理這些參數。

這種做法存在兩個重要缺陷:一是需要大量專家知識和反復調參,二是"一刀切"的靜態策略無法適配每個樣本的獨特特性

本文提出AdaGen——一個通用的、可學習的、樣本自適應的生成策略框架。通過強化學習訓練一個輕量級策略網絡,AdaGen 能根據當前生成狀態自動為每個樣本定制最優的生成策略,在四大主流生成范式上均實現了顯著的性能提升與效率優化。

  • 論文標題:
  • AdaGen: Learning Adaptive Policy for Image Synthesis
  • 論文鏈接:
  • https://arxiv.org/abs/2603.06993
  • 論文代碼:
  • https://github.com/LeapLabTHU/AdaGen

核心動機:從"靜態一刀切"到"動態因材施教"



圖:AdaGen的核心思想?,F有方法使用預定義的靜態策略,所有樣本共享相同調度規則;AdaGen則通過RL訓練的策略網絡,為每個樣本自適應地產生定制化的生成策略。

現有的多步生成模型在推理時,所有樣本共享同一套預定義的調度規則。以 MaskGIT 為例,即使生成步數為 T = 16,也需要配置 64 個策略參數(每步 4 個參數),實際操作中極度依賴人工經驗。更關鍵的是,一張簡單的風景圖和一張復雜的人物肖像,真的應該用完全相同的生成策略嗎?

AdaGen 的核心思想非常直觀:引入一個通過強化學習訓練的策略網絡(Policy Network),讓它觀察當前的生成狀態,自動且自適應地為每個樣本決定最優的生成參數。

統一 MDP 建模:一個框架統一四大生成范式







狀態轉移 (Transition):由預訓練的生成模型決定。擴散模型和流模型的轉移由 ODE 求解器確定,是確定性的;MaskGIT 和自回歸模型的轉移則是隨機的。





對抗獎勵建模:不讓策略"投機取巧"

訓練策略網絡的另一個核心挑戰在于:如何設計有效的獎勵信號?論文探索了三種方案,揭示了一個重要發現:



圖:三種獎勵設計的對比。(a) 用FID作獎勵:FID雖低至2.56,但圖像質量差,保真度不達標;(b) 用預訓練獎勵模型:保真度好了但樣本多樣性嚴重不足;(c) AdaGen的對抗獎勵建模:保真度與多樣性兼顧。

(a) 用 FID 作獎勵:雖然 FID 數值可以被優化到很低(2.56),但生成圖像的視覺質量反而很差。策略網絡學會了"刷"指標的捷徑,犧牲了視覺保真度。

(b) 用預訓練獎勵模型:保真度上去了,但生成樣本趨于同質化,多樣性嚴重不足。策略過擬合于獎勵模型的偏好。

(c) 對抗獎勵建模(AdaGen 的方案):引入一個判別器作為獎勵模型,與策略網絡進行對抗訓練。策略網絡試圖最大化獎勵,而判別器則不斷提高區分真假圖像的標準,有效防止策略過擬合。最終實現了保真度與多樣性的良好平衡。



圖:AdaGen的訓練流程。策略網絡控制生成過程產生圖像,對抗獎勵模型同時評估生成結果并不斷自我進化。預訓練生成模型在整個過程中保持凍結。

訓練算法簡潔優雅,核心循環僅包含兩步:(1) 策略網絡優化:生成圖像,用 PPO 算法更新策略網絡使獎勵最大化;(2) 獎勵模型優化:同時采樣真實和生成圖像,訓練判別器更好地區分兩者。兩者交替進行,形成類似 GAN 的博弈過程。

動作平滑:馴服高維動作空間的探索





圖:優化過程。當生成步數從T=8增加到T=32時(黃色曲線),優化變得不穩定且性能下降。引入動作平滑后(紅色曲線),訓練恢復穩定且性能超越T=8基線。

論文發現,不穩定性的根源在于 PPO 探索時對每步獨立添加高斯噪聲,導致動作序列出現劇烈且不必要的高頻波動。而對于逐步推進的迭代生成過程,最優策略往往是平滑變化的。為此,論文提出動作平滑技術——對策略輸出施加指數移動平均(EMA)濾波:







圖:動作平滑前后的對比。左側未平滑時,動作序列劇烈抖動(FID=3.5);右側引入平滑后,序列合理平穩(FID=2.3)。

上圖直觀對比了平滑前后的效果:從雜亂無章的鋸齒波到平滑有序的下降曲線,FID 也從 3.5 降至 2.3。

實驗結果:四大范式全面提升

跨范式有效性驗證

AdaGen 在 ImageNet 256×256 上跨越四大生成范式、六個模型進行了驗證。在所有范式和推理步數下,AdaGen 均一致超越對應的基線方法,且性能增益在推理步數較少時更為顯著:



表:AdaGen 在 ImageNet 256×256 上的 FID-50K 結果(↓越低越好),覆蓋四大生成范式。注:MaskGIT、DiT、SiT 在不同推理步數 T 下評測;VAR 采用固定的 10 步生成,因此僅在 T=10 列報告結果。

效率優勢



圖:AdaGen在四種模型上的質量-效率權衡。無論是理論計算量(TFLOPs)還是實際GPU/CPU推理時延,AdaGen均能推進質量-效率前沿,實現1.6×到3.6×的推理加速。

上圖系統展示了 AdaGen 在四種生成模型上的質量-效率權衡。無論是理論計算量還是實際推理延遲,AdaGen 均一致推進了質量-效率前沿,實現1.6× 到 3.6×的推理加速。

極低的額外開銷

AdaGen 的策略網絡僅為生成器增加0.07% 到 0.40%的額外推理計算量,因此其性能提升并不以增大推理開銷為代價:



表:AdaGen 策略網絡的推理開銷占生成器總計算量的比例。

結語

AdaGen 將生成策略的設計從"手工藝術"轉變為"數據驅動的優化問題"。通過統一的 MDP 建模、對抗獎勵設計和動作平滑技術,AdaGen 以一種輕量、通用的方式,在四大主流生成范式上實現了 17% 到 54% 的性能提升,或 1.6× 到 3.6× 的推理加速。這一工作表明,多步生成模型的潛力遠未被充分挖掘——一個好的"調度策略",和模型架構本身同樣重要。

特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相關推薦
熱點推薦
炸裂!比爾·蓋茨自爆出軌20多次,一度被愛潑斯坦勒索

炸裂!比爾·蓋茨自爆出軌20多次,一度被愛潑斯坦勒索

新民周刊
2026-06-14 13:05:15
伊朗11名世界杯成員被美拒簽

伊朗11名世界杯成員被美拒簽

體壇周報
2026-06-14 02:43:18
鄢姣,金融監管總局辦公廳副主任,皮膚白皙,顏值不輸當紅女明星

鄢姣,金融監管總局辦公廳副主任,皮膚白皙,顏值不輸當紅女明星

李昕言溫度空間
2026-06-14 08:27:32
好恐怖的天倫之樂!女子曬家庭聚會,面和心不和被演繹得淋漓盡致

好恐怖的天倫之樂!女子曬家庭聚會,面和心不和被演繹得淋漓盡致

林林先生
2026-06-13 10:25:06
警鐘長鳴!國務院安委辦通報典型案例 商洛高速橋梁垮塌等事故細節公布

警鐘長鳴!國務院安委辦通報典型案例 商洛高速橋梁垮塌等事故細節公布

極目新聞
2026-06-14 09:38:49
自我葬送的冠軍!三重致命崩盤,揭秘馬刺總決賽潰敗真正真相

自我葬送的冠軍!三重致命崩盤,揭秘馬刺總決賽潰敗真正真相

君馬體育
2026-06-14 13:55:54
搶在王毅專機起飛前,烏蘭巴托那邊的小動作已經擺上桌

搶在王毅專機起飛前,烏蘭巴托那邊的小動作已經擺上桌

混沌錄
2026-06-14 00:30:26
多國嘉賓:在中國,人權不是抽象概念,而是扎根現實的民生福祉

多國嘉賓:在中國,人權不是抽象概念,而是扎根現實的民生福祉

中國日報網
2026-06-13 17:07:04
移民英國真相大白后,劉鑾雄近況曝光,難怪甘比要拋頭露面當網紅

移民英國真相大白后,劉鑾雄近況曝光,難怪甘比要拋頭露面當網紅

以茶帶書
2026-06-13 14:27:01
詹俊也犯了巨大巨大失誤!將美國歌手誤認為是小羅:實在是太像了

詹俊也犯了巨大巨大失誤!將美國歌手誤認為是小羅:實在是太像了

風過鄉
2026-06-14 07:49:53
原諒林丹10年,謝杏芳定居西班牙夫妻分居,10歲兒子才是未來依靠

原諒林丹10年,謝杏芳定居西班牙夫妻分居,10歲兒子才是未來依靠

攬星河的筆記
2026-06-13 16:35:03
SpaceX上市馬斯克成首位萬億富豪,中國卻用長征五號每次只打10顆衛星:太空競賽的真正差距

SpaceX上市馬斯克成首位萬億富豪,中國卻用長征五號每次只打10顆衛星:太空競賽的真正差距

商道童言
2026-06-13 20:05:25
市占率跌破10%!日系三巨頭在華遇挫:豪擲110億赴印度建廠

市占率跌破10%!日系三巨頭在華遇挫:豪擲110億赴印度建廠

快科技
2026-06-10 10:15:12
總決賽命中率34.3%!??怂箵肀ёYR唐斯布朗奪冠

總決賽命中率34.3%!福克斯擁抱祝賀唐斯布朗奪冠

體壇周報
2026-06-14 13:58:15
白鹿的中專學歷實錘了!?

白鹿的中專學歷實錘了???

八卦瘋叔
2026-06-14 10:56:48
網友曬出清北鵝腿群聊天記錄,一群學生刷:姨姨,腿腿,餓餓

網友曬出清北鵝腿群聊天記錄,一群學生刷:姨姨,腿腿,餓餓

映射生活的身影
2026-06-13 18:24:17
“寶媽”回鄉考編排名第一,沒等來入職通知卻被別人遞補,多次維權后崗位直接取消;相關部門立案調查

“寶媽”回鄉考編排名第一,沒等來入職通知卻被別人遞補,多次維權后崗位直接取消;相關部門立案調查

大風新聞
2026-06-13 18:34:21
好消息,克里米亞孤島基本成型

好消息,克里米亞孤島基本成型

李未熟擒話2
2026-06-14 08:00:26
中國14億人挑不出11個會踢球的?董路:印度挑不出1個會跳水的

中國14億人挑不出11個會踢球的?董路:印度挑不出1個會跳水的

念洲
2026-06-14 10:35:26
文班:這是我人生最深刻一課,總決賽大部分時間是我們統治著比賽

文班:這是我人生最深刻一課,總決賽大部分時間是我們統治著比賽

懂球帝
2026-06-14 13:01:11
2026-06-14 14:23:00
機器之心Pro incentive-icons
機器之心Pro
專業的人工智能媒體
13246文章數 142669關注度
往期回顧 全部

科技要聞

Anthropic最強模型被禁,傳亞馬遜通風報信

頭條要聞

男友花94500元買"全國僅兩只"LV鴕鳥皮包 女友發現問題

頭條要聞

男友花94500元買"全國僅兩只"LV鴕鳥皮包 女友發現問題

體育要聞

8年8隊奪冠,鄧肯那句話,現在還給了馬刺

娛樂要聞

具俊曄曝大S離世前虛弱照,難怪小s退讓

財經要聞

金價跌至900元關口,大媽又來抄底了!

汽車要聞

深藍S07華為乾崑激光版增程車型上市 限時15.49萬元起

態度原創

游戲
房產
教育
旅游
公開課

《神秘海域》還活著!記者稱新作已進入開發階段

房產要聞

海南最賺錢行業曝光!最快4年半,??谌钯I三房!

教育要聞

2026年高考本科分數線預測!特控線有望下降,今年的考生很幸運

旅游要聞

在福建霞浦,看“漁舟唱晚”與“濱海煙火”撞個滿懷

公開課

李玫瑾:為什么性格比能力更重要?

無障礙瀏覽 進入關懷版