首页 > 科技数码 >南洋理工大学AI图像生成新方法:只看有用部分

南洋理工大学AI图像生成新方法:只看有用部分

来源:互联网 2026-06-20 10:17:17

南洋理工大学提出频谱强制方法,在扩散模型训练中动态屏蔽被噪点淹没的高频信息,仅保留有用部分。该方法不修改训练流程,计算量仅增0.5%。在ImageNet上FID降低14.5%,训练时间节省17%-33%,适用于粗分块的自然图像生成。

南洋理工大学S-Lab实验室主导的一项研究,以预印本形式发布于2026年6月,揭示并解决了一个AI图像生成训练中的关键效率问题。

提到AI生成图片,人们通常会想到能够凭空创作逼真风景、人像的扩散模型。这类模型通过先向清晰图像添加噪点,再训练AI从噪点中还原图像的方式进行学习。

长期稳定更新的攒劲资源: >>>点此立即查看<<<

然而,南洋理工大学的研究团队发现,在去噪过程中,AI将大量计算资源浪费在了处理已完全被噪点覆盖、毫无信息价值的高频细节上。他们提出了一个名为频谱强制(Spectral Forcing,简称SF)的解决方案。该方案几乎不增加额外计算开销,也无需改动核心训练流程。

一、AI画图的底层逻辑:噪声与信号的博弈

理解此项研究,需先了解扩散模型的训练机制。以主流训练方式为例,AI在每个训练步骤看到的是一张介于纯噪点和清晰图像之间的“半成品图”。其任务是预测如何从当前状态走向清晰图像。

自然图像遵循一个规律:细节纹理等高频信息所携带的能量,远低于轮廓形状等低频信息。当加入噪点时,微弱的高频细节极易被彻底淹没。研究团队通过数学推导,精确界定了在每个训练时刻,哪些频率以上的信息已完全失去价值。

问题在于,AI模型并不知晓这条界线的存在。它仍然会耗费算力去处理那些已被噪点覆盖、不含任何有用信号的高频部分。

二、计算力的浪费:AI在学习无意义的内容

为了验证这一假设,研究团队进行了实验。他们训练了一个小型模型,并评估其在各“时刻-频率”组合上的预测有效性。

结果呈现出一个清晰的楔形区域图。在低频及靠近清晰图像的时刻,AI确实在学习有效信息。但在高频及靠近纯噪点的时刻,AI的预测要么退化为固定的数学公式,要么甚至不如最简单的零预测基线。这表明,大量计算被浪费在了两类无意义的任务上。

更关键的是,在ImageNet数据集上训练的真实大型模型中,同样观察到了这种浪费现象,证实了问题的普遍性。

三、频谱强制:动态调整的“低通滤镜”

解决方案的核心思想是:在每个训练时刻,主动屏蔽掉已被噪点覆盖的无用高频信息,只让AI专注于仍包含有效信号的部分。

频谱强制就像一把随时间伸缩的“低通滤镜”。其截止频率根据理论推导的动态界线设定——训练初期截止频率很低,仅允许极低频信息通过;随着训练推进,截止频率逐渐扩大,允许更多频率信息进入,直至最终取消滤镜。

技术实现上,它利用JPEG压缩同源的二维离散余弦变换(2D-DCT)来分解和重组图像频率。该操作不引入可学习参数,额外计算开销仅为总训练成本的约0.5%,且完全不影响原有训练流程。

关于截止频率的变化曲线(调度方案),线性增长方案在ImageNet标准设置下表现最佳,而从理论公式推导的解析方案则在更高分辨率场景中更具优势。

四、频谱强制的有效边界与适用条件

研究团队清晰地界定了该技术的适用范围。其效果最佳需要同时满足两个条件:

1. AI采用“粗粒度分块”处理图像(如图块数量较少)。
2. 图像的高频内容主要由噪点构成,而非有价值的信号。

通过在不同合成数据集上的对照实验,结论得到验证:在符合自然图像规律(高频信息少)的数据上,效果显著;而在富含清晰高频边缘的数据上,强行过滤反而会损害模型性能。

此外,当图像分块本身已很细(如256块),模型本就能看到较多细节时,频谱强制的收益会变小,但通常也不会造成损害。

五、真实数据集效果:显著提升训练效率与图像质量

在ImageNet-256数据集上的实验提供了有力证据。在使用特定模型架构和配置下,启用频谱强制后:

– 图像质量评测指标(FID)从24.19降至20.68,提升14.5%。
– 图像多样性与清晰度指标(初始分数)从83.28提升至93.96,提升约13%。

更重要的是训练效率的提升:加入频谱强制后,训练60轮次即可达到原本约90轮次的效果,训练120轮次可达原本约145轮次水平,预计可节省17%到33%的训练时间。

在更小的模型或更细的分块设置下,频谱强制也显示出稳定的早期优势或轻微改善,且不会对性能造成伤害。

六、调度方案选择:线性增长为何优于理论最优?

一个有趣的现象是,在ImageNet标准设置下,简单的线性调度方案表现优于理论上更优的解析方案。研究团队给出了三点解释:

1. 理论公式基于全局拟合,可能对真实图像极高频率的能量衰减估计过激,屏蔽了尚存微弱信号的部分。
2. 在粗分块配置下,解析方案早期过于保守,导致模型长时间接收的有效信息不足。
3. 解析方案截止频率增长在初期过慢,影响整体学习效率。

因此,线性方案在实践中成为了更稳健的默认选择,尤其是在标准分辨率下。

七、在文生图模型中的应用迁移

研究还将频谱强制应用于一个原生视觉-语言模型(SenseNova-U1)。这类模型通常也采用粗分块以控制序列长度,恰好适合频谱强制发挥效用。

在文字生成图像的基准测试中,加入频谱强制后,模型在多个需要理解整体语义结构的子任务上(如实体状态、计数等)获得了明显提升,这与低频信息编码语义的理论预测相符。

八、技术细节与参数影响

研究团队进一步测试了多项设计参数:

最低截止点:设置越小,迫使模型早期更专注低频,压力越大,默认值0.05表现稳健。
图像分辨率:分辨率越高,频谱强制的改善潜力越大,解析方案的优势也更明显。
计算开销:训练与推理阶段均仅增加约0.5%的计算量,无额外内存占用,无可学习参数。

总之,这项研究的重要贡献在于,它显式地揭示并修复了扩散模型训练中长期存在的“结构性浪费”。频谱强制通过一个动态滤镜,引导模型将计算力集中用于学习真正有用的频率信息。

对于用户,这意味着未来同算力下的模型训练更快、质量更高;对于开发者,这是一个几乎零成本即可集成到现有流程的实用改进。当然,它也非万能,在数据本身富含关键高频信息或模型已采用细粒度分块时,其收益会减小。研究团队对此保持了清晰的认知。

常见问题解答

Q1:频谱强制需要修改扩散模型的训练流程吗?

A:不需要。它仅是在图像输入模型前增加一个动态低通滤镜预处理步骤,不修改损失函数、采样器、模型架构等核心部分,额外计算开销极小。

Q2:频谱强制在所有图像生成任务中都有效吗?

A:并非如此。它在图像处理采用粗分块、且高频内容主要为噪点时效果最佳。若图像本身富含重要高频边缘,或模型已使用细粒度分块,则效果有限甚至可能轻微下降。

Q3:为什么在ImageNet标准设置下,线性调度方案优于理论解析方案?

A>主要原因在于,在256×256分辨率与64分块的标准配置下,理论解析方案对高频的过滤过于激进,且早期频率开放过慢,影响了模型接收有效训练信号的效率。线性方案提供了更均衡的增长,适应性更好。在高分辨率场景下,解析方案会重新显现优势。

侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述

热游推荐

更多
湘ICP备14008430号-1 湘公网安备 43070302000280号
All Rights Reserved
本站为非盈利网站,不接受任何广告。本站所有软件,都由网友
上传,如有侵犯你的版权,请发邮件给xiayx666@163.com
抵制不良色情、反动、暴力游戏。注意自我保护,谨防受骗上当。
适度游戏益脑,沉迷游戏伤身。合理安排时间,享受健康生活。