标签:diffusion-models
-
生成对抗网络与扩散模型在3D结构预测中的演进及其在药物研发领域的应用
📝
🎙️ Latent Space
📄 文章探讨了生成对抗网络(GAN)向扩散模型的演进,指出扩散模型已成为处理蛋白质和蛋白质配体系统等领域的重要基元。同时介绍了AI研究人员如何利用物理学背景改进分子建模算法,并讨论了在药物研发中,通过对真实项目失败模式的分析来确定关键科学目标的重要性。
-
Nvidia 专家解析:加速扩散模型的量化、缓存与蒸馏策略
📝
🎙️ AI Engineer
📄 Nvidia 专家 Ziv Ilan 探讨了优化扩散模型以实现实时生成的路径。他详细阐述了量化、缓存和蒸馏三大核心技术,并介绍了开源库 FastGen 在降低算力门槛与提升训练稳定性上的实际应用。
-
超越U-Net:Transformer在扩散模型中的高效与稳定表现 · 乔木博客
🎙️ 向阳乔木
📄 本文介绍了 Diffusion Transformers (DiT) 如何用 Transformer 架构取代扩散模型中的 U-Net,并证明了 Transformer 的规模扩展定律同样适用于图像生成。文章强调 Gflops 是比参数量更关键的性能指标,详细阐述了 DiT 的 Patchify、条件注入(adaLN-Zero)及训练稳定性,并指出其对 Stable Diffusion 3、FLUX.1 和 Sora 等后续模型发展产生了深远影响,标志着扩散模型进入了与语言模型一致的 Transformer 发展轨道。
-
Diffusion 模型到底是什么? · 乔木博客
🎙️ 向阳乔木
📄 本文阐述了 Diffusion 模型(扩散模型)作为一种训练框架的本质,而非模型架构。它借鉴物理扩散现象,并具有在数据稀缺场景下的优势。文章分析了 Diffusion 模型早期发展缓慢的原因,对比了其在图像与文本生成领域的成熟度差异,并与自回归模型(如 GPT)进行比较。最后,文章探讨了算力、数据、工程积累等因素的作用,并引发了对 AI 前沿驱动因素的思考。
-
扩散模型深度解析:从噪声到艺术的数学旅程 (斯坦福CME296精华)
📝
🎙️ Best Partners TV
📄 本视频深度解析了扩散模型(Diffusion Models)的工作原理,涵盖了从随机噪声出发的生成过程、前向加噪与逆向去噪的核心步骤、变分推断在解决不可解问题中的应用、以及DDIM等优化技术。通过类比和数学推导,揭示了扩散模型如何从混沌中创造高分辨率图像,并探讨了其工程实现中的效率挑战与解决方案。
-
规模化构建生成式音视频模型:Google DeepMind 的幕后技术洞察
📝
🎙️ AI Engineer
📄 本文由 Google DeepMind 研究科学家 Sander Dieleman 分享,深入探讨了训练大规模扩散模型的核心环节。内容涵盖了数据清洗的重要性、潜空间表示(Latent Representation)的原理、扩散过程的频域分析、Transformer 架构的演进、采样引导(Guidance)的威力以及模型蒸馏与控制信号的最新进展,揭示了 Veo 等前沿模型背后的技术细节。