新闻中心
扩散模型攻克算法难题,AGI不远了!谷歌大脑找到迷宫最短路径
「扩散模型」也能攻克算法难题?
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
图片
一位博士研究人员做了一个有趣的实验,用「离散扩散」寻找用图像表示的迷宫中的最短路径。
图片
作者介绍,每个迷宫都是通过反复添加水平和垂直墙生成的。
其中,起始点和目标点随机选取。
从起点到目标点的最短路径中,随机采样一条作为解决方案的路径。最短路径是通过精确算法算出来的。
图片
然后使用离散扩散模型和U-Net。
将起点和目标的迷宫被编码在一个通道中,而模型在另一个通道中用解来消除迷宫的噪声。
图片
再难一点的迷宫,也能做的很好。
图片
为了估算去噪步骤 p(x_{t-1} | x_t),算法会估算 p(x_0 | x_t)。在这个过程中可视化这一估计值(底行),显示「当前假设」,最终聚焦在结果上。
图片
英伟达高级科学家Jim Fan表示,这是一个有趣的实验,扩散模型可以「渲染」算法。它可以仅从像素实现迷宫遍历,甚至使用了比Transforme弱得多的U-Net。
我一直认为扩散模型是渲染器,而Transformer是推理引擎。看起来,渲染器本身也可以编码非常复杂的顺序算法。
图片
这个实验简直惊呆了网友,「扩散模型还能做什么?!」
图片
还有人表示,一旦有人在足够好的数据集上训练扩散Transformer,AGI就解决了。
图片
不过这项研究还未正式发布,作者表示稍后更新在arxiv上。

值得一提的是,这个实验中,他们采用了谷歌大脑团队曾在2025年提出的离散扩散模型。
图片
就在最近,这项研究重新更新了一版。
离散扩散模型
「生成模型」是机器学习中的核心问题。
它既可用于衡量我们捕获自然数据集统计数据的能力,也可用于需要生成图像、文本和语音等高维数据的下游应用程序。
GAN、VAE、大型自回归神经网络模型、归一化流等方法,在样本质量、采样速度、对数似然,以及训练稳定性方面都各有千秋。
最近,「扩散模型」已成为图像、音频生成,最受欢迎的替代方案。
它可以用更少的推理步骤,实现了与GAN相当的样本质量,以及与自回归模型相当的对数似然。
图片
论文地址:https://www.php.cn/link/46994a3cd8d943d03b44b8fc9792d435
虽然已有人提出了离散和连续状态空间的扩散模型,但最近的研究主要集中在,连续状态空间中运行的高斯扩散过程(如实值图像和波形数据)。
离散状态空间的扩散模型,已在文本和图像分割领域进行了探索,但是还没有在文本和图像的大规模生成任务中,证明是一个有竞争力的模型。
谷歌研究团队提出了一种全新的离散去噪扩散概率模型(D3PM)。
研究中,作者证明了过度矩阵的选择是一个重要的设计决策,它能改善图像和文本领域的结果。
此外,他们还提出了一种新的损失函数,它结合了变分下界和辅助的交叉熵损失。
在文本方面,这个模型在字符级文本生成方面取得了很好的效果,同时可以扩展到大词汇量的LM1B数据集上。
在CIFAR-10图像数据集上,最新模型接近了连续空间DDPM模型的样本质量,并超过了连续空间 DDPM 模型的对数似然。
图片
项目作者
Arnaud Pannatier

Arnaud Pannatier从2025年3月在导师François Fleuret的机器学习小组开始攻读博士学位。
他最近开发了HyperMixer,使用超级网络让MLPMixer能够处理各种长度输入。这使得模型能够以一种排列不变的方式处理输入,并证明了它给了模型一种随着输入长度线性扩展的注意力行为。
在EPFL,他先后获得了物理学学士学位和计算机科学与工程硕士学位(CSE-MASH)。
参考资料:
https://www.php.cn/link/46994a3cd8d943d03b44b8fc9792d435
https://www.php.cn/link/1879d84e181b6262704e95372dc9f4dc
以上就是扩散模型攻克算法难题,AGI不远了!谷歌大脑找到迷宫最短路径的详细内容,更多请关注其它相关文章!
# agi
# 安平数字营销推广
# 曲阜网站推广软件
# 的是
# 太强
# 核心技术
# 好用
# 很好
# 是一个
# 提出了
# 化生
# 远了
# 最短
# follow
# 排列
# 网络模型
# gan
# 仙女山营销推广公司
# 推广音乐网站怎么赚钱的
# 网站建设作业代码怎么写
# 济宁网站关键词优化排名
# 中国网站建设代码
# 自助网站建设常见问题
# SEO入门相机自拍
# 社区网站推广
相关栏目:
【
行业资讯67740 】
【
技术百科0 】
【
网络运营39195 】
相关推荐:
折叠屏有哪些手机
爱奇艺vip会员可以同时几个人用?
j*a 怎么清空数组元素
夸克*免费吗
手机拍电脑屏幕有条纹怎么解决
vb中的datediff函数怎么用 VB中的DateDiff函数:详尽指南
苹果16系统有哪些功能
汽车排量是什么意思
j*a怎么讲数组打印
为什么学typescript
如何学好typescript
市盈率中1stdv是什么意思
在遥控器中power是什么意思
输入命令如何换行
红米手机怎么设置变成5G手机
typescript掌握哪些可以做项目
固态硬盘如何检查
如何查看win10版本命令行
美食音乐每日推荐怎么写
为什么夸克运行不了
如何判断固态硬盘端口
市盈率300是什么意思
5G手机导航怎么旋转
如何增加固态硬盘
怎么用win7系统盘重装系统
如何用命令下载服务器网站
夸克高考为什么不靠谱
市盈率底下 18A 19E 是什么意思
固态硬盘如何消除缓存
单片机蓝牙怎么开启设备
type-c接口接地是什么意思
焊机上power指示灯亮是什么意思
燃气热水器上的power是什么意思
夸克用的什么服务器
移动固态硬盘如何使用
如何显示固态硬盘
typescript适合什么用
哪里要用typescript
夸克文字口令是什么意思
安装固态硬盘如何设置
typescript和node学哪个
苹果16要升级哪些功能
dos命令如何复制目录结构
高市盈率是什么意思
春运返程如何抢票成功
固态硬盘内存如何查找
如何正确使用固态硬盘
如何编写一个linux命令
怎么更新typescript
苹果16颜色有哪些


2024-04-02
浏览次数:次
返回列表