新闻中心

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

2023-12-04
浏览次数:
返回列表

为了应对多模态大语言模型中视觉信息提取不充分的问题,哈尔滨工业大学(深圳)的研究人员提出了双层知识增强的多模态大语言模型-九天(JiuTian-LION)。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

需要重新写的内容是:论文链接:https://arxiv.org/abs/2311.11860

GitHub: https://github.com/rshaojimmy/JiuTian 

项目主页: https://rshaojimmy.github.io/Projects/JiuTian-LION

VALL-E VALL-E

VALL-E是一种用于文本到语音生成 (TTS) 的语言建模方法

VALL-E 134 查看详情 VALL-E

与现有的工作相比,九天首次分析了图像级理解任务和区域级定位任务之间的内部冲突,提出了分段指令微调策略和混合适配器来实现两种任务的互相提升。

通过注入细粒度空间感知和高层语义视觉知识,九天实现了在包括图像描述、视觉问题、和视觉定位等17个视觉语言任务上显著的性能提升( 比如Visual Spatial Reasoning 上高达5% 的性能提升),在其中13个评测任务上达到了国际领先水平,性能对比如图1所示。

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

图1:对比其他MLLMs,九天在大部分任务上都取得了最优的性能。

九天JiuTian-LION

通过赋予大型语言模型(LLMs)多模态感知能力,一些工作开始生成多模态大语言模型(MLLMs),并在许多视觉语言任务上取得了突破性进展。然而,现有的MLLMs主要采用图文对预训练得到的视觉编码器,如CLIP-ViT

这些视觉编码器的主要任务是学习图像层面的粗粒度图像文本模态对齐,但是它们缺乏全面的视觉感知和信息抽取能力,无法进行细粒度的视觉理解

在很大程度上,这种视觉信息提取不足和理解程度不够的问题会导致MLLMs存在视觉定位偏差、空间推理不足和物体幻觉等多个缺陷,如图2所示

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

请参考图2:九天(JiuTian-LION)是一种采用双层视觉知识增强的多模态大语言模型

九天相较于现有的多模态大语言模型(MLLMs),通过注入细粒度空间感知视觉知识和高层语义视觉证据,有效地提升了MLLMs的视觉理解能力,生成更准确的文本回应,减少了MLLMs的幻觉现象

双层视觉知识增强的多模态大语言模型-九天(JiuTian-LION)

为了解决MLLMs在视觉信息提取和理解方面存在的不足,研究人员提出了一种双层视觉知识增强的MLLMs方法,被称为九天(JiuTian-LION)。具体的方法框架如图3所示

该方法主要从两方面增强MLLMs,渐进式融合细粒度空间感知视觉知识(Progressive Incorporation of Fine-grained Spatial-aware Visual knowledge)和软提示下的高层语义视觉证据(Soft Prompting of High-level Semantic Visual Evidence)。

具体来说,研究人员提出了一种分段指令微调策略,以解决图像级理解任务和区域级定位任务之间的内部冲突。他们逐步将细粒度的空间感知知识注入到MLLMs中。同时,他们将图像标签作为高层语义视觉证据加入MLLMs,并使用软提示方法来减轻不正确标签可能带来的负面影响

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

九天(JiuTian-LION)模型框架图如下所示:

该工作通过分段式训练策略先分别基于Q-Former 和 Vision Aggregator – MLP 两个分支学习图像级理解和区域级定位任务,然后在最后训练阶段利用具有路由机制的混合适配器来动态融合不同分支的知识提升模型在两种任务的表现。

该工作还通过RAM提取图像标签作为高层语义视觉证据,然后提出软提示方法来提高高层语义注入的效果

渐进式融合细粒度空间感知视觉知识

当直接将图像级理解任务(包括图像描述和视觉问答)与区域级定位任务(包括指示表达理解,指示表达生成等)进行单阶段混合训练时,MLLMs 会遭遇两种任务之间存在的内部冲突,从而不能在所有任务上取得较好的综合性能。

研究人员认为这种内部冲突主要由两个问题引起。第一个问题是缺少区域级的模态对齐预训练,当前具有区域级定位能力的 MLLMs 大多先使用大量相关数据进行预训练,不然很难在有限地训练资源下让基于图像级模态对齐的视觉特征适应区域级任务。

另一个问题是图像级理解任务和区域级定位任务之间的输入输出模式差异,后者需要模型额外理解关于物体坐标的特定短句(以横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%的形式)。为了解决以上问题,研究人员提出了分段式指令微调策略,以及具有路由机制的混合适配器。

如图4所示,研究人员将单阶段指令微调过程拆分为三阶段:

使用ViT、Q-Former和图像级适配器学习全局视觉知识的图像级理解任务;使用Vision Aggregator、MLP和区域级适配器学习细粒度空间感知视觉知识的区域级定位任务;提出了具有路由机制的混合适配器,动态融合不同分支中学习到的不同粒度的视觉知识。表3显示了分段式指令微调策略相对于单阶段训练的性能优势

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

图4:分段式指令微调策略


横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

对于注入软提示下的高层语义视觉证据,需要进行重写处理

研究人员提出使用图像标签作为高层语义视觉证据的有效补充,以进一步增强MLLMs的全局视觉感知理解能力

具体来说,首先通过 RAM 提取图像的标签,然后利用特定的指令模版“According to , you are allowed to use or partially use the following tags:”包装图像标签。该指令模版中的“”会被替换为一个可学习的软提示向量。

配合模版中特定短语“use or partially use”,软提示向量可以指导模型减轻不正确标签带来的潜在负面影响。

实验结果

研究人员在包括图像描述(image captioning)、视觉问答(VQA)、和指示表达理解(REC)等17个任务基准集上进行了评测。

实验结果表明,九天在13个评测集上达到了国际领先水平。特别的,相比较 InstructBLIP 和 Shikra,九天分别在图像级理解任务和区域级定位任务上取得了全面且一致的性能提升,在 Visual Spatial Reasoning (VSR) 任务上可达到最高5%的提升幅度。

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

从图5可以看出,在不同的视觉语言多模态任务中,九天和其他MLLMs的能力存在差异,表明九天在细粒度视觉理解和视觉空间推理能力方面表现更优秀,并且能够输出具有更少幻觉的文本回应

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

重写的内容是:第五张图展示了对九天大模型、InstructBLIP和Shikra的能力差异进行的定性分析

图6通过样本分析,表明了九天模型在图像级和区域级视觉语言任务上都具有优秀的理解和识别能力。

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

第六张图:通过更多例子的分析,从图像和区域级视觉理解的角度展示了九天大模型的能力

总结

(1)该工作提出了一个新的多模态大语言模型-九天:通过双层视觉知识增强的多模态大语言模型。

(2)该工作在包括图像描述、视觉问答和指示表达理解等17个视觉语言任务基准集上进行评测,其中13个评测集达到了当前最好的性能。

(3)这项工作提出了一种分段式指令微调策略,以解决图像级理解和区域级定位任务之间的内部冲突,并实现了两种任务之间的相互提升

(4)该工作成功将图像级理解和区域级定位任务进行整合,多层次全面理解视觉场景,未来可以将这种全面的视觉理解能力应用到具身智能场景,帮助机器人更好、更全面地识别和理解当前环境,做出有效决策。

以上就是横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%的详细内容,更多请关注其它相关文章!


# 训练  # follow  # 多模  # 直升  # 提出了  # 所示  # 两种  # 细粒度  # ai  # 六枝特区网络推广微信营销  # 宝山抖音seo运营推广  # 网站推广局限性是什么  # seo站长交流  # 饿了么网站推广哪个好  # seo和sem哪种客户需要  # seo顾问赚钱多少  # 网站霸屏推广定制  # 丹东网站建设平台介绍  # 狼道seo  # 是一种  # 麦当劳  # 开源  # 如图 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 春运订票什么时候抢票  建伍遥控器power是什么意思  固态硬盘质量如何  如何用命令提示符显示隐藏分区  路由器power闪红绿灯闪是什么意思  春运大巴上抢票怎么抢票  万能表上的power是什么意思  苹果16粉色还有哪些机型  put linux命令如何书写  单片机显存怎么设置最佳  vue项目如何用typescript  手机拍显示屏有条纹怎么去除  华为5g手机怎么选择  固态硬盘如何打开软件  vs怎么编写typescript  苹果16哪些型号好用  金色cmyk色值是多少  为什么要用typescript6  苹果16有哪些不同  分享一个稳定的ao3镜像网址  闲鱼上面的power是什么意思  单片机怎么储存和显示  显示器power接口是什么意思  typescript有哪些版本  推特是什么软件国内可以使用吗  如何选择启用固态硬盘  自己如何安装固态硬盘  如何利用运行命令查看声音启动  问一下市盈率是什么意思  360n7锁屏壁纸怎么固定  如何增加固态硬盘  win7怎么关闭360壁纸屏保  华为使用nfc功能是什么意思  如何进入 dos 命令行  固态硬盘如何测试  固态硬盘2m如何修复  performance是什么意思  如何进入安卓命令行  市盈率ttm是什么意思  交管12123协议头不完整怎么解决  360f4怎么取消百变壁纸  夸克为什么老是投屏失败  怎么在typescript定义集合  j*a整形怎么转数组  国标控制器单片机怎么接线  单片机加热片怎么制作  关系型数据库和非关系型数据库有哪些  youtube受限模式是什么_youtube受限模式是什么意思  j*a怎么用json数组  ftp$如何执行宏命令 

搜索