新闻中心

大模型幻觉率排行:GPT-4 3%最低,谷歌Palm竟然高达27.2%

2023-11-14
浏览次数:
返回列表

人工智能发展进步神速,但问题频出。OpenAI 新出的 GPT 视觉 API 前脚让人感叹效果极好,后脚又因幻觉问题令人不禁吐槽。

幻觉一直是大模型的致命缺陷。由于数据集庞杂,其中难免会有过时、错误的信息,导致输出质量面临着严峻的考验。过多重复的信息还会使大模型形成偏见,这也是幻觉的一种。但是幻觉并非无解命题。开发过程中对数据集慎重使用、严格过滤,构建高质量数据集,以及优化模型结构、训练方式都能在一定程度上缓解幻觉问题。

有那么多流行的大型模型,它们对缓解幻觉的效果如何呢?这里有一个明确对比它们差距的排行榜

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

大模型幻觉率排行:GPT-4 3%最低,谷歌Palm竟然高达27.2%

Vectara 平台发布了这个排行榜,该平台专注于人工智能。排行榜的更新日期是2025年11月1日,Vectara 表示他们将会继续跟进幻觉评估,以便随着模型的更新而更新排行榜

项目地址:https://github.com/vectara/hallucination-leaderboard

为了确定这个排行榜,Vectara进行了事实一致性研究,并训练了一个模型来检测LLM输出中的幻觉。他们使用了一个媲美SOTA模型,并通过公共API向每个LLM提供了1000篇简短文档,并要求它们仅使用文档中呈现的事实对每篇文档进行总结。在这1000篇文档中,只有831篇文档被每个模型总结,其余文档由于内容限制被至少一个模型拒绝回答。利用这831份文件,Vectara计算了每个模型的总体准确率和幻觉率。每个模型拒绝响应prompt的比率详见「Answer Rate」一栏。发送给模型的内容都不包含非法或不安全内容,但其中的触发词足以触发某些内容过滤器。这些文件主要来自CNN/每日邮报语料库

大模型幻觉率排行:GPT-4 3%最低,谷歌Palm竟然高达27.2%

需要注意的是,Vectara 评估的是摘要准确性,而不是整体事实准确性。这样可以比较模型对所提供信息的响应。换句话说,评估的是输出摘要是否与源文件「事实一致」。由于不知道每个 LLM 是在什么数据上训练的,因此对于任何特别问题来说,确定幻觉都是不可能的。此外,要建立一个能够在没有参考源的情况下确定回答是否是幻觉的模型,就需要解决幻觉问题,而且需要训练一个与被评估的 LLM 一样大或更大的模型。因此,Vectara 选择在总结任务中查看幻觉率,因为这样的类比可以很好地确定模型整体真实性。

幻觉模型的检测地址是:https://huggingface.co/vectara/hallucination_evaluation_model

Glean Glean

Glean是一个专为企业团队设计的AI搜索和知识发现工具

Glean 210 查看详情 Glean

此外,越来越多的LLM被用于RAG(Retrieval Augmented Generation,检索增强生成)管道以回答用户的查询,如Bing Chat和谷歌聊天集成。在RAG系统中,模型被部署为搜索结果的汇总器,因此该排行榜也是衡量模型在RAG系统中使用时准确性的良好指标

鉴于GPT-4一直以来的出色表现,它的幻觉率最低似乎不足为奇。然而,一些网友表示,他们对于GPT-3.5和GPT-4之间并没有太大的差距感到惊讶

大模型幻觉率排行:GPT-4 3%最低,谷歌Palm竟然高达27.2%

在追赶GPT-4和GPT-3.5之后,LLaMA 2表现出色。然而,谷歌的大型模型表现让人不满意。一些网友表示,谷歌的BARD常常用“我还在训练中”来回避其错误答案

大模型幻觉率排行:GPT-4 3%最低,谷歌Palm竟然高达27.2%

有了这样的排行榜,能够让我们对于不同模型之间的优劣有更加直观的判断。前几天,OpenAI 推出了 GPT-4 Turbo,这不,立刻有网友提议将其也更新在排行榜中。

大模型幻觉率排行:GPT-4 3%最低,谷歌Palm竟然高达27.2%

下次的排行榜会是怎样的,有没有大幅变动,我们拭目以待。

以上就是大模型幻觉率排行:GPT-4 3%最低,谷歌Palm竟然高达27.2%的详细内容,更多请关注其它相关文章!


# 开源  # 提升seo工具 si  # 台湾知名网站建设商  # 阿里指数 关键词排名  # 广州SEO优化电池充电  # 大足区seo优化优惠吗  # 网站建设开发优质商家  # 贵州网站优化设计  # seo发烧友  # 黑龙江网站推广销售公司  # 谷歌seo专业术语指南  # 都是  # 模型  # 下载使用  # 最全  # 句话  # 站上  # 让人  # 的是  # 腾讯  # 文档  # llama  # ai 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: bored是什么意思  焊机上power指示灯亮是什么意思  typescript是什么软件  镜像ao3链接入口  云笔记本电脑有什么用  datediff函数怎么用视频  固态硬盘如何打开软件  typescript属性只读如何修改  j*a二数组怎么创建  单片机显存怎么设置最佳  夸克*免费吗  单片机怎么连接电路图  夸克高考为什么不靠谱  typescript需要学多久  苹果16系统有哪些问题  新装固态硬盘如何安装  如何卸载typescript  春运抢票准备什么东西  春运抢票哪里最火热  照相机上面power是什么意思  j*a数组怎么放字符  power在录音笔上是什么意思  j*a数组对象怎么取  360桌面壁纸怎么弄掉  春运抢票可以抢几次啊  市盈率292是什么意思  三星固态硬盘如何安装  如何更新苹果ios16  新的固态硬盘如何分区  空调power灯一直闪是什么意思  如何看固态硬盘信息  怎么把手机里爱奇艺的视频下载到u盘里  华为5g手机怎么用4g网络  比亚迪秦nfc功能是什么意思  电脑type-c接口是什么意思  苹果16自带配件有哪些  启辰星power标志是什么意思  夸克是什么用途  命令指示符如何打开盘符  j*a数组怎么取元素  python 如何执行linux命令  oracle中datediff函数怎么用 Oracle中DATEDIFF函数详解  征信不好如何恢复信誉度 ‌征信不好恢复信誉度的方法  市盈率亏损是什么意思  typescript怎么设置滚动条  微波炉power中文是什么意思  python和typescript学哪个  solo交友软件怎么恢复聊天记录  苹果16哪些功能好用  哪些明星在用苹果16 

搜索