新闻中心
基于LLaMA却改张量名,李开复公司大模型引争议,官方回应来了
前段时间,开源大模型领域迎来了一个新的模型 —— 上下文窗口大小突破 200k,能一次处理 40 万汉字的「Yi」。
创新工场董事长兼 CEO 李开复创立了大模型公司「零一万物」,并且构建了这个大模型,其中包括了 Yi-6B 和 Yi-34B 两个版本
根据 Hugging Face 英文开源社区平台和 C-Eval 中文评测榜单,Yi-34B 推出时取得了多项 SOTA 国际最佳性能指标认可,成为全球开源大模型「双料冠军」,击败了 LLaMA2 和 Falcon 等开源竞品。

Yi-34B 也成为当时唯一成功登顶 Hugging Face 全球开源模型排行榜的国产模型,称「全球最强开源模型」。
发布后,这个模型吸引了许多国内外的研究人员和开发者的关注
但最近,有研究者发现,Yi-34B 模型基本上采用了 LLaMA 的架构,只是重命名了两个张量。

请点击此链接查看原贴:https://news.ycombinator.com/item?id=38258015
帖子中还提到:
Yi-34B 的代码实际上是对 LLaMA 代码的一次重构,但看似并未作出任何实质性改变。这个模型明显是基于原始 Apache 2.0 版的 LLaMA 文件进行的编辑,但却未提及 LLaMA:

Yi vs LLaMA 代码对比。代码链接:https://www.diffchecker.com/bJTqkvmQ/
此外,这些代码更改并没有通过 Pull Request 的方式提交到 transformers 项目中,而是以外部代码的形式附加上去,这可能存在安全风险或不被框架所支持。HuggingFace 排行榜甚至不会对这个上下文窗口最高可达 200K 的模型进行基准测试,因为它没有自定义代码策略。
他们声称这是 32K 模型,但它被配置为 4K 模型,没有 RoPE 伸缩配置,也没有解释如何伸缩(注:零一万物之前表示模型本身在 4K 的序列上进行训练,但是在推理阶段可以扩展到 32K)。目前,关于其微调数据的信息为零。他们也没有提供复现他们的基准测试的说明,包括可疑的 MMLU 高分。
任何在人工智能领域工作过一段时间的人都不会对此视而不见。这是虚假宣传吗?违反许可证规定吗?实际上是作弊了基准测试吗?谁在乎呢?我们可以换一篇论文,或者在这种情况下,拿走所有风险投资的钱。至少Yi在标准之上,因为它是一个基础模型,而且性能确实不错
在数天前,在 Huggingface 社区中,有开发者也指出:
根据我们的了解,除了重新命名两个张量之外,Yi 完全采用了 LLaMA 的架构。(input_layernorm, post_attention_layernorm)
Glean
Glean是一个专为企业团队设计的AI搜索和知识发现工具
210
查看详情

在讨论中,一些网友表示:如果他们要确切地使用Meta LLaMA的架构、代码库和其他相关资源,就必须遵守LLaMA规定的许可协议

为了遵守 LLaMA 的开源协议,一位开发者决定将自己的名字改回,并重新发布到 huggingface 上
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜
01-ai/Yi-34B,张量已重命名以匹配标准 LLaMA 模型代码。相关链接:https://huggingface.co/chargoddard/Yi-34B-LLaMA
通过阅读这段内容,我们可以推断出贾扬清离开阿里并开始创业的消息是前几天在他的朋友圈中提到的

对于这件事,机器之心也向零一万物进行了求证。零一万物回应说:
GPT 是一个业内公认的成熟架构,LLaMA 在 GPT 上做了总结。零一万物研发大模型的结构设计基于 GPT 成熟结构,借鉴了行业顶尖水平的公开成果,同时基于零一万物团队对模型和训练的理解做了大量工作,这是我们首次发布获得优秀结果的地基之一。与此同时,零一万物也在持续探索模型结构层面本质上的突破。
模型结构仅是模型训练其中一部分。Yi 开源模型在其他方面的精力,比如数据工
程、训练方法、baby sitting(训练过程监测)的技巧、hyperparameter 设置、评估方法以及对评估指标的本质理解深度、对模型泛化能力的原理的研究深度、行业顶尖的 AI Infra 能力等,投入了大量研发和打底工作,这些工作往往比起基本结构能起到更大的作用跟价值,这些也是零一万物在大模型预训练阶段的核心技术护城河。
在进行大量的训练实验过程中,我们根据实验执行的需求对代码进行了改名。我们非常重视开源社区的反馈,并对代码进行了更新,以更好地融入Transformer生态系统
我们非常感谢社区的反馈,我们在开源社区刚刚起步,希望和大家携手共创社区繁荣,易开源将会尽最大努力持续进步
以上就是基于LLaMA却改张量名,李开复公司大模型引争议,官方回应来了的详细内容,更多请关注其它相关文章!
# ai
# 常州seo快速排名
# 寿光网站建设哪个好用
# 我们可以
# 重构
# 进行了
# 这是
# 是一个
# 腾讯
# 引争议
# 李开复
# 来了
# 开源
# llama
# hugging face
# 模型
# 沈阳网络营销推广机构
# 黎川企业网站建设招聘
# 徐州网站建设优化
# 密云区网站建设特价
# 百度视频营销推广
# 忠县百度seo
# 主播同款网站怎么做推广
# 艺术品网站建设团队
相关栏目:
【
行业资讯67740 】
【
技术百科0 】
【
网络运营39195 】
相关推荐:
个人征信不好如何恢复 个人征信不良的全面修复指南
early什么意思
单身交友必备软件
cos150度等于多少
广东春运几点抢票
单片机.lib文件怎么打开
power在充电器上是什么意思
市盈率中1stdv是什么意思
hen是什么意思
台达变频器power灯是什么意思
单片机log怎么看
openwrt有什么用
165开头的是什么电话号码
如何选购ssd固态硬盘
苹果16自带配件有哪些
typescript干什么的
苹果16更新了哪些软件
夸克为什么老是投屏失败
路亚竿上的power是什么意思
typescript入门要多久
怎么下载360桌面壁纸
typescript参数怎么用
市盈率pe是什么意思
typescript什么意思
三菱变频器POWER是什么意思
r中如何逐行执行命令
一秒是多少毫秒
什么是unix时间戳
单片机面包板怎么插
如何去除计算器的命令
折叠屏手机哪款最好
如何使用批处理命令编译vc程序
如何判断固态硬盘
命令控制台如何执行sql文件
如何安装台式机固态硬盘
vfp 命令窗口如何实现换行
如何4k对齐固态硬盘
为什么进行域名解析
固态硬盘如何消除缓存
单片机怎么控制闪烁技术
春运抢票准备什么
春运抢票最快几天能成功
如何由js快速切换typescript
j*a中数组怎么传递
如何通过dos命令
什么是夸克模组文件格式
8英寸等于多少厘米
linux如何安装yum命令
iphone拍电子屏有横条如何解决
阿里云盘的会员怎么用


2023-11-14
浏览次数:次
返回列表