新闻中心
ICLR 2025|浙大、千问发布预训练数据管理器DataMan,53页细节满满
DataMan:提升大语言模型预训练效率的数据管理器
aixiv专栏持续报道全球顶尖ai研究成果。本文介绍由浙江大学和阿里巴巴千问团队合作完成的一项研究,该研究针对大语言模型(llms)预训练数据选择问题,提出了一种名为dataman的数据管理器,用于提升模型训练效率。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

在模型规模不断增长的背景下,预训练数据质量至关重要。然而,现有方法往往依赖经验和直觉,缺乏系统性指导。DataMan通过逆向思维,即分析模型对不同数据质量的反应,来建立一套全面的数据质量评估标准。
一、基于逆向思维的质量标准构建
DataMan的研究人员采用四步法构建质量标准:
-
分析困惑度异常: 利用超级LLM分
析预训练数据中困惑度(PPL)极高和极低的文本,找出影响模型性能的关键文本特征。 - 迭代提炼标准: 基于步骤1的分析,迭代提炼出13个关键的文本质量标准,涵盖准确性、连贯性、语言风格、知识新颖性、主题聚焦等多个方面。
- 构建综合评分体系: 除了13个标准外,还构建了一个综合“总体评分”,更全面地评估文本质量。
- 验证标准有效性: 将超级LLM的评分与人工评分进行对比,验证标准的有效性,结果显示一致性超过95%。

二、DataMan数据管理流程
DataMan是一个集数据标注、模型微调和数据采样于一体的数据管理器:
Zyro AI Background Remover
Zyro推出的AI图片背景移除工具
145
查看详情
- 数据标注: 对SlimPajama语料库进行标注,为每个文档打上14个质量评分和15个应用领域的标签。
- 模型微调: 使用Qwen2-1.5B作为基础模型,通过文本生成损失进行微调,使DataMan能够自动评分和识别领域。
- 数据采样: 基于DataMan的评分和领域识别结果,采用top-k采样等策略,选择最优的数据子集进行模型训练。

三、实验结果与分析
研究人员使用DataPajama (447B tokens)语料库进行实验,对比了DataMan与其他数据选择方法的性能:
- DataMan显著提升模型性能: 在语言建模、任务泛化和指令遵循等方面,使用DataMan选择的数据训练的模型均优于基线模型,指令遵循任务的胜率高达78.5%。
- 有效进行领域数据混合: DataMan的领域识别能力可以有效地进行领域数据混合,进一步提升模型在特定领域的性能。
- 数据量与性能正相关: 使用更大规模的数据集(60B tokens)进行训练,模型性能进一步提升。
- PPL与ICL性能的错位分析: 研究分析了困惑度(PPL)与上下文学习(ICL)性能之间的关系,发现域不匹配和ICL任务复杂性是造成错位的主要原因。





论文信息:
- 论文标题:DataMan: Data Manager for Pre-training Large Language Models
- 作者单位:浙江大学 & 阿里巴巴
- 论文链接:https://www.php.cn/link/5424eee00c1ab222f20cea406d120812 (链接可能需要更新为实际链接)
DataMan为大语言模型的预训练数据选择提供了一种新的思路和方法,其在提升模型性能和效率方面具有显著的潜力。
以上就是ICLR 2025|浙大、千问发布预训练数据管理器DataMan,53页细节满满的详细内容,更多请关注其它相关文章!
# 你该
# 平舆企业推广营销招聘网
# 关于seo优化总结
# seo网站工作
# 海尔网站推广策划书1
# 荔湾网站推广方法
# seo公司什么意思
# 游戏推广电话营销话术
# 网站建设运营实习生
# 医疗营销推广平台
# 公司门户网站建设步骤
# 如何应对
# 科大
# 工程
# 网易
# 系列产品
# 阿里巴巴
# 质量标准
# 浙江大学
# 开源
# 管理器
# Qwen
# 2025
# ai
# dataman
# 数据管理器
相关栏目:
【
行业资讯67740 】
【
技术百科0 】
【
网络运营39195 】
相关推荐:
md5解密是什么意思
typescript与es6学哪个
如何以管理员身份打开cmd命令行窗口
空调控制面板power灯一直亮是什么意思
台达plc只有power灯亮是什么意思
url解码什么意思
5r是多少钱
为什么程序员热爱typescript
新装固态硬盘如何安装
如何找出命令行
单片机引脚怎么改成上拉
wps中datediff函数怎么用 WPS中DATEDIFF函数的语法和用法分享
电信开通nfc功能是什么意思
科技型企业成长"十步法"
如何用adb命令停用系统软件
苹果16新增哪些功能
春运大巴上抢票怎么抢票
driver是什么意思
ts什么意思
typescript能干什么
苹果16送哪些配件
early什么意思
按键精灵datediff函数怎么用 如何使用按键精灵中的Datediff函数教程
nfc近场通讯功能是什么意思
什么是unix时间戳
hp固态硬盘如何安装
vs如何输入命令行参数
typescript中范围如何设定
j*a怎么清除数组
摩托车上power是什么意思
360桌面壁纸怎么弄掉
虚拟机如何用命令清除垃圾
单片机面包板怎么插
什么网址不能域名解析
soup是什么意思
华为使用nfc功能是什么意思
如何通过命令检测u盘启动
苹果16有哪些款式的
命令控制台如何执行sql文件
如何用命令行连接本地数据库
vivo怎么投屏到电视看爱奇艺教程
react怎么使用 typescript
恋爱软件免费聊天不收费的有哪些
位置控制单片机怎么用的
typescript学会要多久
税负是什么意思
vue组件typescript怎么用
win7怎么做幻灯片
爱奇艺视频怎么下载到手机u盘怎么转换格式方法
为什么要出折叠屏手机


2025-02-28
浏览次数:次
返回列表
析预训练数据中困惑度(PPL)极高和极低的文本,找出影响模型性能的关键文本特征。