新闻中心

达摩院发布一站式AI视频创作平台"寻光",打造全新AI工作流

2024-07-09
浏览次数:
返回列表
今年是 AI 视频生成爆发的元年,以 Sora 为代表的算法模型和产品应用不断涌现。短短几个月内,我们目睹了几十种视频生成工具的问世,基于 AI 的视频创作方式开始流行起来。

但新技术也引发更多的挑战与质疑,除了大家熟知的 “开盲盒” 现象,AI 所生成的视频内容也因可控性差、处理工作流繁琐而频频被诟病。

OpenAI 曾经邀请专业视频制作团队对 Sora 进行了测试,其中来自于多伦多的 Shy Kids 团队,利用 Sora 制作了一个气球人主题的短片,把创意和 AI 技术进行了完美的结合,让人印象深刻。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

达摩院发布一站式ai视频创作平台\

整个短片其实并不是 Sora 直接输出的结果,而是由多个视频片段组成,且 Sora 在生成不同视频时,很难保证主角的一致性。因此,在引入了大量的人工后期编辑,他们才呈现出最终的短片效果。Shy Kids 的主创们总结,“Sora 的技术很酷,但是它的生成过程很难控制。”

对生成内容的精准可控,是 AI 视频创作中的重要需求,也是今天算法面临的一大挑战。

达摩院发布一站式AI视频创作平台\

为此,在刚结束的上海世界人工智能大会(WAIC)上,达摩院发布了一站式 AI 视频创作平台 “寻光”。

其定位为 PUGC 一站式 AI 视频创作平台,可辅助用户创作剧本、分镜图等,并通过工作流整合提升创作全流程的效率,支持对生成及上传素材进行丰富的 AI 编辑,提供人物控制、场景控制、风格迁移、运镜控制、目标新增 / 消除 / 修改等十多种 AI 编辑功能,让视频中的元素和对象精准可控。

达摩院希望借由寻光平台进一步提升 AI 视频创作的效率,目标是用 AI 能力重塑传统视频制作的整个流程,打造 AI 时代的全新视频工作流。

业界首次落地
基于图层的视频编辑

在寻光研发的初期,达摩院还与*传媒从业者及创作者进行了广泛且密集调研,了解其对于视频 AIGC 创作的需求与痛点。他们发现,视频图层几乎是所有视频创作者们提到频次最高、最迫切的需求。

基于此,寻光平台首次在行业推出系统性的视频图层编辑功能。用户通过文本输入,即可生成符合文本描述且具有透明背景的视频,并且一键将其融合到其他背景视频当中。在传统视频生成能力的基础上,用图层这样一种更灵活的形式来产生内容。

达摩院发布一站式AI视频创作平台\

寻光更提供图层拆解功能,轻轻一圈,选定目标立刻拆解为单独的图层视频,再丝滑嵌入不同的背景视频。

达摩院发布一站式AI视频创作平台\

用户可以将不同的前景图层跟不同的背景进行图层融合,组合出更多新的视频。图层融合的能力进一步激发 AI 创作力和想象力,同时能够保持多个分镜头之间的场景和人物的一致性。
达摩院发布一站式AI视频创作平台\
在达摩院看来,AI 不会取代创作者的工作,而是会优化视频创作的工作流,成为创意驱动的新引擎。

一站式 AI 创作平台
更简洁的交互,更丰富的编辑能力

剧本创作、分镜设计、素材编辑…… 传统的视频创作步骤分工明晰、周期冗长。在 AI 技术的加持下,原本分散在不同制作流程中的创作步骤,如今都可以在寻光平台上流畅完成。

“我们希望让视频编辑像操作 ppt 一样简洁直观,容易上手。” 达摩院视觉技术实验室高级算法专家陈威华在现场介绍,寻光平台的一大亮点在交互方面。

寻光平台在设计时便充分考虑到 AI 视频创作的特点,将每个视频项目抽象为多个分镜头画面,用户可根据剧本自动生成一组分镜头,也可以自己上传原始视频素材,由算法切分成多个分镜头。

在创作空间里,用户可以很方便的查看每一个分镜头,一个场景内的多个分镜头可以收起或者展开,场景之间可以通过拖拽来调整顺序,场景内的分镜头也可以进行拖拽。用户也可以在任意位置上进行分镜头的添加和新建,可调用图片生成或者视频生成能力去产生内容,也可以添加自己已有的各种素材。

达摩院发布一站式AI视频创作平台\

对于每个分镜头,寻光提供完整且智能的 AI 视频编辑能力进行处理,可依据用户意图,在语义层面而不是像素层面实现编辑。分镜头里的人体、人脸、前景、背景等任意局部目标,都可以进行精细化的编辑和修改。

比如,理解空间景深的运镜控制;

达摩院发布一站式AI视频创作平台\

易标AI 易标AI

告别低效手工,迎接AI标书新时代!3分钟智能生成,行业唯一具备查重功能,自动避雷废标项

易标AI 135 查看详情 易标AI
又比如,能够理解物体相对关系的目标消除 / 修改。

达摩院发布一站式AI视频创作平台\

在对视频全局元素的编辑上,寻光平台提供了超过 20 种的风格迁移。

达摩院发布一站式AI视频创作平台\

寻光也提供帧率控制、视频超分等实用的视频编辑功能。

达摩院发布一站式AI视频创作平台\

“我们希望一个视频里的所有元素都是可编辑、可修改的,这样可以给用户的创作提供最大的自由度”,陈威华说。

写在最后

今天,我们正处在 AIGC 的变革浪潮之中,AI 有可能催生出新的视频工作流。无论是专业的*从业者还是热爱创作的 UGC 用户,都将从中获益。

“工欲善其事,必先利其器”,达摩院希望寻光视频创作平台能够成为每一位创作者的专属视频工作室,实现 AI 与创作者之间更紧密、高效的协作,真正释放 AI 的生产力。

为此,达摩院视觉技术实验室已做了大量技术储备。该实验室致力于多模态视觉信号的理解与生成技术研究,当前的重点研究方向包括更加精准的图像 / 视频 / 3D 内容生成,更加可控的图像 / 视频 / 3D 内容编辑,更加高效的生成框架,多模态的理解 - 生成框架等。

陈威华表示,“寻光”将于近期开放内测,持续迭代,优化交互,欢迎创作者们来定制属于自己的 AI 工作流。

内测申请地址:
https://xunguang.damo-vision.com/

以上就是达摩院发布一站式AI视频创作平台"寻光",打造全新AI工作流的详细内容,更多请关注其它相关文章!


# 达摩院  # 世界人工智能大会  # 寻光  # 视频编辑  # sora  # 产业  # 坪山网站建设哪家便宜  # 招商产品在网站推广  # seo的具体作用  # 2019墨子seo博客  # .网站内部相关优化策略  # 良庆区网络营销推广中心  # 精准营销定向推广策略  # 潍坊网站推广怎么选  # 佛山产品推广网站建设  # 市场网络营销推广  # 首次  # 进行了  # 华纳  # 南极  # 多个  # 图层  # 工作流  # 一站式  # 达摩 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 比亚迪秦nfc功能是什么意思  春运大巴上抢票怎么抢票  j*a怎么声明byte数组  春运抢票最多能抢几趟车  如何提高import命令的性能  xdm是什么意思  win7旗舰版wifi怎么打开  1tb等于多少mb  typescript中如何定义json  固态硬盘如何接主机  命令行如何运行j*a  汽车中控导航机power线是什么意思  夸克缺什么登录不了  如何进入cmd命令行  手机如何更改固态硬盘  路由器上的power按钮是什么意思  单片机计时程序怎么写  如何去除计算器的命令  破太岁是什么意思  基金市盈率是什么意思  .asm如何在命令行运行  苹果16系统网站有哪些  md5解密是什么意思  固态硬盘颗粒如何修理  固态硬盘如何区分好坏  苹果16日发售哪些机型  ai显示无法找到链接的文件是什么意思  显卡上面TYPE-C是什么接口  夸克网盘是什么都有吗  多少毫安的充电宝可以带上飞机  win10电脑如何使用命令提示符  固态硬盘如何下载网页  j*a数组怎么取元素  汽车排量是什么意思  硬件如何执行命令  分享一个稳定的ao3镜像网址  ip dhcp是什么意思  手机如何ip绑定域名解析  域名解析后为什么要进行域名备案  如何用chown命令  满射和单射定义  交管12123协议头不完整怎么弄  dos命令 如何将变量 作为路径的一部分  typescript如何遍历map  市盈率ttm写的亏损是什么意思  苹果16更新了哪些版本  光刻机是干什么用的  市盈率回落是什么意思  typescript的文件如何执行  如何更新固态硬盘固件 

搜索