新闻中心

Magentic-UI— 微软开源的人机协作AI Agent研究原型

2025-05-21
浏览次数:
返回列表

Magentic-UI简介

magentic-ui 是微软发布的一个开源研究原型,旨在探索人机协作的 ai agent 系统。magentic-ui 是以用户为中心的 ai agent,能够协助用户完成复杂的 web 操作,包括网页浏览、代码执行以及文件处理。magentic-ui 的核心特性包括协作规划(co-planning)、协作执行(co-tasking)、安全机制(action guards)以及从经验中学习(plan learning)。magentic-ui 让用户在任务规划和执行期间全程参与,提供清晰且可控的交互过程。通过利用人类反馈来提高任务完成效率并减少人力成本,magentic-ui 构建了一个研究人类与 ai agent 协作的理想实验平台。

小云雀 小云雀

剪映出品的AI视频和图片创作助手

小云雀 1949 查看详情 小云雀

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

Magentic-UI— 微软开源的人机协作AI Agent研究原型Magentic-UI的核心功能

  • 协作规划:任务开始前生成详细的步骤计划,用户可以调整、确认,保证任务按预期展开。
  • 协作执行:实时显示即将执行的动作,用户可随时接管控制权,确保任务执行符合需求。
  • 安全保障:在执行重要或不可逆的操作前征询用户同意,支持用户自定义审批规则,保护操作安全。
  • 学习复用:任务结束后保存执行方案,用户可以在未来的任务中重复使用或修改这些方案,从而提升工作效率。

Magentic-UI的技术架构

  • 系统设计:Magentic-UI 基于 AutoGen 的 Magentic-One 系统,由多个专业代理(agents)协同运作完成任务。Orchestrator(协调者)由大型语言模型(LLM)驱动,负责与用户共同制定任务计划,确定何时需要用户反馈,并将具体任务分派给其他代理执行。WebSurfer(网页浏览者)是一个具备浏览器操控能力的 LLM Agent,能够执行点击、输入、滚动等操作,以完成 Orchestrator 分配的网页浏览任务。Coder(代码执行者)是一个配备了 Docker 代码执行容器的 LLM Agent,它会将执行结果反馈给 Orchestrator。FileSurfer(文件处理者)则是一个配备了 Docker 容器和文件转换工具的 LLM 代理,它可以定位文件、将其转换成 Markdown 格式,并回答关于文件的相关问题。
  • 交互流程:用户通过文本消息和附带图像的方式与 Magentic-UI 进行互动。Orchestrator 根据用户的输入创建自然语言的分步计划,用户可以通过编辑界面对其进行修改。Orchestrator 会根据计划中的每一步骤判断是由哪个代理或用户来完成,并发送请求等待响应。当所有步骤都完成后,Orchestrator 将生成最终的答案呈现给用户。如果在执行过程中发现计划存在不足之处,Orchestrator 可以在得到用户许可后重新规划并执行新的计划。
  • 安全性与控制:用户可以设定 Magentic-UI 可以访问的网站白名单,对于不在白名单内的网站需要获得用户的明确批准才能访问。用户可以在 Magentic-UI 执行任务的任意阶段中断它,停止任何尚未执行的代码或网页浏览操作。Magentic-UI 控制的浏览器和代码执行器均运行在 Docker 容器内,这不仅避免了对主机环境的影响,还防止了登录凭证泄露等安全隐患。此外,用户还可以配置行动审批策略,规定 Magentic-UI 在执行特定操作时是否需要用户的批准。

Magentic-UI的项目链接

  • 官方网站:https://www.php.cn/link/c7498c23c40caf66d815866fd8c0d398
  • GitHub仓库:https://www.php.cn/link/07273dd0571b92c3ee6817638418f839

Magentic-UI的实际应用

  • 复杂任务自动化:帮助用户自动完成涉及多步骤的 Web 活动,例如对比商品价格、填写在线表格或者预订旅行。
  • 代码编写与执行辅助:生成代码片段、安全地运行代码,比如进行数据分析或编写脚本。
  • 文件处理与信息检索:转换文件格式、搜索文件内容并回答相关问题。
  • 研究与开发:为科研人员提供一个实验平台,用于探索人机协作的新模式。
  • 教育与培训:作为一种教学工具,帮助学生学习任务规划和 AI 协作技巧。

以上就是Magentic-UI— 微软开源的人机协作AI Agent研究原型的详细内容,更多请关注其它相关文章!


# docker  # 还可以  # 自然语言  # 安装包  # 一键  # 工作效率  # 网页浏览  # 是一个  # 开源  # 用户可以  # ai agent  # ai  # 工具  # 浏览器  # git  # 微软  # 衢州seo推广咨询热线  # 亳州seo优化哪家靠谱  # 搜好看头像的关键词排名  # webpack 怎么开发seo  # 常州网络营销推广报价  # 白云头条seo费用  # 惠城营销推广哪里好  # 江西深圳网站建设  # 开学快闪视频网站推广  # 南湾广告网站优化 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 固态硬盘如何显示  开机如何运行dos命令提示符  命令行如何运行c  区块链的热闹将何去何从?  怎么在项目中使用typescript  debug中如何用n命令命名程序文件名  哪里要用typescript  干股是什么意思  j*a如何运行curl命令行  固态硬盘如何备份  如何通过命令行启动tomcat  play的三人称单数和过去式  云淡风轻什么意思  固态硬盘如何测试  typescript和哪个语音很像  为什么学typescript  夸克高考为什么不靠谱  市盈率是负数是什么意思  春运抢票技巧攻略  主板如何禁用固态硬盘  春运返程如何抢票成功  软件命令行参数如何设置  cmd如何定时执行命令  固态硬盘如何装入机箱  j*a怎么求数组均值  typescript中如何引入本地js  ip dhcp是什么意思  win10如何打开dos命令窗口大小  一年多少周  grep命令的是如何实现  typescript和nodejs哪个好  华为的nfc功能是什么意思  单片机软件keil怎么运行  如何安装tree命令  电脑显示器上power是什么意思  如何知道固态硬盘  如何创建sql命令  typescript学多久可以学会  hive中datediff函数怎么用 Hive中DATEDIFF函数的使用指南  春运订票什么时候抢票  为什么夸克没有动漫  跨境电商gmv是什么意思?跨境电商GMV:理解其含义、计算方法和影响因素  8寸照片尺寸多少厘米  typescript多久能学会  命令控制台如何执行sql文件  5r是多少钱  单片机怎么读取电流值  vue组件typescript怎么用  多少毫安的充电宝可以带上飞机  win10系统如何打开cmd命令 

搜索