位置:首页 > 新闻资讯 > Magentic-UI— 微软开源的人机协作AI?Agent研究原型

Magentic-UI— 微软开源的人机协作AI?Agent研究原型

时间:2025-05-21  |  作者:  |  阅读:0

Magentic-UI简介

magentic-ui 是微软发布的一个开源研究原型,旨在探索人机协作的 ai agent 系统。magentic-ui 是以用户为中心的 ai agent,能够协助用户完成复杂的 web 操作,包括网页浏览、代码执行以及文件处理。magentic-ui 的核心特性包括协作规划(co-planning)、协作执行(co-tasking)、安全机制(action guards)以及从经验中学习(plan learning)。magentic-ui 让用户在任务规划和执行期间全程参与,提供清晰且可控的交互过程。通过利用人类反馈来提高任务完成效率并减少人力成本,magentic-ui 构建了一个研究人类与 ai agent 协作的理想实验平台。

Magentic-UI的核心功能

  • 协作规划:任务开始前生成详细的步骤计划,用户可以调整、确认,保证任务按预期展开。
  • 协作执行:实时显示即将执行的动作,用户可随时接管控制权,确保任务执行符合需求。
  • 安全保障:在执行重要或不可逆的操作前征询用户同意,支持用户自定义审批规则,保护操作安全。
  • 学习复用:任务结束后保存执行方案,用户可以在未来的任务中重复使用或修改这些方案,从而提升工作效率。

Magentic-UI的技术架构

  • 系统设计:Magentic-UI 基于 AutoGen 的 Magentic-One 系统,由多个专业代理(agents)协同运作完成任务。Orchestrator(协调者)由大型语言模型(LLM)驱动,负责与用户共同制定任务计划,确定何时需要用户反馈,并将具体任务分派给其他代理执行。WebSurfer(网页浏览者)是一个具备浏览器操控能力的 LLM Agent,能够执行点击、输入、滚动等操作,以完成 Orchestrator 分配的网页浏览任务。Coder(代码执行者)是一个配备了 Docker 代码执行容器的 LLM Agent,它会将执行结果反馈给 Orchestrator。FileSurfer(文件处理者)则是一个配备了 Docker 容器和文件转换工具的 LLM 代理,它可以定位文件、将其转换成 Markdown 格式,并回答关于文件的相关问题。
  • 交互流程:用户通过文本消息和附带图像的方式与 Magentic-UI 进行互动。Orchestrator 根据用户的输入创建自然语言的分步计划,用户可以通过编辑界面对其进行修改。Orchestrator 会根据计划中的每一步骤判断是由哪个代理或用户来完成,并发送请求等待响应。当所有步骤都完成后,Orchestrator 将生成最终的答案呈现给用户。如果在执行过程中发现计划存在不足之处,Orchestrator 可以在得到用户许可后重新规划并执行新的计划。
  • 安全性与控制:用户可以设定 Magentic-UI 可以访问的网站白名单,对于不在白名单内的网站需要获得用户的明确批准才能访问。用户可以在 Magentic-UI 执行任务的任意阶段中断它,停止任何尚未执行的代码或网页浏览操作。Magentic-UI 控制的浏览器和代码执行器均运行在 Docker 容器内,这不仅避免了对主机环境的影响,还防止了登录凭证泄露等安全隐患。此外,用户还可以配置行动审批策略,规定 Magentic-UI 在执行特定操作时是否需要用户的批准。

Magentic-UI的项目链接

  • 官方网站:https://www.php.cn/link/c7498c23c40caf66d815866fd8c0d398
  • GitHub仓库:https://www.php.cn/link/07273dd0571b92c3ee6817638418f839

Magentic-UI的实际应用

  • 复杂任务自动化:帮助用户自动完成涉及多步骤的 Web 活动,例如对比商品价格、填写在线表格或者预订旅行。
  • 代码编写与执行辅助:生成代码片段、安全地运行代码,比如进行数据分析或编写脚本。
  • 文件处理与信息检索:转换文件格式、搜索文件内容并回答相关问题。
  • 研究与开发:为科研人员提供一个实验平台,用于探索人机协作的新模式。
  • 教育与培训:作为一种教学工具,帮助学生学习任务规划和 AI 协作技巧。

福利游戏

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多