家政网站建设方案分析,哈尔滨做网站找哪家好,企业网站和信息化建设,展馆设计网站AgentStudio: A Toolkit for Building General Virtual Agents 前言AbstractMotivationFramework评估GUI GroudingReal-World Cross-Application Benchmark Suite Conclusion 前言
来自昆仑万象的一篇智能体环境数据大一统框架工作#xff0c;对未来计算机智能体的发展具有指… AgentStudio: A Toolkit for Building General Virtual Agents 前言AbstractMotivationFramework评估GUI GroudingReal-World Cross-Application Benchmark Suite Conclusion 前言
来自昆仑万象的一篇智能体环境数据大一统框架工作对未来计算机智能体的发展具有指导性意义作者在环境上对计算机智能体的输入输出进行了统一基于该环境又设计了智能体数据的收集评估框架通过实验也验证了数据集收集的重要性。此外它还提供了丰富的文档便于初学者学习。
Paperhttps://arxiv.org/pdf/2403.17918.pdfDocumenthttps://skyworkai.github.io/agent-studio/FromArxiv 26 Mar 2024
Abstract
创造在任意数字设备上操作任意软件的自主虚拟智能体仍然是当前AI的主要挑战。关键的两点障碍在于现实环境中构建虚拟智能体的基础设施不足以及对基础智能体能力评估的需求。为了解决这些问题本文提出AgentStudio一个在线、现实、多模式的工具包可以涵盖智能体开发完整的生命周期。包括环境设置数据收集智能体评估以及可视化。观察和动作空间高度通用支持函数调用和人机界面。AgentStudio的图形用户界面进一步增强了这种多功能性允许在现实环境中高效开发数据集和基准。为了说明这一点作者引入了一个视觉基础数据集和一个真实世界的基准套件二者都是通过图像化界面创建的。此外作者还提出一些源自AgentStudio的可行解例如通用视觉基础、开放式工具创建、视频学习等。作者开源了环境、数据集、基准测试和界面以促进开发更通用的虚拟智能体。
Motivation 受到环境和数据的限制现有的智能体仅在简单、受限的场景下评估演示缺乏实用性和可靠性。真实环境难以收集数据阻碍智能体的提升。
AgentStudio工具包如何解决上述问题
包括了智能体观察和动作空间的定义工具。提供了跨平台的在线环境支持。支持交互式数据的收集与评估以及可扩展的任务套件增强实用性和灵活性。
上图展示AgentStudio如何在环境上和数据集上解决之前工作的问题。
Framework
AgentStudio优势
可复现、多模态、跨平台的在线环境。支持docker、FastAPI以及虚拟机连接各种操作系统和设备注重真实落地场景。统一标准输入输出。和人类保持一致通过观察屏幕输入控制键鼠和命令行输出也支持函数调用和API。全面、可扩展、可组合的任务集。包含在十余个应用上全面评估AI智能体的能力覆盖各种应用场景包含不同难度任务。完整的智能体数据收集和评估代码。可用于人工标注数据集也可用于智能体自行收集经验。关注工具创造和应用。支持智能体在交互中自行创造并复用新的工具。交互式可视化界面。提供用户友好的轻量化GUI界面帮助用户一键自动化创建任务并收集数据。
下图是使用AgentStudio人工标注数据以及自动标注数据的过程。
评估
除了工具包的搭建研究团队评估了多个多模态智能体完成任务的能力。为了全面评估智能体的能力AgentStudio的实验从多个角度考虑
图形界面grounding数据集。任务为单步动作指令无需规划 关注智能体与图形界面交互的能力。日常任务与组合任务数据集。任务涉及调用复杂API或者多步动作以及跨软件交互。用于评估智能体完成日常任务、以及进行复杂动作规划的能力。
GUI Grouding
每个数据都是三元组 T ( g , s , a ) T(g,s,a) T(g,s,a)分别代表instruction、截图和鼠标动作。基于AgentStudio团队设计了一个包含 227 条鼠标点击指令的数据集涵盖三种流行的桌面操作系统和九种应用程序。在当前多模态模型上进行评估结果如下表所示 在闭源模型上模型展示了在不同操作系统下泛化的差异性并且得分都不高GUI能力不足。在开源模型上基于Qwen-VL微调的SeeClick在每个任务上都是最高分凸显了进一步扩展GUI基础数据的重要性以通过数据驱动的方法改进多模式模型从而实现有效的现实部署。 上图是在位置和点击类型两个指标上的比较。可以看到所有模型在精确定位上得分较低有很大改进空间b表明点击成功率和元素大小相关分而治之的方法可能提升点击的准确率。
Real-World Cross-Application Benchmark Suite
为了说明AgentStudio在复杂的场景促进评估作者引入了由77个现实任务组成的基准套件包括工具使用、GUI基础、长期规划等。每个任务形式化为一个三元组包括自然语言描述重置环境组件防止其它项干扰实验评估结果轨迹组件。结果如下 虽然GPT-4在大多数API任务中表现出色但是在GUI和组合任务上面临挑战另一方面Gemini-1.0 Pro 和 GPT-3.5 Turbo 总体上表现出相对较低的成功率但它们较高的批评准确率意味着这些模型可能有潜力通过开发新颖的自校正算法来提高其性能。
Conclusion
本文介绍了AgentStudio一个开放的工具包用于开发在现实数字世界中的通用智能体它包括数据收集评估、可视化和用户界面允许在任意人类任务上开发测试。这篇工作非常solid 在各种智能体打架的今天AgentStudio从另一个角度出发 在底层统一了各种计算机智能体的评估和交互工作合理且完整 有极强的扩展性和自定义性具有特别大的发展前途。我认为基于这篇工作未来可以考虑的方向有
通用工具的积累。即插即用的工具可以为任何智能体所用这也涉及相关的框架与协议。更