首页行业百科OSWorld 是什么?AI 智能体“操作电脑”能力的权威标尺

OSWorld 是什么?AI 智能体“操作电脑”能力的权威标尺

2026-07-29 10:04:46阅读 5

OSWorld 是一个开源的、基于真实虚拟机的基准测试平台,专门用于评估 AI 智能体(Agent)在真实操作系统中完成开放式任务的能力。简单来说,如果说 MMLU、GSM8K 是衡量大模型“知识水平”的考试,那么 OSWorld 就是衡量 AI“动手操作电脑”能力的标尺。它由香港大学 NLP 实验室、CMU、滑铁卢大学等顶尖机构联合发布,已被 OpenAI、Anthropic、Google 等全球顶级 AI 团队采纳为官方评估标准。

📌 本文大纲

  • OSWorld 是什么:AI 智能体的“操作电脑”能力标尺
  • 核心设计:基于真实虚拟机的沙盒环境
  • 任务构成:369 个真实工作场景
  • 版本演进:从 OSWorld 1.0 到 OSWorld 2.0
  • 行业地位:全球 AI 巨头的“官方标尺”
  • 总结
OSWorld 是什么?AI 智能体“操作电脑”能力的权威标尺_图1 图源:AI生成示意图

一、OSWorld 是什么:AI 智能体的“操作电脑”能力标尺

OSWorld 由 Tianbao Xie 等学者在 2024 年发表的论文《OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments》中正式提出,该论文发表在 NeurIPS 2024 的数据集与基准测试 track 上。

它的核心价值在于:让 AI 智能体在真实的操作系统中,像人一样使用鼠标和键盘完成复杂任务。在 OSWorld 中,智能体需要观察桌面截图、理解自然语言指令,然后通过生成鼠标点击、键盘输入等操作来完成任务。任务完成后,系统会自动检查文件、应用状态、浏览器数据等,判断任务是否真正完成。

二、核心设计:基于真实虚拟机的沙盒环境

OSWorld 最大的特点是基于真实虚拟机(VM)技术构建,而不是一个玩具般的模拟器。这意味着:

  • 真实操作系统:支持 Ubuntu、Windows 和 macOS,智能体面对的是真正的操作系统和应用程序,而非简化版仿真环境。
  • 真实应用程序:环境中预装了 Chromium/Chrome 浏览器、LibreOffice 办公套件、Thunderbird 邮件客户端、VLC 播放器、VS Code、GIMP 图像编辑器等真实软件。
  • 真实交互方式:智能体通过鼠标点击、键盘输入、滚动、拖拽等人类常用的方式与系统交互。

OSWorld 将环境控制(如 VMware、Docker)与任务逻辑、评估逻辑解耦,这意味着开发者可以在本地用 VMware 跑一个任务,也可以在云端用 Docker 并行跑上百个任务。

三、任务构成:369 个真实工作场景

OSWorld 1.0 原始基准包含 369 个 Ubuntu 任务,涵盖 10 类应用场景:

  • 268 个单应用任务:涉及文件管理、网页浏览、邮件处理、办公文档编辑等
  • 101 个跨应用工作流:需要同时操作多个应用程序才能完成
  • 43 个补充 Windows 任务:用于跨平台分析

这些任务全部来自真实的计算机使用场景,每个任务都配有可执行的验证脚本,由机器自动判定 Agent 是否真正完成,不依赖人工评价。

以其中一个典型任务为例:Agent 需要打开邮件客户端、定位邮件、下载附件、按规则重命名文件、打开账本、找到正确的 sheet 和行列、按格式填写——整个过程超过 60 步连续操作,任何一步出错都会导致整体失败。

在 OSWorld 首次发布时,人类参与者可以完成 72.36% 的任务,而当时最强的模型-智能体组合仅达到 12.24%。主要失败原因包括 GUI 定位不准确、操作知识不足、长周期规划能力弱、以及难以从错误中恢复。

四、版本演进:从 OSWorld 1.0 到 OSWorld 2.0

OSWorld 项目持续演进,目前已推出两个主要版本:

OSWorld 1.0(2024) :原始版本,369 个任务,聚焦短周期、单应用或简单跨应用任务。

OSWorld-Verified(2025 年 7 月) :对原始基准进行了就地修订,修正了任务错误、更新了评估器、升级了应用程序和网站版本,并提供了可扩展的 AWS 评估平台。

OSWorld 2.0(2026 年 6 月 26 日) :一个全新的后继基准,包含 108 个长周期工作流,覆盖日常与专业场景。其任务难度与上一代完全不是一个量级:熟练人类完成一个任务的中位时间约 1.6 小时,是 OSWorld 1.0 的约 48 倍;近七成任务需要熟练用户花一个多小时。

五、行业地位:全球 AI 巨头的“官方标尺”

OSWorld 的权威性来自三个核心特征:

  1. 真实环境:在真实的 Ubuntu 和 Windows 系统中,用真实的应用完成任务,不是仿真、不是沙盒简化版
  2. 真实任务:369 个由人类专家精心设计的任务,覆盖办公、编程、浏览、设计、系统管理等日常工作场景
  3. 客观评分:每个任务都配有可执行的验证脚本,Agent 是否真正完成由机器自动判定

正因如此,OSWorld 已成为全球评估计算机操作智能体的黄金标准。OpenAI、Anthropic、Google 在发布最新模型时,均以 OSWorld 作为官方标尺。

此外,OSWorld 的框架也被广泛复用——微软的 Windows Agent Arena 直接基于 OSWorld 框架构建,创建了 150+ 个 Windows 任务。

六、总结

OSWorld 是当前 AI 领域衡量“智能体操作电脑”能力的最权威基准测试。它通过真实虚拟机环境、真实应用程序和真实工作任务,为评估 AI 的计算机操作能力提供了客观、可复现的标尺。从 2024 年首次发布时最强模型仅 12.24% 的成功率,到 2026 年 Claude Opus 4.8 在 OSWorld-Verified 上达到 83.5%,OSWorld 不仅见证了 AI 操作电脑能力的飞速进步,也不断用更高难度的任务(如 OSWorld 2.0 的长周期工作流)推动着行业向前发展。

💡 如果你正在寻找能将 AI 的理解能力转化为实际业务生产力的工具,可以了解 实在Agent。它通过“TARS 大模型 + ISSUT 屏幕语义理解 + RPA 引擎”的全栈架构,无需 API 即可直接操作各类业务系统,将 AI 的理解转化为跨系统执行力。已服务超 6000 家制造、能源、交通航空、跨境、医药、电商等行业企业。访问实在智能官网(www.ai-indeed.com)即可申请试用。

立即领取行业头部企业 AI 应用案例

资深 AI Agent 技术专家将为您定制数字员工解决方案

立即获取方案