OSReward:AI智能体操作电脑的可靠性评估新基准

论文简介

2026年7月30日,研究团队发布了 OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models,这是一个用于评估AI智能体操作电脑任务完成情况的标准化基准。

研究背景

计算机使用智能体(Computer-Using Agents, CUAs)正在快速发展,能够自动操作电脑完成任务。但一个核心问题是:如何判断智能体是否正确完成了任务?

现有方法依赖视觉语言模型(VLM)作为判断者,但这些判断者的可靠性一直缺乏系统评估。

核心贡献

研究团队构建了三个基准数据集:

  • OSReward:包含多样化智能体轨迹的真实基准,经过多阶段人工标注
  • OSReward-Hard:专注于困难案例的挑战集
  • OSReward-Multi:细粒度效率和一致性评分

同时发布了:

  • OS-Shepherd-100K:包含10万条推理标注的轨迹判断数据集
  • OS-Shepherd(9B和35B):开源奖励模型,成本降低30-60%

关键发现

评估发现,即使是最先进的模型也远未达到理想判断者的标准,存在系统性偏差:倾向于将失败的任务误判为成功。可靠但昂贵的模型无法大规模应用,而经济的开源模型性能差距明显。

作者团队

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan 等多位研究者

来源

论文来源:arXiv:2607.28609 ↗

提交日期:2026年7月30日

分类:Artificial Intelligence (cs.AI), Computation and Language (cs.CL), Computer Vision (cs.CV)


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注