论文简介
2026年7月30日,研究团队发布了 OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models,这是一个用于评估AI智能体操作电脑任务完成情况的标准化基准。
研究背景
计算机使用智能体(Computer-Using Agents, CUAs)正在快速发展,能够自动操作电脑完成任务。但一个核心问题是:如何判断智能体是否正确完成了任务?
现有方法依赖视觉语言模型(VLM)作为判断者,但这些判断者的可靠性一直缺乏系统评估。
核心贡献
研究团队构建了三个基准数据集:
- OSReward:包含多样化智能体轨迹的真实基准,经过多阶段人工标注
- OSReward-Hard:专注于困难案例的挑战集
- OSReward-Multi:细粒度效率和一致性评分
同时发布了:
- OS-Shepherd-100K:包含10万条推理标注的轨迹判断数据集
- OS-Shepherd(9B和35B):开源奖励模型,成本降低30-60%
关键发现
评估发现,即使是最先进的模型也远未达到理想判断者的标准,存在系统性偏差:倾向于将失败的任务误判为成功。可靠但昂贵的模型无法大规模应用,而经济的开源模型性能差距明显。
作者团队
Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan 等多位研究者
来源
论文来源:arXiv:2607.28609 ↗
提交日期:2026年7月30日
分类:Artificial Intelligence (cs.AI), Computation and Language (cs.CL), Computer Vision (cs.CV)
发表回复