你可能已经在各种 benchmark 榜单上看过 GUI Agent 的 "大胜" 了。
OSWorld 上 70%+ 的成功率、网页操作几乎封神、连写个邮件发个文件都不成问题。各家发布会 PPT 一片飘红,仿佛 AI 马上就要接管你的电脑。
但我最近读到一篇论文,感觉它把这层滤镜狠狠摘掉了。
当有人把赛场从 “Chrome + Office” 搬到 FreeCAD、QGIS、剪映、KiCad、Blender 这些真正干活的软件里,结果一下子变得非常诚实:56 款专业软件、338 个真实工作流、平均 100 步以上的操作链条,就连最强的 Gemini 3.1 Pro 和 Kimi K2.6,pass@3 成功率也只有 41% 左右,单次平均通过率只有 30% 出头。
这场考试的名字叫Workflow Gym,来自字节Seed评测团队,于6月上旬公开。
读完论文我最大的感受是:这不是又一个 "数字更大" 的 benchmark ,这是把 GUI Agent 从热身赛拉到了正赛。
之前的考场,太友好了
我先回顾下目前已有的 GUI Benchmark。
OSWorld 覆盖 8 款软件,以 Chrome、VS Code、LibreOffice 为主,任务平均几分钟就能完成;PC-Eval 也是 8 款,集中在 Word、Excel、邮件、计算器这类日常办公场景;AmbiBench 虽然覆盖 25 款应用,但全部是移动端,更多停留在点外卖、发微信这类任务上;GUI-360 则直接锁定在微软三件套。
但问题在于,当我看到 “成功率 75%” 这种数字时,很容易产生一种错觉:好像 AI 已经快能替人上班了,好像我们已经无限逼近 AGI 时代了。
可真实情况并不是这样。
真正产生经济价值的工作,不只是让 AI 在 Chrome 里填表单,也不只是让 AI 在 Excel 里做求和。真正的工作往往发生在复杂流程里,发生在工业级的专业软件里。
比如,在 FreeCAD 里画机械零件,在 QGIS 里叠图层做地理分析,在 KiCad 里画电路板,在剪映里剪一段 8 秒的视频并精确到帧地加三个叠化转场,在 GNU Radio 里搭信号流图。
这些任务有一个共同特征:专业软件、长链条、强约束、硬验收。对就是对,错就是错,没有 “差不多就行”。
而这些,恰恰是过去大多数 GUI benchmark 没有充分覆盖到的地方。
Workflow Gym 到底考什么
Workflow Gym 的设计思路,用体育类比最容易讲清楚。
如果说 OSWorld 更像是在测 100 米短跑,看你起跑反应快不快、单个动作准不准,那 Workflow Gym 更像是在测 110 米栏 + 400 米混合泳 + 10 公里自行车。
你不只是要跑,还要跨栏、换气、掌握平衡,还要在不同技术动作之间切换。一次失误不是只丢掉这一秒,而是会让后面的整个流程都串掉。
它的任务设计有四个核心原则。
第一,真实。
这些任务不是出题人拍脑袋编出来的,而是从领域专家的日常工作里 “挖” 出来的。1000 多个候选任务,最后筛到 338 个,筛选标准是:网上搜不到现成解法,必须真的理解这个领域才能做。也就是说,模型不能靠训练数据里见过类似教程就蒙混过关。
第二,专业。
Workflow Gym 覆盖 6 个顶级领域、23 个细分二级领域,包括工程设计、科学计算、多媒体创作、地理与环境、数据分析、财务与管理,甚至还有生物信息、化学建模、游戏引擎这些冷门但真实存在的工作场景。
里面的软件包括 FreeCAD、KiCad、Qucs-S、OpenModelica、DWSIM、ParaView、GeoGebra、剪映、Blender、Kdenlive、OBS、Mixxx、QGIS、GRASS GIS、SAGA GIS、JASP、jamovi、Weka、KNIME、GnuCash、HomeBank、OpenLCA、ClustalW、VESTA、Godot 等。
每款软件都被打包成独立的虚拟机镜像,预装、预配置、去除登录步骤,保证每个模型拿到的 “考场” 是一致的。Windows 和 Ubuntu 双环境也都有覆盖。
第三,长程。
官方按人类专家标注的操作步数划分难度: 30-44 步是 Easy , 129 题,占 38.2%; 45-60 步是 Medium , 159 题,占 47%; 61 步以上是 Hard , 50 题,占 14.8%,最长的题目达到 110 步。而模型实际跑起来因为探索、犯错、重试,交互轮次经常冲到 80-400 步。这是真正的马拉松,不是冲刺。
第四,可验证。
这是很多长程 benchmark 糊弄过去的地方 —— 任务太开放,最后靠人眼打分,复现性一塌糊涂。 Workflow Gym 给每道题都定义了确定性的判分标准:要么比对输出文件的二进制内容(比如导出的工程文件是否与标答一致),要么把最终界面截图喂给裁判 VLM 按关键点核对(比如剪映时间线上 "00:00:02:29 处是否无缝衔接""00:00:06:06 处是否添加了叠化转场 "),判分逻辑与任务类型匹配。论文里抽样 60 道题做人评对照,自动评测和人评一致的有 59 道,人评机评一致率达:98.3%。
这四条放在一起,意思很简单:分数掺不了水。
更狠的是数据质检流程。一道题入库要过四关 —— 指令质检( PE 自动检测模糊描述)、领域专家人工审核、标注员在环境镜像里按操作规范完整复现、最后再拿 SOTA GUI Agent 跑一遍预实验,确保不是任务本身有歧义。任何一关不过都要打回重修。
成绩单:第一名也才及格线边缘
然后是最刺激的部分 —— 把当前最能打的几个模型拉进来裸考。
实验设置很克制:每个任务一开始只给一段自然语言指令,没有 step-by-step 提示,没有中间纠错,没有人类兜底,最大 400 轮交互。每个任务跑 3 次独立采样,用 pass@3 和单次通过率两个指标衡量。
结果是这样的:
我盯着这个表看了很久,有三个数字格外刺眼。
第一个, 30.67%。这是 Gemini 3.1 Pro 的单次平均通过率 —— 在专业 GUI 任务里,三次里要失败两次。它在 OSWorld 上是 70%+ 的选手,到这儿直接脚踝斩。
第二个, 2.67%。 Gemini-3-Flash 在 Hard 题( 60 步以上)上的 pass@3 。这意味着 338 道题里最难的那 50 道,轻量模型基本是全送。 Hard 题不是 "难一点",是 "根本做不动"。
第三个,也是最反直觉的一个: Kimi-K2.6 在 Hard 题上拿了 25.33%,反而比 Gemini-3.1-Pro 的 21.33% 高一点点。长程鲁棒性这件事,不一定和模型 "通用智商" 严格挂钩。
分领域看更有意思。 Kimi 在数据分析、多媒体创作上表现最好,和它的 coding + 多模态能力强吻合; Gemini 在地理信息、工程设计、科学仿真上更强,显示出对复杂空间界面的理解力优势。每个模型都有自己的 "舒适区软件",也有自己的黑洞。
说白了,没有谁是 "通吃" 的。
模型到底输在哪里
论文没有止步于仅晒分数,作者做了两层失败归因 —— 结果层和过程层 —— 结论比分数本身更值得看。
结果层把失败分成两类:没跑完( workflow incompletion )和跑完但错了( execution inaccuracy )。一个鲜明的规律是:模型越强,"没跑完" 的比例越低 —— 强模型至少能硬撑着把流程走下来。"跑完但错了" 的比例并没有同步下降多少。
这就像一个马拉松选手,以前是中途退赛,现在是咬着牙冲过终点但成绩无效。
过程层归因,作者归纳出四个模型出现比例都很高的死穴:
1.长程一致性断裂。 这是最致命的一个。做到第 20 步时,已经忘了第 5 步设的参数是什么;明明第 15 步刚点错了一个按钮,第 16 步还假装一切正常继续往下走。 Workflow 这种东西,没有 save point ,错一步后面全歪。人类专家干活时脑子里有个 "任务地图",知道自己走到哪一步、距离目标还有多远,当前模型这个 "地图" 要么画不全,要么走着走着就糊了。
2.错误扩散无法自我修复。 模型点错一个按钮、输错一个数值、拖拽偏了几个像素,第一反应不是 "我是不是错了",而是在错误状态下继续 "合理" 操作,越走越远。人类遇到这种情况会 undo 、会回退、会看看哪里不对,当前 GUI Agent 的自我纠错回路基本是残疾的 —— 一旦偏航,就是 "头也不回地驶向错误终点"。
3.目标漂移。 做着做着,把用户最初要什么忘了。比如任务是 "剪一段 8 秒的视频并在三个时间点加叠化转场",模型剪完视频、加完特效,最后忘了导出;或者导出了,但没检查时长对不对。这种 "做了 80% 但漏掉最关键验收点" 的失败,在 Hard 题里尤其密集。
4.专业软件理解不足。 这一条其实是把前三类问题的根往深挖了一层。 QGIS 的图层堆栈、 KiCad 的网表层级、 Blender 的模式切换( Object/Edit/Sculpt )、 FreeCAD 的 sketcher 约束 —— 这些 UI 范式是各领域几十年演化出来的,没有 "通用常识" 可以覆盖。模型看到一个陌生的面板和按钮,既没有领域知识做预判,也没有系统化的探索策略,基本就是瞎点。
更底层的,论文点出了一个结构性矛盾:人类使用 GUI 是连续的视觉 - 动作回路,而当前 Agent 框架几乎都是 "截图→推理→输出坐标→点击" 这种离散的观察 - 动作循环。 这个 paradigm 在简单场景够用,在专业软件的精细操作(精确拖拽、快捷键组合、右键菜单、模态对话框)面前,分辨率不够。
这不是某家模型的问题,是整个范式的瓶颈。
这张榜为什么重要
每年都有新 benchmark ,为什么要单独说这一个?
因为它把行业里一个心照不宣的窗户纸捅破了:当前 GUI Agent 的能力边界,基本被 "通用软件 × 短任务" 锁死了。 你在演示视频里看到的那些 "AI 帮你操作电脑",大部分是在舒适区里表演。只要你丢给它一个需要打开专业软件、走完整工作流、产出有硬性验收标准的任务,神话立刻破功。
这件事对从业者的信号其实很清晰。
做模型的,长程一致性、错误恢复、专业领域知识注入,这三个是下一个阶段必须正面啃的骨头。单靠 scaling 看多模态基座模型能不能自然涌现?我个人持怀疑态度 —— 论文里 GPT-5.4 和 Gemini-3.1-Pro 的差距并没有大到质变,说明这是个架构 + 训练范式问题,不只是参数问题。
做产品的,别再拿 "AI 自动帮你完成一切工作" 当宣传口径了。目前模型任务的完成度仍缺乏细节、深入性和稳定执行这三点重要因素,目前最靠谱的产品形态是人机协作:人盯框架和流程、 AI 做原子操作,或者 AI 跑一遍人来验收。这不是单靠产品包装能解决的问题,而是当前模型在长程规划、状态保持、细节执行和自我纠错上的能力边界。
做 benchmark 的同行, Workflow Gym 立了一个好参照 —— 真实任务、专业环境、确定性判分、 VM 镜像可批量复现。这四条应该是下一代 GUI benchmark 的入场券,而不是加分项。
比赛刚开始
Workflow Gym 只是一期, 338 题、 56 款软件。项目 Roadmap 里写着将会继续扩充软件范围和指令覆盖面,还要把评测环境和训练环境打通(评训一体,支持 RL 闭环),以及探索把 GUI 轨迹转化为 MCP 工具接口的可能性。
最后说句私心的。
我读完这篇论文反而挺兴奋。不是因为分数低看好戏,是因为终于有人不拿 "Chrome + Excel 操作成功率" 来定义 AI 的执行能力了。专业软件里的工作流,才是真正衡量 "AI 能不能替人干活" 的考场。 FreeCAD 、 QGIS 、 KiCad 这些名字,听着冷门,但它们背后是工程师、地理分析师、硬件设计师、视频剪辑师 —— 真正在产出经济价值的人。
30% 不是一个好看的数字,但它可能是一个更诚实的数字。相比那些接近 90% 的榜单成绩,它更接近真实工作流里的能力边界:专业软件、长链路、硬验收、不可糊弄。评测的意义不在于让所有模型刷新纪录,而在于把真实差距摆到桌面上。