项目方向
我正在搭建一个面向真实 Android 环境的 Mobile GUI-VLA 实验基线。这里的 VLA 并不是让机器人抓取物体的那一类视觉—语言—动作系统;它关注的是手机屏幕:模型读到自然语言任务和当前截图,判断下一步应做什么,再把动作交给设备执行。
从截图到动作
可以把一次交互理解为一条短循环:任务描述与截图进入策略,策略输出结构化动作,例如点击、滑动、输入、返回或等待;设备执行后产生新截图,下一轮再据此决策。真正困难的地方不只是“会不会回答”,而是把语言中的目标可靠地落到具体界面元素和坐标上。研究中通常把这项能力称为 GUI grounding:模型需要在视觉界面里定位正确的控件,并理解当前页面状态是否允许执行该动作。
基线与轨迹记录
这个项目优先做一条薄而完整的链路:接入 Android 模拟器或设备,获取截图,解析并执行动作,保存完整轨迹,并能回放、检查和导出数据。这样每次成功或失败都不是一次性的演示,而是后续分析的依据。现阶段的重点是让 baseline 在真实任务中稳定运行;训练、检查点管理和闭环评估会围绕实际的失败分布逐步展开,而不预先假定某一种复杂的 agent 结构。
任务评估
评估也不能只看模型输出是否“像对的”。任务是否完成、一次交互耗时多久,以及不确定时是否能安全停止,都应该与轨迹一起记录。AndroidWorld 提供了带初始化、成功检查和清理逻辑的真实 Android 任务环境;OSWorld 的结果也提醒我们,真实计算机界面中的视觉定位与操作知识仍是多模态 agent 的主要难点。因此,这个方向更像是在把一个可观察、可复现实验系统先搭稳,再让数据和评估引导模型改进。