模型策略
Midscene 的模型策略有两个目标。一是用纯视觉理解用户实际看到的界面,让自动化不受渲染技术限制。二是提供灵活的单模型和多模型配置能力,让用户根据业务需求选择合适的模型组合。
基于可见界面的纯视觉路线
大模型驱动的 UI 自动化需要完成任务规划和元素定位。业界主要有两种定位方式:结合 DOM 与截图标注,或直接基于截图进行纯视觉定位。Midscene 采用纯视觉路线——由模型直接分析界面截图来定位目标元素,执行 UI 操作和元素定位时不依赖 DOM 或额外标注。
这一选择让用户看到的界面成为自动化的唯一依据,为 Midscene 带来以下优势:
- 以一致的方式操作浏览器 Canvas、Android、iOS 和桌面应用等不同类型的界面。
- 摆脱 UI 渲染技术栈的限制,无需维护 Selector 或额外的界面标注。
- 校验颜色、高亮状态和布局等用户实际看到的效果。
- 更接近真实用户操作软件的方式,发现潜在的交互设计问题
- Token 消耗量只与页面分辨率和任务复杂度相关,不会随着页面结构(如 DOM 数量)膨胀而膨胀
使用视觉路径也有明确的不足。纯视觉定位要求模型具备视觉理解能力,只能使用指定的、对 GUI 操作比较稳定的模型,而不是任意 LLM。Midscene 用更高的模型能力要求,换取跨平台的一致性和更低的界面维护成本。
Midscene 在数据提取或页面理解场景中,仍可按需附带 DOM 信息。具体参数请参考 API Reference。
单模型与多模型配置
Midscene 始终需要一个默认模型。默认模型可以同时承担任务规划、元素定位和页面理解等全部工作,也可以作为多模型组合的基础。用户可以根据业务需求,只使用默认模型,或按需加入 Planning 模型和 Insight 模型。多模型组合可能增加任务耗时和 Token 消耗。
使用多模型组合时,三类模型可以共同参与一条自动化任务链路:
下一步
本文只介绍 Midscene 的模型理念和选择原则。配置方法请参考可选:配置多个模型。如果任务效果不理想,请参考模型调试与可观测性定位问题。

