ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Midscene:AI视觉自动化完整指南,3条命令跑通跨平台UI测试

2026/9/11 14:59:06 拓冰建站 浏览量
Midscene:AI视觉自动化完整指南,3条命令跑通跨平台UI测试 MidsceneAI视觉自动化完整指南3条命令跑通跨平台UI测试【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midsceneMidscene 是一个面向 UI 测试的开源 AI 视觉自动化框架它通过多模态模型直接看屏幕截图来定位元素你用自然语言描述操作就能在 Web、Android、iOS 上跑 E2E 测试不用维护选择器。它怎么运作截图、模型、操作三步循环常见的 UI 自动化先解析 DOM 或无障碍树再按选择器找元素页面结构一变脚本就挂。Midscene 不走这条路每一步执行前它截取当前屏幕连同你的自然语言指令一起交给多模态大模型模型返回点哪里、填什么、页面上的数据是什么框架再把结果落成真实操作。整个流程是一个观察—规划—执行循环每操作完一次就重新截图确认并根据最新画面继续规划。好处是图标按钮、canvas、原生应用、跨域 iframe 只要人能看见就能定位代价是每步都有一次模型往返比直接点选择器慢换来的是 UI 改版后脚本通常不用改。装好环境并跑通第一个脚本环境要求 Node.js 20.19 及以上22.12、24 也可以然后全局安装命令行工具# 需要 Node.js 20.19 npm i -g midscene/cli在运行命令的目录放一个.env文件配置模型服务的地址MIDSCENE_MODEL_BASE_URL、密钥MIDSCENE_MODEL_API_KEY、模型名MIDSENCE_MODEL_NAME与模型家族MIDSCENE_MODEL_FAMILY可选模型见模型配置文档。接着写第一个 YAML 脚本page声明目标页面tasks里的每一步就是一句自然语言语法读一遍就懂page: url: https://www.bing.com tasks: - name: 搜索天气 flow: - ai: 搜索今天天气 - aiAssert: 结果中显示了天气信息执行midscene ./bing-search.yaml即可。CLI 会实时打印进度跑完生成可视化报告出问题时能回看每一步的画面。完整语法见YAML 脚本指南和CLI 文档packages/cli/tests/midscene_scripts/ 下还有现成脚本可参考。四个核心能力怎么用用 aiAct 把一整件事说成一句话结论不用自己拆步骤一句目标交给aiAct模型自行分解并逐步执行。用法上JS 里写await agent.aiAct(搜索耳机并把第一件加入购物车)YAML 里就是一行ai:指令需要补充背景知识比如遇到弹窗先关掉可用setAIActContext()全局设置。实际效果是多步骤、带分支的任务也能稳定完成但每步都要重新观察截图耗时和 token 高于单步操作复杂任务才值得用。从屏幕提取数据并做视觉断言结论aiQuery和aiAssert负责读屏幕不碰 DOM 就能拿到结构化数据、验证界面是否如预期。用法aiQuery(页面上的商品, {name: string, price: number}[])返回 JSON 数组aiAssert(页面顶部出现了导航栏)成立则通过不成立抛错并附带模型给出的原因。实际效果是传统选择器只能确认元素存在Midscene 还能校验颜色、高亮、布局这些用户真实看到的状态做电商价格核对、报表巡检这类任务更直接。一套 API 覆盖浏览器和手机结论Web、Android、iOS、HarmonyOS 和桌面共用同一套 AI 接口差别只在脚本头部的环境配置。用法Web 端接入 Playwright 或 PuppeteerPlaywright 集成文档Android 设备通过 adb 连上后在脚本里填deviceIdiOS 需先配好 WebDriverAgent。各平台都带 Playground不写代码就能先试自然语言指令细节见平台入门指南。实际效果同一段搜索、加购、断言价格的流程浏览器和手机测试套件各改一个头部配置就能复用不用学第二套 API。Bridge 模式从终端接管已打开的浏览器结论脚本可以直接接管你本地已登录的浏览器手动操作和自动操作在同一页面上切换。用法装好 Chrome 扩展在侧边栏 Bridge Mode 面板填入本地 WebSocket 地址默认ws://localhost:3766再从终端运行脚本扩展会提示允许连接详见Bridge 模式文档。实际效果已登录的 cookie 和会话状态直接复用自动化卡住时随时接手手动操作调试和日常办公自动化都更顺手。总结与常见问题Midscene 用每步一次截图加模型往返换掉了选择器维护代价是速度收益是跨平台统一和极低的维护成本。建议路径先在 Playground 里试出可用的自然语言指令再把这些指令固化成 YAML 或 JS 脚本纳入 CI。问支持哪些模型答需要多模态且具备 UI 定位能力Qwen3.x、Doubao-Seed-2.1、GLM-4.6V、gemini-3.5-flash、UI-TARS 等也包含可自部署的开源模型模型家族在.env的MIDSCENE_MODEL_FAMILY里指定。问比选择器自动化慢多少答每步都要上传截图并等模型响应明显慢于直接点选择器复杂aiAct任务消耗更多 token。换来的是 UI 改版后脚本通常不用改且报告会展示模型每步看到的画面排查更直观。问弹窗、Cookie 这类干扰怎么处理答用aiActContext给模型传业务背景例如出现 Cookie 弹窗先关闭语法细节见API 参考与基础概念。【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考