ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

如何为 Midscene 配置独立的 Planning 与 Insight 模型

2026/9/15 15:58:20 拓冰建站 浏览量
如何为 Midscene 配置独立的 Planning 与 Insight 模型 如何为 Midscene 配置独立的 Planning 与 Insight 模型【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene当 Midscene 的默认多模态模型在复杂任务规划或页面理解上出现能力瓶颈时可以为 Planning 意图和 Insight 意图分别配置独立模型让更强的推理模型承担规划与理解工作而由默认模型继续负责元素定位。本文基于 模型策略 与 模型配置文档说明如何为 Midscene 配置这两类独立模型、按使用方式加载配置并用midscene model verify验证结果。适用前提你已经按 Supported models and setup 完成了一个可用的默认模型配置MIDSCENE_MODEL_*。多模型配置是可选项——文档明确建议先从默认模型开始仅在遇到明确的能力瓶颈时再引入专用模型。先判断什么时候需要独立模型Midscene 将自动化工作流中的模型职责分为三类模型在组合中的作用默认模型提供基础能力负责元素定位Locate以及未交给 Planning 或 Insight 模型的其他任务Planning 模型增强复杂目标、多步骤任务和分支场景中的规划能力Insight 模型增强数据提取、断言和页面理解能力文档给出的两个典型引入场景使用更老版本的 GPT-5早于gpt-5.4的模型不支持视觉定位不能作为默认模型时建议只将其用作 Planning 模型并搭配另一个多模态模型完成定位使用智谱 AutoGLM 这类面向移动端交互的模型时aiAssert和aiQuery这类需要页面理解的 API 应通过MIDSCENE_INSIGHT_MODEL_*环境变量配置独立的 Insight 模型。需要注意的代价多模型协作可能增加任务耗时和 Token 消耗。Planning 和 Insight 两者都可以只配置其中一个也可以同时配置。配置独立模型的环境变量每个意图都有自己的一组环境变量。Planning 模型和 Insight 模型各需要 4 个必填项Planning 意图Insight 意图说明MIDSCENE_PLANNING_MODEL_API_KEYMIDSCENE_INSIGHT_MODEL_API_KEYAPI KeyMIDSCENE_PLANNING_MODEL_BASE_URLMIDSCENE_INSIGHT_MODEL_BASE_URLAPI 端点 URL末尾不要加/chat/completion底层 SDK 会自动补上MIDSCENE_PLANNING_MODEL_NAMEMIDSCENE_INSIGHT_MODEL_NAME模型名称MIDSCENE_PLANNING_MODEL_FAMILYMIDSCENE_INSIGHT_MODEL_FAMILY模型族决定 Midscene 处理坐标的方式完整的可选项..._TIMEOUT、..._TEMPERATURE、..._RETRY_COUNT、..._RETRY_INTERVAL、..._HTTP_PROXY、..._SOCKS_PROXY、..._INIT_CONFIG_JSON、..._EXTRA_BODY_JSON、..._RESPONSE_FORMAT分别对应 Planning 和 Insight 意图的独立设置逐项含义参见 模型配置参考 中的两张表格。模型配置参考 中有一条重要说明通用的MIDSCENE_MODEL_*高级设置超时、温度、重试、代理等只有在你配置了对应的MIDSCENE_INSIGHT_MODEL_*或MIDSCENE_PLANNING_MODEL_*之后才会作用于对应的 Insight 或 Planning 意图。以下示例来自官方文档使用 Qwen 3.5 作为默认模型负责视觉定位GPT-5.4 同时作为 Planning 和 Insight 模型负责复杂推理。其中https://...与sk-...是文档中的占位写法需要替换为你自己的接口地址和 API Key# 默认多模态模型Qwen 3.5 export MIDSCENE_MODEL_BASE_URLhttps://... # Qwen 3.5 接口地址 export MIDSCENE_MODEL_API_KEY... # 你的 Qwen 3.5 API Key export MIDSCENE_MODEL_NAMEqwen3.5-plus export MIDSCENE_MODEL_FAMILYqwen3.5 # Planning 模型GPT-5.4 export MIDSCENE_PLANNING_MODEL_API_KEYsk-... # 你的 GPT-5.4 API Key export MIDSCENE_PLANNING_MODEL_BASE_URLhttps://... export MIDSCENE_PLANNING_MODEL_NAMEgpt-5.4 export MIDSCENE_PLANNING_MODEL_FAMILYgpt-5 # Insight 模型GPT-5.4 export MIDSCENE_INSIGHT_MODEL_API_KEYsk-... # 你的 GPT-5.4 API Key export MIDSCENE_INSIGHT_MODEL_BASE_URLhttps://... export MIDSCENE_INSIGHT_MODEL_NAMEgpt-5.4 export MIDSCENE_INSIGHT_MODEL_FAMILYgpt-5示例中默认模型的 family 写作qwen3.5。按 Supported models and setup 的 Qwen 系列表格qwen3.5属于仍保持兼容的旧 family 值新配置推荐qwen3两者按文档说明均可工作。按使用方式加载配置Midscene 从环境变量读取模型配置三种使用方式对应三种加载方法Playground把配置文本直接粘贴到设置页面。CLImidscene命令在运行midscene命令的目录创建.env文件midscene/cli会自动加载。注意两点.env每行不要加export前缀运行 YAML 任务时当前 shell 中已有的同名变量优先于.env需要让.env覆盖它们时使用--dotenv-override。JavaScript SDKSDK 直接读取 Node.js 进程的process.env。如果配置存放在.env文件中安装dotenv并在创建 Agent 之前执行import dotenv/config;。如果 shell、容器或部署平台已经提供了这些变量则不需要 dotenv。验证配置配置完成后运行验证命令# 使用当前项目中安装的 CLI npx midscene model verify # 或使用最新版本的 CLI npx midscene/clilatest model verifymodel verify会检查模型连通性和 Midscene 兼容性通常耗时约 5 秒。它读取当前工作目录的.env文件并默认让.env中的值覆盖 shell 中同名变量与其他 YAML 任务相反这是该命令的特殊行为。三个意图的配置都会被纳入检查全部通过时输出✅ Model verify passed.验证失败时命令会打印失败详情并生成可直接执行的 curl 请求用于单独测试 base URL、API Key 和模型名。注意这些 curl 命令中会包含你的 API Key不要公开分享。如果你想在运行 Midscene 前先确认接口本身是否可达可以直接向模型服务发一个curl请求把变量替换为你的实际值MIDSCENE_MODEL_BASE_URL替换为你的接口地址 MIDSCENE_MODEL_API_KEY替换为你的 API Key MIDSCENE_MODEL_NAME替换为你的模型名 curl -X POST ${MIDSCENE_MODEL_BASE_URL%/}/chat/completions \ -H Authorization: Bearer ${MIDSCENE_MODEL_API_KEY} \ -H Content-Type: application/json \ -d { model: ${MIDSCENE_MODEL_NAME}, messages: [ { role: user, content: What is 11? } ] }模型调试与可观测性 对两种结果给出了判断方法如果 curl 请求成功但 Midscene 验证命令失败说明模型 API 本身可达问题在模型能力或 Midscene 配置例如MIDSCENE_MODEL_FAMILY is not set to a multimodal model with UI localization表示多模态模型的MIDSCENE_MODEL_FAMILY没有设置正确。边界与后续排查多模型配置会增加任务耗时和 Token 消耗。配置完成后可以用DEBUGmidscene:ai:profile:stats打印模型耗时与 Token 用量核对每个意图实际调用的模型和开销是否符合预期。如果模型能连通但定位、规划或页面理解不稳定文档建议查看回放报告确认任务时间线没有进入错误页面或分支、优先使用同系列中官方支持的更新版本、用代表性任务对比不同供应商模型的成功率、耗时和成本。记录模型调用MIDSCENE_RECORD_MODEL_CALLtrue会写出包含请求体和 base64 截图的本地 JSONL 文件仅在排查期间开启事后保护或删除这些文件。进一步的问题定位、LangSmith/Langfuse 集成与调用记录参见 模型调试与可观测性。【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考