ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

ModLens 生态全景与路线图:从图片视觉桥到 ModSearch 搜索桥,独立开发者如何打造插件矩阵

2026/9/26 2:38:15 拓冰建站 浏览量
ModLens 生态全景与路线图:从图片视觉桥到 ModSearch 搜索桥,独立开发者如何打造插件矩阵 ModLens 生态全景与路线图从图片视觉桥到 ModSearch 搜索桥独立开发者如何打造插件矩阵【免费下载链接】modlensThe first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件为 DeepSeek、GLM 等纯文本模型外挂视觉能力粘贴图片即得结构化 JSON 证据OCR、版面、语义。项目地址: https://gitcode.com/gh_mirrors/mo/modlensModLens 是面向 DeepSeek Harnessdsh的首个视觉插件也是 DeepSeek、GLM 等纯文本编码 Agent 的视觉桥粘贴一张图片即可得到结构化 JSON 证据OCR 全文、版面区域、语义实体让读不了图的模型也能看见。本文完整梳理 ModLens 生态视觉桥如何工作、一键安装与实测效果、姊妹项目 ModSearch 搜索桥以及独立开发者如何以单一职责理念打造插件矩阵。 一张图看懂ModLens 视觉桥的工作流程DeepSeek 的旗舰聊天模型和 GLM-5.3 本身都是纯文本模型无法读取图片。ModLens 的思路很克制不改模型、不改宿主只在图片进入对话时做一次翻译——把它交给视觉引擎读一遍再把结果以结构化证据的形式还给文本模型。整个流程三步触发粘贴的图片进入对话不同宿主下可能是临时文件路径也可能是从会话记录里捞回来的路径skill 自动触发无需任何触发词转换内置视觉引擎之一Gemini、OpenAI 兼容、Anthropic、Antigravity CLI、Claude CLI、Kimi CLI读取图片回传输出不是随意一段描述而是 schema 约束的 JSON——OCR 全文、按阅读顺序排列的版面区域、实体与关系列表模型回答时会引用其中的具体细节而不是编。这个证据而非想象的契约定义在 src/schema.ts完整输出字段规范见 docs/output-schema.zh-CN.md触发逻辑与工作流写在 skills/modlens/SKILL.md。 一键安装视觉插件的 3 种上手方式方式一dsh 用户一条命令。这是最轻的装法整个插件就是一个 dsh 包npx -y deepseek-ai/dsh plugin --profile web add liustack/modlens3.26.5安装后注册了modlens_read_image原生工具并为纯文本模型自动生成(modlens vision)变体入口原生视觉模型如 GLM-5.3-Flash 会自动排除绝不覆盖其原生看图能力。方式二其他宿主用 skill 安装。Claude Code、Codex、Pi、OpenCode 等宿主通过 skill 接入npx -y skills add liustack/modlens --skill modlens --global方式三把安装交给你的 AI。把 INSTALL.md 交给正在对话的 Agent它会自动探测本机已有环境、配置引擎并跑健康检查。值得强调的是零配置起步ModLens 会复用你机器上已登录的 Claude Code、Codex 等 CLI什么都没有的话免费的 Antigravity CLI 无需任何 key申请一个免费的 Gemini key约 3 分钟、无需信用卡则能把每次读取压到 5-10 秒。对于不用终端的 dsh Web 用户设置页的 Plugins 入口里有专门的 ModLens 配置卡片切换视觉引擎、填 key 与端点、勾选哪些本地登录可以被复用保存即生效——连配置文件都不用打开。 实测密集图表、批量图片与粘贴恢复官方展示的几组真实运行全部驱动纯文本 DeepSeek-V4-Flash未经剪辑能很好地说明视觉桥的成色128 个 AI 模型的散点图对比——双轴、对数刻度、按提供方着色、虚线标记的重点区域全部被逐字读出。密集图表正是视觉桥最容易翻车的场景一条推文截图作者、文案、照片细节两人各穿什么衣服、时间戳以及 5.4M 浏览、1.6K 回复、11.6 万点赞等每一个互动数字都不缺还有一条容易被忽略的路径——粘贴恢复recover-paste。在 Claude Code、Pi、OpenCode 里粘贴的图片字节会先落到本地会话存储JSONL 或 SQLite而不是普通临时文件。ModLens 会自动探测自己运行在哪个宿主里把图片字节捞回来再读取各宿主的存储位置与恢复细节见 docs/harness-setup.zh-CN.md。 ModSearch 搜索桥补上模型的第二感官需要看图的模型通常也需要联网。ModSearch 是 ModLens 的姊妹项目同一套工艺用在另一个缺失的感官上给没有网络访问能力的模型提供Web 搜索、X 搜索和单页抓取——免费、免注册、无需 API keynpx -y deepseek-ai/dsh plugin --profile web add liustack/modsearchlatest围绕 DeepSeek Harness目前已经能看出一个清晰的感官分工插件矩阵插件负责的感官一句话定位ModLens️ 视觉图片粘贴 → 结构化 JSON 证据OCR、版面、语义ModSearch 网络Web 搜索、X 搜索、单页抓取免费无 keydsh-screenshot 捕获热键截屏直接进 dsh截屏是捕获的活刻意不在 ModLens 里做AIManager️ 入口最轻的 dsh 桌面外壳零代码零配置一键安装依赖dsh-market 市场dsh 内置插件市场800 社区插件一键安装更新DSH Desktop 前端免 Node.js 的桌面端手机远程控制与 IM 通道在路线图上每个插件只做一件事边界互相咬合——这正是矩阵的雏形。️ 独立开发者能复用的 4 个做法ModLens 由单一作者维护、不接受 PRissue 驱动路线图MIT 协议随便 fork它的路径对小团队和个人开发者很有参考价值把边界写进仓库而不是写在口头上。AGENTS.md 与 CONTRIBUTING.md 明确列出永不加入清单摄像头、截屏热键、裁剪/像素工具箱、bounding box 与置信分——视觉解析是唯一职责联网交给 ModSearch截屏交给 dsh-screenshot。矩阵不是一个大而全的工具而是几把边界清晰的尖刀。用可复现的证据说话。evals/ 目录为每次实验留档命令、版本、输入 SHA-256、原始输出、耗时与评分任何它能读密集图表的说法都可以重跑验证。连提示注入测试图evals/cases/prompt-injection/都是脚本生成的图片内容一律按不可信输入处理见 docs/security.zh-CN.md。信任本身就是功能。复用本地 CLI 的登录读图时每次都会在结果里标注花了谁的配额API key 可以不进 argv 和聊天所有错误输出先做脱敏。对个人项目来说不坑用户的钱包是最便宜的口碑。保持最轻的接触面。没有 hook、没有守护进程、不改任何宿主配置skill 宿主里就是一个文件夹dsh 里就是一个插件卸载 删文件夹Agent 立刻回到出厂状态。️ 路线图信号与参与方式CHANGELOG.md 是这份路线图最诚实的载体从 dsh 各版本兼容0.1.0 → 0.1.7、第三方文本模型的(modlens vision)变体families: [*]可自选、按 provider 的代理路由到多 API key 轮换与配额冷却、Windows 全链路支持——几乎每个版本都由一个真实用户 issue 推动节奏是数天一版。想参与也简单开 issuebug、建议、读不懂的报错就是最直接的贡献fork 则是完全属于你的副本——MIT 协议下改名、改造、再发布都不需要许可git clone https://gitcode.com/gh_mirrors/mo/modlens一句话总结ModLens 用一个插件补一个感官的方式展示了独立开发者如何围绕 DeepSeek Harness 生态把视觉桥、搜索桥、截屏、市场这些边界清晰的模块拼成插件矩阵——而下一个缺失的感官也许正等着你来补。【免费下载链接】modlensThe first vision plugin for DeepSeek Harness, and the vision bridge for every text-only coding agent. Paste an image, get structured JSON evidence (OCR, layout, semantics). | 全网最强 DeepSeek Harness 外挂视觉插件为 DeepSeek、GLM 等纯文本模型外挂视觉能力粘贴图片即得结构化 JSON 证据OCR、版面、语义。项目地址: https://gitcode.com/gh_mirrors/mo/modlens创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考