ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Cherry Studio 升级 @ai-sdk/deepseek 至 2.0.57:修复 DeepSeek 视觉模型图片输入被丢弃的问题

2026/9/20 4:48:20 拓冰建站 浏览量
Cherry Studio 升级 @ai-sdk/deepseek 至 2.0.57:修复 DeepSeek 视觉模型图片输入被丢弃的问题 Cherry Studio 升级 ai-sdk/deepseek 至 2.0.57修复 DeepSeek 视觉模型图片输入被丢弃的问题【免费下载链接】cherry-studio Cherry Studio 是一款支持多个 LLM 提供商的桌面客户端项目地址: https://gitcode.com/CherryHQ/cherry-studio导读本文基于仓库.changeset/deepseek-vision-image-input.md这一变更记录讲解 Cherry Studio 如何通过将ai-sdk/deepseek升级到 2.0.57使 DeepSeek 视觉模型能够真正接收用户消息中的图片内容。此前旧版本 SDK 会把多模态 user 消息拍扁成纯文本字符串丢掉所有非文本部分导致视觉模型拿不到图片。读完本文你将了解这一回归的成因、修复方案在仓库中的落点SDK 版本解析、provider 注册、本地补丁清理以及仓库中可验证该能力的数据与测试依据。变更内容概览.changeset/deepseek-vision-image-input.md是一份针对cherrystudio/ai-core包的 patch 级变更声明核心内容可概括为两点升级依赖将ai-sdk/deepseek升级到2.0.57使 DeepSeek 视觉模型可以接收图片输入修复回归旧版本会把 user 消息扁平化为纯字符串plain string丢弃所有非文本部分同时该包不再需要本地补丁no longer patched locally。由于是patch级别的 changeset该变更被归类为 bug 修复而非破坏性变更遵循了 contrib/development.md 中关于语义化版本的管理约定。问题根因多模态消息被拍扁成纯字符串在 AI SDK 的多模态消息模型中一条 user 消息由content数组组成数组中可同时包含文本部分与图片部分。仓库测试 AiService.test.ts 展示了这种消息形态messages: [{ role: user, content: [{ type: image, image: new Uint8Array() }] }]当用户向视觉模型发送这张图里有什么 描述文字时消息内容在 SDK 层面应当被序列化为类似 OpenAI Chat Completions 的多模态格式content为数组含type: image_url/type: text等部分。旧版本ai-sdk/deepseek的问题在于它在构造请求时把整个content数组拼接成一个普通字符串字符串化过程中非文本部分图片被直接丢弃。结果就是视觉模型收到的请求里只有文字、没有图片图片理解能力形同虚设。这一点在 changeset 原文中有明确表述The previous version flattened user messages into a plain string and dropped every non-text part旧版本将 user 消息扁平化为纯字符串并丢弃所有非文本部分。修复方案升级 ai-sdk/deepseek 到 2.0.57修复方式不是打本地补丁去覆盖 SDK 的序列化逻辑而是直接升级上游依赖让新版 SDK 自身具备正确的多模态消息序列化能力变更记录.changeset/deepseek-vision-image-input.md受影响包cherrystudio/ai-core升级对象ai-sdk/deepseek2.0.57锁文件 pnpm-lock.yaml 中记录了ai-sdk/deepseek2.0.57的解析条目Node 18peer 依赖zod^3.25.76 || ^4.1.8与 changeset 声明保持一致。仓库中同时存在更新的2.0.62解析条目同文件第 2167 行说明依赖树中保留了多个版本以供不同导入方解析。仓库中的落地证据1. DeepSeek provider 的创建入口cherrystudio/ai-core通过动态导入的方式按需创建 DeepSeek provider见 initialization.tscreate: async (settings) (await import(ai-sdk/deepseek)).createDeepSeek(settings)这里从ai-sdk/deepseek包导入createDeepSeek工厂函数。正因为 provider 创建直接依赖该 SDK 包SDK 版本从会拍扁消息的旧版升级到 2.0.57 后所有经由 ai-core 发往 DeepSeek 的多模态请求都会自动获得正确的图片传输行为无需改动业务层代码。2. 视觉模型在 Provider Registry 中的声明仓库的 provider 目录packages/provider-registry/明确声明了支持图片输入的 DeepSeek 视觉模型。在 creators/deepseek.ts 中{ id: deepseek-v4-flash-vision-exp, name: DeepSeek V4 Flash Vision Exp, family: deepseek-flash, capabilities: [function-call, image-recognition, reasoning, structured-output], contextWindow: 1048576, maxOutputTokens: 393216, inputModalities: [text, image], outputModalities: [text], ... }关键字段字段值说明iddeepseek-v4-flash-vision-exp视觉实验版模型标识capabilities含image-recognition声明模型具备图片识别能力inputModalities[text, image]输入模态包含图片是 SDK 允许下发图片数据的模型侧前提outputModalities[text]输出为纯文本contextWindow/maxOutputTokens1048576 / 393216百万级上下文与输出上限同文件第 51-63 行的deepseek-flashDeepSeek V4.1 Flash同样声明了image-recognition能力与inputModalities: [text, image]。此外providers/deepseek.ts 中为deepseek-v4-flash-vision-exp配置了三种可用的协议端点openai-responses、openai-chat-completions、anthropic-messages说明该模型在多种端点形态下都可用。3. 本地补丁已移除changeset 提到该包 is no longer patched locally不再需要本地补丁。对比 patches/ 目录可验证仓库中仍保留着ai-sdk__anthropic.patch、ai-sdk__google3.0.113.patch、ai-sdk__openai-compatible2.0.72.patch、ai-sdk__openai3.0.109.patch、ai-sdk__react3.0.187.patch等一批对 AI SDK 相关包的本地补丁但不存在ai-sdk__deepseek.patch。这说明 DeepSeek 相关能力完全交由上游 2.0.57 版本负责Cherry Studio 不再通过 pnpm patch 机制改写其源码——这对维护者而言意味着更少的版本升级摩擦和更低的被上游变更破坏的风险。4. 相关测试佐证provider-registry 的测试套件对 DeepSeek 视觉模型进行了覆盖provider-endpoint-matrix.test.ts将deepseek-v4-flash-vision-exp纳入端点矩阵校验验证其在各协议端点下的可用性catalog-invariants.test.ts校验视觉模型的定价与同系列deepseek-v4-flash保持一致等目录不变式provider-reasoning-contracts.test.ts验证视觉模型的推理契约。主进程侧 AiService.test.ts 也包含携带{ type: image, image: new Uint8Array() }图片部分的 user 消息用例从端到端角度印证了图片作为独立消息部分传输这一多模态消息模型在项目中的实际使用方式。对使用者与开发者的实际意义用户侧升级后在 Cherry Studio 中向 DeepSeek 视觉模型如deepseek-v4-flash-vision-exp、deepseek-flash发送带图片的对话图片数据能够随请求送达模型而不是在序列化阶段被丢弃。图片输入的具体传输通道由 AiService.ts 中的图片传输注册表imageTransportRegistry等机制统一管理模型侧是否接收图片则受 provider registry 中inputModalities的约束。开发者侧对于基于cherrystudio/ai-core构建 provider 的开发者应确保ai-sdk/deepseek不低于 2.0.57否则多模态 user 消息会被旧版 SDK 拍扁成纯文本视觉模型将静默丢失图片输入。维护者侧DeepSeek 包已脱离本地补丁体系升级上游 SDK 时无需再同步维护 patch 文件但仍需在升级后回归验证 provider-endpoint-matrix 与 catalog-invariants 等测试确保视觉模型的端点矩阵、定价与推理契约不被破坏。小结.changeset/deepseek-vision-image-input.md记录了一次典型的上游修复、本地收敛式 bug 修复通过把ai-sdk/deepseek升级到 2.0.57让 DeepSeek 视觉模型重新获得图片输入能力同时移除本地补丁、简化依赖维护。该变更与仓库中 aiCore 的 provider 初始化、provider-registry 的视觉模型声明以及配套测试共同构成完整闭环是理解 Cherry Studio 多模态消息在 SDK 层的序列化边界与依赖管理策略的良好切入点。【免费下载链接】cherry-studio Cherry Studio 是一款支持多个 LLM 提供商的桌面客户端项目地址: https://gitcode.com/CherryHQ/cherry-studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考