ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

QMedia API 参考手册:mm_server 与 mmrag_server 全接口速查,快速嵌入你的业务系统

2026/8/22 15:49:21 拓冰建站 浏览量
QMedia API 参考手册:mm_server 与 mmrag_server 全接口速查,快速嵌入你的业务系统 QMedia API 参考手册mm_server 与 mmrag_server 全接口速查快速嵌入你的业务系统【免费下载链接】QmediaAn open-source AI content search engine designed specifically for content creators. Supports extraction of text, images, and short videos. Allows full local deployment (web app, RAG server, LLM server). Supports multi-modal RAG content QA.项目地址: https://gitcode.com/gh_mirrors/qm/QmediaQMedia 是一款面向内容创作者的开源 AI 内容搜索引擎支持文本、图片与短视频的内容抽取支持全本地部署并提供多模态 RAG 内容问答能力。本文作为QMedia API 参考手册帮你一张表速查mm_server与mmrag_server两大服务的全部接口让你几分钟内就能把多模态检索能力嵌入自己的业务系统 一、两大服务的分工先搞清再调接口QMedia 的 API 能力由两个独立服务承载理解它们的分工是快速集成的第一步服务定位核心能力入口文件mm_server多模态模型服务图片 OCR、音频转写、文本/图片向量化、CLIP 多模态向量、模型保活mm_server/main.pymmrag_server多模态RAG 检索服务笔记数据查询、站内/全网搜索、向量索引构建、文本与多模态 RAG 问答mmrag_server/main.py 简单记忆mm_server管算模型推理mmrag_server管搜检索问答。两者均可通过 docker-compose.yml 一键本地部署。二、mm_server多模态模型服务全接口速查mm_server基于 FastAPI 注册了 4 个路由分组image process / video process / embeddings / set model cached共 6 个接口。官方接口示意图如下1. 图片文字识别POST /api/image-ocr对图片做 OCR 识别是视频截帧、图文笔记文本抽取的关键接口。源码位于mm_server/api/image_service.py。请求参数JSON Body参数类型说明imagestring图片地址或 Base64 内容modelstring使用的 OCR 模型optionsobject可选扩展参数返回字段返回识别结果列表每条包含text识别文本、boxes文字框坐标、score置信度、font_size、area、text_proportion文字占比等字段定义见 ocr.py 中的OCRResponse。2. 音频转写POST /api/audio_transcription上传音视频文件自动完成语音转文字适合短视频口播内容提取。源码位于mm_server/api/video_service.py。请求参数multipart 表单参数类型说明filefile音频/视频文件表单文件modelstring转写模型名称返回字段language语言、language_probability语言置信度、duration时长、segments分段结果每段含start/end时间戳与text文本——可直接用于生成视频字幕 3. 文本向量化POST /api/embeddings将文本编码为向量支撑语义检索。源码位于mm_server/api/embed_service.py。参数类型说明promptstring待编码的文本modelstring向量模型名称optionsobject可选参数返回embeddingfloat 数组。4. CLIP 多模态向量文本与图片同空间接口用途POST /api/clip-text-embeddings文本编码为 CLIP 向量参数同/api/embeddingsPOST /api/clip-image-embeddings图片编码为 CLIP 向量参数为imagemodel这是以文搜图、以图搜文的核心文本与图片被编码到同一向量空间即可直接做跨模态相似度计算正是 QMedia 多模态 RAG 问答的底层能力。5. 模型保活设置POST /api/set-keep-alive模型冷启动较慢该接口可设置模型缓存存活时间避免重复加载。源码位于mm_server/api/cached_service.py。参数类型说明model_namestring模型名clip/hf/video/ocr传all表示全部keep_aliveint缓存存活时间秒hold_foreverbool为true时模型常驻内存永不释放⚡ 集成技巧在高并发业务中可对clip模型设置hold_forever用少量内存换显著的首次响应速度。三、mmrag_server多模态 RAG 检索服务全接口速查mmrag_server对外提供笔记管理、搜索与 RAG 问答三大类接口启动时会自动构建多模态检索管线见mmrag_server/main.py。接口总览如下1. 笔记数据接口note 分组接口方法参数说明/note/{note_id}GETnote_id路径参数按 ID 获取单条笔记详情/notesGETpage默认 1、limit默认 10分页查询笔记列表源码位于mmrag_server/api/note_view.py。2. 搜索接口public_search 分组接口参数说明GET /note-searchquery站内搜索在本地笔记库中关键词检索GET /public-searchquery、max_search默认 3全网搜索按配置启用 Google 搜索或模板搜索源码位于mmrag_server/api/search.py。3. 文本 RAG 接口search 分组接口方法说明GET /embeddingGET构建文本向量索引检索前需先调用GET /rag-searchquery、topk默认 5语义检索返回最相近的笔记列表GET /rag-queryquery基于 LLM 的单轮 RAG 问答POST /rag-chat-queryquery、history历史对话、streaming流式开关多轮对话问答streamingtrue时以流式逐字返回源码位于mmrag_server/api/rag_search.py。4. 多模态 RAG 接口mm_search 分组⭐这是 QMedia 最有辨识度的能力——同时检索文本与图片再用大模型生成答案接口方法说明GET /embedding-mmembed_mode默认auto构建多模态检索管线服务启动时自动执行GET /mm-rag-searchquery、topk默认 15多模态检索返回相关笔记与媒体素材GET /mm-rag-queryquery多模态 RAG 问答LLM 综合图文节点生成回答源码位于mmrag_server/api/mm_rag_search.py。多模态检索的结果会以媒体卡片形式呈现相关图片可通过服务挂载的/medias静态目录直接访问问答环节则由大模型基于检索到的图文节点综合生成回答四、快速嵌入业务系统3 步接入指南本地部署两个服务按仓库说明配置mm_server/config.py.local与mmrag_server/config.py.local端口、模型、存储路径通过docker-compose.yml一键拉起。调用模型能力业务侧按需调用mm_server的 OCR、音频转写与向量接口把非结构化素材变成可检索内容。接入检索问答前端直接对接mmrag_server的/mm-rag-search/mm-rag-query或流式/rag-chat-query即可在你的产品中嵌入搜笔记 AI 问答能力。 注意两个服务均基于 FastAPI自带/docs交互式文档页联调时打开即可在线试调每个接口。五、常见问题FAQQ1为什么调用/mm-rag-search没有结果先确认向量索引已构建。/embedding-mm在服务启动时自动执行若自定义了数据源请手动调用一次再检索。Q2首次请求很慢之后正常模型冷加载所致。调用POST /api/set-keep-alive调大keep_alive或设置hold_forevertrue即可缓解。Q3mmrag_server的图片素材怎么取服务将本地素材目录挂载为/medias静态路由返回数据中的媒体资源拼接该前缀即可访问。掌握以上接口你就拥有了 QMedia 的完整 API 能力版图从 OCR、语音转写到 CLIP 向量再到多模态 RAG 问答按需组合即可支撑你自己的内容搜索与问答产品 【免费下载链接】QmediaAn open-source AI content search engine designed specifically for content creators. Supports extraction of text, images, and short videos. Allows full local deployment (web app, RAG server, LLM server). Supports multi-modal RAG content QA.项目地址: https://gitcode.com/gh_mirrors/qm/Qmedia创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考