ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

5分钟在Windows装好PostgreSQL pgvector:从零到向量相似搜索

2026/9/6 17:23:32 拓冰建站 浏览量
5分钟在Windows装好PostgreSQL pgvector:从零到向量相似搜索 5分钟在Windows装好PostgreSQL pgvector从零到向量相似搜索【免费下载链接】pgvectorOpen-source vector similarity search for Postgres项目地址: https://gitcode.com/GitHub_Trending/pg/pgvectorpgvector Windows 安装比想象中简单这个开源扩展给 PostgreSQL 带来向量数据类型与 HNSW/IVFFlat 近邻搜索文本嵌入、图像向量都能直接用 SQL 查相似。下面按真实任务走一遍——编译装好扩展、建表查相似、给慢查询加索引。️ 一、Windows 上装 pgvectornmake 两行命令跑通编译先确认两件事PostgreSQL 是 13 以上版本装 16 及以上最省心Visual Studio 装了 C 桌面开发组件。漏装后者是新手最常见的卡点nmake 会直接报找不到编译器 cl.exe。以管理员身份打开 x64 Native Tools Command Prompt for VS整段贴入下面的命令。它在干什么设置 PGROOT 指向 PostgreSQL 安装目录克隆 v0.8.6 源码用 nmake 编译并安装——Windows 的构建规则就写在仓库根目录的 Makefile.win 里。set PGROOTC:\Program Files\PostgreSQL\16 git clone --branch v0.8.6 https://gitcode.com/GitHub_Trending/pg/pgvector cd pgvector nmake /F Makefile.win nmake /F Makefile.win install预期看到什么几屏编译信息后安静结束、没有任何 ERROR 就是成功vector.dll 已进 lib 目录.control 和 .sql 已进 share\extension。顺手验证打开 psql 执行CREATE EXTENSION vector;返回 CREATE EXTENSION 就说明扩展可用了。二、建表、塞数据、查相似三步验证扩展真的能用建表时把 embedding 列的类型写成vector(3)3 就是维度。psql 里依次执行下面三段建表、插两条数据、按 L2 距离找出离[3,1,2]最近的记录。CREATE TABLE items (id bigserial PRIMARY KEY, embedding vector(3)); INSERT INTO items (embedding) VALUES ([1,2,3]), ([4,5,6]); SELECT * FROM items ORDER BY embedding - [3,1,2] LIMIT 5;预期看到什么最后一条返回 id1——[1,2,3] 离 [3,1,2] 比 [4,5,6] 近说明距离算子工作正常。要按语义相似度搜把-换成余弦距离就行。这个阶段不加索引也能查pgvector 默认做精确近邻搜索召回 100%只是数据上万后会变慢。vector 类型的实现可以看 src/vector.c。 三、搜得慢HNSW 还是 IVFFlat向量索引配置一次讲清先给结论多数场景选 HNSW。它查询快、召回高空表也能建IVFFlat 建得快、占内存少但必须先有数据做聚类空表上建出来效果很差。数据上万后全表扫描扛不住了该加近似索引。下面这段先给建图留足内存、建 HNSW 索引再用 EXPLAIN 确认查询真的走上了索引。SET maintenance_work_mem 2GB; CREATE INDEX ON items USING hnsw (embedding vector_l2_ops); EXPLAIN (ANALYZE, BUFFERS) SELECT * FROM items ORDER BY embedding - [3,1,2] LIMIT 5;预期看到什么EXPLAIN 输出里出现Index Scan using ... hnsw说明索引生效。两个坑提醒一下近似索引会牺牲一点点召回加索引后结果和精确搜索略有差异是正常的若返回行数偏少把hnsw.ef_search从默认的 40 调大即可。四、装完之后接下来可以做什么到这一步向量数据已经和关系数据在同一个数据库里能 JOIN、能走事务。三个方向值得马上动手一是接入真实嵌入把模型输出的文本或图像 embedding 存进 halfvec 列存储体积直接减半二是给带 WHERE 条件的查询配好过滤索引必要时开启 0.8.0 引入的迭代扫描解决近似索引过滤后结果变少的问题三是定期用 EXPLAIN 看线上查询确认索引没被优化器绕过。不用再引入额外的向量数据库PostgreSQL 一个就够了。【免费下载链接】pgvectorOpen-source vector similarity search for Postgres项目地址: https://gitcode.com/GitHub_Trending/pg/pgvector创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考