一. 什么是 pgvector?在AI驱动的应用里,向量数据已经成为存储与检索的核心。pgvector正是PostgreSQL为此打造的利器——一个开源的扩展,让数据库能原生处理和搜索高维嵌入向量。核心能力一览 向量存储:把向量数据直接存在普通表里,和标准字段放一起。 距离计算:支持欧氏距离(L2)
在AI驱动的应用里,向量数据已经成为存储与检索的核心。pgvector正是PostgreSQL为此打造的利器——一个开源的扩展,让数据库能原生处理和搜索高维嵌入向量。
核心能力一览
长期稳定更新的攒劲资源: >>>点此立即查看<<<
聊这个之前,先得问一个问题:为什么非要在一套数据库里搞向量?其实原因很直接。
事情从安装开始。前提是PostgreSQL版本至少13+,然后在系统里装上pgvector。装好后,进数据库执行一句话就能启用:
CREATE EXTENSION IF NOT EXISTS vector;
想确认是否成功?跑一条查询即可:
SELECT * FROM pg_extension WHERE extname='vector';
如果看到结果,恭喜,可以开始创建向量列了。

向量列的类型是vector,也支持vector(n),其中n就是维度。
举个例子:
CREATE TABLE documents ( id BIGSERIAL PRIMARY KEY, embedding VECTOR(3) -- 假设嵌入向量是3维);
注意一个小要点:向量列的维度是固定的,创建完表后就不能改了,所以建表前想清楚维度。
插入数据时,直接用字符串格式的数组就行:
INSERT INTO documents (embedding) VALUES ('[1,2,3]'), ('[4,5,6]'),('[4,0,5]');
搜索最近邻居的核心是使用距离运算符。最常用的是欧氏距离:
-- 使用 L2 距离SELECT id,embedding <-> '[1,2,3]' as score,embedding FROM documents ORDER BY embedding <-> '[1,2,3]' LIMIT 5;

根据score的得分,就能查询出相近的向量,值越小代表越相似,算法如下
公式

| 操作符 | 相似度度量 | 说明 | 推荐场景 | 值越小代表 |
|---|---|---|---|---|
<-> | 欧氏距离 (L2 Distance) | 计算两个向量之间的几何距离 | 图像、音频、地理数据检索 | 越相似 |
<#> | 负内积 (- Inner Product) | 取负号后的内积,用于最大内积搜索 | 推荐系统、模型打分 | 越相似 |
<=> | 余弦距离 (Cosine Distance) | 1 - 余弦相似度,对向量长度不敏感 | 文本语义检索、跨语言向量匹配 | 越相似 |
除了增删查,还有一些日常维护操作,比如:
# 向现有表中添加向量列ALTER TABLE items ADD COLUMN embedding vector(3);# 更新向量UPDATE items SET embedding = '[1,2,3]' WHERE id = 1;# 删除向量UPDATE items SET embedding = '[1,2,3]' WHERE id = 1;
(注意:第二个UPDATE是删除向量的常见做法——将向量置空或清零。)
写段Python代码演示一下使用过程。推荐pgvector-python配合psycopg2。
import numpy as npimport psycopg2from pgvector.psycopg2 import register_vector# 连接数据库conn = psycopg2.connect(host='192.168.1.101', dbname='test-agent', user='postgres', password='123456', port=5433)register_vector(conn) # 注册 vector 类型cur = conn.cursor()# 插入示例向量embedding = np.random.rand(3).astype('float32')print(embedding)cur.execute( "INSERT INTO documents (embedding) VALUES (%s)", (embedding,) # 注意这里的逗号,确保是元组格式)conn.commit()# 查询最近邻query_embedding = np.random.rand(3).astype('float32')print(query_embedding)cur.execute( "SELECT id, embedding,embedding <-> %s as score FROM documents ORDER BY embedding <-> %s LIMIT 5", (query_embedding, query_embedding,))rows = cur.fetchall()for r in rows: print(r)cur.close()conn.close()
这段代码里有个细节值得注意:cur.execute里传参数时,embedding后面一定要加逗号,这样Python才能正确解析成元组。否则可能会报参数个数不对的错误。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述