恒美微站
首页
关于我们
建站服务
主题模板
案例展示
资讯中心
联系我们
AI基本概念@向量、向量数据库、召回率
首页
资讯中心
/
AI基本概念@向量、向量数据库、召回率
AI基本概念@向量、向量数据库、召回率
发布时间:2026/9/7 21:55:26
标量、向量、矩阵、张量是描述数据维度的四个核心概念它们之间关系如下维度递进关系标量是 0 维向量是 1 维矩阵是 2 维3 维及以上称为高阶张量 。包含关系标量可以看作 0 阶张量向量是 1 阶张量矩阵是 2 阶张量因此标量、向量、矩阵都是张量的特殊情况。数据堆叠逻辑标量堆叠一次形成向量向量堆叠一次形成矩阵矩阵继续堆叠形成更高阶张量 。标量Scalar标量Scalar就是一个单独的数没有方向只有大小 。举例温度 25°C、损失函数值 0.5、学习率 0.01。表示通常用小写斜体字母表示如 a、x。向量Vector向量Vector向量就是既有大小又有方向的量是一组有序排列的数可以理解为一维数组 。数学向量和物理矢量本质上是同一概念都指既有大小又有方向的量数学领域通常称向量物理学领域通常称矢量。举例一个人的特征向量 [身高, 体重, 年龄]、词向量表示词语语义。表示通常用粗体小写字母表示如 x。矩阵Matrix矩阵Matrix是由多个向量按行列排列组成的二维表格 。举例一张灰度图片的像素值矩阵、神经网络中的权重矩阵、一个批次的数据如 32 个样本 ×784 个特征。表示通常用粗体大写字母表示如 A。张量Tensor张量Tensor是向量和矩阵概念的推广可以表示任意维度的数组 。举例彩色图片高度×宽度×通道数、视频数据批次×时间×高度×宽度×通道数。为什么需要向量数据库向量数据库的出现是因为传统数据库只会“查字面”而AI时代更需要“查意思”。简单说传统数据库像MySQL处理的是结构化的表格数据靠的是精确匹配和关键词搜索。比如你搜“苹果”它只能找出字面上含“苹果”的记录但搜“红色的水果”就无能为力了。传统数据库的索引如B-Tree是为精确匹配和范围查询设计的它们完全无法处理“在N维空间里找最近的邻居”这种问题。它们就像一本按拼音排序的字典你很难用它来查找“所有和‘苹果’意思相近的词”。假设数据库里有100万个商品向量用户输入一个查询向量我们要找到最相似的10个。最笨的办法是“暴力计算”把用户的向量和100万个向量逐一计算距离然后排序。这在数据量大的时候慢到无法接受。意思越相近的东西这些数字在空间里的距离就越近。向量数据库就是专门为这种“相似性搜索”设计的它存的不是字而是这串数字查询时靠计算距离来找到语义上最接近的结果。1. 向量Vector究竟是什么向量本质上就是一串数字。在数学上可以理解为一个 n 维空间里的一个点。AI模型比如大模型是把文本、图片、音频这些东西转换成一组高维数字也就是向量。举一个最直观的例子假设我们把”食物”这个概念压缩成两个维度——甜度和酸度。那么• 苹果 → [0.7, 0.3]• 柠檬 → [0.2, 0.9]• 纯净水 → [0.0, 0.0]把这两个维度画在坐标系里你会发现苹果和柠檬的距离很远但都在”食物”的象限里纯净水则几乎在原点附近。这就是向量表达语义的基本思路。一般的向量维度有768 维、1024 维甚至 1536 维。维度越高能捕捉的语义细节就越丰富。2. 什么是 Embedding嵌入Embedding 就是把文本、图片、音频这类非结构化数据转换成固定维度向量表示的过程。这个转换由专门的模型完成我们叫它 Embedding Model 或 Embedding API。3. 什么是向量索引Index向量数据库正是为了解决这个“相似性搜索”痛点它的核心能力不是“存”而是**“高效地查”。核心结论向量数据库的核心竞争壁垒之一就是索引算法的效率和精度平衡。目前主流的向量索引算法有四类各自适用于不同的数据规模和精度要求HNSW分层可导航小世界图目前最主流的方案灵感来自六度分隔理论——构建多层图结构从顶层节点少、跨度大往下逐层精细搜索就像从世界地图逐级放大到城市地图。查询快毫秒级、召回率高通常大于 95%代价是内存占用大。有一个关键参数叫 ef_search——查询时搜索宽度越大召回率越高但越慢。这个参数可以在线调整高流量时降低它减少延迟夜间批处理时提高它追求更高精度。IVF倒排文件索引先把全量向量用 K-Means 聚成若干个簇查询时只搜最近几个簇而非全量。内存占用比 HNSW 低适合亿级以上的超大规模数据代价是召回率通常略低于 HNSW。PQ乘积量化解决向量太多、内存装不下的问题。把高维向量切分成多个子段每段用聚类中心 ID 替代原始浮点值存储——一个 1024 维向量从 4096 字节压缩到 128 字节压缩比达 32 倍。通常和 IVF 组合使用IVF-PQ是处理亿级以上向量的标准方案。DiskANN磁盘索引传统算法要求索引全量在内存DiskANN 把索引主体放在 SSD 上内存只缓存最常用的部分用极小内存代价换取近似的查询性能——适合百亿级以上、内存成本敏感的极端规模场景。在实际业务中纯向量检索往往不够用。真实需求通常是找出和这段文字语义相近、且发布时间在 2024 年之后、且属于技术文档类别的内容——这就是混合检索即向量相似度与标量过滤条件的组合。实现方式有先过滤后检索保证结果满足条件但可能降低召回质量和先检索后过滤保证召回质量但可能过滤后结果不足生产环境的最佳实践是混合策略——先检索一个较大的候选集再应用过滤条件取最终结果。召回率Recall召回率Recall通常也叫查全率核心意思是看在所有实际存在的目标里有多少被成功找了出来 。它主要衡量的是系统或模型“不漏掉”重要信息的能力比如在数据库检索中就是检出的相关文献占全部相关文献的百分比 。三个核心指标召回率RecallK近似搜索结果中有多少是真正的最邻近结果生产环境通常要求大于 98%、延迟P50/P99 分位数P99 反映的是最差 1% 用户的体验——99% 的人在 5ms 内返回、剩下 1% 等了 2 秒这 1% 就是灾难、吞吐QPS每秒能处理多少次查询。三个指标相互制约——提高召回率会增加延迟、降低吞吐生产调优就是在这三者间找到业务可接受的最优平衡点。这些指标在 PoC 阶段就必须有明确的测量和验证而不是上线后才发现不达标。