← LIU YI / RESEARCH
R05概念研究 / 指标待验证

VectorDB:面向 RAG 的向量检索研究

围绕中文内容检索,研究分层索引、语义分块、重排序和分布式存储的一体化设计。

EVIDENCE BOUNDARY

文中的 QPS、召回率和规模指标属于设计目标,尚无公开仓库或独立基准支持。

VectorDB: 自研高性能向量数据库

VectorDB — High-Performance Vector Search Engine


摘要 Abstract

在大语言模型(LLM)驱动的 RAG(检索增强生成)架构中,向量数据库是影响系统响应速度和准确度的关键瓶颈。现有开源方案(Milvus、Qdrant、Weaviate)在亿级向量规模下性能下降显著,且与 LLM 应用层的集成需要大量中间件。XINVAY 自研的 VectorDB 是一款专为内容检索场景深度优化的分布式向量数据库引擎,原生集成 RAG 管线,支持亿级向量毫秒级语义召回

关键词:向量数据库;RAG;近似最近邻搜索;分布式索引;语义检索

证据边界:本文是系统设计与研究目标稿。文中的 QPS、召回率、延迟与亿级规模指标尚无公开仓库、完整实验环境或第三方基准支持,不应视为已交付性能。


一、为什么自研向量数据库

1.1 现有方案的问题

痛点现有方案VectorDB 解法
性能衰减亿级向量时 QPS 骤降自研分层索引(HSW + IVFPQ 混合)
中间件冗余需额外部署 Embedding 服务、重排序服务原生 RAG 管线,一站式检索
中文语义弱通用 Embedding 模型中文效果差自训练中文语义模型,含行业语料
运维复杂分布式部署需手动管理分片自动分片 + 动态扩缩容

1.2 核心设计目标

prompt
┌─────────────────────────────────────────────────┐
│                  VectorDB                        │
├─────────────────────────────────────────────────┤
│  Embedding Layer  │  自训练模型 · 1280d/768d    │
├─────────────────────────────────────────────────┤
│  Index Layer      │  HSW + IVFPQ + 分层导航     │
├─────────────────────────────────────────────────┤
│  Storage Layer    │  列式存储 · 内存映射 · SSD友好 │
├─────────────────────────────────────────────────┤
│  Query Layer      │  混合检索 · 重排序 · 过滤     │
├─────────────────────────────────────────────────┤
│  RAG Pipeline     │  Chunking · Retrieval · Rerank │
└─────────────────────────────────────────────────┘

二、技术架构

2.1 分层索引引擎

VectorDB 采用三级索引架构:

层级算法作用延迟
L1 粗排HSW 图索引快速定位候选区域< 1ms
L2 精排IVFPQ 量化精确距离计算< 5ms
L3 重排交叉编码器语义精排< 10ms

2.2 核心性能指标

指标数值说明
单节点吞吐10,000+ QPS128维向量,Top100 召回
召回率> 99.5%vs 暴力搜索(ANN-Benchmarks)
索引构建100万向量/秒8核 CPU
内存效率向量原始大小 × 1.2含索引开销

三、原生 RAG 集成

3.1 端到端检索管道

点击放大 (Click to zoom)
graph LR
    A[原始文档] --> B[智能分块<br/>Semantic Chunking]
    B --> C[Embedding<br/>自训练模型]
    C --> D[VectorDB<br/>分层索引]
    E[用户查询] --> F[查询 Embedding]
    F --> D
    D --> G[Top-K 候选]
    G --> H[Cross-Encoder<br/>重排序]
    H --> I[最终结果]

3.2 智能分块策略

  • 语义分块:基于段落语义边界切分,而非固定 token 数
  • 重叠窗口:相邻块保留 20% 重叠,避免语义断裂
  • 元数据保留:自动提取标题层级、列表结构等文档结构信息

四、中文语义优化

4.1 自训练 Embedding 模型

  • 基于 BGE-M3 二次训练
  • 训练语料:1000 万+ 中文内容行业文本
  • 新增支持:小红书/抖音风格的短文本口语化语义

4.2 行业词表

  • 品牌名称识别(避免切词错误)
  • 行业黑话/流行语实时更新
  • 平台特定术语(种草、拔草、探店等)

五、部署模式

模式适用场景向量规模
嵌入模式单机小规模<100万
单机模式中小企业100万–5000万
集群模式大规模生产5000万–10亿+

六、当前进展

VectorDB 目前处于 Ongoing 研发阶段,核心索引引擎已完成:

  • ✅ HSW + IVFPQ 混合索引
  • ✅ 原生 RAG 管线(分块→向量化→检索→重排)
  • ✅ 中文 Embedding 模型 v1.0
  • 🔄 分布式集群模式
  • 🔄 gRPC / RESTful API

预计 2026 Q3 随 Nexus Code 一同开放 Beta 测试。


← 返回研究页面