RAG应用技术选型
一、核心需求
1.精准语义检索:在海量知识库中,以高精度和高召回率找到与用户问题相关的文档片段
2.上下文感知召回:找到了相关的文档片段,还需要理解这些片段在原文中的完整上下文
3.关键信息适配上下文:大模型上下文窗口有限,把精准的信息放入上下文窗口
4.生成内容无幻觉:生成的结果必须严格基于检索到的信息,不编造不存在信息,可追信息溯来源。
二、RAG核心流程
文档解析 → 分块 Chunk → Embedding 向量化 → 向量库存储 → 语义检索 + 关键词检索 → 重排序 Rerank → 大模型生成应答
三、各层技术选型
1.文档解析和分块
1)场景建议:
数据类型 切分策略
论文、报告、长文本 借助大模型进行切分
日志、对话记录、表格 固定长度切分 + 强重叠
合同、法律文件、规章制度 条款维度切割
2)切分策略
策略 语义完整率 召回率影响 适应场景
固定大小、滑动窗口 68% 基准 短文本、新闻摘要、论坛帖子
语义切块 92% 召回率高 非结构化文档
条款切块 100% 较准确 法律文书、合同
3)切分工具
基于规则的层级分块:LangChain RecursiveCharacterTextSplitter(加入separators符号) (512 token, 20% overlap)
场景:通用文档、学术论文
基于语义相似度的智能分块 :SemanticChunker
场景:专业领域文档:财报、法律文书、技术手册,话题频繁切换的访谈记录、会议纪要
4)目前开源的解析文档工具对比
Marker 商用需授权 ,GPL协议
MinerU 精度高对中文、公式、表格、多栏支持强,硬件GPU(16GB显存)处理速度快,支持pip/Docker安装部署,开源协议Apache2.0
2.Embedding 嵌入模型选型
需要开源部署
bge-m3:全能:多语言、稀疏 + 稠密 + 检索,RAG 标配,支持混合检索 ,硬件要求:6G 显存
bge-large-zh-v1.5:中文场景最强传统嵌入
3.Rerank重排序模型选型
提升检索精度的关键,过滤无关文档,大幅降低幻觉
1)bge-reranker-large:中文最强,排序精度极高,适合对结果要求苛刻的场景
2)Qwen3-Reranker-0.6B:速度快、资源省、多语言、长文本,性价比极高
追求精度,不计成本 选bge-reranker-large
追求性价比,资源受限,多语言或长文档 选 Qwen3-Reranker-0.6B
最佳组合:BGE Embedding + BGE Rerank 一套全家桶,中文 RAG 效果拉满
4.大模型LLM选型
Qwen2-14B-Instruct DeepSeek-R1-14B-Chat
模型大小:14B 14B
显存占用:15~18GB 14~17GB
最低硬件:24G 显存单卡(RTX4090/A10) 24G 显存
优点: 中文 RAG 综合能力最强,精准引用检索文档 推理速度比 Qwen2-14B 快,vLLM 吞吐更高
vLLM 调度完美,支持 128K 长上下文 幻觉控制好,RAG 不易编造内容
商用开源、无版权风险
缺点: 必须 24G 显存起步 中文语义理解略逊 Qwen2
超高并发下需多卡分布式 复杂多轮 RAG 对话能力一般
硬件配置:
轻量生产: 用户100~500,RTX 4090 ×2 或 A10 24GB ×2 ,64–128GB 内存,2TB SSD,部署 vLLM
大型企业、专业深度问答:选 Qwen2-32B-Instruct + A100 80G
四、企业级落地推荐
解析:MinerU
分块:递归分块 + 语义分块
Embedding:bge-m3 / bge-large-zh
向量库:Milvus
检索:向量 + BM25 混合
Rerank:bge-reranker-large
LLM:通义千问 / Qwen-14B/72B
编排:LangChain + LangGraph