RAG应用技术选型建议

RAG应用技术选型

一、核心需求

    1.精准语义检索:在海量知识库中,以高精度和高召回率找到与用户问题相关的文档片段

    2.上下文感知召回:找到了相关的文档片段,还需要理解这些片段在原文中的完整上下文

    3.关键信息适配上下文:大模型上下文窗口有限,把精准的信息放入上下文窗口

    4.生成内容无幻觉:生成的结果必须严格基于检索到的信息,不编造不存在信息,可追信息溯来源。

二、RAG核心流程

    文档解析 → 分块 Chunk → Embedding 向量化 → 向量库存储 → 语义检索 + 关键词检索 → 重排序 Rerank → 大模型生成应答

三、各层技术选型

    1.文档解析和分块

      1)场景建议:

              数据类型                                    切分策略

        论文、报告、长文本                    借助大模型进行切分

        日志、对话记录、表格                  固定长度切分 + 强重叠

        合同、法律文件、规章制度            条款维度切割

        2)切分策略

          策略                语义完整率          召回率影响            适应场景

  固定大小、滑动窗口      68%                  基准            短文本、新闻摘要、论坛帖子

        语义切块                92%                召回率高          非结构化文档

        条款切块              100%                  较准确          法律文书、合同

        3)切分工具

            基于规则的层级分块:LangChain RecursiveCharacterTextSplitter(加入separators符号)  (512 token, 20% overlap)

            场景:通用文档、学术论文

          基于语义相似度的智能分块 :SemanticChunker

            场景:专业领域文档:财报、法律文书、技术手册,话题频繁切换的访谈记录、会议纪要

        4)目前开源的解析文档工具对比

            Marker 商用需授权 ,GPL协议

            MinerU 精度高对中文、公式、表格、多栏支持强,硬件GPU(16GB显存)处理速度快,支持pip/Docker安装部署,开源协议Apache2.0

      2.Embedding 嵌入模型选型

        需要开源部署

            bge-m3:全能:多语言、稀疏 + 稠密 + 检索,RAG 标配,支持混合检索  ,硬件要求:6G 显存

            bge-large-zh-v1.5:中文场景最强传统嵌入

      3.Rerank重排序模型选型

          提升检索精度的关键,过滤无关文档,大幅降低幻觉

          1)bge-reranker-large:中文最强,排序精度极高,适合对结果要求苛刻的场景

          2)Qwen3-Reranker-0.6B:速度快、资源省、多语言、长文本,性价比极高

              追求精度,不计成本 选bge-reranker-large

              追求性价比,资源受限,多语言或长文档 选 Qwen3-Reranker-0.6B

          最佳组合:BGE Embedding + BGE Rerank 一套全家桶,中文 RAG 效果拉满

        4.大模型LLM选型

                            Qwen2-14B-Instruct                                                  DeepSeek-R1-14B-Chat

模型大小:14B                       14B

                显存占用:15~18GB     14~17GB

最低硬件:24G 显存单卡(RTX4090/A10)                                      24G 显存

优点:  中文 RAG 综合能力最强,精准引用检索文档               推理速度比 Qwen2-14B 快,vLLM 吞吐更高

                            vLLM 调度完美,支持 128K 长上下文 幻觉控制好,RAG 不易编造内容

            商用开源、无版权风险

缺点:  必须 24G 显存起步             中文语义理解略逊 Qwen2

          超高并发下需多卡分布式             复杂多轮 RAG 对话能力一般

          硬件配置:

          轻量生产: 用户100~500,RTX 4090 ×2 或 A10 24GB ×2 ,64–128GB 内存,2TB SSD,部署 vLLM

          大型企业、专业深度问答:选 Qwen2-32B-Instruct + A100 80G

四、企业级落地推荐

    解析:MinerU

    分块:递归分块 + 语义分块

    Embedding:bge-m3 / bge-large-zh

    向量库:Milvus

    检索:向量 + BM25 混合

    Rerank:bge-reranker-large

    LLM:通义千问 / Qwen-14B/72B

    编排:LangChain + LangGraph

©著作权归作者所有,转载或内容合作请联系作者
【社区内容提示】社区部分内容疑似由AI辅助生成,浏览时请结合常识与多方信息审慎甄别。
平台声明:文章内容(如有图片或视频亦包括在内)由作者上传并发布,文章内容仅代表作者本人观点,简书系信息发布平台,仅提供信息存储服务。

相关阅读更多精彩内容

友情链接更多精彩内容