)
RAG 的核心工作原理一個 RAG( Retrieval-Augmented Generation簡稱 RAG, 檢索增強(qiáng)生成) 系統(tǒng)的運(yùn)行閉環(huán)主要分為兩個階段離線數(shù)據(jù)準(zhǔn)備階段Indexing文檔解析 將 PDF、Word、Markdown 等異構(gòu)文檔拆解為結(jié)構(gòu)化文本。智能分塊Chunking 將長文切分為精細(xì)的文本塊Chunk并結(jié)合向量化模型Embedding轉(zhuǎn)為高維稠密向量。向量存儲 將向量和原文持久化存儲到向量數(shù)據(jù)庫中如 pgvector、Milvus 等。在線檢索與生成階段Inference用戶提問 用戶輸入 Query。召回檢索 系統(tǒng)通過 混合檢索Hybrid Search 語義向量檢索比如pgvector 關(guān)鍵詞精準(zhǔn)匹配(比如支持BM25), 通過 RRF倒數(shù)排名融合從數(shù)據(jù)庫中撈出幾十個候選片段。 目標(biāo) 確保高召回率絕不漏掉正確答案。重排Rerank 引入重排模型如 Cohere Rerank、BGE-Reranker對候選片段深度打分剔除噪音精準(zhǔn)選出最相關(guān)的 Top-N。目標(biāo) 極高精度把噪音全部過濾。增強(qiáng)生成 將用戶問題與精選的干凈上下文喂給 LLM由大模型生成帶引用溯源的準(zhǔn)確回答。RAG Rerank重排Rerank重排能夠讓 RAG 系統(tǒng)的精度更高和相關(guān)性更高。RAG檢索增強(qiáng)生成 系統(tǒng)中Rerank重排 解決了 RAG 中最痛的一個痛點(diǎn)返回一大堆內(nèi)容很多都是不相關(guān)的?;蛘哒f答案找出來了但排在十幾名開外被一堆無關(guān)的噪音淹沒導(dǎo)致大模型看不見或選錯。RAG Rerank 框架選擇1.商業(yè) API 方案開箱即用、免運(yùn)維代表 Cohere Rerank特點(diǎn) 頂尖水平多語言支持極佳提供現(xiàn)成的 SDK對 Java/Python 極友好適合追求開發(fā)效率或業(yè)務(wù)快速驗(yàn)證的團(tuán)隊(duì)。2.開源方案數(shù)據(jù)安全、零 API 成本代表 BGE-Reranker 、Qwen3-Reranker特點(diǎn) 適合有內(nèi)網(wǎng)私有化、數(shù)據(jù)不出海合規(guī)要求的企業(yè)。通常在服務(wù)器或 GPU 機(jī)器上通過 Python (FastAPI) 封裝為一個微服務(wù)供后端如 Java 項(xiàng)目通過 HTTP 進(jìn)行調(diào)用。參考資料https://cloud.google.com/use-cases/retrieval-augmented-generation?hlzh-CNhttps://www.callmissed.com/blog/rag-best-practices-2026