欢迎光临
我们一直在努力

拒绝“胡编乱造”:为什么大模型时代必须引入 RAG 技术?

拒绝“胡编乱造”:为什么大模型时代必须引入 RAG 技术?

大家好,我是你们的老朋友,一名在代码世界里摸爬滚打多年的程序员。

最近,LLM(大型语言模型)的热度简直比夏天的气温还高。从 ChatGPT 到各类国产大模型,我们似乎进入了一个“万物皆可 AI”的时代。但在实际落地应用中,很多开发者朋友发现了一个尴尬的现象:大模型虽然博学,但经常“信口开河”。

比如你问它:“我们公司上周发布的内部财报关键数据是多少?”它可能会给你编造一个看起来非常合理、但实际上完全错误的答案。这种现象在业界被称为**“幻觉”(Hallucination)**。

为了解决这个问题,RAG(检索增强生成,Retrieval-Augmented Generation) 技术应运而生,并迅速成为企业级 AI 应用的标准架构。今天,我们就用通俗易懂的方式,聊聊为什么要使用 RAG,以及它是如何工作的。

为什么大模型需要 RAG?

要理解 RAG 的价值,我们先得看看传统大模型的局限性。你可以把预训练的大模型想象成一个**“参加了高考但没带参考书进考场的学霸”**:

  • 知识截止:它的知识停留在训练数据结束的那一天。对于昨天发生的新闻、最新的股价或你公司的内部文档,它一无所知。
  • 黑盒不可控:你很难让它精确地引用来源。如果它说错了,你很难追溯是哪里出了问题。
  • 上下文限制:虽然现在的模型支持很长的上下文窗口,但你不可能把几百 GB 的企业知识库全部塞进每一次对话的 Prompt(提示词)中,既昂贵又低效。
  • RAG 的核心思想就是:给这个“学霸”配一本“实时更新的参考书”。

    当用户提问时,系统先去“参考书”(外部知识库)里查找相关片段,然后把问题和这些片段一起交给大模型,让大模型基于事实来回答。

    RAG 的核心工作流程

    RAG 并不是一个单一的算法,而是一套架构流程。为了让大家更直观地理解,我绘制了下面的流程图:

    #mermaid-svg-EAuP07GvYuxbqrzX{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-EAuP07GvYuxbqrzX .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-EAuP07GvYuxbqrzX .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-EAuP07GvYuxbqrzX .error-icon{fill:#552222;}#mermaid-svg-EAuP07GvYuxbqrzX .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-EAuP07GvYuxbqrzX .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-EAuP07GvYuxbqrzX .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-EAuP07GvYuxbqrzX .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-EAuP07GvYuxbqrzX .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-EAuP07GvYuxbqrzX .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-EAuP07GvYuxbqrzX .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-EAuP07GvYuxbqrzX .marker{fill:#333333;stroke:#333333;}#mermaid-svg-EAuP07GvYuxbqrzX .marker.cross{stroke:#333333;}#mermaid-svg-EAuP07GvYuxbqrzX svg{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-EAuP07GvYuxbqrzX p{margin:0;}#mermaid-svg-EAuP07GvYuxbqrzX .label{font-family:\”trebuchet ms\”,verdana,arial,sans-serif;color:#333;}#mermaid-svg-EAuP07GvYuxbqrzX .cluster-label text{fill:#333;}#mermaid-svg-EAuP07GvYuxbqrzX .cluster-label span{color:#333;}#mermaid-svg-EAuP07GvYuxbqrzX .cluster-label span p{background-color:transparent;}#mermaid-svg-EAuP07GvYuxbqrzX .label text,#mermaid-svg-EAuP07GvYuxbqrzX span{fill:#333;color:#333;}#mermaid-svg-EAuP07GvYuxbqrzX .node rect,#mermaid-svg-EAuP07GvYuxbqrzX .node circle,#mermaid-svg-EAuP07GvYuxbqrzX .node ellipse,#mermaid-svg-EAuP07GvYuxbqrzX .node polygon,#mermaid-svg-EAuP07GvYuxbqrzX .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-EAuP07GvYuxbqrzX .rough-node .label text,#mermaid-svg-EAuP07GvYuxbqrzX .node .label text,#mermaid-svg-EAuP07GvYuxbqrzX .image-shape .label,#mermaid-svg-EAuP07GvYuxbqrzX .icon-shape .label{text-anchor:middle;}#mermaid-svg-EAuP07GvYuxbqrzX .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-EAuP07GvYuxbqrzX .rough-node .label,#mermaid-svg-EAuP07GvYuxbqrzX .node .label,#mermaid-svg-EAuP07GvYuxbqrzX .image-shape .label,#mermaid-svg-EAuP07GvYuxbqrzX .icon-shape .label{text-align:center;}#mermaid-svg-EAuP07GvYuxbqrzX .node.clickable{cursor:pointer;}#mermaid-svg-EAuP07GvYuxbqrzX .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-EAuP07GvYuxbqrzX .arrowheadPath{fill:#333333;}#mermaid-svg-EAuP07GvYuxbqrzX .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-EAuP07GvYuxbqrzX .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-EAuP07GvYuxbqrzX .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-EAuP07GvYuxbqrzX .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-EAuP07GvYuxbqrzX .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-EAuP07GvYuxbqrzX .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-EAuP07GvYuxbqrzX .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-EAuP07GvYuxbqrzX .cluster text{fill:#333;}#mermaid-svg-EAuP07GvYuxbqrzX .cluster span{color:#333;}#mermaid-svg-EAuP07GvYuxbqrzX div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:\”trebuchet ms\”,verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-EAuP07GvYuxbqrzX .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-EAuP07GvYuxbqrzX rect.text{fill:none;stroke-width:0;}#mermaid-svg-EAuP07GvYuxbqrzX .icon-shape,#mermaid-svg-EAuP07GvYuxbqrzX .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-EAuP07GvYuxbqrzX .icon-shape p,#mermaid-svg-EAuP07GvYuxbqrzX .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-EAuP07GvYuxbqrzX .icon-shape .label rect,#mermaid-svg-EAuP07GvYuxbqrzX .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-EAuP07GvYuxbqrzX .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-EAuP07GvYuxbqrzX .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-EAuP07GvYuxbqrzX :root{–mermaid-font-family:\”trebuchet ms\”,verdana,arial,sans-serif;}

    生成阶段

    在线检索阶段

    离线索引阶段

    返回最相关的文本片段

    用户提问

    查询处理

    原始文档/PDF/网页

    文本切片

    向量化 Embedding

    向量数据库

    向量相似度搜索

    相关上下文

    构建增强提示词

    大语言模型

    最终回答

    从图中我们可以清晰地看到,RAG 分为两个主要阶段:

  • 离线索引阶段(Indexing):

    • 将你的私有数据(如 PDF、Word、数据库记录)进行清洗和切片。
    • 使用 Embedding 模型将这些文本转换为向量(一串数字),存入向量数据库。这就好比给每段文字打上了“语义标签”。
  • 在线检索与生成阶段(Retrieval & Generation):

    • 用户提问后,系统将问题也转化为向量。
    • 在向量数据库中搜索与问题向量最相似的文本片段(即“最相关的参考书页”)。
    • 将用户问题 + 检索到的参考内容组合成一个新的 Prompt,发送给大模型。
    • 大模型根据提供的参考内容生成答案。
  • 实战演示:一个简单的 RAG Demo

    光说不练假把式。下面我们用 Python 结合 LangChain 框架和一个简单的向量存储库,演示一个最小化的 RAG 流程。

    1. 环境准备

    你需要安装以下库:

    pip install langchain langchain-community faiss-cpu openai tiktoken

    注:为了演示方便,这里使用 OpenAI 的 API。如果你使用本地模型,可以替换为 Ollama 或其他兼容接口。

    2. 代码实现

    创建一个名为 rag_demo.py 的文件:

    import os
    from langchain.text_splitter import CharacterTextSplitter
    from langchain.embeddings.openai import OpenAIEmbeddings
    from langchain.vectorstores import FAISS
    from langchain.chains import RetrievalQA
    from langchain.chat_models import ChatOpenAI
    from langchain.prompts import PromptTemplate

    # 设置你的 OpenAI API Key
    os.environ["OPENAI_API_KEY"] = "your-api-key-here"

    def build_rag_system():
    # 1. 准备数据 (模拟一段私有知识)
    raw_text = """
    阿里巴巴集团成立于1999年,由马云带领其他17人在杭州公寓创立。
    淘宝网是阿里巴巴集团旗下的网络零售平台,成立于2003年5月。
    阿里云是阿里巴巴集团旗下的云计算及人工智能科技公司,成立于2009年。
    """

    # 2. 文本切片 (将长文本切分成小块,便于检索)
    text_splitter = CharacterTextSplitter(
    separator="\\n",
    chunk_size=100,
    chunk_overlap=20
    )
    texts = text_splitter.split_text(raw_text)

    # 3. 向量化并存储到向量数据库 (FAISS)
    embeddings = OpenAIEmbeddings()
    vector_store = FAISS.from_texts(texts, embeddings)

    # 4. 定义大模型
    llm = ChatOpenAI(model_name="gpt-3.5-turbo", temperature=0)

    # 5. 自定义 Prompt 模板 (关键步骤:告诉模型只依据上下文回答)
    template = """
    请仅根据以下提供的上下文信息回答问题。
    如果上下文中没有包含答案,请直接说“我不知道”,不要编造。

    上下文:
    {context}

    问题:
    {question}

    回答:
    """
    PROMPT = PromptTemplate(template=template, input_variables=["context", "question"])

    # 6. 构建 RAG 链
    qa_chain = RetrievalQA.from_chain_type(
    llm=llm,
    chain_type="stuff",
    retriever=vector_store.as_retriever(),
    chain_type_kwargs={"prompt": PROMPT}
    )

    return qa_chain

    if __name__ == "__main__":
    # 初始化系统
    rag_system = build_rag_system()

    # 测试提问
    question = "淘宝网是什么时候成立的?"
    result = rag_system.run(question)

    print(f"问题: {question}")
    print(f"回答: {result}")

    # 测试一个不在上下文中的问题
    question_unknown = "腾讯公司是哪年成立的?"
    result_unknown = rag_system.run(question_unknown)

    print(f"\\n问题: {question_unknown}")
    print(f"回答: {result_unknown}")

    3. 运行结果预期

    当你运行这段代码时,你会观察到:

  • 对于“淘宝网成立时间”,模型会准确回答“2003年5月”,因为它在向量数据库中找到了相关片段。
  • 对于“腾讯成立时间”,模型会回答“我不知道”,因为我们的私有数据里没有腾讯的信息,且我们在 Prompt 中限制了它不要编造。
  • 这就是 RAG 的魅力:可控、可追溯、基于事实。

    RAG 的优势总结

    通过上面的讲解和代码,我们可以总结出使用 RAG 的几大核心理由:

    • 消除幻觉:强制模型基于检索到的真实数据回答,大幅降低胡说八道的概率。
    • 数据实时更新:不需要重新训练庞大的模型,只需更新向量数据库中的文档,模型就能获取最新知识。
    • 保护隐私与安全:私有数据可以保留在企业内部,只将脱敏后的片段或向量用于交互,避免将核心机密直接传给公有大模型。
    • 提供引用来源:可以轻松地在回答中标注“信息来源自文档第几页”,增加了答案的可信度。

    避坑指南与最佳实践

    虽然 RAG 很强大,但在实际落地中也有几个常见的“坑”需要注意:

  • 切片策略很重要:如果文本切得太碎,可能丢失语境;切得太大,可能包含过多噪音。建议根据文档结构(如按段落、按标题)进行智能切片。
  • 混合检索:单纯的向量相似度搜索有时不够精准。对于关键词匹配要求高的场景(如搜索具体的订单号),建议结合关键词检索(BM25)和向量检索,即“混合检索”。
  • 重排序(Re-ranking):检索回来的前 K 个片段不一定都是最相关的。可以在检索后加一步“重排序”模型,对结果进行精排,再交给大模型,能显著提升回答质量。
  • 结语

    RAG 技术并不是要取代大模型,而是为大模型装上了“眼睛”和“耳朵”,让它能看清现实世界的数据。对于大多数企业应用来说,“大模型 + RAG” 是目前性价比最高、落地最快的 AI 解决方案。

    希望这篇文章能帮你理清 RAG 的思路。如果你正准备动手搭建自己的知识库助手,不妨从上面的小 Demo 开始尝试吧!

    参考资料

    • LangChain 官方文档 – Retrieval
    • Facebook AI Research – FAISS
    • Lewis et al., “Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks” (RAG 概念的起源论文)
    赞(0)
    未经允许不得转载:171主机测评 » 拒绝“胡编乱造”:为什么大模型时代必须引入 RAG 技术?
    分享到: 更多 (0)

    评论 抢沙发

    • 昵称 (必填)
    • 邮箱 (必填)
    • 网址