Ollama+AnythingLLM搭建本地私有RAG知识库
链接适配微信公众号阅读逻辑,文风轻量化、分段清晰、重点加粗,所有操作节点标注配图需求,复制即可直接发布
导语
你是否有这些困扰:
公司内部手册、产品规范、私密业务文档,想让AI快速检索问答,但不敢上传ChatGPT、扣子等云端工具,担心数据泄露?
今天分享一套全本地、零数据外传、免费开源的私有知识库方案:Ollama大模型 + AnythingLLM可视化RAG工具,不用写复杂代码,个人电脑10分钟就能搭建完成。
所有文档、向量数据全部存储在本机,敏感资料完全可控,下面从零手把手教学。
一、先搞懂:什么是RAG?一张图看懂核心原理
RAG全称:检索增强生成
简单4步工作逻辑:
和云端AI核心区别:ChatGPT仅能依靠训练数据作答;本地RAG只会基于你的私有文档输出答案,还能展示回答引用的原文出处,杜绝AI幻觉。
【配图1:RAG工作流程示意图,四步流转可视化简图】
二、3款主流本地RAG工具横向对比,按需选择
目前开源本地知识库主流方案3款,结合上手难度、隐私、资源占用整理对比表:
| AnythingLLM | 新手开箱首选 | ⭐极低(桌面客户端) | 中高 | 最轻 | 个人、小团队快速体验 |
| PrivateGPT | 极致隐私内网方案 | ⭐高(命令行+Python) | 最高 | 中等 | 企业内网、高度敏感文件 |
| Dify | 团队协作AI应用平台 | ⭐中等(Docker部署) | 中等 | 最重 | 开发团队、对外文档问答产品 |
工具简短点评
独立桌面客户端,Windows/Mac/Linux全适配,内置向量库、RAG、对话界面,拖拽上传文档即可,无需拆分安装多个组件,新手首选。
纯本地离线处理,数据零外传,但依赖命令行操作,适合有开发基础、对数据隔离要求极高的企业。
可视化拖拽工作流,支持智能体RAG,适合多人协作搭建商用问答系统,最低需要8G以上内存。
三、实操教程:AnythingLLM+Ollama完整搭建流程
前置说明
整套方案仅需两个软件:Ollama(本地大模型推理)+ AnythingLLM(可视化RAG管理),全程免费开源。
步骤1:安装Ollama并拉取所需模型
1.1 Ollama安装命令
- Windows:官网 ollama.com 下载exe安装包双击安装
- Mac:终端执行
brew install ollama
- Linux:终端执行
curl -fsSL https://ollama.com/install.sh | sh
1.2 拉取两类必备模型
一类对话大模型,一类文档向量化嵌入模型,终端依次运行:
# 中文对话模型(推荐Qwen3.5 9B,中文效果优秀)
ollama pull qwen3.5:9b
# 向量嵌入模型(文档转向量核心,体积仅274M)
ollama pull nomic-embed-text
💡Tips:文档以中文为主,可替换嵌入模型bge-m3,命令:ollama pull bge-m3
【配图4:终端拉取模型运行日志截图】
步骤2:安装AnythingLLM桌面客户端
【配图5:AnythingLLM官网下载页截图】
步骤3:软件内绑定Ollama服务
打开AnythingLLM,进入全局设置页面,完成3项配置:
Ollama默认本地地址http://localhost:11434,软件会自动识别连接。
【配图6:AnythingLLM Ollama模型配置页面完整截图】
步骤4:创建专属工作区,上传私有文档
步骤5:本地知识库问答测试
向聊天框输入文档相关问题,例如:
- 产品退款规则是什么?
- 项目底层使用什么数据库?
工具会自动检索匹配文档片段,基于原文生成回答,底部附带引用文档来源,可溯源查看原文。
四、进阶优化:5个大幅提升RAG问答效果的技巧
单纯搭建完成效果有限,这5个实操技巧解决检索不准、回答幻觉问题:
文档提前预处理
上传前删除页眉页脚、目录、版权无关文字;表格内容转为纯文本;超长文档按章节拆分独立文件,减少无效干扰文本。
匹配适配的嵌入模型
通用文档用nomic-embed-text;大批量中文业务文档替换bge-m3,中文检索匹配度更高。
自定义文档分块大小
工作区设置-Document Settings可调分块token:
- 合同、长专业文档:1500-2000 token
- FAQ、短知识点文档:500 token
默认1000token适配通用场景。
开启纯文档引用模式
打开「Query Mode」,模型仅使用上传文档内容作答,不会调用自身预训练知识补充内容,杜绝凭空编造,适合合规、严谨场景。
按主题拆分工作区
不要把所有文档放入同一工作区,产品、技术、财务文档分设独立空间,缩小检索范围,匹配精度显著提升。
五、团队多人使用:Docker部署AnythingLLM
单人桌面版仅本地使用,多人协作推荐Docker容器部署,支持账号权限管理:
部署命令
docker pull mintplexlabs/anythingllm
docker run -d -p 3001:3001 \\
–name anythingllm \\
-v anythingllm_storage:/app/server/storage \\
mintplexlabs/anythingllm
部署完成后浏览器访问 http://localhost:3001 即可多人登录使用。
六、高频问题答疑
1:电脑8G内存能否流畅运行?
可以。AnythingLLM自身占用约2G内存;使用qwen3.5:4b小模型8G完全够用;9B模型建议16G内存避免卡顿。
2:本地知识库支持存储多少份文档?
无硬性数量上限,仅受硬盘空间限制;文档向量化后占用空间极小,数千份文档仅占用数GB存储空间。
3:中文文档检索问答效果怎么样?
Qwen3.5原生中文能力优秀,搭配nomic-embed-text/bge-m3嵌入模型,常规中文业务文档检索、问答准确率很高。
4:对比Coze、扣子等云端AI工具优势在哪?
短板:需要本地电脑硬件持续运行。
文末总结
本地RAG知识库是Ollama生态实用性最高的落地方案,完美解决私有敏感文档AI问答的隐私痛点:
- 个人用户:直接下载AnythingLLM桌面客户端,10分钟搭建完成;
- 企业高隐私需求:选用PrivateGPT纯离线方案;
- 团队协作开发:Docker部署Dify或容器版AnythingLLM。


