🎬 个人主页:艾莉丝努力练剑
❄专栏传送门:《C语言》《数据结构与算法》《C/C++干货分享&学习过程记录》 《Linux操作系统编程详解》《笔试/面试常见算法:从基础到进阶》《Python干货分享》
⭐️为天地立心,为生民立命,为往圣继绝学,为万世开太平
🎬 艾莉丝的简介:

文章目录
- 1 ~> 无第三方工具的本地大模型原生搭建方案
-
- 1.1 模型资源获取
-
- 1.1.1 主流开源模型仓库
- 1.1.2 模型选型原则
- 1.1.3 模型文件本质
- 1.2 推理引擎部署
-
- 1.2.1 引擎核心作用
- 1.2.2 主流开源推理引擎
- 1.3 推理代码实现
- 2 ~> Ollama 工具体系详解
-
- 2.1 核心定位与价值
- 2.2 核心技术特性
- 2.3 安装方式
-
- 2.3.1 Windows 平台
- 2.3.2 Linux /macOS 平台
- 2.4 常用操作指令
- 2.5 生态与 API 能力
-
- 2.5.1 官方生态矩阵
- 2.5.2 核心 API 接口
- 2.5.3 官方客户端库
- 结尾

1 ~> 无第三方工具的本地大模型原生搭建方案
1.1 模型资源获取
1.1.1 主流开源模型仓库
- Hugging Face Hub:全球最大的开源 AI 模型生态平台,地址:https://huggingface.co/,收录海量预训练模型、数据集与部署方案
- ModelScope(魔搭):国内阿里达摩院主导的开源模型社区,地址:https://www.modelscope.cn/models
- 模型官方仓库:各模型研发团队官方发布渠道
1.1.2 模型选型原则
需结合业务功能需求与本地硬件配置(显存、内存、算力),选择适配参数量与量化等级的模型。
1.1.3 模型文件本质
下载的模型并非可执行程序,而是由权重参数文件、配置文件、词表文件等组成的文件集合。以 Ollama 本地存储为例,模型文件分为两类目录:
- blobs:存储二进制权重分片文件
- manifests:存储模型元数据与清单文件
1.2 推理引擎部署
1.2.1 引擎核心作用
推理引擎是大语言模型的执行载体,负责完成模型权重加载、输入文本预处理、张量数学运算、输出文本生成等全推理流程。
1.2.2 主流开源推理引擎
- llama.cpp:纯 C/C++ 实现的轻量级 LLM 推理引擎,支持 CPU/GPU 混合推理,兼容多种量化格式,资源占用低,适合端侧与本地部署
- Hugging Face Transformers:Python 生态主流模型框架,提供统一的模型加载与推理接口,适配绝大多数开源模型,适合开发与调试
1.3 推理代码实现
- 需基于选定的推理引擎,使用 Python 或 C++ 等语言编写模型加载与交互逻辑
- 核心执行链路:模型权重加载 → 输入文本 Token 化 → 前向推理计算 → 输出结果解码
- 方案门槛:原生搭建需掌握模型原理、张量运算、框架 API 等技术栈,部署与调试成本较高
2 ~> Ollama 工具体系详解
2.1 核心定位与价值
- Ollama 是一款开源的本地大语言模型管理与服务工具,官方定位为:Get up and running with large language models
- 核心价值:封装模型下载、权重管理、推理调度、服务化接口等全链路能力,将原生复杂的部署流程简化为命令级操作,支持在消费级硬件上运行开源大语言模型
- 核心能力:模型下载管理、本地推理运行、API 服务化、多模型切换管理
2.2 核心技术特性
- 开源免费:工具本身与支持的全部开源模型均可免费使用,代码开源可审计
- 简易部署:无需复杂环境配置,通过少量命令即可完成安装与模型启动
- 跨平台支持:原生覆盖 macOS、Linux、Windows 三大主流操作系统,同时提供官方 Docker 镜像
- 模型生态丰富:支持 DeepSeek-R1、Llama 3.3、Gemma 2、Qwen 2 等主流开源 LLM,支持一键拉取与版本切换
- 标准化模型打包:通过 Modelfile 将模型权重、运行配置、系统提示等打包为统一实体,实现模型版本化与可复现管理
- 工具调用支持:兼容支持 Function Calling 能力的模型(如 Llama 3.1),可扩展实现复杂任务编排
- 硬件资源自适应:自动检测本地计算资源,优先调用 GPU 加速推理,无 GPU 环境自动回退至 CPU 推理
- 本地隐私保障:所有数据计算与存储均在本地完成,无数据外发链路,保障数据隐私安全
- 活跃社区生态:拥有官方 Discord 社区与 GitHub 开源社区,持续迭代功能与模型支持
2.3 安装方式
2.3.1 Windows 平台
- 系统要求:Windows 10 及以上版本
- 安装方式:从官网下载OllamaSetup.exe安装包,通过图形化向导完成安装
2.3.2 Linux /macOS 平台
- 官方一键安装命令(需提前安装curl工具)
# 执行官方安装脚本,自动完成环境配置与部署
curl -fsSL https://ollama.com/install.sh | sh
- 同时支持手动二进制安装、Docker 容器部署等方式
2.4 常用操作指令
| ollama pull <模型名称> | 从 Ollama 官方模型库拉取指定模型到本地 |
| ollama run <模型名称> | 启动指定模型并进入交互式对话模式 |
| ollama ps | 列出当前正在运行的所有模型实例 |
| ollama rm <模型名称> | 删除本地存储的指定模型 |
| ollama help | 显示 Ollama 命令行帮助信息 |
2.5 生态与 API 能力
2.5.1 官方生态矩阵
- GitHub 源码仓库:项目开源主仓库,包含核心实现代码、Issue 跟踪与贡献指南
- 官方文档:提供完整的安装、配置、API 参考、二次开发文档
- Discord 社区:官方用户交流与技术支持社区
- Ollama Cloud:企业级托管服务,面向高可用、高扩展需求的商业场景
2.5.2 核心 API 接口
Ollama 提供 RESTful API,支持二次开发与系统集成,核心接口包括:
- 文本补全接口:生成单轮文本补全结果
- 对话补全接口:支持多轮对话上下文的生成接口
- 模型管理接口:模型拉取、删除、信息查询、本地模型列表、运行中模型列表
- 嵌入向量接口:生成文本的向量表示
- 模型创建接口:基于 Modelfile 创建自定义模型
- 支持流式响应(Streaming Response),默认返回 JSON 格式数据
- 规范约定:所有时长类型字段均以纳秒为单位
2.5.3 官方客户端库
提供 JavaScript、Python 等主流语言的官方 SDK,简化应用集成开发
结尾
uu们,本文的内容到这里就全部结束了,艾莉丝在这里再次感谢您的阅读!
|
艾莉丝努力练剑
C/C++ & Linux 底层探索者 | 一个正在努力练剑的技术博主 👀 ❤️ ⭐ 💬 不要忘记给博主“一键四连”哦! “今日练剑达成!” “技术之路难免有困惑,但同行的人会让前进更有方向。” |
结语:希望对学习Linux相关内容的uu有所帮助,不要忘记给博主“一键四连”哦!
往期回顾:
【AI大模型接入SDK】大模型部署方案:云端接入与本地部署对比分析
🗡博主在这里放了一只小狗,大家看完了摸摸小狗放松一下吧!🗡
૮₍ ˶ ˊ ᴥ ˋ˶₎ა






