这次我们来看一套完整的 Ollama 本地部署与实战教程。内容从下载安装开始一直覆盖到本地大模型跑起来之后怎么用命令行对话、可视化 WebUI、REST API、Python 批量任务、Java 调用以及 Agent 场景怎么接。如果你一直想在本机跑一个开源大模型又不想折腾复杂的 Python 虚拟环境、手动下载模型权重和 CUDA 配置这篇内容可以直接按章节操作。Ollama 是目前本地部署大语言模型最常用的工具之一。它的核心思路是把模型下载、量化格式、推理服务、HTTP API 这些本该分开处理的事情统一封装成一个本地服务。用户只需要安装一个程序然后用一条命令拉取模型再运行模型就能得到一个既可以在终端对话、也可以被外部程序调用的本地大模型服务。这个服务默认监听在本机端口后面接 WebUI、接脚本、接 Agent 框架都很方便。整篇文章的实操顺序是先安装 Ollama再拉取一个模型然后用命令行完成第一轮对话接着接入网页界面再走一遍 REST API 调用最后用 Python 和 Java 各写一个调用示例。这样一圈跑下来你得到的不仅是一个能聊天的模型而是一个可以继续往项目里集成的本地推理后端。1. Ollama 核心能力速览在进入具体操作之前先把 Ollama 的能力边界和门槛整理清楚。下面这张表只写 Ollama 本身具备的能力模型的具体效果和资源占用要按你实际选择的模型来判断。能力项说明项目类型本地大语言模型运行与模型管理工具开源情况开源项目支持 Windows / macOS / Linux核心功能模型下载、量化运行、命令行交互、本地 HTTP API模型支持Llama、Qwen、DeepSeek、Mistral 等开源模型以官方模型库为准硬件要求CPU 可运行小模型GPU 加速建议使用 NVIDIA 显卡并安装对应驱动显存占用取决于模型大小、量化等级和上下文长度需按实际模型测试启动方式安装后通过命令行启动服务默认监听 11434 端口API 能力提供本地 REST API支持对话、生成、模型列表等接口批量任务不内置队列可通过 API 脚本自行扩展WebUI可接入 Open WebUI 等第三方界面适合场景本地开发测试、私有化部署、Agent 后端、离线推理这里要明确一个概念Ollama 不是模型本身它是“跑模型的运行时”。同一台机器换一个模型显存占用和推理速度可能差别很大。所以后面所有关于资源和性能的验证都要落到“具体模型 当前参数”上。2. 适用场景与使用边界Ollama 最适合的使用场景是把模型放在自己的电脑或内网机器上跑。数据不出本机没有按 token 计费的压力断网也能用。这对三类人特别有价值第一类是刚开始接触大模型想快速跑通一个开源模型找感觉的开发者第二类是希望把模型接入自有系统比如写文档处理工具、批量文本分析脚本、企业内部问答机器人的后端工程师第三类是做 Agent 相关开发的人需要一个本地模型作为推理后端方便反复调试和测试不用担心外部 API 超时或接口配额。它不适合的场景也很明确如果你的目标是拿一个超大参数模型做生产级服务或者需要与现有多云平台生态深度整合那本地部署可能不是效率最高的路径。本地机器能跑的模型规模有限推理速度也受限于单机硬件。遇到这种需求更稳妥的做法是评估云上用模型 API 的方案同时保留本地小模型做开发和联调。合规边界必须单独说。本地部署不等于可以随意使用开源模型也有对应的许可证训练数据的版权、生成内容的用途、商用边界都要确认。如果涉及人脸、声音、个人隐私数据必须确保有合法授权。不要把未经脱敏的敏感信息直接灌进任何模型服务哪怕是本地服务。批量处理任务之前先在小样本上验证效果和风险。3. Ollama 本地部署环境准备3.1 操作系统与硬件Ollama 官方支持 Windows、macOS 和主流 Linux 发行版。硬件上CPU 可以跑但速度受限于算力和内存有 NVIDIA 显卡会有明显加速显存越大能跑的模型越大。没有 NVIDIA 显卡的机器也不是不能试选择小尺寸量化模型用 CPU 推理一样可以完成功能验证只是不要对速度抱太高期望。内存建议 16GB 起步32GB 会更从容因为模型权重本身要占内存推理过程中的中间计算还会额外占用。3.2 软件与驱动检查Windows 用户建议先把系统更新到较新版本NVIDIA 驱动也保持在一个较新的状态。Ollama 会尝试自动调用 GPU如果驱动过旧可能出现“模型能跑但只走 CPU”的情况。判断方法很简单模型运行后用nvidia-smi看 GPU 利用率或者看 Ollama 自身输出的日志。如果你用的是 AMD 显卡情况会复杂一些建议先到官方文档确认支持状态再安装。3.3 磁盘空间与端口规划大语言模型的权重文件通常有两个主流格式未量化的完整权重和量化后的精简权重。量化模型体积明显更小对内存更友好是本地部署的首选。即便如此一个 7B 级别的量化模型也普遍需要数 GB 空间建议部署前预留 30GB 以上的可用磁盘避免拉取到一半空间不足。端口方面Ollama 默认监听 11434如果你本机已经有其他程序占用该端口可以安装后通过环境变量修改监听地址和端口。后面讲安装时我会再提一次。4. Ollama 下载安装与启动方式4.1 Windows 安装Windows 下最简单的方式是直接去官网下载安装包下载完成后双击安装一路确认即可。安装完成后打开新的终端窗口输入ollama --version如果能看到版本号说明安装成功。注意如果终端是安装前打开的可能需要重新打开一个窗口让环境变量生效。4.2 macOS / Linux 安装macOS 用户和 Linux 用户可以用官方安装脚本脚本会把 Ollama 装到系统目录并注册一个后台服务。命令模板如下实际安装时请以官网当前提供的脚本为准curl -fsSL https://ollama.com/install.sh | sh安装完成后输入ollama --version验证。Linux 下如果提示权限问题可以检查当前用户是否有执行权限或者按照脚本输出提示处理。4.3 Docker 部署如果你的环境里已经有 Docker也可以选择容器方式部署。这种方式的好处是环境隔离、