安装与环境

ollama.com 下载对应系统的安装包。Ollama 官方支持 macOS、Windows、Linux。装好后本机 API 默认在 http://localhost:11434


先确认版本

安装完成后打开新的终端,确认 CLI 在 PATH 里:

ollama --version

Linux 文档里也常用 ollama -v。能打印版本号即可进入 快速上手。若命令未找到:macOS 确认已把 App 放到「应用程序」并允许创建 /usr/local/bin/ollama 链接;Windows 重开终端,或检查 %LOCALAPPDATA%\Programs\Ollama 是否在用户 PATH。


macOS

  • 系统:macOS Sonoma(14)及以上
  • 芯片:Apple M 系列(CPU + Metal GPU);Intel Mac 仅 CPU

首选把 ollama.dmg 拖进「应用程序」。首次启动若检测不到 CLI,会提示在 /usr/local/bin 建链接。模型与配置默认在 ~/.ollama,体积可达数十到上百 GB;家目录空间不够时,把 App 放到其他盘并拒绝「移到应用程序」,或按官方文档改模型目录。

日志:~/.ollama/logsapp.logserver.log)。卸载需删除 App、/usr/local/bin/ollama 以及 ~/.ollama 等缓存目录,见 macOS 文档


Windows

  • 系统:Windows 10 22H2 及以上(Home / Pro)
  • GPU:NVIDIA 驱动 551.61+;AMD 需 ROCm v7 / HIP7,或走默认开启的 Vulkan
  • 安装器 OllamaSetup.exe 不需要管理员,默认装到用户目录;装好后托盘常驻,cmd / PowerShell 里都有 ollama

指定安装目录:

OllamaSetup.exe /DIR="D:\Apps\Ollama"

模型默认在 %HOMEPATH%\.ollama。家目录空间不够时,为当前用户设置环境变量 OLLAMA_MODELS 指向大磁盘,然后退出托盘并重新打开 Ollama(或新开终端)。

Windows 10 部分旧字体可能把进度条显示成方块,换终端字体即可。RDNA2 / RX 6000 若没有 ROCm v7,用 Vulkan;核显+独显混用时可用 GGML_VK_VISIBLE_DEVICES 指定独显序号。


Linux

一键安装(推荐):

curl -fsSL https://ollama.com/install.sh | sh

脚本会装二进制并尽量配好 systemd。手动包、ARM64、AMD ROCm 附加包见 Linux 文档。验证:

ollama serve          # 若未作为服务运行
# 另一个终端
ollama -v

推荐做成开机服务:sudo systemctl enable --now ollama。改环境变量用 sudo systemctl edit ollama。NVIDIA 装好驱动后执行 nvidia-smi;AMD 建议官方最新驱动 + ROCm v7。日志:journalctl -e -u ollama。指定版本:curl -fsSL https://ollama.com/install.sh | OLLAMA_VERSION=0.5.7 sh(版本号以 GitHub Releases 为准)。


Docker(可选)

官方镜像 ollama/ollama,端口 11434,模型卷建议持久化:

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

NVIDIA 需 NVIDIA Container Toolkit,启动加 --gpus=all。AMD 常用 ollama/ollama:rocm 并映射 /dev/kfd/dev/dri。容器内跑模型:docker exec -it ollama ollama run gemma4。应用在容器、Ollama 在宿主机时的地址见 应用集成


GPU 与内存(先建立直觉)

平台加速备注
Linux / Windows + NVIDIACUDA计算能力 5.0+;驱动 550+(部分老卡要 570+)
Apple SiliconMetal统一内存,模型占的是整机 RAM
Linux / Windows + AMDROCmVulkan硬件支持 卡片列表为准
无独立 GPUCPU能跑,延迟高;先选小模型或 q4

量化与显存(简化): Library 里的 GGUF 常用 Q4(约 4 bit/权重)和 Q8(约 8 bit)。同参数量下 Q4 更省显存、略损质量;Q8 更接近原精度、更吃显存。粗算:7B 的 Q4 大约 4–5 GB,Q8 大约 7–8 GB,还要加 上下文 KV 缓存。上下文越长越占显存;官方按 VRAM 给默认上下文(例如较小显存约 4k)。ollama psPROCESSOR 是否 100% GPU,出现大量 CPU 卸载就会变慢。

多块 NVIDIA 卡可用 CUDA_VISIBLE_DEVICES 限制可见 GPU。只有 CPU 时先 ollama pull 小模型,或使用 gemma4:cloud 这类云标签。


常见问题

ollama 不是内部或外部命令? 重开终端;Windows 确认安装器已写入用户 PATH。

服务起来了但 curl 连不上? 浏览器打开 http://localhost:11434;Linux 查 systemctl status ollama

模型把磁盘吃满? 设置 OLLAMA_MODELS,用 ollama ls / ollama rm 清理,见 模型库与量化


下一步

评论