Ollama 本地物理服务器部署大模型详细方案

报告日期: 2026 年 3 月 10 日
调研对象: Ollama 本地部署方案
调研目的: 评估在本地物理服务器部署大模型的可行性与实施方案


一、Ollama 介绍

1.1 什么是 Ollama

Ollama 是一个开源的本地大语言模型(LLM)部署工具,于 2023 年发布,2026 年已成为最流行的本地 LLM 运行平台之一。它基于 llama.cpp 项目封装,提供了极简的命令行接口,让用户能够像安装软件一样快速部署和运行大模型。

1.2 核心特点

特点 描述
开箱即用 一键安装,无需复杂配置
跨平台 支持 Linux、macOS、Windows
模型丰富 内置 100+ 预量化模型
资源友好 支持 CPU 推理,GPU 加速可选
API 接口 提供 RESTful API,便于集成
量化优化 内置 GGUF 量化,降低显存需求

1.3 适用场景

场景 适用度 说明
个人开发者 ⭐⭐⭐⭐⭐ 快速验证、本地测试
企业私有化 ⭐⭐⭐⭐⭐ 数据隐私、离线部署
边缘计算 ⭐⭐⭐⭐ 低延迟、本地推理
教学科研 ⭐⭐⭐⭐⭐ 低成本、易上手
生产环境 ⭐⭐⭐⭐ 需配合负载均衡

1.4 与竞品对比

特性 Ollama vLLM llama.cpp HuggingFace TGI
部署难度 ⭐⭐⭐⭐⭐ ⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐
推理速度 ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
显存优化 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐
模型数量 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐⭐
API 支持 ⭐⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐ ⭐⭐⭐⭐⭐
多 GPU ⭐⭐⭐ ⭐⭐⭐⭐⭐ ⭐⭐ ⭐⭐⭐⭐⭐

二、部署方案

2.1 方案一:单机部署(推荐入门)

适用场景: 个人使用、小团队、开发测试

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
┌─────────────────┐
│ 用户应用 │
│ (Web/CLI) │
└────────┬────────┘


┌─────────────────┐
│ Ollama │
│ (127.0.0.1:11434) │
└────────┬────────┘


┌─────────────────┐
│ 大模型 │
│ (GGUF 量化) │
└─────────────────┘

优点:

  • ✅ 部署简单,5 分钟上手
  • ✅ 资源需求低
  • ✅ 适合开发和测试

缺点:

  • ❌ 单点故障
  • ❌ 并发能力有限
  • ❌ 无法水平扩展

2.2 方案二:多机集群部署

适用场景: 企业生产、高并发、多用户

1
2
3
4
5
6
7
8
9
10
11
12
                    ┌─────────────────┐
│ 负载均衡器 │
│ (Nginx/HAProxy)│
└────────┬────────┘

┌───────────────────┼───────────────────┐
│ │ │
▼ ▼ ▼
┌─────────────────┐ ┌─────────────────┐ ┌─────────────────┐
│ Ollama Node 1 │ │ Ollama Node 2 │ │ Ollama Node N │
│ GPU Server │ │ GPU Server │ │ GPU Server │
└─────────────────┘ └─────────────────┘ └─────────────────┘

优点:

  • ✅ 高可用性
  • ✅ 水平扩展
  • ✅ 负载均衡

缺点:

  • ❌ 架构复杂
  • ❌ 成本较高
  • ❌ 需要运维团队

2.3 方案三:Docker 容器化部署

适用场景: CI/CD、云原生、微服务架构

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
# docker-compose.yml
version: '3.8'
services:
ollama:
image: ollama/ollama:latest
container_name: ollama
ports:
- "11434:11434"
volumes:
- ollama_data:/root/.ollama
deploy:
resources:
reservations:
devices:
- driver: nvidia
count: 1
capabilities: [gpu]

volumes:
ollama_data:

优点:

  • ✅ 环境隔离
  • ✅ 易于迁移
  • ✅ 版本管理

缺点:

  • ❌ 需要 Docker 知识
  • ❌ GPU 配置较复杂

2.4 方案四:混合部署(云端 + 本地)

适用场景: 弹性扩容、灾备、成本优化

1
2
日常流量 (80%) → 本地 Ollama 集群
峰值流量 (20%) → 云端 API (Gemini/Claude)

优点:

  • ✅ 成本优化
  • ✅ 弹性扩容
  • ✅ 灾备能力

缺点:

  • ❌ 架构复杂
  • ❌ 需要流量调度

三、部署操作步骤

3.1 Linux 系统部署(Ubuntu 22.04/24.04)

步骤 1: 系统准备

1
2
3
4
5
6
7
8
9
10
11
# 更新系统
sudo apt update && sudo apt upgrade -y

# 安装必要工具
sudo apt install -y curl wget git

# 检查 NVIDIA GPU(如有)
nvidia-smi

# 安装 NVIDIA 驱动(如无)
sudo apt install -y nvidia-driver-550

步骤 2: 安装 Ollama

1
2
3
4
5
6
7
8
9
10
11
# 官方一键安装(推荐)
curl -fsSL https://ollama.com/install.sh | sh

# 验证安装
ollama --version

# 查看服务状态
systemctl status ollama

# 设置开机自启
sudo systemctl enable ollama

步骤 3: 配置 Ollama

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
# 创建配置目录
sudo mkdir -p /etc/ollama

# 创建配置文件
sudo tee /etc/ollama/config.json << 'EOF'
{
"host": "0.0.0.0",
"port": 11434,
"keep_alive": "5m",
"num_parallel": 4
}
EOF

# 设置环境变量(可选)
sudo tee /etc/systemd/system/ollama.service.d/override.conf << 'EOF'
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_KEEP_ALIVE=24h"
Environment="OLLAMA_NUM_PARALLEL=4"
Environment="OLLAMA_MAX_LOADED_MODELS=10"
EOF

# 重载并重启
sudo systemctl daemon-reload
sudo systemctl restart ollama

步骤 4: 下载模型

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
# 查看可用模型
ollama list

# 下载模型(示例)
ollama pull llama3.2:3b # Meta Llama 3.2 3B
ollama pull qwen2.5:7b # 阿里 Qwen 2.5 7B
ollama pull deepseek-r1:7b # 深度求索 R1 7B
ollama pull gemma3:4b # Google Gemma 3 4B
ollama pull minicpm-v:latest # 清华 MiniCPM 多模态

# 查看已下载模型
ollama list

# 删除模型
ollama rm llama3.2:3b

步骤 5: 运行模型

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
# 命令行交互
ollama run llama3.2:3b

# 指定系统提示词
ollama run llama3.2:3b "你是一个专业的 Python 开发者"

# API 调用
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2:3b",
"prompt": "你好,请介绍一下自己",
"stream": false
}'

# 后台服务(默认已启动)
ollama serve

3.2 Windows 系统部署

步骤 1: 下载安装

1
2
3
4
5
6
7
8
# 访问官网下载
# https://ollama.com/download/windows

# 或使用 winget
winget install Ollama.Ollama

# 验证安装
ollama --version

步骤 2: 配置环境变量

1
2
3
4
5
6
# 设置监听地址(允许远程访问)
[System.Environment]::SetEnvironmentVariable("OLLAMA_HOST", "0.0.0.0:11434", "Machine")

# 重启 Ollama 服务
# 右键任务栏 Ollama 图标 → Quit
# 重新启动 Ollama

步骤 3: 下载和运行模型

1
2
3
4
5
# 下载模型
ollama pull llama3.2:3b

# 运行模型
ollama run llama3.2:3b

3.3 Docker 部署

步骤 1: 安装 Docker 和 NVIDIA Container Toolkit

1
2
3
4
5
6
7
8
9
10
11
12
# 安装 Docker
curl -fsSL https://get.docker.com | sh

# 安装 NVIDIA Container Toolkit
distribution=$(. /etc/os-release;echo $ID$VERSION_ID)
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/$distribution/libnvidia-container.list | \
sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit.gpg] https://#g' | \
sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt update
sudo apt install -y nvidia-container-toolkit
sudo systemctl restart docker

步骤 2: 运行 Ollama 容器

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
# 拉取镜像
docker pull ollama/ollama:latest

# 运行容器(GPU 加速)
docker run -d --gpus=all \
-p 11434:11434 \
-v ollama_data:/root/.ollama \
--name ollama \
ollama/ollama:latest

# 运行容器(仅 CPU)
docker run -d \
-p 11434:11434 \
-v ollama_data:/root/.ollama \
--name ollama \
ollama/ollama:latest

3.4 API 集成示例

Python SDK

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
import requests

# 生成文本
response = requests.post('http://localhost:11434/api/generate', json={
'model': 'llama3.2:3b',
'prompt': '写一首关于春天的诗',
'stream': False
})
print(response.json()['response'])

# 对话模式
response = requests.post('http://localhost:11434/api/chat', json={
'model': 'llama3.2:3b',
'messages': [
{'role': 'user', 'content': '你好'},
{'role': 'assistant', 'content': '你好!有什么可以帮助你的?'},
{'role': 'user', 'content': 'Python 怎么读取文件?'}
],
'stream': False
})
print(response.json()['message']['content'])

Node.js SDK

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
const ollama = require('ollama');

// 生成文本
const response = await ollama.generate({
model: 'llama3.2:3b',
prompt: '写一首关于春天的诗'
});
console.log(response.response);

// 对话模式
const chat = await ollama.chat({
model: 'llama3.2:3b',
messages: [
{ role: 'user', content: '你好' }
]
});
console.log(chat.message.content);

四、支持的大模型类型和版本

4.1 模型家族总览(2026 年 3 月)

模型家族 参数量范围 最低显存 特点
Llama 1B - 405B 1GB Meta 通用模型,生态最丰富
Qwen 0.5B - 72B 0.5GB 阿里出品,中文优化
DeepSeek 1.5B - 671B 1GB 深度求索,推理能力强
Gemma 1B - 27B 1GB Google 出品,轻量高效
Mistral 7B - 123B 4GB 法国团队,性能优异
Phi 1.5B - 4B 1GB 微软出品,小模型大能力
Yi 6B - 34B 4GB 零一万物,中英双语
MiniCPM 2B - 4B 2GB 清华出品,端侧优化

4.2 热门模型详细列表

Llama 系列(Meta)

模型 参数量 量化后大小 最低显存 适用场景
llama3.2:1b 1B 0.6GB 1GB 超轻量对话
llama3.2:3b 3B 2GB 2GB 日常对话
llama3.1:8b 8B 4.7GB 6GB 通用任务
llama3.1:70b 70B 40GB 48GB 复杂推理
llama3.1:405b 405B 230GB 320GB 企业级

推荐命令:

1
2
3
ollama pull llama3.2:3b      # 入门推荐
ollama pull llama3.1:8b # 性能平衡
ollama pull llama3.1:70b # 高性能需求

Qwen 系列(阿里云)

模型 参数量 量化后大小 最低显存 适用场景
qwen2.5:0.5b 0.5B 0.3GB 1GB 端侧部署
qwen2.5:1.5b 1.5B 0.9GB 2GB 轻量对话
qwen2.5:3b 3B 2GB 3GB 日常使用
qwen2.5:7b 7B 4.4GB 6GB 通用任务
qwen2.5:14b 14B 8GB 12GB 专业场景
qwen2.5:32b 32B 18GB 24GB 复杂任务
qwen2.5:72b 72B 40GB 48GB 企业级

推荐命令:

1
2
3
ollama pull qwen2.5:7b       # 中文优化,推荐
ollama pull qwen2.5-coder:7b # 代码生成
ollama pull qwen2.5-math:7b # 数学推理

DeepSeek 系列(深度求索)

模型 参数量 量化后大小 最低显存 适用场景
deepseek-r1:1.5b 1.5B 1.1GB 2GB 轻量推理
deepseek-coder:1.3b 1.3B 0.8GB 2GB 代码生成
deepseek-r1:7b 7B 4GB 6GB 通用推理
deepseek-coder:6.7b 6.7B 3.8GB 6GB 代码生成
deepseek-v3:67b 67B 38GB 48GB 高性能
deepseek-r1:671b 671B 400GB 600GB 顶级推理

推荐命令:

1
2
ollama pull deepseek-r1:7b       # 推理能力强
ollama pull deepseek-coder:6.7b # 代码专用

Gemma 系列(Google)

模型 参数量 量化后大小 最低显存 适用场景
gemma3:1b 1B 0.8GB 1GB 超轻量
gemma3:4b 4B 2.5GB 4GB 日常对话
gemma2:9b 9B 5.5GB 8GB 通用任务
gemma2:27b 27B 16GB 24GB 高性能

推荐命令:

1
ollama pull gemma3:4b        # Google 轻量模型

Mistral 系列

模型 参数量 量化后大小 最低显存 适用场景
mistral:7b 7B 4.1GB 6GB 通用任务
mixtral:8x7b 47B (MoE) 26GB 32GB 高性能
mistral-large:123b 123B 70GB 96GB 企业级

推荐命令:

1
2
ollama pull mistral:7b       # 性能优异
ollama pull mixtral:8x7b # MoE 架构

Phi 系列(Microsoft)

模型 参数量 量化后大小 最低显存 适用场景
phi3:mini-3.8b 3.8B 2.3GB 4GB 轻量对话
phi3:small-7b 7B 4GB 6GB 通用任务
phi3:medium-14b 14B 8GB 12GB 复杂任务

推荐命令:

1
ollama pull phi3:mini-3.8b   # 微软小模型

MiniCPM 系列(清华/面壁)

模型 参数量 量化后大小 最低显存 适用场景
minicpm-v:latest 3B 2GB 3GB 多模态
minicpm3:4b 4B 2.5GB 4GB 端侧部署

推荐命令:

1
ollama pull minicpm-v        # 多模态支持

Yi 系列(零一万物)

模型 参数量 量化后大小 最低显存 适用场景
yi:6b 6B 3.5GB 6GB 中英双语
yi:34b 34B 20GB 32GB 长文档理解

推荐命令:

1
ollama pull yi:34b         # 长文档处理

4.3 专用模型

代码生成

1
2
3
4
ollama pull codellama:7b        # Meta 代码专用
ollama pull qwen2.5-coder:7b # 阿里代码专用
ollama pull deepseek-coder:6.7b # 深度求索代码专用
ollama pull starcoder2:7b # 多语言支持

数学推理

1
2
ollama pull qwen2.5-math:7b     # 阿里数学专用
ollama pull llama3.1:8b # 通用推理

多模态(图像理解)

1
2
3
ollama pull llava:7b            # 图像理解
ollama pull minicpm-v:latest # 清华多模态
ollama pull bakllava:latest # 多模态对话

中文优化

1
2
3
ollama pull qwen2.5:7b          # 阿里中文优化
ollama pull chatglm3:6b # 智谱中文
ollama pull yi:34b # 零一万物双语

五、服务器规格要求

5.1 硬件配置金字塔(2026 版)

层级 A:个人/入门级(7B 以下模型)

适用场景: 个人学习、开发测试、轻量 AI 助手

配置项 最低配置 推荐配置
CPU 4 核 8 核 (Intel i5/Ryzen 5)
内存 8GB 16GB DDR4
GPU 可选 GTX 1650 4GB / RTX 3050 6GB
显存 4GB 6-8GB
存储 50GB SSD 500GB NVMe SSD
网络 100Mbps 1Gbps
预算 ¥3,000 ¥8,000

可运行模型:

  • ✅ llama3.2:3b (流畅)
  • ✅ qwen2.5:7b (流畅)
  • ✅ gemma3:4b (流畅)
  • ✅ deepseek-r1:7b (中等)

预期性能:

  • 生成速度:20-50 tokens/s
  • 并发用户:1-3 人
  • 响应延迟:<2 秒

层级 B:团队/中型(7B-34B 模型)

适用场景: 小团队共享、企业知识库、中等并发

配置项 最低配置 推荐配置
CPU 8 核 16 核 (Intel i7/Ryzen 7)
内存 32GB 64GB DDR4
GPU RTX 3060 12GB RTX 4090 24GB × 2
显存 12GB 48GB
存储 500GB SSD 2TB NVMe SSD
网络 1Gbps 10Gbps
预算 ¥20,000 ¥80,000

可运行模型:

  • ✅ llama3.1:8b (流畅)
  • ✅ qwen2.5:14b (流畅)
  • ✅ deepseek-r1:7b (流畅)
  • ✅ yi:34b (中等)
  • ✅ mixtral:8x7b (中等)

预期性能:

  • 生成速度:30-80 tokens/s
  • 并发用户:5-20 人
  • 响应延迟:<1 秒

层级 C:企业级(70B+ 模型)

适用场景: 企业生产、高并发 API 服务、复杂推理

配置项 最低配置 推荐配置
CPU 16 核 64 核 (AMD EPYC/Intel Xeon)
内存 128GB 512GB DDR5
GPU A100 40GB × 2 H100 80GB × 8
显存 80GB 640GB
存储 2TB SSD 10TB NVMe RAID
网络 10Gbps 100Gbps
预算 ¥200,000 ¥2,000,000+

可运行模型:

  • ✅ llama3.1:70b (流畅)
  • ✅ qwen2.5:72b (流畅)
  • ✅ deepseek-v3:67b (流畅)
  • ✅ llama3.1:405b (需多卡)

预期性能:

  • 生成速度:50-150 tokens/s
  • 并发用户:50-500 人
  • 响应延迟:<500ms

5.2 显存需求速查表

模型参数量 FP16 显存 Q4 量化显存 Q2 量化显存
1B 2GB 1GB 0.5GB
3B 6GB 2GB 1GB
7B 14GB 4GB 2GB
13B 26GB 8GB 4GB
34B 68GB 20GB 10GB
70B 140GB 40GB 20GB
123B 246GB 70GB 35GB
405B 810GB 230GB 115GB

量化说明:

  • FP16: 半精度,质量最好,显存需求最高
  • Q4: 4-bit 量化,质量损失<5%,显存节省 70%
  • Q2: 2-bit 量化,质量损失<15%,显存节省 85%

5.3 GPU 选型建议

消费级 GPU(个人/小团队)

GPU 型号 显存 价格 推荐指数 适用模型
GTX 1650 4GB ¥1,000 ⭐⭐⭐ 3B 以下
RTX 3050 6GB ¥1,500 ⭐⭐⭐⭐ 7B (Q4)
RTX 3060 12GB ¥2,000 ⭐⭐⭐⭐⭐ 7B-13B
RTX 4060 8GB ¥2,500 ⭐⭐⭐⭐ 7B (Q4)
RTX 4070 12GB ¥4,500 ⭐⭐⭐⭐⭐ 7B-13B
RTX 4080 16GB ¥6,500 ⭐⭐⭐⭐⭐ 13B-34B
RTX 4090 24GB ¥12,000 ⭐⭐⭐⭐⭐ 34B-70B

专业级 GPU(企业)

GPU 型号 显存 价格 推荐指数 适用模型
A10 24GB ¥30,000 ⭐⭐⭐⭐ 34B
A100 40/80GB ¥80,000 ⭐⭐⭐⭐⭐ 70B
H100 80GB ¥200,000 ⭐⭐⭐⭐⭐ 70B-405B
H200 141GB ¥300,000 ⭐⭐⭐⭐⭐ 405B

5.4 CPU 推理方案(无 GPU)

如果预算有限,可以使用 CPU 推理:

配置 可运行模型 生成速度
4 核 8GB 1B-3B 5-10 tokens/s
8 核 16GB 3B-7B 10-20 tokens/s
16 核 32GB 7B-13B 5-15 tokens/s
32 核 64GB 13B-34B 3-10 tokens/s

优化建议:

  • 使用 Q4 或 Q2 量化模型
  • 增加内存到 64GB+
  • 使用 AVX-512 指令集 CPU
  • 考虑 Apple M 系列芯片(统一内存架构)

5.5 网络与存储建议

网络配置

场景 带宽要求 建议
本地单机 无要求 内网即可
局域网共享 1Gbps 千兆交换机
互联网 API 100Mbps+ 公网 IP + 防火墙
多机集群 10Gbps+ RDMA/RoCE

存储配置

组件 要求 建议
系统盘 50GB SSD 500GB NVMe
模型存储 10GB/模型 2TB+ NVMe
缓存 可选 1TB SSD
备份 可选 外接 HDD/云存储

六、性能优化建议

6.1 模型量化

1
2
3
4
5
6
# 下载量化模型(推荐 Q4)
ollama pull llama3.2:3b-q4_0
ollama pull qwen2.5:7b-q4_k_m

# 自定义量化(需要 Ollama 源码)
ollama create mymodel -f ./Modelfile

6.2 并发优化

1
2
3
4
5
6
7
8
# 设置并行请求数
export OLLAMA_NUM_PARALLEL=4

# 设置最大加载模型数
export OLLAMA_MAX_LOADED_MODELS=10

# 设置保持活跃时间
export OLLAMA_KEEP_ALIVE=24h

6.3 GPU 优化

1
2
3
4
5
6
7
8
# 设置 GPU 层数(更多层卸载到 GPU)
export OLLAMA_NUM_GPU=99

# 设置主 GPU
export OLLAMA_MAIN_GPU=0

# 禁用 GPU(使用 CPU)
export OLLAMA_NO_GPU=1

6.4 上下文窗口优化

1
2
3
4
5
6
# 设置上下文长度(默认 2048)
ollama run llama3.2:3b --num_ctx 4096

# 在 Modelfile 中设置
PARAMETER num_ctx 4096
PARAMETER num_batch 512

七、常见问题与解决方案

7.1 安装问题

问题 原因 解决方案
安装脚本失败 网络问题 使用国内镜像或离线安装
服务无法启动 端口占用 修改 OLLAMA_HOST 端口
GPU 无法识别 驱动问题 更新 NVIDIA 驱动

7.2 模型问题

问题 原因 解决方案
下载速度慢 网络问题 使用国内镜像站
显存不足 模型太大 使用量化版本或更小模型
生成乱码 模型损坏 删除后重新下载

7.3 性能问题

问题 原因 解决方案
生成速度慢 硬件瓶颈 升级 GPU 或使用量化
响应延迟高 并发过高 增加 OLLAMA_NUM_PARALLEL
内存泄漏 版本 bug 升级到最新版

八、总结与建议

8.1 核心结论

  1. Ollama 是本地部署大模型的最佳选择之一,特别适合快速上线和缺乏 AI 运维团队的场景
  2. 硬件配置决定模型上限,根据需求选择合适的 GPU 和显存
  3. 量化技术是关键,Q4 量化可在质量损失<5% 的情况下节省 70% 显存
  4. 中文场景优先选择 Qwen 系列,英文场景选择 Llama 或 Mistral

8.2 推荐配置方案

用户类型 推荐配置 预算 可运行模型
个人学习 RTX 3060 12GB + 32GB 内存 ¥5,000 7B-13B
小团队 RTX 4090 24GB × 2 + 64GB 内存 ¥30,000 34B-70B
企业生产 A100 40GB × 4 + 256GB 内存 ¥400,000 70B-405B

8.3 下一步行动

  1. 评估需求: 确定并发用户数、响应延迟要求、预算范围
  2. 选择硬件: 根据需求选择 GPU 和内存配置
  3. 安装测试: 先安装 Ollama,下载小模型测试
  4. 逐步扩展: 从单卡开始,根据需求扩展多卡集群
  5. 监控优化: 部署后持续监控性能,调整量化和并发参数

附录

A. 参考链接

B. 常用命令速查

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
# 安装
curl -fsSL https://ollama.com/install.sh | sh

# 查看版本
ollama --version

# 下载模型
ollama pull <model_name>

# 运行模型
ollama run <model_name>

# 列出模型
ollama list

# 删除模型
ollama rm <model_name>

# 查看日志
journalctl -u ollama -f

# 重启服务
sudo systemctl restart ollama

# API 调用
curl http://localhost:11434/api/generate -d '{"model":"llama3.2:3b","prompt":"你好"}'

C. 术语表

术语 解释
GGUF llama.cpp 的模型格式,支持量化
Q4/Q2 4-bit/2-bit 量化,降低显存需求
Token 模型处理的最小文本单位
MoE Mixture of Experts,稀疏激活架构
Context Window 上下文窗口,模型能处理的文本长度

报告完成时间: 2026-03-10 15:00
调研方法: Tavily API 搜索 + Ollama 官方文档
报告版本: v1.0