Ollama 本地物理服务器部署大模型详细方案
报告日期: 2026 年 3 月 10 日
调研对象: Ollama 本地部署方案
调研目的: 评估在本地物理服务器部署大模型的可行性与实施方案
一、Ollama 介绍
1.1 什么是 Ollama
Ollama 是一个开源的本地大语言模型(LLM)部署工具,于 2023 年发布,2026 年已成为最流行的本地 LLM 运行平台之一。它基于 llama.cpp 项目封装,提供了极简的命令行接口,让用户能够像安装软件一样快速部署和运行大模型。
1.2 核心特点
| 特点 |
描述 |
| 开箱即用 |
一键安装,无需复杂配置 |
| 跨平台 |
支持 Linux、macOS、Windows |
| 模型丰富 |
内置 100+ 预量化模型 |
| 资源友好 |
支持 CPU 推理,GPU 加速可选 |
| API 接口 |
提供 RESTful API,便于集成 |
| 量化优化 |
内置 GGUF 量化,降低显存需求 |
1.3 适用场景
| 场景 |
适用度 |
说明 |
| 个人开发者 |
⭐⭐⭐⭐⭐ |
快速验证、本地测试 |
| 企业私有化 |
⭐⭐⭐⭐⭐ |
数据隐私、离线部署 |
| 边缘计算 |
⭐⭐⭐⭐ |
低延迟、本地推理 |
| 教学科研 |
⭐⭐⭐⭐⭐ |
低成本、易上手 |
| 生产环境 |
⭐⭐⭐⭐ |
需配合负载均衡 |
1.4 与竞品对比
| 特性 |
Ollama |
vLLM |
llama.cpp |
HuggingFace TGI |
| 部署难度 |
⭐⭐⭐⭐⭐ |
⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐ |
| 推理速度 |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
| 显存优化 |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐ |
| 模型数量 |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
| API 支持 |
⭐⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐ |
⭐⭐⭐⭐⭐ |
| 多 GPU |
⭐⭐⭐ |
⭐⭐⭐⭐⭐ |
⭐⭐ |
⭐⭐⭐⭐⭐ |
二、部署方案
2.1 方案一:单机部署(推荐入门)
适用场景: 个人使用、小团队、开发测试
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16
| ┌─────────────────┐ │ 用户应用 │ │ (Web/CLI) │ └────────┬────────┘ │ ▼ ┌─────────────────┐ │ Ollama │ │ (127.0.0.1:11434) │ └────────┬────────┘ │ ▼ ┌─────────────────┐ │ 大模型 │ │ (GGUF 量化) │ └─────────────────┘
|
优点:
- ✅ 部署简单,5 分钟上手
- ✅ 资源需求低
- ✅ 适合开发和测试
缺点:
2.2 方案二:多机集群部署
适用场景: 企业生产、高并发、多用户
1 2 3 4 5 6 7 8 9 10 11 12
| ┌─────────────────┐ │ 负载均衡器 │ │ (Nginx/HAProxy)│ └────────┬────────┘ │ ┌───────────────────┼───────────────────┐ │ │ │ ▼ ▼ ▼ ┌─────────────────┐ ┌─────────────────┐ ┌─────────────────┐ │ Ollama Node 1 │ │ Ollama Node 2 │ │ Ollama Node N │ │ GPU Server │ │ GPU Server │ │ GPU Server │ └─────────────────┘ └─────────────────┘ └─────────────────┘
|
优点:
缺点:
2.3 方案三:Docker 容器化部署
适用场景: CI/CD、云原生、微服务架构
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20
| version: '3.8' services: ollama: image: ollama/ollama:latest container_name: ollama ports: - "11434:11434" volumes: - ollama_data:/root/.ollama deploy: resources: reservations: devices: - driver: nvidia count: 1 capabilities: [gpu]
volumes: ollama_data:
|
优点:
缺点:
- ❌ 需要 Docker 知识
- ❌ GPU 配置较复杂
2.4 方案四:混合部署(云端 + 本地)
适用场景: 弹性扩容、灾备、成本优化
1 2
| 日常流量 (80%) → 本地 Ollama 集群 峰值流量 (20%) → 云端 API (Gemini/Claude)
|
优点:
缺点:
三、部署操作步骤
3.1 Linux 系统部署(Ubuntu 22.04/24.04)
步骤 1: 系统准备
1 2 3 4 5 6 7 8 9 10 11
| sudo apt update && sudo apt upgrade -y
sudo apt install -y curl wget git
nvidia-smi
sudo apt install -y nvidia-driver-550
|
步骤 2: 安装 Ollama
1 2 3 4 5 6 7 8 9 10 11
| curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama
sudo systemctl enable ollama
|
步骤 3: 配置 Ollama
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25
| sudo mkdir -p /etc/ollama
sudo tee /etc/ollama/config.json << 'EOF' { "host": "0.0.0.0", "port": 11434, "keep_alive": "5m", "num_parallel": 4 } EOF
sudo tee /etc/systemd/system/ollama.service.d/override.conf << 'EOF' [Service] Environment="OLLAMA_HOST=0.0.0.0:11434" Environment="OLLAMA_KEEP_ALIVE=24h" Environment="OLLAMA_NUM_PARALLEL=4" Environment="OLLAMA_MAX_LOADED_MODELS=10" EOF
sudo systemctl daemon-reload sudo systemctl restart ollama
|
步骤 4: 下载模型
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15
| ollama list
ollama pull llama3.2:3b ollama pull qwen2.5:7b ollama pull deepseek-r1:7b ollama pull gemma3:4b ollama pull minicpm-v:latest
ollama list
ollama rm llama3.2:3b
|
步骤 5: 运行模型
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15
| ollama run llama3.2:3b
ollama run llama3.2:3b "你是一个专业的 Python 开发者"
curl http://localhost:11434/api/generate -d '{ "model": "llama3.2:3b", "prompt": "你好,请介绍一下自己", "stream": false }'
ollama serve
|
3.2 Windows 系统部署
步骤 1: 下载安装
1 2 3 4 5 6 7 8
|
winget install Ollama.Ollama
ollama --version
|
步骤 2: 配置环境变量
1 2 3 4 5 6
| [System.Environment]::SetEnvironmentVariable("OLLAMA_HOST", "0.0.0.0:11434", "Machine")
|
步骤 3: 下载和运行模型
1 2 3 4 5
| ollama pull llama3.2:3b
ollama run llama3.2:3b
|
3.3 Docker 部署
1 2 3 4 5 6 7 8 9 10 11 12
| curl -fsSL https://get.docker.com | sh
distribution=$(. /etc/os-release;echo $ID$VERSION_ID) curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey | sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit.gpg curl -s -L https://nvidia.github.io/libnvidia-container/$distribution/libnvidia-container.list | \ sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit.gpg] https://#g' | \ sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list sudo apt update sudo apt install -y nvidia-container-toolkit sudo systemctl restart docker
|
步骤 2: 运行 Ollama 容器
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16
| docker pull ollama/ollama:latest
docker run -d --gpus=all \ -p 11434:11434 \ -v ollama_data:/root/.ollama \ --name ollama \ ollama/ollama:latest
docker run -d \ -p 11434:11434 \ -v ollama_data:/root/.ollama \ --name ollama \ ollama/ollama:latest
|
3.4 API 集成示例
Python SDK
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21
| import requests
response = requests.post('http://localhost:11434/api/generate', json={ 'model': 'llama3.2:3b', 'prompt': '写一首关于春天的诗', 'stream': False }) print(response.json()['response'])
response = requests.post('http://localhost:11434/api/chat', json={ 'model': 'llama3.2:3b', 'messages': [ {'role': 'user', 'content': '你好'}, {'role': 'assistant', 'content': '你好!有什么可以帮助你的?'}, {'role': 'user', 'content': 'Python 怎么读取文件?'} ], 'stream': False }) print(response.json()['message']['content'])
|
Node.js SDK
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17
| const ollama = require('ollama');
const response = await ollama.generate({ model: 'llama3.2:3b', prompt: '写一首关于春天的诗' }); console.log(response.response);
const chat = await ollama.chat({ model: 'llama3.2:3b', messages: [ { role: 'user', content: '你好' } ] }); console.log(chat.message.content);
|
四、支持的大模型类型和版本
4.1 模型家族总览(2026 年 3 月)
| 模型家族 |
参数量范围 |
最低显存 |
特点 |
| Llama |
1B - 405B |
1GB |
Meta 通用模型,生态最丰富 |
| Qwen |
0.5B - 72B |
0.5GB |
阿里出品,中文优化 |
| DeepSeek |
1.5B - 671B |
1GB |
深度求索,推理能力强 |
| Gemma |
1B - 27B |
1GB |
Google 出品,轻量高效 |
| Mistral |
7B - 123B |
4GB |
法国团队,性能优异 |
| Phi |
1.5B - 4B |
1GB |
微软出品,小模型大能力 |
| Yi |
6B - 34B |
4GB |
零一万物,中英双语 |
| MiniCPM |
2B - 4B |
2GB |
清华出品,端侧优化 |
4.2 热门模型详细列表
| 模型 |
参数量 |
量化后大小 |
最低显存 |
适用场景 |
| llama3.2:1b |
1B |
0.6GB |
1GB |
超轻量对话 |
| llama3.2:3b |
3B |
2GB |
2GB |
日常对话 |
| llama3.1:8b |
8B |
4.7GB |
6GB |
通用任务 |
| llama3.1:70b |
70B |
40GB |
48GB |
复杂推理 |
| llama3.1:405b |
405B |
230GB |
320GB |
企业级 |
推荐命令:
1 2 3
| ollama pull llama3.2:3b ollama pull llama3.1:8b ollama pull llama3.1:70b
|
Qwen 系列(阿里云)
| 模型 |
参数量 |
量化后大小 |
最低显存 |
适用场景 |
| qwen2.5:0.5b |
0.5B |
0.3GB |
1GB |
端侧部署 |
| qwen2.5:1.5b |
1.5B |
0.9GB |
2GB |
轻量对话 |
| qwen2.5:3b |
3B |
2GB |
3GB |
日常使用 |
| qwen2.5:7b |
7B |
4.4GB |
6GB |
通用任务 |
| qwen2.5:14b |
14B |
8GB |
12GB |
专业场景 |
| qwen2.5:32b |
32B |
18GB |
24GB |
复杂任务 |
| qwen2.5:72b |
72B |
40GB |
48GB |
企业级 |
推荐命令:
1 2 3
| ollama pull qwen2.5:7b ollama pull qwen2.5-coder:7b ollama pull qwen2.5-math:7b
|
DeepSeek 系列(深度求索)
| 模型 |
参数量 |
量化后大小 |
最低显存 |
适用场景 |
| deepseek-r1:1.5b |
1.5B |
1.1GB |
2GB |
轻量推理 |
| deepseek-coder:1.3b |
1.3B |
0.8GB |
2GB |
代码生成 |
| deepseek-r1:7b |
7B |
4GB |
6GB |
通用推理 |
| deepseek-coder:6.7b |
6.7B |
3.8GB |
6GB |
代码生成 |
| deepseek-v3:67b |
67B |
38GB |
48GB |
高性能 |
| deepseek-r1:671b |
671B |
400GB |
600GB |
顶级推理 |
推荐命令:
1 2
| ollama pull deepseek-r1:7b ollama pull deepseek-coder:6.7b
|
Gemma 系列(Google)
| 模型 |
参数量 |
量化后大小 |
最低显存 |
适用场景 |
| gemma3:1b |
1B |
0.8GB |
1GB |
超轻量 |
| gemma3:4b |
4B |
2.5GB |
4GB |
日常对话 |
| gemma2:9b |
9B |
5.5GB |
8GB |
通用任务 |
| gemma2:27b |
27B |
16GB |
24GB |
高性能 |
推荐命令:
Mistral 系列
| 模型 |
参数量 |
量化后大小 |
最低显存 |
适用场景 |
| mistral:7b |
7B |
4.1GB |
6GB |
通用任务 |
| mixtral:8x7b |
47B (MoE) |
26GB |
32GB |
高性能 |
| mistral-large:123b |
123B |
70GB |
96GB |
企业级 |
推荐命令:
1 2
| ollama pull mistral:7b ollama pull mixtral:8x7b
|
Phi 系列(Microsoft)
| 模型 |
参数量 |
量化后大小 |
最低显存 |
适用场景 |
| phi3:mini-3.8b |
3.8B |
2.3GB |
4GB |
轻量对话 |
| phi3:small-7b |
7B |
4GB |
6GB |
通用任务 |
| phi3:medium-14b |
14B |
8GB |
12GB |
复杂任务 |
推荐命令:
1
| ollama pull phi3:mini-3.8b
|
MiniCPM 系列(清华/面壁)
| 模型 |
参数量 |
量化后大小 |
最低显存 |
适用场景 |
| minicpm-v:latest |
3B |
2GB |
3GB |
多模态 |
| minicpm3:4b |
4B |
2.5GB |
4GB |
端侧部署 |
推荐命令:
Yi 系列(零一万物)
| 模型 |
参数量 |
量化后大小 |
最低显存 |
适用场景 |
| yi:6b |
6B |
3.5GB |
6GB |
中英双语 |
| yi:34b |
34B |
20GB |
32GB |
长文档理解 |
推荐命令:
4.3 专用模型
代码生成
1 2 3 4
| ollama pull codellama:7b ollama pull qwen2.5-coder:7b ollama pull deepseek-coder:6.7b ollama pull starcoder2:7b
|
数学推理
1 2
| ollama pull qwen2.5-math:7b ollama pull llama3.1:8b
|
多模态(图像理解)
1 2 3
| ollama pull llava:7b ollama pull minicpm-v:latest ollama pull bakllava:latest
|
中文优化
1 2 3
| ollama pull qwen2.5:7b ollama pull chatglm3:6b ollama pull yi:34b
|
五、服务器规格要求
5.1 硬件配置金字塔(2026 版)
层级 A:个人/入门级(7B 以下模型)
适用场景: 个人学习、开发测试、轻量 AI 助手
| 配置项 |
最低配置 |
推荐配置 |
| CPU |
4 核 |
8 核 (Intel i5/Ryzen 5) |
| 内存 |
8GB |
16GB DDR4 |
| GPU |
可选 |
GTX 1650 4GB / RTX 3050 6GB |
| 显存 |
4GB |
6-8GB |
| 存储 |
50GB SSD |
500GB NVMe SSD |
| 网络 |
100Mbps |
1Gbps |
| 预算 |
¥3,000 |
¥8,000 |
可运行模型:
- ✅ llama3.2:3b (流畅)
- ✅ qwen2.5:7b (流畅)
- ✅ gemma3:4b (流畅)
- ✅ deepseek-r1:7b (中等)
预期性能:
- 生成速度:20-50 tokens/s
- 并发用户:1-3 人
- 响应延迟:<2 秒
层级 B:团队/中型(7B-34B 模型)
适用场景: 小团队共享、企业知识库、中等并发
| 配置项 |
最低配置 |
推荐配置 |
| CPU |
8 核 |
16 核 (Intel i7/Ryzen 7) |
| 内存 |
32GB |
64GB DDR4 |
| GPU |
RTX 3060 12GB |
RTX 4090 24GB × 2 |
| 显存 |
12GB |
48GB |
| 存储 |
500GB SSD |
2TB NVMe SSD |
| 网络 |
1Gbps |
10Gbps |
| 预算 |
¥20,000 |
¥80,000 |
可运行模型:
- ✅ llama3.1:8b (流畅)
- ✅ qwen2.5:14b (流畅)
- ✅ deepseek-r1:7b (流畅)
- ✅ yi:34b (中等)
- ✅ mixtral:8x7b (中等)
预期性能:
- 生成速度:30-80 tokens/s
- 并发用户:5-20 人
- 响应延迟:<1 秒
层级 C:企业级(70B+ 模型)
适用场景: 企业生产、高并发 API 服务、复杂推理
| 配置项 |
最低配置 |
推荐配置 |
| CPU |
16 核 |
64 核 (AMD EPYC/Intel Xeon) |
| 内存 |
128GB |
512GB DDR5 |
| GPU |
A100 40GB × 2 |
H100 80GB × 8 |
| 显存 |
80GB |
640GB |
| 存储 |
2TB SSD |
10TB NVMe RAID |
| 网络 |
10Gbps |
100Gbps |
| 预算 |
¥200,000 |
¥2,000,000+ |
可运行模型:
- ✅ llama3.1:70b (流畅)
- ✅ qwen2.5:72b (流畅)
- ✅ deepseek-v3:67b (流畅)
- ✅ llama3.1:405b (需多卡)
预期性能:
- 生成速度:50-150 tokens/s
- 并发用户:50-500 人
- 响应延迟:<500ms
5.2 显存需求速查表
| 模型参数量 |
FP16 显存 |
Q4 量化显存 |
Q2 量化显存 |
| 1B |
2GB |
1GB |
0.5GB |
| 3B |
6GB |
2GB |
1GB |
| 7B |
14GB |
4GB |
2GB |
| 13B |
26GB |
8GB |
4GB |
| 34B |
68GB |
20GB |
10GB |
| 70B |
140GB |
40GB |
20GB |
| 123B |
246GB |
70GB |
35GB |
| 405B |
810GB |
230GB |
115GB |
量化说明:
- FP16: 半精度,质量最好,显存需求最高
- Q4: 4-bit 量化,质量损失<5%,显存节省 70%
- Q2: 2-bit 量化,质量损失<15%,显存节省 85%
5.3 GPU 选型建议
消费级 GPU(个人/小团队)
| GPU 型号 |
显存 |
价格 |
推荐指数 |
适用模型 |
| GTX 1650 |
4GB |
¥1,000 |
⭐⭐⭐ |
3B 以下 |
| RTX 3050 |
6GB |
¥1,500 |
⭐⭐⭐⭐ |
7B (Q4) |
| RTX 3060 |
12GB |
¥2,000 |
⭐⭐⭐⭐⭐ |
7B-13B |
| RTX 4060 |
8GB |
¥2,500 |
⭐⭐⭐⭐ |
7B (Q4) |
| RTX 4070 |
12GB |
¥4,500 |
⭐⭐⭐⭐⭐ |
7B-13B |
| RTX 4080 |
16GB |
¥6,500 |
⭐⭐⭐⭐⭐ |
13B-34B |
| RTX 4090 |
24GB |
¥12,000 |
⭐⭐⭐⭐⭐ |
34B-70B |
专业级 GPU(企业)
| GPU 型号 |
显存 |
价格 |
推荐指数 |
适用模型 |
| A10 |
24GB |
¥30,000 |
⭐⭐⭐⭐ |
34B |
| A100 |
40/80GB |
¥80,000 |
⭐⭐⭐⭐⭐ |
70B |
| H100 |
80GB |
¥200,000 |
⭐⭐⭐⭐⭐ |
70B-405B |
| H200 |
141GB |
¥300,000 |
⭐⭐⭐⭐⭐ |
405B |
5.4 CPU 推理方案(无 GPU)
如果预算有限,可以使用 CPU 推理:
| 配置 |
可运行模型 |
生成速度 |
| 4 核 8GB |
1B-3B |
5-10 tokens/s |
| 8 核 16GB |
3B-7B |
10-20 tokens/s |
| 16 核 32GB |
7B-13B |
5-15 tokens/s |
| 32 核 64GB |
13B-34B |
3-10 tokens/s |
优化建议:
- 使用 Q4 或 Q2 量化模型
- 增加内存到 64GB+
- 使用 AVX-512 指令集 CPU
- 考虑 Apple M 系列芯片(统一内存架构)
5.5 网络与存储建议
网络配置
| 场景 |
带宽要求 |
建议 |
| 本地单机 |
无要求 |
内网即可 |
| 局域网共享 |
1Gbps |
千兆交换机 |
| 互联网 API |
100Mbps+ |
公网 IP + 防火墙 |
| 多机集群 |
10Gbps+ |
RDMA/RoCE |
存储配置
| 组件 |
要求 |
建议 |
| 系统盘 |
50GB SSD |
500GB NVMe |
| 模型存储 |
10GB/模型 |
2TB+ NVMe |
| 缓存 |
可选 |
1TB SSD |
| 备份 |
可选 |
外接 HDD/云存储 |
六、性能优化建议
6.1 模型量化
1 2 3 4 5 6
| ollama pull llama3.2:3b-q4_0 ollama pull qwen2.5:7b-q4_k_m
ollama create mymodel -f ./Modelfile
|
6.2 并发优化
1 2 3 4 5 6 7 8
| export OLLAMA_NUM_PARALLEL=4
export OLLAMA_MAX_LOADED_MODELS=10
export OLLAMA_KEEP_ALIVE=24h
|
6.3 GPU 优化
1 2 3 4 5 6 7 8
| export OLLAMA_NUM_GPU=99
export OLLAMA_MAIN_GPU=0
export OLLAMA_NO_GPU=1
|
6.4 上下文窗口优化
1 2 3 4 5 6
| ollama run llama3.2:3b --num_ctx 4096
PARAMETER num_ctx 4096 PARAMETER num_batch 512
|
七、常见问题与解决方案
7.1 安装问题
| 问题 |
原因 |
解决方案 |
| 安装脚本失败 |
网络问题 |
使用国内镜像或离线安装 |
| 服务无法启动 |
端口占用 |
修改 OLLAMA_HOST 端口 |
| GPU 无法识别 |
驱动问题 |
更新 NVIDIA 驱动 |
7.2 模型问题
| 问题 |
原因 |
解决方案 |
| 下载速度慢 |
网络问题 |
使用国内镜像站 |
| 显存不足 |
模型太大 |
使用量化版本或更小模型 |
| 生成乱码 |
模型损坏 |
删除后重新下载 |
7.3 性能问题
| 问题 |
原因 |
解决方案 |
| 生成速度慢 |
硬件瓶颈 |
升级 GPU 或使用量化 |
| 响应延迟高 |
并发过高 |
增加 OLLAMA_NUM_PARALLEL |
| 内存泄漏 |
版本 bug |
升级到最新版 |
八、总结与建议
8.1 核心结论
- Ollama 是本地部署大模型的最佳选择之一,特别适合快速上线和缺乏 AI 运维团队的场景
- 硬件配置决定模型上限,根据需求选择合适的 GPU 和显存
- 量化技术是关键,Q4 量化可在质量损失<5% 的情况下节省 70% 显存
- 中文场景优先选择 Qwen 系列,英文场景选择 Llama 或 Mistral
8.2 推荐配置方案
| 用户类型 |
推荐配置 |
预算 |
可运行模型 |
| 个人学习 |
RTX 3060 12GB + 32GB 内存 |
¥5,000 |
7B-13B |
| 小团队 |
RTX 4090 24GB × 2 + 64GB 内存 |
¥30,000 |
34B-70B |
| 企业生产 |
A100 40GB × 4 + 256GB 内存 |
¥400,000 |
70B-405B |
8.3 下一步行动
- 评估需求: 确定并发用户数、响应延迟要求、预算范围
- 选择硬件: 根据需求选择 GPU 和内存配置
- 安装测试: 先安装 Ollama,下载小模型测试
- 逐步扩展: 从单卡开始,根据需求扩展多卡集群
- 监控优化: 部署后持续监控性能,调整量化和并发参数
附录
A. 参考链接
B. 常用命令速查
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26
| curl -fsSL https://ollama.com/install.sh | sh
ollama --version
ollama pull <model_name>
ollama run <model_name>
ollama list
ollama rm <model_name>
journalctl -u ollama -f
sudo systemctl restart ollama
curl http://localhost:11434/api/generate -d '{"model":"llama3.2:3b","prompt":"你好"}'
|
C. 术语表
| 术语 |
解释 |
| GGUF |
llama.cpp 的模型格式,支持量化 |
| Q4/Q2 |
4-bit/2-bit 量化,降低显存需求 |
| Token |
模型处理的最小文本单位 |
| MoE |
Mixture of Experts,稀疏激活架构 |
| Context Window |
上下文窗口,模型能处理的文本长度 |
报告完成时间: 2026-03-10 15:00
调研方法: Tavily API 搜索 + Ollama 官方文档
报告版本: v1.0