Ollama本地大模型完整教程:免费跑Llama 4、千问Qwen3,数据不出你的电脑

2026-06-19 · ai_tools · 自建站IP

痛点场景

三个让人想用本地大模型的理由: 1. 数据隐私:公司的合同、客户的聊天记录、个人日记——你不想把这些上传到任何云端AI 2. 网络限制:出差时没网、企业内网屏蔽外部AI服务、API偶尔抽风 3. 成本控制:重度用户每月API费用轻松上$100+,跑本地模型基本零成本

Ollama 让这一切变得简单——一条命令安装,一条命令运行模型,不需要懂CUDA、不需要配环境变量。

工具介绍

Ollama 是一个开源的本地大模型运行平台。它的设计哲学:让运行大模型像 docker run 一样简单。

核心特点: - 支持几乎所有主流开源模型:Llama 4、Qwen3、DeepSeek-V3、Mistral、Gemma等 - 自动GPU加速(NVIDIA/AMD/Apple Silicon) - 本地API(兼容OpenAI API格式,无缝替代) - Windows/macOS/Linux全平台 - 模型量化支持,8GB显存跑70亿参数模型没问题

官网:https://ollama.com
GitHub:https://github.com/ollama/ollama(90k+ Stars)

安装:3分钟搞定

Windows

官网 https://ollama.com/download/windows 下载安装包 → 双击 → 完成。

安装后,右下角任务栏会出现羊驼图标,Ollama已在后台运行。

macOS

brew install ollama

或直接从官网下载 .dmg 安装。

Linux

curl -fsSL https://ollama.com/install.sh | sh

验证安装

ollama --version
# Ollama version 0.9.x

核心操作:5条命令玩转

1. 下载并运行模型

# 推荐首试:Qwen3(通义千问3,8B参数,中文最强开源模型之一)
ollama run qwen3:8b

# 或 Llama 4 Scout(Meta最新8B多模态模型)
ollama run llama4:8b

# DeepSeek-V3(目前综合能力最强的开源模型之一)
ollama run deepseek-v3:8b

首次运行自动下载(几个GB,视网速5-30分钟)。

2. 列出已下载的模型

ollama list

3. 删除模型

ollama rm qwen3:8b

4. 查看模型信息

ollama show qwen3:8b

5. 自定义系统提示词(Modelfile)

创建一个 Modelfile

FROM qwen3:8b
PARAMETER temperature 0.7
SYSTEM "你是一个专业的技术文档写手,风格简洁、准确、实用。"

创建自定义模型:

ollama create tech-writer -f Modelfile
ollama run tech-writer

硬件要求实测

模型 参数量 最低显存 推荐显存 流畅度
Qwen3:1.8b 18亿 2GB 4GB ⚡⚡⚡
Llama 4 Scout:8b 80亿 6GB 8GB ⚡⚡⚡
Qwen3:8b 80亿 6GB 8GB ⚡⚡⚡
DeepSeek-V3:8b 80亿 6GB 8GB ⚡⚡⚡
Qwen3:14b 140亿 10GB 16GB ⚡⚡
Qwen3:32b 320亿 20GB 24GB
Llama 4 Maverick:70b 700亿 40GB 48GB

⚡⚡⚡ = 实时流畅 ⚡⚡ = 正常 ⚡ = 可用但稍慢

绝大数人的笔记本(16GB内存+8GB显存)跑8B模型绰绰有余。

MacBook M系列因为有统一内存,M2 Pro(16GB)跑Qwen3:14b也流畅。Windows游戏本更不用说。

接入第三方前端

命令行虽好用,但聊天体验一般。推荐这些前端:

Open WebUI(最推荐)

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui \
  ghcr.io/open-webui/open-webui:main

访问 http://localhost:3000 → 一个完全可用的ChatGPT风格界面,自动连接本地Ollama。

支持:多模型切换、对话历史、文件上传、RAG(可以喂PDF让本地模型基于文档回答)。

官网:https://openwebui.com

Chatbox(桌面应用,适合新手)

下载地址:https://chatboxai.app

安装后 → 设置 → 模型提供方选「Ollama」→ 自动检测本地模型 → 开始聊天。UI设计像微信,对非技术用户极友好。

嵌入自己的应用

Ollama的API完全兼容OpenAI格式:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",  # Ollama服务地址
    api_key="ollama"  # 随便写,Ollama不校验
)

response = client.chat.completions.create(
    model="qwen3:8b",
    messages=[{"role": "user", "content": "用Python写一个快速排序"}]
)

print(response.choices[0].message.content)

所有基于OpenAI SDK的应用,改base_urlapi_key就能跑在本地模型上。

进阶技巧

1. 同时运行多个模型

# 终端1
ollama run qwen3:8b

# 终端2
ollama run llama4:8b

两个模型同时可用,互不干扰(只要显存够)。

2. 调整上下文窗口

# 创建自定义模型时指定更长上下文
ollama create my-model --context-size 32768

Qwen3:8b默认32K上下文,对于分析长文档很有用。

3. 联网搜索(最新功能)

Ollama 0.6+支持tool calling。搭配Open WebUI,可以配置搜索引擎插件,让本地模型也能联网搜索,实现类似Perplexity的本地版。

4. 定时更新模型

ollama pull qwen3:8b  # 拉取最新版本

开源模型更新频繁,每月拉一次保持最新。

对比:本地模型 vs API

维度 Ollama本地 API(OpenAI/Claude)
成本 免费(电费忽略不计) $20-100+/月
隐私 ✅ 数据不出本机 ⚠️ 数据上传云端
离线 ✅ 断网也能用 ❌ 必须联网
速度 8B模型实时 实时
能力上限 顶尖模型的70-80% 100%
配置难度 ⭐(一条命令) ⭐(填个Key)
适合场景 日常辅助、隐私敏感 高强度推理、复杂编程

推荐策略:日常问答用Ollama本地模型,重大问题切换到云端API——两者不冲突,可以同时用。


大模型不应该被锁在硅谷的数据中心里。Ollama证明了:你笔记本里的小羊驼,也能跑出不错的AI体验。