Ollama模型运行指南与使用方法详解
时间:2026-08-21 | 作者:极客少年 | 阅读:0用Ollama跑大模型,到底怎么操作?
简单说,就是把模型拉到本地再跑起来。
Ollama在本地运行大语言模型确实很方便。从拉模型到启动运行,再到做一些配置调整,核心步骤并不多。
无论你的机器是Windows、macOS还是Linux,只要装好了Ollama,下面这些方法基本都通用。
一. 拉取模型
想跑模型,先得把模型从Ollama的仓库拉到本地。这个步骤叫“拉取”。
命令极其简单:
ollama pull
举个具体例子,拉一个LLaMA 3的8B参数版本:
ollama pull llama3
目前比较热门的几个模型:
llama3:Meta家出品,通用任务表现不错。mistral:Mistral AI的模型,效率出了名的高。phi3:微软的轻量级选手,对低配置设备比较友好。
想找更多模型,可以去Ollama模型库里查看。
如果只是想看本地已经下载的模型,也可以在终端里敲 ollama list。
有一点必须注意:
模型文件通常不小,几个GB算是起步价。所以网络稳定性和磁盘空间都要提前预留。
另外,不同大小的模型版本可以按需选择,比如 llama3:8b 和 llama3:70b。小模型对硬件的要求会低很多。
二. 运行模型
模型拉到本地后,就可以开始运行。
Ollama主要有两种方式:一种是在终端里直接交互,另一种是通过API调用。
方式 1:交互式终端
命令堪称一锤子买卖:
ollama run
比如:
ollama run llama3
进去之后是什么感觉?
执行后会直接进入对话模式。你输入什么,模型就回什么。
比如你输入一句 "What is the capital of France",模型会马上回应 "The capital of France is Paris."。
如果要退出,输入 /exit 或按 Ctrl+D 就行。
方式 2:通过 API 运行
Ollama同时也提供了REST API。
如果你想把模型集成到自己的应用或脚本里,这种方式会更方便。
默认地址:http://localhost:11434
用 curl 试一下:
curl http://localhost:11434/api/generate -d '{
"model": "llama3",
"prompt": "Write a short poem about the moon."
}'
返回的内容:
模型会生成一段JSON格式的文本,解析起来很方便。
编程集成:比如用Python调用一下:
import requests
response = requests.post('http://localhost:11434/api/generate', json={
'model': 'llama3',
'prompt': 'Hello, world!'
})
print(response.json())
三. 管理运行中的模型
模型跑起来后,还需要做一些基础管理。
-
看看有哪些模型已经下载了:
ollama list
-
想删掉某个模型释放空间:
ollama rm
-
看看当前哪些模型正在后台跑:
ollama ps
ollama ps 这个命令会显示当前正在运行的模型实例,一目了然。
四. 优化运行性能
不同模型对硬件的要求差别很大。
硬件门槛大致参考:
- 小模型(比如
phi3):4-8GB内存基本能跑。 - 大模型(比如
llama3:70b):16GB以上内存是底线,有GPU会好很多。
GPU 加速得配置好:
如果机器有独立显卡,记得装上NVIDIA CUDA驱动(Windows/Linux)或者Metal(macOS)。
Ollama在检测到可用GPU时,会默认启用加速。
参数调整:
想知道运行细节,可以加 --verbose 参数。
如果要调整模型生成时的温度、top-k什么的,可以通过API指定:
{
"model": "llama3",
"prompt": "Tell a story",
"temperature": 0.7,
"top_p": 0.9
}
多模型同时跑:
Ollama确实支持同时跑多个模型。
不过前提是内存和CPU/GPU资源得够用,否则就容易卡顿。
五. 常见问题
实际使用时,常见问题主要有下面几类:
- 模型未找到:先确认是不是执行了
ollama pull这一步,模型没下载到本地肯定跑不了。 - 运行缓慢:可以考虑换个更小的模型,或者检查GPU加速有没有生效。
- 端口占用:Ollama默认使用11434端口,如果被其他程序占用了,可以通过环境变量改一下:
export OLLAMA_HOST=127.0.0.1:11435
- 内存不足:关掉一些吃内存的程序,或者选择参数更小的模型。
六. 进阶使用
如果基础用法已经不够用,可以继续做更深度的操作。
- 自定义模型:通过
Modelfile文件创建你自己的模型,比如可以自定义提示词、调整参数,然后使用:
ollama create mymodel -f Modelfile
- 批量处理:写个脚本循环调用API,一次性处理大量任务,效率会高很多。
- 嵌入生成:使用
/api/embeddings端点生成文本嵌入,这在搜索或者分类任务里很有用。
示例场景
- 对话:直接
ollama run mistral就能跟模型聊天。 - 代码生成:输入
Write a Python script to sort a list,模型会直接生成代码。 - API 集成:把Ollama嵌入到Web应用里,实现实时内容生成。
如果需要特定模型运行示例或API集成代码,直接调整对应参数就好。
七. ollama run 命令详解
Ollama运行模型的核心命令就是 ollama run。
比如要运行 Llama 3.2 并跟它对话:
ollama run llama3.2
执行后,如果本地没有这个模型,它会自动去下载:

下载完成后,就可以在终端里开始交互了:
writing manifest success >>> 你好 Hello >>> 能讲中文吗 是的,我可以在 Chinese 中对話。哪些话题或问题想要了解我呢?
要结束对话,输入 /bye 或按 Ctrl+d 即可。
用 ollama list 可以查看已安装的模型:
NAME ID SIZE MODIFIED llama3.2 baf6a787fdff 1.3 GB 4 minutes ago
支持的模型列表可以去官网查阅:https://ollama.com/library

下表列出一些常用模型的下载命令:
| 模型 | 参数 | 大小 | 下载命令 |
|---|---|---|---|
| Llama 3.3 | 70B | 43GB | ollama run llama3.3 |
| Llama 3.2 | 3B | 2.0GB | ollama run llama3.2 |
| Llama 3.2 | 1B | 1.3GB | ollama run llama3.2:1b |
| Llama 3.2 Vision | 11B | 7.9GB | ollama run llama3.2-vision |
| Llama 3.2 Vision | 90B | 55GB | ollama run llama3.2-vision:90b |
| Llama 3.1 | 8B | 4.7GB | ollama run llama3.1 |
| Llama 3.1 | 405B | 231GB | ollama run llama3.1:405b |
| Phi 4 | 14B | 9.1GB | ollama run phi4 |
| Phi 3 Mini | 3.8B | 2.3GB | ollama run phi3 |
| Gemma 2 | 2B | 1.6GB | ollama run gemma2:2b |
| Gemma 2 | 9B | 5.5GB | ollama run gemma2 |
| Gemma 2 | 27B | 16GB | ollama run gemma2:27b |
| Mistral | 7B | 4.1GB | ollama run mistral |
| Moondream 2 | 1.4B | 829MB | ollama run moondream |
| Neural Chat | 7B | 4.1GB | ollama run neural-chat |
| Starling | 7B | 4.1GB | ollama run starling-lm |
| Code Llama | 7B | 3.8GB | ollama run codellama |
| Llama 2 Uncensored | 7B | 3.8GB | ollama run llama2-uncensored |
| LLaVA | 7B | 4.5GB | ollama run lla va |
| Solar | 10.7B | 6.1GB | ollama run solar |
八. 通过 Python SDK 使用模型
如果你想在Python代码里直接调用Ollama的能力,官方提供了Python SDK,流程也很清晰。
1. 安装 Python SDK
先通过pip把包装上:
pip install ollama
2. 编写 Python 脚本
然后就可以写代码了。
下面是一个最简单的例子,用Llama 3.2模型生成回答:
import ollama
response = ollama.generate(
model="llama3.2", # 模型名称
prompt="你是谁。" # 提示文本
)
print(response)
3. 运行 Python 脚本
在终端里运行脚本:
python test.py
效果就是模型会根据输入返回对应的回答。
4. 对话模式
如果你想跟模型多轮对话,可以用 chat 接口:
from ollama import chat
response = chat(
model="llama3.2",
messages=[
{"role": "user", "content": "为什么天空是蓝色的?"}
]
)
print(response.message.content)
5. 流式响应
有时候模型输出很慢,用流式响应可以不断拿到生成的内容,体验更好:
from ollama import chat
stream = chat(
model="llama3.2",
messages=[{"role": "user", "content": "为什么天空是蓝色的?"}],
stream=True
)
for chunk in stream:
print(chunk["message"]["content"], end="", flush=True)
免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。
相关文章
更多-
- Ollama模型交互基础教程与使用入门
- 时间:2026-08-21
-
- Ollama模型未找到拉取失败与本地调用报错处理方案
- 时间:2026-08-12
-
- Ollama安装配置全攻略及API调用测试步骤
- 时间:2026-08-08
-
- Ollama下载安装运行教程:插件市场配置与测试方法
- 时间:2026-08-08
-
- Ollama安装失败解决教程与企业安全部署及API测试步骤
- 时间:2026-08-07
-
- Ollama私有化部署实战:图文详解配置与模型选择建议
- 时间:2026-08-07
-
- Ollama安装失败解决指南:报错排查与版本回滚方法
- 时间:2026-08-07
-
- Ollama本地模型运行指南:下载、路径设置与性能优化
- 时间:2026-08-07
精选合集
更多大家都在玩
大家都在看
更多-
- 2026年9月17日小鸡庄园答案
- 时间:2026-09-16
-
- 蚂蚁庄园今日答案2026年9月17日
- 时间:2026-09-16
-
- 蚂蚁庄园小课堂今日最新答案2026年9月17日
- 时间:2026-09-16
-
- 蚂蚁庄园小鸡答题今日答案2026年9月17日
- 时间:2026-09-16
-
- 褪黑素主要由人体哪个器官分泌 蚂蚁庄园今日答案9.17
- 时间:2026-09-16
-
- 蚂蚁庄园今天答题答案2026年9月17日
- 时间:2026-09-16
-
- 蚂蚁庄园答题今日答案2026年9月17日
- 时间:2026-09-16
-
- 研学旅游指导师的核心服务对象是 蚂蚁新村今日答案2026.9.16
- 时间:2026-09-16