位置:首页 > 新手教程 > Ollama模型运行指南与使用方法详解

Ollama模型运行指南与使用方法详解

时间:2026-08-21  |  作者:极客少年  |  阅读:0

用Ollama跑大模型,到底怎么操作?

简单说,就是把模型拉到本地再跑起来。

Ollama在本地运行大语言模型确实很方便。从拉模型到启动运行,再到做一些配置调整,核心步骤并不多。

无论你的机器是Windows、macOS还是Linux,只要装好了Ollama,下面这些方法基本都通用。

一. 拉取模型

想跑模型,先得把模型从Ollama的仓库拉到本地。这个步骤叫“拉取”。

命令极其简单

ollama pull 

举个具体例子,拉一个LLaMA 3的8B参数版本:

ollama pull llama3

目前比较热门的几个模型

  • llama3:Meta家出品,通用任务表现不错。
  • mistral:Mistral AI的模型,效率出了名的高。
  • phi3:微软的轻量级选手,对低配置设备比较友好。

想找更多模型,可以去Ollama模型库里查看。

如果只是想看本地已经下载的模型,也可以在终端里敲 ollama list

有一点必须注意

模型文件通常不小,几个GB算是起步价。所以网络稳定性和磁盘空间都要提前预留。

另外,不同大小的模型版本可以按需选择,比如 llama3:8bllama3:70b。小模型对硬件的要求会低很多。

二. 运行模型

模型拉到本地后,就可以开始运行。

Ollama主要有两种方式:一种是在终端里直接交互,另一种是通过API调用。

方式 1:交互式终端

命令堪称一锤子买卖

ollama run 

比如:

ollama run llama3

进去之后是什么感觉

执行后会直接进入对话模式。你输入什么,模型就回什么。

比如你输入一句 "What is the capital of France",模型会马上回应 "The capital of France is Paris."。

如果要退出,输入 /exit 或按 Ctrl+D 就行。

方式 2:通过 API 运行

Ollama同时也提供了REST API。

如果你想把模型集成到自己的应用或脚本里,这种方式会更方便。

默认地址http://localhost:11434

用 curl 试一下

curl http://localhost:11434/api/generate -d '{
  "model": "llama3",
  "prompt": "Write a short poem about the moon."
}'

返回的内容

模型会生成一段JSON格式的文本,解析起来很方便。

编程集成:比如用Python调用一下:

import requests
response = requests.post('http://localhost:11434/api/generate', json={
    'model': 'llama3',
    'prompt': 'Hello, world!'
})
print(response.json())

三. 管理运行中的模型

模型跑起来后,还需要做一些基础管理。

  • 看看有哪些模型已经下载了

    ollama list
  • 想删掉某个模型释放空间

    ollama rm 
  • 看看当前哪些模型正在后台跑

    ollama ps

ollama ps 这个命令会显示当前正在运行的模型实例,一目了然。

四. 优化运行性能

不同模型对硬件的要求差别很大。

硬件门槛大致参考

  • 小模型(比如 phi3):4-8GB内存基本能跑。
  • 大模型(比如 llama3:70b):16GB以上内存是底线,有GPU会好很多。

GPU 加速得配置好

如果机器有独立显卡,记得装上NVIDIA CUDA驱动(Windows/Linux)或者Metal(macOS)。

Ollama在检测到可用GPU时,会默认启用加速。

参数调整

想知道运行细节,可以加 --verbose 参数。

如果要调整模型生成时的温度、top-k什么的,可以通过API指定:

{
  "model": "llama3",
  "prompt": "Tell a story",
  "temperature": 0.7,
  "top_p": 0.9
}

多模型同时跑

Ollama确实支持同时跑多个模型。

不过前提是内存和CPU/GPU资源得够用,否则就容易卡顿。

五. 常见问题

实际使用时,常见问题主要有下面几类:

  • 模型未找到:先确认是不是执行了 ollama pull 这一步,模型没下载到本地肯定跑不了。
  • 运行缓慢:可以考虑换个更小的模型,或者检查GPU加速有没有生效。
  • 端口占用:Ollama默认使用11434端口,如果被其他程序占用了,可以通过环境变量改一下:
export OLLAMA_HOST=127.0.0.1:11435
  • 内存不足:关掉一些吃内存的程序,或者选择参数更小的模型。

六. 进阶使用

如果基础用法已经不够用,可以继续做更深度的操作。

  • 自定义模型:通过 Modelfile 文件创建你自己的模型,比如可以自定义提示词、调整参数,然后使用:
ollama create mymodel -f Modelfile
  • 批量处理:写个脚本循环调用API,一次性处理大量任务,效率会高很多。
  • 嵌入生成:使用 /api/embeddings 端点生成文本嵌入,这在搜索或者分类任务里很有用。

示例场景

  • 对话:直接 ollama run mistral 就能跟模型聊天。
  • 代码生成:输入 Write a Python script to sort a list,模型会直接生成代码。
  • API 集成:把Ollama嵌入到Web应用里,实现实时内容生成。

如果需要特定模型运行示例或API集成代码,直接调整对应参数就好。

七. ollama run 命令详解

Ollama运行模型的核心命令就是 ollama run

比如要运行 Llama 3.2 并跟它对话:

ollama run llama3.2

执行后,如果本地没有这个模型,它会自动去下载:

下载完成后,就可以在终端里开始交互了:

writing manifest 
success 
>>> 你好
Hello
>>> 能讲中文吗
是的,我可以在 Chinese 中对話。哪些话题或问题想要了解我呢?

要结束对话,输入 /bye 或按 Ctrl+d 即可。

ollama list 可以查看已安装的模型:

NAME           ID              SIZE      MODIFIED      
llama3.2    baf6a787fdff    1.3 GB    4 minutes ago

支持的模型列表可以去官网查阅:https://ollama.com/library

下表列出一些常用模型的下载命令

模型参数大小下载命令
Llama 3.370B43GBollama run llama3.3
Llama 3.23B2.0GBollama run llama3.2
Llama 3.21B1.3GBollama run llama3.2:1b
Llama 3.2 Vision11B7.9GBollama run llama3.2-vision
Llama 3.2 Vision90B55GBollama run llama3.2-vision:90b
Llama 3.18B4.7GBollama run llama3.1
Llama 3.1405B231GBollama run llama3.1:405b
Phi 414B9.1GBollama run phi4
Phi 3 Mini3.8B2.3GBollama run phi3
Gemma 22B1.6GBollama run gemma2:2b
Gemma 29B5.5GBollama run gemma2
Gemma 227B16GBollama run gemma2:27b
Mistral7B4.1GBollama run mistral
Moondream 21.4B829MBollama run moondream
Neural Chat7B4.1GBollama run neural-chat
Starling7B4.1GBollama run starling-lm
Code Llama7B3.8GBollama run codellama
Llama 2 Uncensored7B3.8GBollama run llama2-uncensored
LLaVA7B4.5GBollama run lla va
Solar10.7B6.1GBollama run solar

八. 通过 Python SDK 使用模型

如果你想在Python代码里直接调用Ollama的能力,官方提供了Python SDK,流程也很清晰。

1. 安装 Python SDK

先通过pip把包装上:

pip install ollama

2. 编写 Python 脚本

然后就可以写代码了。

下面是一个最简单的例子,用Llama 3.2模型生成回答:

import ollama
response = ollama.generate(
    model="llama3.2",  # 模型名称
    prompt="你是谁。"  # 提示文本
)
print(response)

3. 运行 Python 脚本

在终端里运行脚本:

python test.py

效果就是模型会根据输入返回对应的回答。

4. 对话模式

如果你想跟模型多轮对话,可以用 chat 接口:

from ollama import chat
response = chat(
    model="llama3.2",
    messages=[
        {"role": "user", "content": "为什么天空是蓝色的?"}
    ]
)
print(response.message.content)

5. 流式响应

有时候模型输出很慢,用流式响应可以不断拿到生成的内容,体验更好:

from ollama import chat
stream = chat(
    model="llama3.2",
    messages=[{"role": "user", "content": "为什么天空是蓝色的?"}],
    stream=True
)
for chunk in stream:
    print(chunk["message"]["content"], end="", flush=True)

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多