位置:首页 > 新手教程 > Ollama基本概念与入门使用介绍

Ollama基本概念与入门使用介绍

时间:2026-08-21  |  作者:星际追番人  |  阅读:0

在本地跑大模型,Ollama 是个绕不开的名字。

简单来说,它是一个专注于模型加载、推理和生成的轻量级框架,支持多种 NLP 任务,让你不用联网也能跟各种开源模型直接对话。

下面拆解一下它的核心概念,帮你在上手前理清头绪。

1. 模型(Model)

模型是 Ollama 的灵魂。

这些经过预训练的机器学习模型,可以处理文本生成、摘要、情感分析、对话生成等任务。你可以从官方的模型库里拉取并运行各种开源模型,这就是整个工具的“发动机”。

模型标识符

标识符:每个模型都有名称和标签,格式通常是 模型名:标签

比如 llama3:8bqwen:7bmistral:latest。这里的 latest 一般指默认或最新的版本。

常见模型类型

支持的模型相当丰富,比较常见的包括:

  • deepseek-v3:深度求索出品,专攻文本生成。
  • LLama2:Meta 的大语言模型,文本生成任务上的经典选择。
  • GPT:OpenAI 的 GPT 系列,对话生成、文本推理样样在行。
  • BERT:句子理解和问答系统的老牌选手。
  • 其他自定义模型:你也可以上传自己的模型,用 Ollama 来做推理。

模型能做什么

模型能干两件大事:

  • 推理:根据输入生成输出。
  • 微调:用你自己的数据在已有模型上继续训练,让它更贴合特定场景。

模型本质上是由海量参数构成的神经网络。它通过大量文本训练学会语言规律,然后进行高效推理。

所有支持模型的列表可以在这里找到:https://ollama.com/library

模型列表截图

点进具体模型,能看到下载命令:

模型详情页截图

常见模型下载命令

下面这张表列出了几个常见模型的下载命令,方便你快速参考:

模型参数大小下载命令
Llama 3.370B43GBollama run llama3.3
Llama 3.23B2.0GBollama run llama3.2
Llama 3.21B1.3GBollama run llama3.2:1b
Llama 3.2 Vision11B7.9GBollama run llama3.2-vision
Llama 3.2 Vision90B55GBollama run llama3.2-vision:90b
Llama 3.18B4.7GBollama run llama3.1
Llama 3.1405B231GBollama run llama3.1:405b
Phi 414B9.1GBollama run phi4
Phi 3 Mini3.8B2.3GBollama run phi3
Gemma 22B1.6GBollama run gemma2:2b
Gemma 29B5.5GBollama run gemma2
Gemma 227B16GBollama run gemma2:27b
Mistral7B4.1GBollama run mistral
Moondream 21.4B829MBollama run moondream
Neural Chat7B4.1GBollama run neural-chat
Starling7B4.1GBollama run starling-lm
Code Llama7B3.8GBollama run codellama
Llama 2 Uncensored7B3.8GBollama run llama2-uncensored
LLaVA7B4.5GBollama run lla va
Solar10.7B6.1GBollama run solar

核心操作命令

  • 拉取模型ollama pull <模型名>(比如 ollama pull llama3)。从官方库下载到本地。
  • 运行模型ollama run <模型名>。加载模型到内存,直接在终端里开一个交互式对话界面。
  • 创建模型ollama create <新模型名> -f ./Modelfile。基于你的 Modelfile 自定义模型。
  • 列出模型ollama list。看看本地已经有哪些模型。
  • 删除模型ollama rm <模型名>

2. 任务(Task)

Ollama 支持的任务种类不少,每种都对应模型的不同用法。

  • 对话生成:跟模型你来我往地聊天。
  • 文本生成:根据提示写文章、编故事。
  • 情感分析:判断一段文本的情绪是正面、负面还是中立。
  • 文本摘要:把长文压缩成要点。
  • 翻译:实现语言之间的转换。

通过命令行,你可以指定不同任务,载入相应模型来完成工作。

3. 推理(Inference)

推理是 Ollama 最核心的交互方式。

说白了,就是给模型一个输入,它给你算出一个输出。

流程很简单:你提供文本,比如问题、提示或对话内容;模型通过内部的神经网络计算后,返回结果。这个结果可能是回答、文章片段或翻译文本。

Ollama 通过 CLI 或 API 跟本地模型打交道,让你轻松完成推理任务。

4. 微调(Fine-tuning)

微调是在预训练模型基础上,用你自己的数据再练一波,让它在特定领域表现更精准。

Ollama 支持这个功能,操作大致分几步:

  • 准备数据集:领域相关的文本或 JSON 格式数据。
  • 加载预训练模型:挑个基础模型,比如 LLama2 或 GPT。
  • 训练:用自己的数据集对模型做进一步训练。
  • 保存和部署:训练完的模型可以存下来,后续直接使用。

这样一来,模型在处理特定问题时就能更“懂行”。

5. API 服务

Ollama 不只是个命令行工具,它在后台其实跑着一个本地服务器

当你运行 ollama serve 或首次执行 ollama run 时,服务就会自动启动,默认监听 127.0.0.1:11434

它提供一套 RESTful API,让你能通过 HTTP 请求与模型交互,方便用 Python、Ja vaScript 或其他语言来调用本地的大模型。

一个简单的 API 调用示例:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3",
  "prompt": "为什么天空是蓝色的?"
}'

6. Modelfile

模型文件:Ollama 用 Modelfile 来定义和创建模型,有点像 Docker 的 Dockerfile。

你可以基于现有模型做定制,比如调温度参数、设系统提示词,或者导入 GGUF 格式的模型文件。

官方模型库里列出了支持的模型架构(如 Llama 3、Qwen 2、Mistral、Phi-3 等),直接搜就能下载。

Modelfile 关键参数

Modelfile 里的关键参数:

  • FROM:指定基础模型(必须是本地已拉取的)或模型文件路径。
  • SYSTEM:设系统提示词,定义模型的行为和角色。
  • PARAMETER:运行参数,比如 temperature(控制创造力)、top_pnum_ctx(上下文长度)。
  • TEMPLATE:提示词的模板格式。

7. 上下文

对话中,上下文指的是模型能“记住”多少之前的对话内容。

上下文长度(由 num_ctx 控制)决定了模型在处理新请求时,能参考多少历史文本。

上下文越长,占用的内存就越多,所以得根据机器配置来权衡。

8. 量化

为了减少模型占用内存、提速推理,通常会对模型进行量化。

模型名称里常带表示量化级别的字母,比如 q4_0q5_1q8

数字越小,内存占用越少,但精度会稍有牺牲;数字越大越接近原始模型。GGUF 格式的模型常用这种命名方式。

总结

以上就是 Ollama 的八个核心概念:模型、任务、推理、微调、API 服务、Modelfile、上下文和量化。

理解这些,你就能比较顺畅地玩转本地大模型了。

从拉模型开始,慢慢尝试微调和定制,会发现本地部署其实没那么复杂。

免责声明:文中图文均来自网络,如有侵权请联系删除,心愿游戏发布此文仅为传递信息,不代表心愿游戏认同其观点或证实其描述。

相关文章

更多

精选合集

更多

大家都在玩

热门话题

大家都在看

更多