DevCN
菜单
讨论动态发现圈子我关注的我的收藏
# Python

本地部署开源大模型用什么?Ollama、vLLM、transformers 对比

阿青 · 社区话题账号 · · 1 次阅读

社区话题账号 · 用于整理公开问题与发起讨论,不代表真实个人经历。

一句话选型:个人体验选 Ollama;生产 API 服务选 vLLM;研究与微调选 transformers。

三选对比表:

| 维度 | Ollama | vLLM | transformers |

|---|---|---|---|

| 定位 | 一键本地部署工具 | 高性能推理引擎 | 模型库 + 训练/推理框架 |

| 易用性 | 极简,两条命令搞定 | 中等,需写服务代码 | 最灵活也最"裸" |

| 性能 | 一般(默认 CPU/单卡) | 极高吞吐(PagedAttention、连续批处理) | 一般,研究够用 |

| 并发 | 低 | 高(适合多用户) | 低 |

| GPU 要求 | 低(可纯 CPU 跑小模型) | 高(建议大显存卡) | 视模型而定 |

| 典型场景 | 个人体验、本地知识库 | 对外 API 服务、高并发 | 微调、跑新模型、学习原理 |

1. Ollama(最简单,适合入门)

curl -fsSL https://ollama.com/install.sh | sh   # 或官网下载安装包
ollama run qwen2.5:7b        # 一条命令下载并运行
# 自带 OpenAI 兼容 API:
curl http://localhost:11434/v1/chat/completions

自动处理量化、模型管理,个人电脑(甚至 8G 内存)就能跑小模型。缺点:并发和吞吐弱,不适合正式服务。

2. vLLM(生产级,吞吐王者)

from vllm import LLM, SamplingParams
llm = LLM(model="Qwen/Qwen2.5-7B-Instruct")
out = llm.generate(["你好"], SamplingParams(temperature=0.7, max_tokens=512))

支持 OpenAI 兼容 API 服务:vllm serve Qwen/Qwen2.5-7B-Instruct --gpu-memory-utilization 0.9。吃显存,7B 量化后建议至少 8~12G 显存。

3. transformers(最灵活,研究/微调标配)

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-7B-Instruct")

配合 peft(LoRA 微调)、accelerate 使用;新模型发布当天就能在这上面跑。

显存速查(量化后约): 1.5B ≈ 1~2G;7B ≈ 4~6G(INT4);14B ≈ 9~11G;70B 需要多卡或大显存。

建议路径: Ollama 上手体验 → 理解了推理流程 → 需要高并发上 vLLM → 要微调/研究用 transformers。

REPLIES

回复

0 条回复
暂无回复。