想把模型跑在自己机器上,又不想碰复杂的推理框架,Ollama 是目前最省事的一条路。
装好之后先跑通一个
装完直接拉一个中等体量的模型:
ollama run qwen2.5:7b第一次会下载几个 G,之后就是本地推理,断网也能用。
显存和内存怎么估
粗略的经验值:7B 模型按 4 位量化算,显存占 5 GB 左右;14B 大概 9 GB。显存不够时 Ollama 会自动往内存里放一部分,速度会明显下降,但不会直接失败。
常见坑
- 模型目录默认在 C 盘,空间紧张时要先改
OLLAMA_MODELS环境变量再拉模型 - 中文任务优先选 qwen 系列,英文写作可以试 llama 系列
- 7B 级别做长文档摘要会丢细节,别指望它替代大模型
暂无评论