想把模型跑在自己机器上,又不想碰复杂的推理框架,Ollama 是目前最省事的一条路。

装好之后先跑通一个

装完直接拉一个中等体量的模型:

ollama run qwen2.5:7b

第一次会下载几个 G,之后就是本地推理,断网也能用。

显存和内存怎么估

粗略的经验值:7B 模型按 4 位量化算,显存占 5 GB 左右;14B 大概 9 GB。显存不够时 Ollama 会自动往内存里放一部分,速度会明显下降,但不会直接失败。

常见坑

  • 模型目录默认在 C 盘,空间紧张时要先改 OLLAMA_MODELS 环境变量再拉模型
  • 中文任务优先选 qwen 系列,英文写作可以试 llama 系列
  • 7B 级别做长文档摘要会丢细节,别指望它替代大模型