Ollama系列文章:
Ollama入门,一键启动本地DeepSeek大模型
Ollama入门,Ollama技术架构与原理
Ollama进阶,在Python、Java、Go项目中集成Deepseek、QWQ大模型
Ollama进阶,在Javascript(nodejs)前后端项目中集成Deepseek、QWQ大模型
Ollama高手,玩转本地自定义大模型(LLM)
Ollama高手,调优Ollama环境变量,提高性能与安全性
Ollama高手,调优Ollama模型参数,提高模型输出质量
在前面的系列文章中我们了解了如何在自有的项目中集成Ollama大模型,同时也知道了如何根据项目自身情况自定义大语言模型,从而完成与项目的集成。现在我们进一步探讨Ollama的环境变量调优,使之可以充分调动本地机器的软硬件资源,以提升系统的性能。同时Ollama默认配置存在未授权访问与模型窃取等安全隐患,生产环境中需要进行必要的调整,以提高安全性。

1、如何修改Ollama环境变量
在 Ollama 中,环境变量用于配置运行时的行为、优化性能、控制资源使用等。通过环境变量可以方便地调整 Ollama 的功能,而无需修改代码或重新编译。
在 Linux / macOS 中修改环境变量
1、临时修改,在终端中直接设置环境变量:
export OLLAMA_PORT=12345
export OLLAMA_MODEL_DIR=/path/to/models
ollama serve
2、永久修改,编辑 Shell 配置文件:
~/.bashrc #bash
~/.zshrc #zsh
~/.config/fish/config.fish #fish
打开配置文件后,在文件末尾添加:
export OLLAMA_PORT=12345
export OLLAMA_MODEL_DIR=/path/to/models
export OLLAMA_NUM_GPUS=1
保存后运行以下命令使其生效:
source ~/.bashrc # bash
source ~/.zshrc # zsh
完成修改后,可以通过echo $OLLAMA_PORT命令查看是否生效。
在 Windows 中修改环境变量
1、临时修改,在 PowerShell 中运行:
$env:OLLAMA_PORT="12345"
$env:OLLAMA_MODEL_DIR="C:\path\to\models"
ollama serve
2、永久修改,通过环境变量设置界面添加或修改,然后重启计算机
变量名: OLLAMA_PORT
变量值: 12345
完成修改后,可以通过echo %OLLAMA_PORT%或echo $env:OLLAMA_PORT命令查看是否生效。
在 Docker 中修改环境变量
可以通过 -e 选项传入环境变量:
docker run -e OLLAMA_PORT=12345 -e OLLAMA_MODEL_DIR=/models ollama/ollama:latest
2、如何通过环境变量调优Ollama GPU使用
通过环境变量调优 Ollama 的 GPU 使用,可以有效提升推理性能,减少内存消耗,并根据硬件资源合理分配任务。可以根据本地硬件情况,选择合适的方式进行优化,具体而言:
显存充足的 GPU: 尝试 OLLAMA_GPU_LAYERS=40 以上的设置,以便更多层数在 GPU 上运行。
显存有限的 GPU: 限制 GPU 层数,同时监控显存占用 (nvidia-smi),以避免 OOM(Out of Memory)错误。
CPU+GPU 混合推理: 如果 GPU 层数设置过高导致显存不足,可适当减少 OLLAMA_GPU_LAYERS,让部分推理任务回退到 CPU。
拥有大内存的机器: 启用 MLOCK,使用 OLLAMA_USE_MLOCK=1 锁定内存,避免数据换页。
场景 1:最大化 GPU 利用率
尽可能将模型加载到 GPU 上运行,减少 CPU 负载;同时使用 mlock 锁定模型在内存中,提升推理性能,适用于高性能 GPU,显存充足的场景。
export OLLAMA_ENABLE_CUDA=1
export OLLAMA_GPU_LAYERS=40
export OLLAMA_USE_MLOCK=1
场景 2:显存有限的 GPU 使用
限制 GPU 使用的显存,确保不会因显存不足导致崩溃;同时部分层数在 CPU 上运行,减轻 GPU 负担,适用于显存较小的 GPU(如 8GB 或 12GB)。
export OLLAMA_ENABLE_CUDA=1
<


1379

被折叠的 条评论
为什么被折叠?



