导入本地gguf模型
在模型同路径下创建Modelfile文件
编辑FROM ./Meta-Llama-3-8B-Instruct.Q4_0.gguf
使用命令导入模型
ollama create Meta-Llama-3-8B-Instruct -f D:\OllamaModel\Modelfilelinux 下安装ollama
#自动安装
curl -fsSL https://ollama.com/install.sh | sh#手动安装
#解压 jiangbin和lib中的文件分别拷贝到/usr/local目录下的对应bin和lib文件夹下.
ollama serve # 启动服务#配置启动服务
vim /etc/systemd/system/ollama.service
## 填写以下内容
[Unit]
Description=Ollama Service
After=network-online.target
[Service]
ExecStart=/root/ollama/bin/ollama serve
User=root
Group=root
Restart=always
RestartSec=3
Environment="OLLAMA_MODELS=/root/ollama/model"
[Install]
WantedBy=default.target
#启动服务
sudo systemctl daemon-reload
sudo systemctl enable ollama
sudo systemctl start ollama
##关闭服务
sudo systemctl stop ollama
sudo systemctl disable ollama.service#添加额外环境变量
[Service]
Environment="OLLAMA_HOST=0.0.0.0:7861" # Ollama监听的网络端口 允许外部网络访问
Environment="OLLAMA_MODELS=/model/postion//models" # 修改模型存放路径
Environment="CUDA_VISIBLE_DEVICES=0,1" #指定使用多张GPUOLLAMA_MAX_LOADED_MODELS 设置同时加载模型的数量
OLLAMA_NUM_PARALLEL 这个变量决定了Ollama可以同时处理的用户请求数量。设置OLLAMA_NUM_PARALLEL=4可以让Ollama同时处理两个并发请求。
OLLAMA_KEEP_ALIVE 这个变量控制模型在内存中的存活时间。设置OLLAMA_KEEP_ALIVE=24h可以让模型在内存中保持24小时,提高访问速度。

Comments | NOTHING