ollama


导入本地gguf模型

在模型同路径下创建Modelfile文件
编辑FROM ./Meta-Llama-3-8B-Instruct.Q4_0.gguf
使用命令导入模型
ollama create Meta-Llama-3-8B-Instruct -f D:\OllamaModel\Modelfile

linux 下安装ollama

#自动安装
curl -fsSL https://ollama.com/install.sh | sh
#手动安装
#解压  jiangbin和lib中的文件分别拷贝到/usr/local目录下的对应bin和lib文件夹下.
ollama serve  # 启动服务
#配置启动服务
vim /etc/systemd/system/ollama.service
## 填写以下内容
[Unit]
Description=Ollama Service
After=network-online.target

[Service]
ExecStart=/root/ollama/bin/ollama serve
User=root
Group=root
Restart=always
RestartSec=3
Environment="OLLAMA_MODELS=/root/ollama/model"

[Install]
WantedBy=default.target

#启动服务
sudo systemctl daemon-reload
sudo systemctl enable ollama
sudo systemctl start ollama

##关闭服务
sudo systemctl stop ollama
sudo systemctl disable ollama.service
#添加额外环境变量
[Service]
Environment="OLLAMA_HOST=0.0.0.0:7861" # Ollama监听的网络端口 允许外部网络访问
Environment="OLLAMA_MODELS=/model/postion//models" # 修改模型存放路径
Environment="CUDA_VISIBLE_DEVICES=0,1" #指定使用多张GPU

OLLAMA_MAX_LOADED_MODELS 设置同时加载模型的数量
OLLAMA_NUM_PARALLEL 这个变量决定了Ollama可以同时处理的用户请求数量。设置OLLAMA_NUM_PARALLEL=4可以让Ollama同时处理两个并发请求。
OLLAMA_KEEP_ALIVE 这个变量控制模型在内存中的存活时间。设置OLLAMA_KEEP_ALIVE=24h可以让模型在内存中保持24小时,提高访问速度。

声明:冰醋酸|版权所有,违者必究|如未注明,均为原创|本网站采用BY-NC-SA协议进行授权

转载:转载请注明原文链接 - ollama


一切随缘