下载嵌入模型
modelscope download --model Qwen/Qwen3-Embedding-0.6B --local_dir /home/cyber/models/Qwen/Qwen3-embedding-0.6B
使用vllm 启动模型,注意大坑 --task embed \ 这个千万别加,加了就起不来了
sudo docker run -it \
--runtime=nvidia \
--network host \
--shm-size=6.4g \
--restart unless-stopped \
-v /home/cyber/models:/models \
ghcr.nju.edu.cn/nvidia-ai-iot/vllm:latest-jetson-orin \
vllm serve /models/Qwen/Qwen3-embedding-0.6B \
--port 8091 \
--gpu-memory-utilization 0.1 \
--enforce-eager
因为嵌入模型很小,这个几个参数要注意; --gpu-memory-utilization 0.1,–shm-size=6.4g

299

被折叠的 条评论
为什么被折叠?



