Wiki » Oprogramowanie » AI »
Pobranie modeli i uruchomienie¶
- Pobranie modeli
- Instalacja zależności PokażUkryj
apt-get install -y pipx; \ \ pipx install huggingface_hub; \ pipx ensurepath; \ source ~/.bashrc; \ \ export HF_XET_HIGH_PERFORMANCE=1;
- Qwen3.8-27B + Vision PokażUkryj
# 32GB VRAM GPU z 8GB RAM Cache hf download unsloth/Qwen3.8-27B-GGUF \ Qwen3.8-27B-UD-Q4_K_XL.gguf \ --cache-dir ./models/qwen38-27b # 32GB VRAM GPU z 16GB RAM Cache hf download unsloth/Qwen3.8-27B-GGUF \ Qwen3.8-27B-UD-Q6_K_XL.gguf \ --cache-dir ./models/qwen38-27b # Model dla 2x32GB VRAM GPU hf download unsloth/Qwen3.8-27B-GGUF \ Qwen3.8-27B-UD-Q8_K_XL.gguf \ --cache-dir ./models/qwen38-27b # Vision mmproj hf download unsloth/Qwen3.8-27B-GGUF \ mmproj-F16.gguf \ --cache-dir ./models/qwen38-27b;
- VSCode FIM/NextLine/Embedding/ReRanker Auto Complete dla IDE PokażUkryj
# FIM/NextLine dla Auto Complete IDE hf download unsloth/Qwen2.5-Coder-3B-Instruct-128K-GGUF \ Qwen2.5-Coder-3B-Instruct-Q8_0.gguf \ --cache-dir ./models/Qwen2.5-Coder-3B # Embedding hf download unsloth/embeddinggemma-300m-GGUF \ embeddinggemma-300M-Q8_0.gguf \ --cache-dir ./models/embeddinggemma-300M # ReRanker hf download sinjab/jina-reranker-v2-base-multilingual-Q4_K_M-GGUF \ jina-reranker-v2-base-multilingual-Q4_K_M.gguf \ --cache-dir ./models/jina-reranker-v2-base-multilingual
- Vision Qwen3.5-9B PokażUkryj
Mały model kodujący z Vision który można uruchomić na osobnej karcie GPU i wykorzystywać do analizy przez zewnętrzne oprogramowanie
hf download unsloth/Qwen3.5-9B-GGUF \ Qwen3.5-9B-UD-Q4_K_XL.gguf \ --cache-dir ./models/Qwen3.5-9B; # Vision mmproj hf download unsloth/Qwen3.5-9B-GGUF \ mmproj-BF16.gguf \ --cache-dir ./models/Qwen3.5-9B;
- Audio STT Qwen3-ASR-1.7B PokażUkryj
Mały model STT który można uruchomić na starszym GPU aby obsługiwał STT i wykorzystywać do analizy przez zewnętrzne oprogramowanie
# Qwen3-ASR Audio hf download unslothai/Qwen3-ASR-1.7B-GGUF \ Qwen3-ASR-1.7B-Q8_0.gguf \ --cache-dir ./models/Qwen3-ASR-1.7B; # Qwen3-ASR Audio mmproj hf download unslothai/Qwen3-ASR-1.7B-GGUF \ mmproj-Qwen3-ASR-1.7B-Q8_0.gguf \ --cache-dir ./models/Qwen3-ASR-1.7B;
- Archiwum
Modele zastąpione nowszymi wersjami- Qwen3.6-27B-MTP PokażUkryj
hf download unsloth/Qwen3.6-27B-MTP-GGUF \ Qwen3.6-27B-UD-Q4_K_XL.gguf \ --cache-dir ./models/qwen36-27b-MTP; # Model dla GPU z 16GB VRAM hf download unsloth/Qwen3.6-27B-MTP-GGUF \ Qwen3.6-27B-UD-IQ3_XXS.gguf \ --cache-dir ./models/qwen36-27b-MTP;
- Qwen2.5-Coder-7B-Ins by AceCoder PokażUkryj
Model ma mniejszy context tylko 32K, zjada więcej RAM niż modele unsloth/Qwen2.5-Coder-3B-Instruct-128K-GGUF Qwen2.5-Coder-3B-Instruct-Q8_0.gguf
hf download mradermacher/AceCoder-Qwen2.5-Coder-7B-Ins-V1.1-i1-GGUF \ AceCoder-Qwen2.5-Coder-7B-Ins-V1.1.i1-Q4_K_M.gguf \ --cache-dir ./models/Qwen2.5-Coder-7B
- Qwen3.6-27B-MTP PokażUkryj
- Instalacja zależności PokażUkryj
- Uruchomienie
- Model kodujacy PokażUkryj
TREE=20260723 MODEL=/home/storage/stripe/llm/models/Qwen2.5-Coder-3B/models--unsloth--Qwen2.5-Coder-3B-Instruct-128K-GGUF/snapshots/5326551926d06f7f9cab53c9b9b552e3bedfe8ba/Qwen2.5-Coder-3B-Instruct-Q8_0.gguf CTX=131072 RAM=12288 IP=x.x.x.x PORT=8081 ./${TREE}/build/bin/llama-server \ -m ${MODEL} \ \ -t 4 \ -fa 1 \ \ --parallel 2 \ \ --ctx-size ${CTX} \ --cache-ram ${RAM} \ --cache-type-v q8_0 \ --cache-type-k q8_0 \ \ --jinja \ --reasoning off\ \ --temperature 0.6 \ --top-k 20 \ --top-p 0.95 \ --min-p 0.0 \ --repeat-penalty 1.0 \ --presence-penalty 0.0 \ \ --batch-size 2048 \ --ubatch-size 2048 \ \ --host ${IP} \ --port ${PORT} - Model Embedding PokażUkryj
TREE=20260723 MODEL=/home/storage/stripe/llm/models/embeddinggemma-300M/models--unsloth--embeddinggemma-300m-GGUF/snapshots/6661a6504c30d8304af13455cb4a5d4f5bc6011f/embeddinggemma-300M-Q8_0.gguf CTX=8192 # maksymalny rozmiar jaki był trenowany dla czterech wątków RAM=2048 IP=x.x.x.x PORT=8082 ./${TREE}/build/bin/llama-server \ --embedding \ -m ${MODEL} \ \ -t 4 \ -fa 1 \ \ --parallel 4 \ \ --ctx-size ${CTX} \ --cache-ram ${RAM} \ --cache-type-v q8_0 \ --cache-type-k q8_0 \ \ --jinja \ --reasoning off\ \ --batch-size 2048 \ --ubatch-size 2048 \ \ --host ${IP} \ --port ${PORT} - Model Embedding PokażUkryj
TREE=20260723 MODEL=/home/storage/stripe/llm/models/jina-reranker-v2-base-multilingual/models--sinjab--jina-reranker-v2-base-multilingual-Q4_K_M-GGUF/snapshots/c1b17df2ce6b810e31e2cae9491b98eecf05947b/jina-reranker-v2-base-multilingual-Q4_K_M.gguf CTX=4096 # Maksymalny jaki był trenowany RAM=2048 IP=x.x.x.x PORT=8083 ./${TREE}/build/bin/llama-server \ --reranking \ -m ${MODEL} \ --alias jina-reranker-v2 \ \ -fa 1 \ \ --parallel 4 \ \ --ctx-size ${CTX} \ --cache-ram ${RAM} \ --cache-type-v q8_0 \ --cache-type-k q8_0 \ \ --jinja \ --reasoning off\ \ --batch-size 2048 \ --ubatch-size 2048 \ \ --host ${IP} \ --port ${PORT}
- Model kodujacy PokażUkryj