Wiki » Konfiguracja serwerów » Hardware » GPU » GPU Nvidia »
GPU Nvidia RTX 40xx¶
Instalacja sterowników na HOST w Debian Trixie¶
Instalacja Pakietów PokażUkryj
rdate -n ntp.task.gda.pl; \ wget https://developer.download.nvidia.com/compute/cuda/repos/debian13/x86_64/cuda-keyring_1.1-1_all.deb; \ dpkg -i cuda-keyring_1.1-1_all.deb; \ apt-get update; \ apt-get -y install cuda-toolkit-13-3;
Instalacja samych sterowników headless
apt install nvidia-driver-cuda nvidia-kernel-open-dkmsLinki do zasobów:
- https://wiki.debian.org/NvidiaGraphicsDrivers#data-center
- https://developer.nvidia.com/cuda-downloads?target_os=Linux&target_arch=x86_64&Distribution=Debian&target_version=13&target_type=deb_network
- https://docs.nvidia.com/datacenter/tesla/driver-installation-guide/latest/debian.html#debian-installation-network
laama.cpp + Nvidia CUDA¶
- Instalacja zależności(cmake itd.) PokażUkryj
apt-get install -y cmake ccache libssl-dev;
- Kompilacja llama.cpp PokażUkryj
git clone https://github.com/ggml-org/llama.cpp `date +%Y%m%d-cuda`; \ cd `date +%Y%m%d-cuda`; \ \ cmake -B build \ -DGGML_CUDA_FA=ON \ -DGGML_CUDA_USE_FLASH_ATTENTION=ON \ -DGGML_CUDA_FA_ALL_QUANTS=ON \ -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON \ -DCMAKE_CUDA_COMPILER=/usr/local/cuda/bin/nvcc \ -DCMAKE_CUDA_ARCHITECTURES=89; \ \ cmake --build build --config Release -j$(nproc);
Pobranie modeli i uruchomienie¶
- Pobranie modeli
- Instalacja zależności PokażUkryj
apt-get install -y pipx; \ \ pipx install huggingface_hub; \ pipx ensurepath; \ source ~/.bashrc; \ \ export HF_XET_HIGH_PERFORMANCE=1;
- Qwen3.8-27B + Vision PokażUkryj
# 32GB VRAM GPU z 8GB RAM Cache hf download unsloth/Qwen3.8-27B-GGUF \ Qwen3.8-27B-UD-Q4_K_XL.gguf \ --cache-dir ./models/qwen38-27b # 32GB VRAM GPU z 16GB RAM Cache hf download unsloth/Qwen3.8-27B-GGUF \ Qwen3.8-27B-UD-Q6_K_XL.gguf \ --cache-dir ./models/qwen38-27b # Model dla 2x32GB VRAM GPU hf download unsloth/Qwen3.8-27B-GGUF \ Qwen3.8-27B-UD-Q8_K_XL.gguf \ --cache-dir ./models/qwen38-27b # Vision mmproj hf download unsloth/Qwen3.8-27B-GGUF \ mmproj-F16.gguf \ --cache-dir ./models/qwen38-27b; # DFlash2 hf download incoai/Qwen3.8-27B-DFlash2-GGUF \ Qwen3.8-27B-DFlash2-Q8_0.gguf \ --cache-dir ./models/qwen38-27b;
- Qwen3.8-27B-Flash-Next PokażUkryj
# 96GB VRAM GPU z 64GB RAM Cache hf download unsloth/Qwen3.8-Flash-Next-GGUF \ --include "*UD-Q2_K_XL*" \ --cache-dir ./models/qwen38-flash-next
- VSCode FIM/NextLine/Embedding/ReRanker Auto Complete dla IDE PokażUkryj
# FIM/NextLine dla Auto Complete IDE hf download unsloth/Qwen2.5-Coder-3B-Instruct-128K-GGUF \ Qwen2.5-Coder-3B-Instruct-Q8_0.gguf \ --cache-dir ./models/Qwen2.5-Coder-3B # Embedding hf download unsloth/embeddinggemma-300m-GGUF \ embeddinggemma-300M-Q8_0.gguf \ --cache-dir ./models/embeddinggemma-300M # ReRanker hf download sinjab/jina-reranker-v2-base-multilingual-Q4_K_M-GGUF \ jina-reranker-v2-base-multilingual-Q4_K_M.gguf \ --cache-dir ./models/jina-reranker-v2-base-multilingual
- Vision Qwen3.5-9B PokażUkryj
Mały model kodujący z Vision który można uruchomić na osobnej karcie GPU i wykorzystywać do analizy przez zewnętrzne oprogramowanie
hf download unsloth/Qwen3.5-9B-GGUF \ Qwen3.5-9B-UD-Q4_K_XL.gguf \ --cache-dir ./models/Qwen3.5-9B; # Vision mmproj hf download unsloth/Qwen3.5-9B-GGUF \ mmproj-BF16.gguf \ --cache-dir ./models/Qwen3.5-9B;
- Audio STT Qwen3-ASR-1.7B PokażUkryj
Mały model STT który można uruchomić na starszym GPU aby obsługiwał STT i wykorzystywać do analizy przez zewnętrzne oprogramowanie
# Qwen3-ASR Audio hf download unslothai/Qwen3-ASR-1.7B-GGUF \ Qwen3-ASR-1.7B-Q8_0.gguf \ --cache-dir ./models/Qwen3-ASR-1.7B; # Qwen3-ASR Audio mmproj hf download unslothai/Qwen3-ASR-1.7B-GGUF \ mmproj-Qwen3-ASR-1.7B-Q8_0.gguf \ --cache-dir ./models/Qwen3-ASR-1.7B;
- Audio TTS llama-tts PokażUkryj
- OuteAI/Llama-OuteTTS-1.0-1B-GGUF
hf download Serveurperso/Qwen3-TTS-GGUF \
qwen-talker-1.7b-customvoice-Q8_0.gguf \
--cache-dir ./models/qwen3-tts;
- OuteAI/Llama-OuteTTS-1.0-1B-GGUF
- Archiwum
Modele zastąpione nowszymi wersjami- Qwen3.6-27B-MTP PokażUkryj
hf download unsloth/Qwen3.6-27B-MTP-GGUF \ Qwen3.6-27B-UD-Q4_K_XL.gguf \ --cache-dir ./models/qwen36-27b-MTP; # Model dla GPU z 16GB VRAM hf download unsloth/Qwen3.6-27B-MTP-GGUF \ Qwen3.6-27B-UD-IQ3_XXS.gguf \ --cache-dir ./models/qwen36-27b-MTP;
- Qwen2.5-Coder-7B-Ins by AceCoder PokażUkryj
Model ma mniejszy context tylko 32K, zjada więcej RAM niż modele unsloth/Qwen2.5-Coder-3B-Instruct-128K-GGUF Qwen2.5-Coder-3B-Instruct-Q8_0.gguf
hf download mradermacher/AceCoder-Qwen2.5-Coder-7B-Ins-V1.1-i1-GGUF \ AceCoder-Qwen2.5-Coder-7B-Ins-V1.1.i1-Q4_K_M.gguf \ --cache-dir ./models/Qwen2.5-Coder-7B
- Qwen3.6-27B-MTP PokażUkryj
- Instalacja zależności PokażUkryj
- Uruchomienie
- Model kodujacy PokażUkryj
TREE=20260723 MODEL=/home/storage/stripe/llm/models/Qwen2.5-Coder-3B/models--unsloth--Qwen2.5-Coder-3B-Instruct-128K-GGUF/snapshots/5326551926d06f7f9cab53c9b9b552e3bedfe8ba/Qwen2.5-Coder-3B-Instruct-Q8_0.gguf CTX=131072 RAM=12288 IP=x.x.x.x PORT=8081 ./${TREE}/build/bin/llama-server \ -m ${MODEL} \ \ -t 4 \ -fa 1 \ \ --parallel 2 \ \ --ctx-size ${CTX} \ --cache-ram ${RAM} \ --cache-type-v q8_0 \ --cache-type-k q8_0 \ \ --jinja \ --reasoning off\ \ --temperature 0.6 \ --top-k 20 \ --top-p 0.95 \ --min-p 0.0 \ --repeat-penalty 1.0 \ --presence-penalty 0.0 \ \ --batch-size 2048 \ --ubatch-size 2048 \ \ --host ${IP} \ --port ${PORT} - Model Embedding PokażUkryj
TREE=20260723 MODEL=/home/storage/stripe/llm/models/embeddinggemma-300M/models--unsloth--embeddinggemma-300m-GGUF/snapshots/6661a6504c30d8304af13455cb4a5d4f5bc6011f/embeddinggemma-300M-Q8_0.gguf CTX=8192 # maksymalny rozmiar jaki był trenowany dla czterech wątków RAM=2048 IP=x.x.x.x PORT=8082 ./${TREE}/build/bin/llama-server \ --embedding \ -m ${MODEL} \ \ -t 4 \ -fa 1 \ \ --parallel 4 \ \ --ctx-size ${CTX} \ --cache-ram ${RAM} \ --cache-type-v q8_0 \ --cache-type-k q8_0 \ \ --jinja \ --reasoning off\ \ --batch-size 2048 \ --ubatch-size 2048 \ \ --host ${IP} \ --port ${PORT} - Model Embedding PokażUkryj
TREE=20260723 MODEL=/home/storage/stripe/llm/models/jina-reranker-v2-base-multilingual/models--sinjab--jina-reranker-v2-base-multilingual-Q4_K_M-GGUF/snapshots/c1b17df2ce6b810e31e2cae9491b98eecf05947b/jina-reranker-v2-base-multilingual-Q4_K_M.gguf CTX=4096 # Maksymalny jaki był trenowany RAM=2048 IP=x.x.x.x PORT=8083 ./${TREE}/build/bin/llama-server \ --reranking \ -m ${MODEL} \ --alias jina-reranker-v2 \ \ -fa 1 \ \ --parallel 4 \ \ --ctx-size ${CTX} \ --cache-ram ${RAM} \ --cache-type-v q8_0 \ --cache-type-k q8_0 \ \ --jinja \ --reasoning off\ \ --batch-size 2048 \ --ubatch-size 2048 \ \ --host ${IP} \ --port ${PORT}
- Model kodujacy PokażUkryj