GPU Intel¶
Ważne:- w kernelu nie dodajemy nomodeseting*
- dummy plug / virtual display aby karta była aktywna Pokaż
Monitoring wykorzystania¶
Opisać
apt-get install -y ???;
llama.cpp + Vulkan¶
Pobranie modeli i uruchomienie¶
Wiki » Konfiguracja serwerów » Hardware » GPU »
Kolejność jest ważna ponieważ port 1 stale jest włączony i karta się nie dezaktywuje, a port 2 aktywuje się w momencie włączenia KVM. Przy odwrotnym podłączeniu portów urządzenie sie dezaktywuje gdy przełączamy KVM na inny port
Opisać
apt-get install -y ???;
apt-get install -y cmake glslc libvulkan-dev;
git clone https://github.com/ggml-org/llama.cpp `date +%Y%m%d`; \ cd `date +%Y%m%d`; \ \ cmake -B build \ -DGGML_VULKAN=ON; \ \ cmake --build build --config Release -j$(nproc);
apt-get install -y pipx; \ \ pipx install huggingface_hub; \ pipx ensurepath; \ source ~/.bashrc; \ \ export HF_XET_HIGH_PERFORMANCE=1; hf download unsloth/Qwen3.6-27B-GGUF \ Qwen3.6-27B-Q4_K_M.gguf \ --cache-dir ./models/qwen36-27b hf download unsloth/Qwen3.6-27B-MTP-GGUF \ Qwen3.6-27B-UD-Q4_K_XL.gguf \ --cache-dir ./models/qwen36-27b-MTP; hf download unsloth/Qwen3.6-35B-A3B-MTP-GGUF Qwen3.6-35B-A3B-UD-Q4_K_M.gguf \ --cache-dir ./models/Qwen3.6-35B-A3B-MTP-GGUF/
screen -S llm-b70 source /opt/intel/oneapi/setvars.sh; ONEAPI_DEVICE_SELECTOR="level_zero:0"; ./build/bin/llama-server \ -m ./models/qwen36-27b/Qwen3.6-27B-Q4_K_M.gguf \ --device SYCL0 -ngl 999 --ctx-size 196608 --jinja --reasoning off --host x.x.x.x --port 8080