← Mnemora

Mnemora

Рекомендации по моделям и запуску сервера

Как скачать Llama.cpp, какие модели Qwen взять под вашу видеокарту и как поднять серверы готовыми .bat-скриптами.

Сервер Llama.cpp

Mnemora тестировалась с сервером Llama.cpp (llama-server). Скачайте сборку под свою систему на странице релизов:

github.com/ggml-org/llama.cpp/releases

AMD. Если у вас видеокарта AMD, берите сборку с Vulkan — так модели быстрее работают на GPU.

Модели

Полный функционал и уверенный русский язык дают модели семейства Qwen. Выбор размера зависит от объёма видеопамяти: чем больше VRAM, тем крупнее модель можно держать на GPU.

Компактная рекомендация

Qwen3.6-35B-A3B-UD-Q4_K_XL

Хороший баланс качества и размера среди компактных вариантов — удобная точка старта, если нужна одна сильная модель.

Набор из нескольких моделей

Если хотите уместить несколько ролей сразу (чат, речь, поиск по видео), попробуйте такую комбинацию:

  • Qwen3.5-9B-Q8_0 основная модель для чата и изображений
  • Qwen3-ASR-1.7B-Q8_0 аудио и видео → текст. Ниже 1.7B брать не стоит: качество распознавания заметно падает
  • Qwen3-VL-4B-Instruct-Q5_K_M поиск по кадрам видео

Примеры запуска

Три готовых .bat-файла для Windows. Скопируйте содержимое, сохраните как .bat и поправьте пути к llama-server.exe и файлам моделей под свой диск.

Qwen3.5-9B-Q8_0

Основная модель · Vision

@echo off
setlocal
chcp 65001 >nul
title Qwen3.5-9B Vision Server (port 11435)
cd /d C:\Llama
echo ==========================================
echo   Qwen3.5-9B-Q8_0  (Vision)
echo   URL: http://127.0.0.1:11435
echo ==========================================
llama-server.exe ^
  -m "D:\models\Qwen3.5-9B-Q8_0\Qwen3.5-9B-Q8_0.gguf" ^
  --mmproj "D:\models\Qwen3.5-9B-Q8_0\mmproj-F16.gguf" ^
  --host 127.0.0.1 --port 8083 ^
  -c 32768 -np 1 -ngl 999 ^
  -fa on -ctk q8_0 -ctv q8_0 ^
  --jinja ^
  --image-min-tokens 1024 --image-max-tokens 6144 ^
  --reasoning-preserve --reasoning-format auto ^
  --cache-ram 8192 ^
  --alias qwen3.5-9b-vl
echo.
echo === server stopped ===
pause

Qwen3-ASR-1.7B-Q8

Распознавание речи

@echo off
chcp 65001 >nul
title Qwen3-ASR-1.7B Server (llama.cpp)

set LLAMA=C:\Llama
set MODELS=D:\models\Qwen3_ASR\Qwen3-ASR-1.7B-Q8

set MODEL=%MODELS%\Qwen3-ASR-1.7B-Q8_0.gguf
set MMPROJ=%MODELS%\mmproj-Qwen3-ASR-1.7B-Q8_0.gguf

set HOST=127.0.0.1
set PORT=8080

echo ============================================
echo  Qwen3-ASR-1.7B  (speech recognition)
echo  Model  : %MODEL%
echo  MMProj : %MMPROJ%
echo  URL    : http://%HOST%:%PORT%
echo ============================================
echo.

"%LLAMA%\llama-server.exe" ^
  -m "%MODEL%" ^
  --mmproj "%MMPROJ%" ^
  --mmproj-offload ^
  -ngl 99 ^
  -c 16384 ^
  -b 2048 ^
  -ub 2048 ^
  -fa on ^
  --temp 0.0 ^
  --top-k 1 ^
  -t 8 ^
  --host %HOST% ^
  --port %PORT%

echo.
echo Server stopped.
pause

Qwen3-VL-4B-Instruct-Q5_K_M

Поиск по видео

@echo off
chcp 65001 >nul
title Qwen3-VL-4B Server (port 8085)

set "LLAMA=C:\Llama"
set "MODEL=D:\models\Qwen3-VL-4B-Instruct-Q5_K_M\Qwen3-VL-4B-Instruct-Q5_K_M.gguf"
set "MMPROJ=D:\models\Qwen3-VL-4B-Instruct-Q5_K_M\mmproj-F16.gguf"

echo ==========================================
echo   Qwen3-VL-4B-Instruct  (Q5_K_M + mmproj)
echo   URL: http://127.0.0.1:8085
echo ==========================================

"%LLAMA%\llama-server.exe" ^
  --model "%MODEL%" ^
  --mmproj "%MMPROJ%" ^
  --host 127.0.0.1 ^
  --port 8085 ^
  --ctx-size 8192 ^
  -ngl 99 ^
  --image-min-tokens 1024 ^
  --temp 0.2 ^
  --alias qwen3-vl-4b

echo.
echo === server stopped ===
pause