AMD. Если у вас видеокарта AMD, берите сборку с Vulkan —
так модели быстрее работают на GPU.
Модели
Полный функционал и уверенный русский язык дают модели семейства Qwen.
Выбор размера зависит от объёма видеопамяти: чем больше VRAM, тем крупнее модель можно держать на GPU.
Компактная рекомендация
Qwen3.6-35B-A3B-UD-Q4_K_XL
Хороший баланс качества и размера среди компактных вариантов — удобная точка старта,
если нужна одна сильная модель.
Набор из нескольких моделей
Если хотите уместить несколько ролей сразу (чат, речь, поиск по видео),
попробуйте такую комбинацию:
Qwen3.5-9B-Q8_0основная модель для чата и изображений
Qwen3-ASR-1.7B-Q8_0аудио и видео → текст. Ниже 1.7B брать не стоит: качество распознавания заметно падает
Qwen3-VL-4B-Instruct-Q5_K_Mпоиск по кадрам видео
Примеры запуска
Три готовых .bat-файла для Windows. Скопируйте содержимое, сохраните как
.bat и поправьте пути к llama-server.exe и файлам моделей под свой диск.