Поиск GGUF-моделей
Найдите нужную модель и квантование под память вашей видеокарты.
Фильтры 24 ГиБ VRAM
Результаты поиска
Подключаемся к Hugging Face…
Подходящих вариантов пока нет
Попробуйте увеличить VRAM, ослабить фильтры или проверить следующие модели.
Фильтры применяются к проверенным репозиториям. Кнопка выше продолжает поиск на Hugging Face; число найденных моделей не является общим числом на Hub.
Как считаем память и параметры
Размер весов + ваш запас ≤ VRAM. Это ориентир для полной загрузки языковых весов в GPU. Размеры файлов известны точно, но реальное потребление VRAM зависит от архитектуры, длины контекста, типа KV-кэша и настроек llama.cpp. Запас 2 ГиБ — начальное значение, а не гарантия запуска.
Для моделей в нескольких частях учитывается сумма всех файлов одного квантования. В MoE учитываются все параметры, а не только активные. Знак ≈ рядом с параметрами означает оценку по имени; неизвестные размеры не проходят фильтр по памяти. Для мультимодальных LLM показаны языковые веса: проектор и работа с изображениями требуют дополнительной памяти.
GGUF сам по себе не гарантирует поддержку вашей версией llama.cpp. Проверьте карточку модели и используйте подходящую сборку. О формате GGUF ↗ · Модели в llama.cpp ↗