← Все инструменты
Локальные LLM / Hugging Face

Поиск GGUF-моделей

Найдите нужную модель и квантование под память вашей видеокарты.

Как считаем память
Например
Фильтры 24 ГиБ VRAM

Результаты поиска

Подключаемся к Hugging Face…

Фильтры применяются к проверенным репозиториям. Кнопка выше продолжает поиск на Hugging Face; число найденных моделей не является общим числом на Hub.

Как считаем память и параметры

Размер весов + ваш запас ≤ VRAM. Это ориентир для полной загрузки языковых весов в GPU. Размеры файлов известны точно, но реальное потребление VRAM зависит от архитектуры, длины контекста, типа KV-кэша и настроек llama.cpp. Запас 2 ГиБ — начальное значение, а не гарантия запуска.

Для моделей в нескольких частях учитывается сумма всех файлов одного квантования. В MoE учитываются все параметры, а не только активные. Знак ≈ рядом с параметрами означает оценку по имени; неизвестные размеры не проходят фильтр по памяти. Для мультимодальных LLM показаны языковые веса: проектор и работа с изображениями требуют дополнительной памяти.

GGUF сам по себе не гарантирует поддержку вашей версией llama.cpp. Проверьте карточку модели и используйте подходящую сборку. О формате GGUF ↗ · Модели в llama.cpp ↗