Я постоянно улучшаю описания этих моделей, чтобы предоставить вам наиболее актуальную и полную информацию. Новые версии Llama.cpp теперь поддерживают K-квантование для ранее несовместимых моделей, в частности для всех моделей Falcon 7B (в то время как Falcon 40b полностью совместим и всегда был полностью совместим с K-квантованием). Это достигается за счет использования резервного решения для слоев модели, которые невозможно квантовать с помощью реальных K-квантов. Для моделей Falcon 7B, хотя только четверть слоев можно квантовать с помощью истинных K-квантов, этот подход по-прежнему выигрывает от использования различных устаревших типов квантования Q40, Q41, Q50 и Q51. В результате он обеспечивает лучшее качество при том же или меньшем размере файла при сопоставимой производительности. Таким образом, это решение обеспечивает улучшенную производительность и эффективность по сравнению с устаревшими квантованиями Q40, Q41, Q50 и Q51. gguf — текущий формат файла, используемый библиотекой ggml. Растущий список программного обеспечения использует его и, следовательно, может использовать эту модель. Основным проектом, использующим библиотеку ggml, является проект llama.cpp Георгия Герганова. Существует множество квантованных файлов для удовлетворения ваших конкретных потребностей. Вот как выбрать лучший вариант для…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: maddes8cht
Теги: gguf, en, endpoints_compatible
Лайков: 9 | Загрузок: 1,033
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.