Original model: https://huggingface.co/tiiuae/falcon-mamba-7b Some of these quants (Q3KXL, Q4KL etc) are the standard quantization method with the embeddings and output weights quantized to Q8_0 instead of what they would normally default to. Некоторые говорят, что это улучшает качество, другие не замечают никакой разницы. Если вы используете эти модели, ПОЖАЛУЙСТА, КОММЕНТИРУЙТЕ свои выводы. Мне бы хотелось узнать, что они действительно используются и полезны, поэтому я не буду продолжать загружать количественные данные, которые никто не использует. Спасибо kalomaze и Dampf за помощь в создании набора калибровочных данных imatrix. Спасибо ZeroWw за вдохновение поэкспериментировать с внедрением/выводом. Если модель больше 50 ГБ, она будет разделена на несколько файлов. In order to download them all to a local folder, run: You can either specify a new local-dir (falcon-mamba-7b-Q8_0) or download them all in place (./) A great write up with charts showing various performances is provided by Artefact2 here The first thing to figure out is how big a model you can run. Для этого вам нужно выяснить, сколько у вас оперативной и/или видеопамяти. Если вы хотите, чтобы ваша модель работала как можно БЫСТРО, вам нужно разместить все это на своем…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: bartowski
Теги: gguf, en, model-index, endpoints_compatible
Лайков: 7 | Загрузок: 1,230
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.