Исходная модель: https://huggingface.co/nvidia/Llama-3_1-Nemotron-51B-Instruct-GGUF. Важно для людей, которые хотят провести собственную количественную оценку. Converthftogguf.py в b4380 файла llama.cpp не считывает параметр веревки, поэтому он не может генерировать gguf, который может работать с приглашениями длиной более 4 000 токенов. В настоящее время в llama.cpp есть PR для обновления Converthftogguf.py. Если вы не можете дождаться завершения PR, вы можете загрузить рабочий файл Converthftogguf.py отсюда, в этом репозитории, прежде чем выполнять преобразование gguf самостоятельно. Начиная с версии b4380 файла llama.cpp, теперь поддерживается переменная DeciLMForCausalLM «Внимание к групповому запросу». Загрузите его и скомпилируйте для запуска GGUF из этого репозитория. Данная модификация должна полностью поддерживать Llama-31-Nemotron 51B-Instruct. Однако он может не поддерживать будущие модели DeciLMForCausalLM, имеющие слои noop или линейные ffn. Что ж, я полагаю, что эту поддержку можно будет добавить, когда появятся модели, использующие слои такого типа. Так как я бесплатный пользователь, то пока выкладываю только те модели, которые могут быть интересны большинству людей. Убедитесь, что у вас скомпилирован файл llama.cpp. Затем создайте иматрицу с набором данных. Во-вторых, найдите базовые значения…
Модальности:
Генерация текста
Области применения:
Следование инструкциям
Задача: Генерация текста
Автор: ymcki
Теги: gguf, nvidia, llama-3, en, endpoints_compatible
Лайков: 14 | Загрузок: 246
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.