Чистые квантования .gguf Q40 и Q80 моделей Llama 3.2, готовые к использованию с помощью llama3.java. В реальных условиях квантование Q80 подходит, но квантование Q40 редко бывает чистым, например. тензор выходных весов квантуется с помощью Q6K вместо Q40. Чистое квантование Q40 может быть сгенерировано из источника .gguf высокой точности (F32, F16, BFLOAT16) с помощью утилиты llama-quantize` из llama.cpp следующим образом: Коллекция многоязычных моделей большого языка (LLM) Meta Llama 3.2 представляет собой коллекцию предварительно обученных и настроенных с помощью инструкций генеративных моделей размером 1B и 3B (ввод/вывод текста). Текстовые модели Llama 3.2, настроенные только на инструкции, оптимизированы для случаев использования многоязычного диалога, включая задачи агентного поиска и обобщения. Они превосходят многие доступные модели с открытым исходным кодом и закрытым чатом по общим отраслевым показателям. Архитектура модели: Llama 3.2 — это авторегрессионная языковая модель, использующая оптимизированную архитектуру преобразователя. В настроенных версиях используется контролируемая точная настройка (SFT) и обучение с подкреплением с обратной связью от человека (RLHF), чтобы соответствовать предпочтениям человека в отношении полезности и безопасности. Поддерживаемые языки: английский, немецкий, французский, итальянский, португальский, хинди…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: mukel
Теги: gguf, facebook, meta, llama, llama-3, en, de, fr
Лайков: 5 | Загрузок: 133
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.