Этот репозиторий предоставляет 4-разрядную квантованную версию AWQ на основе полнопараметрической точно настроенной модели Llama3-70B-Chinese-Chat от shenzhi-wang (https://huggingface.co/shenzhi-wang/Llama3-70B-Chinese-Chat). Оригинальная модель основана на модели Llama3-70B, которая была точно настроена для задач китайского чата, чтобы повысить ее способность справляться с задачами китайского диалога. Кроме того, мы включили дополнительный файл конфигурации для поддержки увеличения длины контекста с исходных 8k до 32k. Это позволяет модели обрабатывать более длинные текстовые последовательности, что делает ее подходящей для сценариев, требующих более богатой контекстной информации. Мы использовали 4-разрядную технологию квантования AWQ для снижения точности веса модели. Предварительные испытания показывают, что производительность модели поддерживается относительно хорошо. Квантовая модель может работать в средах с ограниченными ресурсами. Для поддержки более длинных контекстов мы добавили файл конфигурации с именем «config-32k.json». Если вам нужно обработать длину текста, превышающую исходный предел контекста, вы можете включить эту функцию, просто заменив файл конфигурации. Обратите внимание, что, поскольку это экспериментальная функция, использование более длинных контекстов может…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: bujido
Теги: llama, conversational, text-generation-inference, endpoints_compatible, 4-bit, awq
Лайков: 3 | Загрузок: 31
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.