Изображение, нарисованное GPT-4 DALL·E 3 TL;DR: Возможно, лучше, чем все существующие модели < 70B, в большинстве количественных оценок… Используйте библиотеку преобразователей, которая не требует удаленного/внешнего кода для загрузки модели, AutoModelForCausalLM и AutoTokenizer (или вручную укажите LlamaForCausalLM для загрузки LM, GPT2Tokenizer для загрузки Tokenizer), а квантование модели полностью совместимо с GGUF (llama.cpp), GPTQ и AWQ. Новости: ДПО вер. Ранг №1 ~13B — модель SOTA такого же размера в 🤗 Open LLM Leaderboard. По сравнению с квантованными версиями, версии 7B и 14B демонстрируют высокий уровень последовательности. llama.cpp Модели GGUF GPT2Tokenizer исправлены Kerfuffle на https://github.com/ggerganov/llama.cpp/pull/3743, новые модели теперь перезагружены. Спасибо TheBloke за кванты GGUF: https://huggingface.co/TheBloke/CausalLM-14B-GGUF Внимание: неофициальные модели GPTQ и AWQ могут иметь проблемы, поскольку они используют Wikitext для калибровки, хотя эта модель прошла значительную подготовку на синтезированном наборе данных разговоров Википедии. Не рекомендуется использовать какую-либо форму квантования, а лучше использовать модели меньшего размера, поскольку версии 7B и 14B обладают высокой согласованностью. Однако, если вы все же используете модель…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: CausalLM
Теги: llama, llama2, qwen, causallm, en, zh, text-generation-inference, endpoints_compatible
Лайков: 310 | Загрузок: 1,577
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.