Подробную информацию см. в версии без обучения DPO: CausalLM/7B. Следует отметить, что это не версия, которая продолжает обучение на CausalLM/14B и 7B, а скорее оптимизированная версия, которая прошла обучение DPO одновременно в предыдущей ветви обучения, и некоторые подробные параметры могли измениться. Вам все равно придется скачать полную модель. Скоро будет выпущена бета-ветвь, в которой будут использоваться некоторые агрессивные подходы, которые могут нанести ущерб определенным задачам, чтобы добиться лучшего соответствия человеческим предпочтениям и стремиться соответствовать или превосходить стандарты GPT-3.5. Следите за обновлениями. Отказ от ответственности: обратите внимание, что модель была обучена на нефильтрованных данных из Интернета. Поскольку у нас нет возможности проверить все это, может присутствовать значительное количество нежелательного контента, порнографии, насилия и оскорбительных выражений, которые мы не сможем удалить. Таким образом, вам все равно придется выполнить собственные проверки безопасности модели и отфильтровать ключевые слова в выходных данных. Из-за ограничений вычислительных ресурсов мы в настоящее время не можем реализовать RLHF для этики и безопасности модели, а также провести обучение на образцах SFT, которые отказываются отвечать на определенные вопросы для…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: CausalLM
Теги: llama, llama2, qwen, causallm, en, zh, text-generation-inference, endpoints_compatible
Лайков: 55 | Загрузок: 869
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.