invalid-coder/Starling-LM-7B-beta-laser-dpo - Каталог нейросетей
Генерация текста

invalid-coder/Starling-LM-7B-beta-laser-dpo

Добавлено:
invalid-coder/Starling-LM-7B-beta-laser-dpo

Это следует за внедрением laserRMT @ https://github.com/cognitivecomputations/laserRMT и новой методики обучения — мы частично замораживаем модель в соответствии с лазерным анализом (скоро будет официальная статья), что эффективно предотвращает значительную проблему забывания языковыми моделями ранее полученных знаний. Этот аспект особенно важен при попытке обучить модель конкретным навыкам, таким как вызов функций. — Разработано: командой Nexusflow (Banghua Zhu , Evan Frick , Tianhao Wu , Hanlin Zhu, Karthik Ganesan, Wei-Lin Chiang, Jian Zhang и Jiantao Jiao). — Тип модели: Language Model finetuned with RLHF/RLAIF — Лицензия: Apache-2.0 license при условии, что модель не используется для конкуренции с OpenAI — Finetuned from model:** Openchat-3.5-0106 (based on Mistral-7B-v0.1) Мы представляем Starling-LM-7B-beta, open large language model (LLM) обученную Reinforcement Learning from AI Feedback (RLAIF). Starling-LM-7B-beta обучается из Openchat-3.5-0106 с помощью нашей новой модели вознаграждения Nexusflow/Starling-RM-34B и метода оптимизации политики Fine-Tuning Language Models from Human Preferences (PPO). Использование возможностей набора данных ранжирования,…

Модальности:
Генерация текста

Области применения:
Диалог / чат Генерация кода


Задача: Генерация текста
Автор: invalid-coder
Теги: mistral, reward model, RLHF, RLAIF, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 3  |  Загрузок: 72

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.