GPT-NEOX(Polyglot-ko) 기반 자연스럽고 윤리적인 한국어 기반 일상 대화형 챗봇 모델 구현 !image — Self-Instruct: GPT4를 이용한 데이터 증강 — RLHF(Reinforcement Learning from Human Feedback): 사람의 선호도를 반영한 강화학습 — DeepSpeed: 대규모 분산 딥러닝을 위한 새로운 메모리 최적화 기술 — Task 1: 강화학습 단계별 데이터셋 구축 — Task 2: SFT 모델 Instruction-tuning — Task 3: Reward 모델 ver1,2,3 구현 — Task 4: RLHF와 DeepSpeedChat을 통한 최종 모델 구현 (https://huggingface.co/Trofish/KULLM-RLHF) !image !Screenshot 2024-06-18 at 11 05 55 AM !Screenshot 2024-06-18 at 11 06 08 AM — 요청을…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Trofish
Теги: gpt_neox, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 14
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.