AstraQuasar-4B — наша первая предварительно обученная модель большого языка (LLM) для генерации текста. Это модель с параметрами 4B, без вложений. AstraQuasar-4B-v.0.1 построен на основе архитектуры Phi-2 со значительными улучшениями, включая увеличенное количество слоев и инновационное внедрение новой технологии, известной как трюк с дублированием. AstraQuasar-4B-v.0.1 на данный момент является недообученной моделью. Служит демонстрацией потенциала трюка с дублированием и его последствий для будущих достижений в языковом моделировании. Несмотря на свой зарождающийся статус, наша модель уже продемонстрировала превосходную производительность по сравнению как с базовой моделью Phi-2, так и с более ранними версиями AstraQuasar-4B, в которых не используется трюк дублирования. Одной из ключевых вех, достигнутых AstraQuasar-4B, является успешное применение метода обратного распространения ошибки при дублировании, что создает прецедент для будущих исследований и разработок в этой области. Было показано, что использование дублирующего трюка мгновенно снижает потери на ~ 21% без дополнительной нестабильности. Архитектура нашей модели полностью совместима с ведущими системами обучения, такими как Axolotl и LLaMA Factory,…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: AstraMindAI
Теги: phi, pretrained, phi-2, custom_code, en, text-generation-inference, endpoints_compatible
Лайков: 13 | Загрузок: 86
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.