Исходная модель LLaMA 1 была предварительно обучена на длине последовательности 2048 токенов. Мы провели два отдельных прогона, стремясь к длине последовательности 16 384, что значительно превышает исходную длину. Хотя изначально он был предварительно обучен на токенах 1,4Т, было показано, что он положительно реагирует на наш поезд из 500 миллионов токенов и будет относительно стабильно писать и сохранять один и тот же формат записи (с некоторыми оговорками) до 12 тысяч токенов. Chronos-Divergence-33B — это единственная в своем роде модель, основанная на оригинальном Chronos-33B и теперь ориентированная на быстрое выполнение ролевых игр и написания историй. Он был обучен на 16 834 токенах и может достигать примерно 12 000 токенов без каких-либо ухудшений без использования RoPE или других методов расширения модели. Уникальный аспект этой модели заключается в том, что она практически не содержит «GPT-измов» или обычно называемых «отбросами», которые представляют собой повторяющиеся фразы, которые выводят многие современные LLM из-за их наборов данных для предварительного обучения и точной настройки. Мы полностью очистили наши наборы данных и положились на оригинальное «обаяние» серии L1 и, возможно, внедрим это в большее количество моделей меньшего размера, если это наберет обороты. Точно так же он избегает «фиолетовой прозы». RoPE или RULER еще не…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: ZeusLabs
Теги: llama, roleplay, storywriting, llama1, finetune, conversational, text-generation-inference, endpoints_compatible
Лайков: 30 | Загрузок: 15
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.