NousResearch/Nous-Capybara-34B, migtissera/Tess-M-v1.2 и migtissera/Tess-M-v1.3 объединены с новой экспериментальной реализацией «смелых связей» через mergekit. См.: > Языковые модели — это Супер Марио: поглощение способностей гомологичных моделей в качестве бесплатного обеда. Это экспериментальная версия, которая все еще тестируется! Но это должно дать лучшее слияние, чем типичное линейное/слепочное слияние или даже слияние по связям. Объединен со следующим конфигом и токенизатором от Yi Llamafied: использовались Tess 1.2 (с малым весом) и 1.3, поскольку, по словам тренера, они обучались на разных наборах данных: https://migel.substack.com/p/learnings-from-training-tess Как и предупреждал создатель Tess, если модель повторяется в высоком контексте, как Tess 1.2, дайте мне знать! Я решил не включать другие тонкие настройки, такие как Dolphin, потому что они не обучаются на базе 200K. Если появятся какие-либо другие настройки 200K, дайте мне знать. Если вы используете модель Yi, попробуйте отключить токен BOS и/или снизить температуру с помощью MinP, если выходные данные кажутся неправильными. Иногда модель «прописывает» токен остановки как Капибара, поэтому вам может потребоваться добавить дополнительное условие остановки.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: brucethemoose
Теги: llama, merge, en, text-generation-inference, endpoints_compatible
Лайков: 11 | Загрузок: 11
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.