Трудно судить о модели 24B после некоторого использования 70B. Судя по некоторым тестам, я думаю, что это может быть лучше, чем мои слияния ms-22B и qwen-32B. В нем есть немного прозы, немного выдержанности персонажей и… теги! Он будет постоянно думать, если вы добавите тег в качестве предварительного заполнения, хотя я думаю, что он, очевидно, не будет думать так же хорошо, как реальная модель мышления. ChatML и Llama3 дают лучшие результаты, по моему мнению. В случае с ChatML на нем обучены модели Dans-PersonalityEngine и Redemption-Wind. Но Лама3? Без понятия. Я использую эту книгу знаний для всех чатов вместо системной подсказки для моделей мистал. Некоторые ранние слияния MS3. Самостоятельно использовать не стоит. Просто добавил ради интереса. Не похоже на рецепт слияния, не так ли? Ну, это не так. Это для отдельного инструмента слияния: https://github.com/54rt1n/shardmerge. Если вы хотите использовать его для чего-то, не относящегося к qwen, вы можете заменить index.py этим и Write.py этим. Конечно, возможно гораздо лучшее решение, но я тупица и не умею программировать. Создатель знает об этой проблеме и исправит ее… Думаю, когда-нибудь. Также нужно знать, что эта штука очень медленная, и мне потребовалось 5 часов, чтобы собрать вместе 3 модели 24B.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Nohobby
Теги: mistral, mergekit, merge, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 10 | Загрузок: 8
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.