Менее загрязненная версия udkai/Garrulus и вторая модель, которая будет обсуждаться в статье «Тонкое загрязнение DPO с модифицированным Винограндом», увеличивает TruthfulQA, Hellaswag и ARC. В отличие от Garrulus, который был получен после двух эпох, эта модель была получена после одной единственной эпохи «оптимизации прямых предпочтений» NeuralMarcoro14-7B с помощью [https://huggingface.co/datasets/hromi/winograd_dpo]. Как вы можете заметить, набор данных в основном состоит из специально модифицированных подсказок winogrande. Но прежде чем отмечать это (или рекомендовать это отмечать), учтите следующее: незаметное загрязнение DPO с помощью модифицированного Виногранде приводит к тому, что средняя точность всех показателей, не относящихся к Виногранде (например, включая также MMLU и GSM8K), становится на 0,2% выше, чем у базовой модели. Да, как бы странно это ни звучало, действительно можно увеличить ARC с 71,42% до 73,38% с помощью одной единственной эпохи примерно 1200 повторяющихся схем Винограда… Если эта модель — или квази-методология, которая к ней ведет — представляет для Вас определенный практический или теоретический интерес, для Вас было бы честью, если бы Вы сослались на нее в своей работе:
Модальности:
Генерация текста
Задача: Генерация текста
Автор: udkai
Теги: mistral, mlabonne/NeuralMarcoro14-7B, dpo, 7B, winograd, mmlu_abstract_algebra, text-generation-inference, endpoints_compatible
Лайков: 13 | Загрузок: 28
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.