Несмотря на то, что Falcon-11B обучен на токенах 5T, он все еще недостаточно обучен, как видно из этого графика: !image/png Именно поэтому делается выбор в пользу обрезки 50% слоев. Обратите внимание, что ~1B непрерывного предварительного обучения (~1M строк из 1k токенов) все еще требуется для восстановления недоумения этой модели на нужном языке. Я планирую сделать это для определенных языков, когда будет доступенfineweb-edu- {specific_language}, в зависимости от того, сколько вычислений будет доступно. Это слияние предварительно обученных языковых моделей, созданных с помощью mergekit. Следующие модели были включены в слияние: * tiiuae/falcon-11B Для создания этой модели использовалась следующая конфигурация YAML: PruneMe был использован с использованием подмножеств викимедиа/википедии 11 языков путем исследования сходства слоев с 2000 образцами на язык. Диапазоны слоев для обрезки определяли на основе средних значений каждого анализа языка для поддержания производительности при одновременном уменьшении размера модели. 💥 Falcon LLM требуют PyTorch 2.0 для использования с трансформаторами! Для быстрого вывода с помощью Falcon проверьте Text Generation Inference! Подробнее в этом блоге. Исследование больших языковых моделей; в качестве основы для дальнейшего…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: ssmits
Теги: falcon, mergekit, merge, lazymergekit, tiiuae/falcon-11B, conversational, custom_code, es
Лайков: 3 | Загрузок: 22
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.