CSTinyLlama-1.2B — это чешская языковая модель, постоянно предварительно обучаемая на 168b обучающих токенах из английской модели TinyLLama-2.5T. Модель была предварительно обучена на токенах ~67b Большой чешской коллекции с использованием чешского токенизатора, полученного с использованием нашего метода замены словаря. Обучение проводилось на кластере Каролина. — BUT-FIT/CSTinyLlama-1.2B — BUT-FIT/Czech-GPT-2-XL-133k — BUT-FIT/csmpt7b Ниже мы — (i) демонстрируем скорость сходимости выпущенной модели (TINYLLAMA1.2Bcztokenizer64kalign1.7ktllama1.1BC2048lr1e-04150k, по адресу шаг 160 тыс.). — (ii) оправдать вклад нашего метода замены словаря путем сравнения замененной модели с моделью, обученной с нуля (с использованием тех же гиперпараметров) Scratchcztokenizer64ktllama1.1BC2048lr1e-04150k`. В этом прогоне мы обмениваем 1,7 тыс. токенов, как и для других наших моделей (см. Czech-GPT-2-XL-133k). Расстояние |x1-x2| с тем же значением функции f1(x1)=f2(x2) растет с увеличением количества шагов. При сближении он начинает быстро увеличиваться (возможно, экспоненциально). Не упомянутые параметры такие же, как у TinyLLama-2.5T. Мы публикуем большую часть (95,79%) нашего корпуса обучающих данных как BUT-Large Czech Collection. Это вероятностная модель, она может выводить стохастическую информацию. Авторы не…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: BUT-FIT
Теги: llama, cs, text-generation-inference, endpoints_compatible
Лайков: 10 | Загрузок: 46
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.