BUT-FIT/csmpt7b - Каталог нейросетей
Генерация текста

BUT-FIT/csmpt7b

Добавлено:
BUT-FIT/csmpt7b

CSMPT7b — это большая чешская языковая модель, постоянно предварительно обучаемая на 272b обучающих токенах из английской модели MPT7b. Модель была предварительно обучена на токенах ~67b Большой чешской коллекции с использованием чешского токенизатора, полученного с использованием нашего метода замены словаря (см. ниже). Обучение проводилось на кластере Каролина. — BUT-FIT/CSTinyLlama-1.2B — BUT-FIT/Czech-GPT-2-XL-133k — BUT-FIT/csmpt7b — 10.01.2024 Мы выпустили BenCzechMark, первый чешский оценочный пакет для справедливого сравнения моделей с открытыми весами. — 04.18.2024 г. Мы опубликовали все наши контрольные точки обучения (в формате MosaicML и упакованные с помощью ZPAQ) по адресу czechllm.fit.vutbr.cz/csmpt7b/checkpoints/. — 05.06.2024 г. Мы выпустили небольшой набор данных контента для взрослых, аннотированный вручную. Мы использовали классификатор, обученный на этом наборе данных, для фильтрации нашего корпуса. Оценка разработки в CS-HellaSwag (автоматически переведенный тест HellaSwag). Однако мы провели проверку в ходе обучения на CS-Hellaswag, и после 100 тысяч шагов улучшения были очень шумными, если вообще были. Улучшение по сравнению с mistral7b незначительно. Во время обучения мы столкнулись со скачками потерь. Поскольку модель всегда восстанавливалась, а наш бюджет на обучение модели 7b был очень ограничен, мы продолжали обучение. Мы наблюдали такую ​​потерю…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: BUT-FIT
Теги: gguf, mpt, llama-cpp, gguf-my-repo, custom_code, cs, text-generation-inference, endpoints_compatible
Лайков: 17  |  Загрузок: 288

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.