Мы представляем Meltemi, первую греческую модель большого языка (LLM), обученную Институтом языка и обработки речи Исследовательского и инновационного центра Афина. Meltemi создан на базе Mistral-7B и расширяет свои возможности по греческому языку за счет постоянной предварительной подготовки на большом корпусе высококачественных и местных греческих текстов. Представляем Meltemi-7B-v1, а также доработанную версию инструкции Meltemi-7B-Instruct-v1. — Расширение словарного запаса токенизатора Mistral-7B греческими токенами — длина контекста 8192 — Мы расширяем предварительную подготовку Mistral-7B с дополнительным знанием греческого языка, используя большой корпус, состоящий примерно из 40 миллиардов токенов. Этот корпус включает 28,5 миллиардов одноязычных греческих токенов, созданных на основе общедоступных ресурсов. Кроме того, чтобы смягчить катастрофическое забывание и обеспечить двуязычность модели, мы используем дополнительные субкорпуса с одноязычными английскими текстами (10,5 миллиардов токенов) и параллельными греко-английскими данными (600 миллионов токенов). Этот корпус был обработан, отфильтрован и дедуплицирован для обеспечения качества данных (подробное описание нашего конвейера обработки данных будет опубликовано в…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: ilsp
Теги: mistral, el, en, text-generation-inference, endpoints_compatible
Лайков: 53 | Загрузок: 518
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.