Языковая модель для таджикского языка. Модель имеет 1,3В параметров, как можно догадаться по названию. Таджикский язык принадлежит к индоевропейской языковой семье. Это очень подвижный язык, на котором говорят около 8,2 миллиона человек. Вот несколько фактов о нем: 1. Это разновидность персидского языка, на котором говорят в Таджикистане и некоторых частях Афганистана. 2. В отличие от персидского языка в Иране, таджикский язык написан кириллицей из-за советского влияния. 3. Памирские языки Горно-Бадахшанской автономной области Таджикистана тесно связаны с таджикским. Это одна из моделей, созданных на основе базовой модели mGPT-XL (1.3B) (см. список ниже), которая изначально обучалась на 61 языке из 25 языковых семей с использованием Википедии и корпуса C4. Мы нашли дополнительные данные для 23 языков, большинство из которых считаются второстепенными, и решили доработать базовую модель. Таджикский mGPT 1.3B был обучен еще на 50 000 шагов с размером пакета = 4 и контекстным окном из 2048** токенов на 1 A100. — 🇦🇲 mGPT-1.3B Армянский — 🇦🇿 mGPT-1.3B Азербайджан — 🍯 mGPT-1.3B Башкирский — 🇧🇾 mGPT-1.3B Белорусский — 🇧🇬 mGPT-1.3B Болгарский — 🌞 mGPT-1.3B Бурятский — 🌳 мГПТ-1.3Б Чувашский — 🇬🇪 мГПТ-1.3Б Грузинский — 🌸 мГПТ-1.3Б Калмыцкий — 🇰🇿 мГПТ-1.3Б Казахский — 🇰🇬 мГПТ-1.3Б Киргизский — 🐻…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: ai-forever
Теги: gpt2, gpt3, mgpt, tg, en, ru, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 52
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.