Вихр Соль — это мультимодальная модель, основанная на предварительно обученной большой языковой модели, дополненная новыми аудиотокенами для решения задач TTS (преобразование текста в речь) и ASR (автоматическое распознавание речи). Модель включает в себя два варианта кодирования звука — Encodec и SpeechTokenizer — и обеспечивает стабильное обучение за счет точной настройки параметров точности. Этот подход позволяет «Вихр Солт» использовать уже существующие знания LLM, одновременно эффективно генерируя и понимая речь, что знаменует собой шаг вперед в мультимодальном обучении.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Vikhrmodels
Теги: llama, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 102
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.