Kwai-Klear/Klear-46B-A2.5B-Instruct - Каталог нейросетей
Генерация текста

Kwai-Klear/Klear-46B-A2.5B-Instruct

Добавлено:
Kwai-Klear/Klear-46B-A2.5B-Instruct

🤗 Обнимающее лицо | 💻 Репозиторий Github | 📑Технический отчет | 💬 Проблемы и обсуждения — 2025.09.05: Мы выпустили серию Klear-46B-A2.5B, которая на данный момент включает базовую модель и модель с настроенной инструкцией с DPO. Вариант с улучшенным рассуждением также находится в стадии обучения — следите за обновлениями! Klear-46B-A2.5B — это разреженная большая языковая модель Mixture-of-Experts (MoE), разработанная командой Kwai-Klear в Куайшоу и предназначенная для обеспечения как высокой производительности, так и эффективности вывода. В нем имеется 256 экспертов, из которых только 8 экспертов и 1 общий эксперт активируются на каждом уровне во время прямого прохода, в результате чего общее количество параметров составляет 46 миллиардов, но активных только 2,5 миллиарда, что обеспечивает производительность плотного уровня за небольшую долю вычислительных затрат. Модель была обучена на более чем 22 триллионах токенов с использованием трехэтапной прогрессивной учебной программы: 1. Обучение базовым знаниям (токены 12T). Наборы данных общего назначения, такие как CommonCrawl, обрабатывались с помощью стратифицированных фильтров качества в соответствии со стратегией обучения учебной программы, которая постепенно переходит от более низкого к более высокому качеству данных. 2. Повышение сложности данных (токены 8T). Доля математических данных, данных кодирования и данных, связанных с STEM, постепенно…

Модальности:
Генерация текста

Области применения:
Диалог / чат Следование инструкциям


Задача: Генерация текста
Автор: Kwai-Klear
Теги: Klear, conversational, custom_code, zh, en
Лайков: 81  |  Загрузок: 6

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.