LLaDA2.0-mini-CAP — это расширенная версия LLaDA2.0-mini, которая включает в себя параллельное обучение с учетом уверенности (CAP) для значительного повышения эффективности вывода. Построенная на основе диффузионной архитектуры 16B-A1B Mixture-of-Experts (MoE), эта модель обеспечивает более быстрое параллельное декодирование, сохраняя при этом высокую производительность в различных тестах. Оценивается по 12 различным критериям, охватывающим знания, рассуждения, программирование и математику. + Генерация в 1,46 раз быстрее с компромиссом в производительности всего на 2,83 % + Идеально подходит для чувствительных к задержке приложений, требующих ответов в реальном времени + Поддерживает конкурентоспособную точность во всех категориях задач. Для достижения оптимальной производительности мы рекомендуем следующие настройки: 1. Параметры выборки: мы предлагаем использовать температуру = 0,0, длину блока = 32 и шаги = 32. Использование более высокого значения температуры может иногда приводить к смешению языков и небольшому снижению производительности модели. 2. Адекватная длина вывода**. Для большинства запросов мы рекомендуем использовать длину вывода 32768 токенов. Если у вас есть вопросы, сотрудничество или отзывы, обращайтесь через Hugging Face или откройте проблему в репозитории. 👉 Присоединяйтесь к нам в продвижении открытых, эффективных и интеллектуальных языковых моделей!
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: inclusionAI
Теги: llada2_moe, dllm, diffusion, llm, text_generation, conversational, custom_code
Лайков: 10 | Загрузок: 560
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.